Внутри блока Transformer
Как сочетаются все элементы архитектуры
«Внутри блока Transformer» — бесплатный урок NLP Academy на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения NLP Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс NLP Academy содержит 4 уроков всего.
Объединение блоков
Трансформер строится путём многократного объединения одного и того же блока. Каждый блок ещё немного уточняет представление. 🧱
Два основных подслоя
У каждого блока есть две части: подслой многоцелевого внимания, за которым следует небольшая полносвязная сеть, применяемая к каждой позиции.
Полносвязная сеть
Полносвязный подслой состоит из двух линейных слоёв с нелинейностью между ними и независимо обрабатывает каждый токен для повышения выразительности.
h = relu(x @ W1 + b1) @ W2 + b2Остаточные связи
Каждый подслой оборачивает свой вход в остаточную связь: вход добавляется обратно к выходу, чтобы градиенты проходили дальше и ничего не терялось.
out = x + sublayer(x)Нормализация слоя
После добавления остаточного соединения нормализация слоя изменяет масштаб значений. Это стабилизирует активации и ускоряет обучение.
out = layer_norm(x + sublayer(x))Блоки кодировщика
Стопка кодировщика считывает вход и строит насыщенные контекстные векторы. Она использует самовнимание, поэтому каждый токен видит все остальные.
Блоки декодировщика
Декодировщик генерирует выход по одному токену за раз. Он добавляет маскированное внимание и перекрёстное внимание к кодировщику.
Маскированное внимание
Во время генерации маскирование скрывает будущие токены, поэтому декодировщик не может заглянуть вперёд и вынужден честно предсказывать следующее слово.
Перекрёстное внимание
Перекрёстное внимание позволяет декодировщику обращаться к выходам кодировщика, связывая создаваемый текст с тем, что модель изначально прочитала.
Глубина даёт мощность
Объединение множества блоков позволяет ранним слоям улавливать простые закономерности, а поздним — строить абстрактное значение, подобно глубоким сетям компьютерного зрения.
Кодировщик, декодировщик или оба
BERT использует только кодировщик, GPT — только декодировщик, а модели перевода используют оба компонента. Блок — это общий строительный элемент. 🚀
Быстрая проверка
Давайте проверим структуру блока.
Повторение
Вы собрали блок трансформера: внимание и полносвязный слой, объединённые с остаточными связями и нормализацией слоя, а затем выстроенные в кодировщики и декодировщики. ✨
Изучай Python с ИИ-репетитором — бесплатно
Пиши и запускай код прямо в браузере, получай мгновенную помощь от ИИ-репетитора 24/7 и продолжи учиться на сайте или в приложении.
- Курсы
- 30
- Уроки
- 120
Часто задаваемые вопросы
Урок «Внутри блока Transformer» бесплатный?
Да — полный текст урока «Внутри блока Transformer» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс NLP Academy, подпишись на CoddyKit PRO. Курс NLP Academy содержит 4 уроков всего.
Чему я научусь в уроке «Внутри блока Transformer»?
Как сочетаются все элементы архитектуры Ты практикуешь NLP Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать NLP Academy?
Предыдущий опыт не требуется. NLP Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.
Сколько времени занимает урок «Внутри блока Transformer»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке NLP Academy?
Да. Каждый урок NLP Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Идея механизма внимания
- Самовнимание шаг за шагом
- Многоголовое внимание и позиции
- Внутри блока Transformer