Загрузка урока...
В этом уроке мы завершаем разбор внутренних механизмов трансформеров. Вы узнаете, как работает концепция Смеси экспертов (MoE) и зачем нужны общие эксперты. Мы разберем популярные функции активации, передовые методы нормализации (RMSNorm) и роль остаточных связей. В финале обсудим базовые принципы токенизации текстов алгоритмом BPE.
В этом уроке мы ставим финальную точку в нашем детальном разборе структуры современных языковых моделей. Мы поговорим о тех компонентах архитектуры, которые делают современные LLM такими мощными, но при этом вычислительно эффективными. Главной темой станет концепция «Смеси экспертов» (Mixture of Experts) — подход, позволяющий кратно увеличить количество параметров модели, не замедляя скорость инференса и генерации ответов.
Мы также спустимся на уровень математики и посмотрим на более мелкие, но критически важные блоки сети: функции активации, остаточные связи и методы нормализации. Вы поймете, почему разработчики передовых моделей всё чаще отказываются от классических подходов в пользу RMSNorm и SwiGLU, и как правильное расположение нормализации (Pre-Norm) защищает сетку от взрыва градиентов. В завершение мы разберем фундамент работы с текстом — токенизацию, чтобы понять, как именно модель алгоритмически «читает» наши слова.
Смесь экспертов (Mixture of Experts): как разделить огромную нейросеть на специализированные подсети и почему этот подход родом из 90-х стал де-факто стандартом для огромных современных LLM.
Механизмы маршрутизации (Routing): как модель через Softmax решает, к какому эксперту направить конкретный токен, зачем нужны «общие эксперты» и как искусственно балансировать нагрузку на видеокарты с помощью добавки к лосс-функции.
Функции активации: эволюция от базовой ReLU к передовым решениям с затворами (Gated) вроде GeLU и SwiGLU, которые активно применяются сегодня.
Нормализация и остаточные связи (Skip Connections): в чем отличия классического LayerNorm от RMSNorm, и почему остаточные связи решают проблему не просто затухания, а нежелательной математической симметрии.
Post-Norm против Pre-Norm: почему мы предпочитаем сначала нормализовать данные перед подачей в слой, и как математически доказывается, что это спасает модель от взрыва градиента пропорционально глубине L слоев.
Токенизация текстов: подходы к разбиению текста (на уровне символов, фрагментов или байтов) и принцип работы алгоритма Byte-Pair Encoding (BPE), склеивающего частые символы шаг за шагом.
В качестве тем для самостоятельного исследования и подготовки к будущим собеседованиям мы предлагаем вам углубиться в следующие направления:
Проанализируйте плюсы и минусы архитектуры MoE: почему использование «общих» экспертов помогает обучению, но от них периодически отказываются в самых новых версиях моделей (как в Qwen 3).
Разберитесь с математическим доказательством того, почему использование нормализации перед входом в блок (Pre-Norm) позволяет получить жесткое математическое ограничение на рост градиента.
Поразмышляйте над токенизацией сложных языков (например, китайского) — почему в случаях, когда язык не имеет явных слов-пробелов, выгоднее и эффективнее сразу спускаться на уровень байтов.
В этом материале нет файлов для просмотра.