Загрузка урока...
В этом уроке мы разберем методы Parameter-Efficient Fine-Tuning (PEFT). Вы узнаете, как дообучать огромные языковые модели под свои задачи, не имея суперкомпьютера. Мы обсудим префикс-тюнинг, детально разберем популярный метод адаптеров LoRA (и его оптимизированную версию QLoRA), а также поговорим о дистилляции знаний и техниках слияния готовых моделей (Model Merging).
О чем этот урок:
Сегодня мы поговорим об очень практической теме — как заставить огромную языковую модель решать наши узкоспециализированные задачи, если у нас ограниченный бюджет. Полное дообучение (Full Fine-Tuning) многомиллиардной LLM требует огромных вычислительных мощностей и целых кластеров видеокарт. Но что делать, если у нас есть всего пара GPU? На помощь приходят методы Parameter-Efficient Fine-Tuning (PEFT).
В этом уроке мы последовательно разберем эволюцию подходов к эффективному дообучению. Мы начнем с простых идей вроде обучаемого системного промпта, а затем перейдем к текущему стандарту индустрии — методу LoRA. Вы поймете, как хитрая математика с использованием низкоранговых матриц позволяет обучать доли процента параметров модели, получая качество, сопоставимое с полным файнтюнингом. Мы также коснемся методов дистилляции знаний (когда маленькая модель учится у большой) и обсудим, как "склеивать" модели между собой без дополнительного обучения.
Префикс-тюнинг (Prefix Tuning): концепция обучаемого системного промпта. Как мы замораживаем основную модель и обучаем только небольшую добавку (префикс) на входе.
P-Tuning v2: развитие идеи префиксов — почему добавление обучаемых параметров на каждом слое трансформера работает лучше, чем только на входе.
Метод LoRA (Low-Rank Adaptation): почему это текущий State-of-the-Art подход. Разбор математической идеи внедрения низкоранговых матриц (A и B) в качестве замороженных добавок к весам внимания (Q,K,V).
Дизайн обучения LoRA: к каким именно матрицам выгоднее всего применять адаптеры и почему размерность ранга (r=4 или 8) оптимальна в большинстве задач.
QLoRA (Quantized LoRA): как квантование оригинальных весов модели до 4 бит позволяет еще сильнее сократить потребление памяти (VRAM) без значительной потери качества.
Слияние моделей (Model Merging): как объединять знания моделей, обученных на разные задачи, путем простого (или взвешенного) усреднения их весов.
Дистилляция знаний (Knowledge Distillation): процесс "обучения студента у учителя" на основе ответов, вероятностей токенов (логитов) или скрытых состояний большой базовой модели.
В качестве тем для самостоятельного исследования и подготовки к будущим собеседованиям мы предлагаем вам углубиться в следующие направления:
Разберитесь в математике LoRA: почему после завершения обучения мы можем просто перемножить матрицы A и B, прибавить их к исходным весам W0 и полностью избавиться от замедления модели (оверхеда) во время инференса.
Сравните подходы к дистилляции: почему использование логитов (вероятностей токенов) "учителя" для обучения "студента" дает лучший результат, чем обучение исключительно на финальных текстовых ответах.
Изучите библиотеку peft от Hugging Face и попробуйте применить метод LoRA на практике для небольшой открытой модели (например, Llama 3 8B или Mistral 7B) на задаче классификации или суммаризации.
В этом материале нет файлов для просмотра.