Загрузка урока...
Коллеги, первое правило клуба Fine-tuning: не делайте Fine-tuning, если можете этого избежать.
90% задач бизнеса решаются через грамотный RAG (Retrieval-Augmented Generation) и инженерный промптинг. Если вы хотите дообучить Llama 3, чтобы она «выучила» ассортимент вашего магазина запчастей — вы совершаете ошибку. Веса модели — это не база данных.
В этом уроке мы проведем демаркационную линию: где заканчивается поиск и начинается изменение мозга модели.
Давайте разберем на атомы, что и когда использовать.
Золотое правило:
Нужны Факты -> RAG.
Нужна Форма -> Fine-tuning.
Нужно и то, и другое -> RAG + Fine-tuning (гибридный подход).
Мы будем заниматься SFT (Supervised Fine-Tuning). Но вы должны знать контекст.
Continued Pre-training: Заливаем в модель терабайты текстов (например, медицинских), чтобы она вообще поняла терминологию. Дорого. Требует кластера GPU.
SFT (Instruction Tuning): Наш выбор. Мы показываем модели пары «Инструкция -> Идеальный ответ». Цель: заставить модель следовать указаниям.
RLHF / DPO (Alignment): Обучение с подкреплением или Direct Preference Optimization. Используется, чтобы модель стала «безопасной» и «полезной». В B2B задачах используется редко, так как SFT обычно достаточно.
Прежде чем арендовать A100 на Qudata, посчитайте ROI.
Prompt Engineering: Стоимость токенов (OpEx). Контекст растет -> цена растет.
Fine-tuning:
CapEx (Разовые затраты): Подготовка датасета (самое дорогое) + Аренда GPU для обучения (от $50 до $500 за цикл).
OpEx: Инференс собственной модели. Часто дешевле, чем GPT-4, но требует DevOps.
Кейс из практики:
Ритейлер тратил $5000/мес на GPT-4 для классификации отзывов. Мы дообучили Mistral 7B (затраты $300 на GPU + 2 дня работы инженера). Теперь модель крутится на одном дешевом сервере ($150/мес). Окупаемость — первый месяц.
У вас есть кейс: «Юридический помощник для составления договоров аренды». У компании есть 5000 идеальных примеров прошлых договоров и база законодательства РФ.
Напишите архитектурное решение:
Что пойдет в RAG?
Чему будем учить модель через Fine-tuning?
Почему нельзя просто засунуть все законы в Fine-tuning?
(Ответ запишите для себя, мы разберем логику в следующем уроке).
В этом материале нет файлов для просмотра.