Загрузка урока...
Самый частый вопрос, который я слышу: «Можно ли дообучить Llama 3 70B на моем игровом ноутбуке?» Короткий ответ: Нет. Длинный ответ: Да, если вы понимаете математику памяти и готовы использовать квантование.
В этом уроке мы научимся считать видеопамять (VRAM) до того, как арендуем сервер, и настроим окружение так, чтобы не тратить часы на установку драйверов CUDA.
Видеопамять расходуется на три вещи: Веса модели + Градиенты + Состояния оптимизатора.
Базовая формула (для Full Fine-tuning в FP16): VRAM ≈ (Количество параметров * 2 байта) * 4 Для модели 7B это: 7 * 2 * 4 = 56 ГБ VRAM. Это много. Даже A100 (40GB) не хватит.
Формула для LoRA + QLoRA (наше спасение): Мы замораживаем основную модель в 4-битном формате и обучаем только маленький адаптер. VRAM ≈ (Параметры * 0.5 байта) + (Размер адаптера) + (Накладные расходы ~2GB)
Таблица требований (Минимальный комфорт для QLoRA): | Модель | Размер весов (4-bit) | Рекомендуемая GPU | Оптимально на Qudata | | :--- | :--- | :--- | :--- | | Llama 3 (8B) | ~5.5 GB | RTX 3090 / 4090 (24GB) | 1x RTX 4090 | | Mistral (7B) | ~5 GB | RTX 3090 / 4090 (24GB) | 1x RTX 4090 | | Llama 3 (70B) | ~40 GB | 2x A100 (80GB) или 2x A6000 | 2x A6000 Ada |
Заходя на маркетплейс мощностей, смотрите не только на название карты, но и на объем памяти.
RTX 3090/4090 (24GB): «Народный выбор». Идеально для экспериментов с моделями до 13B.
A100 / H100 (40/80GB): Профессиональный уровень. Нужны для длинного контекста (32k+) или больших батчей.
Не пытайтесь ставить всё через pip install на голый Windows. Вы утонете в конфликтах версий. Стандарт индустрии — Linux (Ubuntu) + Docker или Conda.
Нам понадобятся:
PyTorch 2.2+ (с поддержкой Flash Attention 2 — это ускоряет обучение в 2 раза).
BitsAndBytes: Библиотека для 4-битного квантования.
PEFT (Parameter-Efficient Fine-Tuning): Библиотека от HuggingFace для адаптеров.
Unsloth: Секретное оружие. Это библиотека, которая оптимизирует ядра GPU специально для Llama/Mistral. Она снижает потребление памяти на 30% и ускоряет обучение на 50%.
Смотреть на бегущие цифры в консоли — путь в никуда. Вы должны видеть график. Зарегистрируйтесь на wandb.ai (бесплатно). В скрипте обучения достаточно добавить одну строчку, чтобы видеть красивые графики падения Loss (ошибки) в реальном времени с телефона.
Зайдите на Qudata (или Colab), выберите GPU с минимум 24GB VRAM.
Установите окружение с библиотекой Unsloth (у них есть готовые Colab notebooks).
Проверьте доступность GPU командой nvidia-smi в терминале.
В этом материале нет файлов для просмотра.