Руководство пользователя
Документация · Учебное пособие · Для разработчиков
Это руководство — для исследователей, которые обучают и запускают модели библиотеки llm: GPT-1, GPT-2, LLaMA, Mistral, Mixtral и Gemma. Оно отвечает на вопрос «как сделать»: установить, собрать модель по конфигу, подготовить данные, обучить, сгенерировать текст, загрузить веса HuggingFace. Почему модели устроены именно так — в учебном пособии; ссылки на нужные главы есть на каждой странице.
Что это за библиотека. Код написан в учебных целях: каждый блок небольшой и читается целиком, а шесть моделей проверены сверкой с HuggingFace — на тех же весах логиты совпадают до ~1e-5–1e-4, greedy-генерация токен в токен. Для экспериментов с архитектурами на небольших моделях её достаточно; для обучения больших моделей — нет: в ней нет распределённого обучения, смешанной точности в Trainer, оптимизированных ядер attention. Полный список — в Ограничениях.
Оглавление
Заголовок раздела «Оглавление»Начало работы
- Установка — uv workspace, версии Python и PyTorch, проверка установки
- Модели и конфиги — шесть классов, ключи конфига,
forwardи KV-кэш
Обучение и генерация
- Токенизатор и данные —
BPETokenizer, датасеты, паддинг и метки - Обучение —
Trainer, оптимизатор, расписание, скрипт экспериментов - Генерация —
generate: greedy, сэмплирование, батч промптов, остановка по EOS - Сохранение и загрузка —
model.save/Model.load, файлы токенизатора
Экосистема HuggingFace
- Загрузка весов HuggingFace — готовые рецепты для всех шести моделей
- Интеграция с HuggingFace — hf-proxy:
transformers.Trainer, HF-формат (только GPT)
Справка
- Ограничения — чего в библиотеке нет и что учесть
Изменения, после которых старый код, конфиги или чекпоинты ведут себя иначе, — в CHANGELOG.