Перейти к содержимому

Руководство пользователя

Документация · Учебное пособие · Для разработчиков

Это руководство — для исследователей, которые обучают и запускают модели библиотеки llm: GPT-1, GPT-2, LLaMA, Mistral, Mixtral и Gemma. Оно отвечает на вопрос «как сделать»: установить, собрать модель по конфигу, подготовить данные, обучить, сгенерировать текст, загрузить веса HuggingFace. Почему модели устроены именно так — в учебном пособии; ссылки на нужные главы есть на каждой странице.

Что это за библиотека. Код написан в учебных целях: каждый блок небольшой и читается целиком, а шесть моделей проверены сверкой с HuggingFace — на тех же весах логиты совпадают до ~1e-5–1e-4, greedy-генерация токен в токен. Для экспериментов с архитектурами на небольших моделях её достаточно; для обучения больших моделей — нет: в ней нет распределённого обучения, смешанной точности в Trainer, оптимизированных ядер attention. Полный список — в Ограничениях.

Начало работы

Обучение и генерация

Экосистема HuggingFace

Справка

Изменения, после которых старый код, конфиги или чекпоинты ведут себя иначе, — в CHANGELOG.