Перейти к содержимому

Архитектуры LLM с нуля

Шесть языковых моделей — от GPT-1 до Gemma — на PyTorch. Небольшой код, который читается целиком и сверен с HuggingFace, и учебное пособие, которое объясняет каждую строку.

Каждая модель — отдельный класс библиотеки llm и глава пособия: что изменилось по сравнению с предыдущей моделью, формулы и разбор кода.

Читается целиком

Каждый блок трансформера — небольшой самостоятельный модуль. Библиотека зависит только от PyTorch и NumPy: никакой магии фреймворков между формулой и кодом.

Сверено с эталоном

На весах HuggingFace логиты всех шести моделей совпадают до 1e-5–1e-4, greedy-генерация с KV-кэшем — токен в токен. Больше 1150 тестов.

Три уровня объяснения

Каждый механизм — идея и статья, затем формулы с числовыми примерами, затем конкретная строка кода, которая их реализует.

Полный цикл

BPE-токенизатор, датасеты, обучение, генерация — greedy, top-k, top-p, KV-кэш, батч промптов — и загрузка готовых весов HuggingFace.

Окно терминала
git clone https://github.com/pese-git/llm-arch-research.git
cd llm-arch-research
uv sync

Нужны Python 3.10+ и uv. Видеокарта не обязательна. Подробнее — в Установке.

С чего начать: понять архитектуры · обучить модель · запустить готовые веса · изменить код