Modded-NanoGPT — когда скорость обучения языковых моделей становится спортом
Представьте, что вам нужно обучить GPT-2 с нуля. Обычно это занимает десятки минут даже на мощных GPU. А что если я скажу, что теперь это можно сделать всего за 3 минуты? Именно такой результат демонстрирует проект Modded-NanoGPT, превративший обучение языковых моделей в настоящий speedrun.
Что это за проект?
Modded-NanoGPT — это форк оригинального NanoGPT от Андрея Карпати, превратившийся в площадку для экспериментов по ускорению обучения языковых моделей. Суть проекта проста: достичь заданного качества модели (3.28 cross-entropy loss на FineWeb validation set) как можно быстрее, используя 8 GPU NVIDIA H100.
Интересно, что за полгода существования проекта время обучения сократилось с 45 минут до рекордных 2.896 минут — в 15,5 раз быстрее оригинала!
Как им удалось такого добиться?
Разработчики применили целый арсенал оптимизаций:
- Современная архитектура: Rotary embeddings, QK-Norm, ReLU²
- Экспериментальный оптимизатор Muon — альтернатива Adam с меньшим потреблением памяти
- FP8 матричные умножения для head-слоя
- Skip-connections между блоками по U-net паттерну
- FlexAttention с адаптивным размером окна внимания
Особенно интересен оптимизатор Muon, который использует Newton-Schulz итерации для приближенного вычисления SVD. Это дает:
- На 1.5× лучшую sample-эффективность
- Меньше потребление памяти, чем у Adam
- Всего 2% overhead по времени
Практическая ценность
Хотя проект позиционируется как «speedrun», его методы имеют вполне практическое применение:
- Экономия денег: обучение 1.5B модели стало в 2.5 раза дешевле ($233 вместо $576)
- Быстрое прототипирование: можно тестировать идеи за минуты, а не часы
- Образовательный ресурс: наглядная демонстрация современных методов оптимизации LLM
Как попробовать?
Установка проста:
git clone https://github.com/KellerJordan/modded-nanogpt.git
cd modded-nanogpt
pip install -r requirements.txt
./run.sh
Или через Docker для точного воспроизведения окружения:
sudo docker build -t modded-nanogpt .
sudo docker run -it --rm --gpus all -v $(pwd):/modded-nanogpt modded-nanogpt sh run.sh
Для кого этот проект?
Modded-NanoGPT будет особенно полезен:
- Исследователям в области NLP
- Инженерам, работающим с обучением больших моделей
- Любому, кто хочет понять современные методы ускорения обучения LLM
Как метко заметил один из участников проекта: «Искусственный интеллект продвигается, изобретая игры и хвастаясь, чтобы побудить других играть». Modded-NanoGPT — именно такая игра, где призы — знания и эффективные методы, которые можно применить в реальных проектах.

Хотите быть в курсе последних рекордов? Заглядывайте в репозиторий — там ведется подробный лог всех достижений и методов.
