Hacker News Digest

01 сентября 2026 г. в 09:52 • mvakde.github.io • ⭐ 602 • 💬 155

OriginalHN

#adamw#arc-agi-1#flash-attention#llm#normuon#rmsnorm#rtx-5090#swinglu#transformer

I trained a small transformer in 1.5hrs and it beats many LLMs

Автор обучил небольшую трансформерную модель с нуля на видеокарте RTX 5090 за 1,5 часа, достигнув 44% точности на публичном наборе ARC-AGI-1 при стоимости всего 67 центов. Это превосходит многие крупные языковые модели и сравнимо с результатами TRM/HRM, при этом модель остаётся открытой и значительно улучшена по сравнению с предыдущей версией: архитектура обновлена (SwiGlu, RMSnorm), количество слоёв увеличено с 4 до 8, улучшена обработка данных и аугментаций, а также заменён оптимизатор AdamW на Normuon с использованием flash attention и переменной длины последовательностей. Ключевое изменение — обучение только на выходных токенах, что сделало подход обучением с учителем и повысило точность с 40% до 44%, несмотря на непонятный автором механизм этого улучшения. На более сложном наборе ARC-2 модель набрала 7%. Автор подчёркивает, что работа направлена на поиск пределов выборочной эффективности в рамках современных методов глубокого обучения, снижение стоимости и ускорение итераций, чтобы сделать исследования доступными широкому кругу людей. ARC считается идеальным бенчмарком из-за малого количества примеров, высокой размерности, отсутствия необходимости в сильных priors и лёгкости для человека. Планы включают дальнейшие исследования для преодоления текущих ограничений при сохранении низкой стоимости экспериментов. Код доступен на GitHub, обсуждение — в X (Twitter).