I trained a small transformer in 1.5hrs and it beats many LLMs 🔥 Горячее 💬 Длинная дискуссия
Автор обучил небольшую трансформерную модель с нуля на видеокарте RTX 5090 за 1,5 часа, достигнув 44% точности на публичном наборе ARC-AGI-1 при стоимости всего 67 центов. Это превосходит многие крупные языковые модели и сравнимо с результатами TRM/HRM, при этом модель остаётся открытой и значительно улучшена по сравнению с предыдущей версией: архитектура обновлена (SwiGlu, RMSnorm), количество слоёв увеличено с 4 до 8, улучшена обработка данных и аугментаций, а также заменён оптимизатор AdamW на Normuon с использованием flash attention и переменной длины последовательностей. Ключевое изменение — обучение только на выходных токенах, что сделало подход обучением с учителем и повысило точность с 40% до 44%, несмотря на непонятный автором механизм этого улучшения. На более сложном наборе ARC-2 модель набрала 7%. Автор подчёркивает, что работа направлена на поиск пределов выборочной эффективности в рамках современных методов глубокого обучения, снижение стоимости и ускорение итераций, чтобы сделать исследования доступными широкому кругу людей. ARC считается идеальным бенчмарком из-за малого количества примеров, высокой размерности, отсутствия необходимости в сильных priors и лёгкости для человека. Планы включают дальнейшие исследования для преодоления текущих ограничений при сохранении низкой стоимости экспериментов. Код доступен на GitHub, обсуждение — в X (Twitter).
Комментарии (155)
Успех модели обусловлен не «обучением на тесте», а метаобучением и эффективной предобработкой данных, что ставит под сомнение доминирование LLM в абстрактном рассуждении. Часть аудитории считает использование обучающих примеров из ARC-AGI во время теста «benchmaxxing»: модель адаптируется к структуре задач, а не демонстрирует обобщение. Автор возражает: ARC-AGI — метаобучающий бенчмарк, где метки ответов скрыты и модель выводит ответ по паттернам, что соответствует стандартам метаобучения. Критики сравнивают подход со «сдачей по старым билетам», но это не то же самое, что прямое обучение на тестах, поскольку метки недоступны. Автор подтверждает: используется только структура вопросов из eval-набора, без меток. Синтетические данные также не применялись — только реальные примеры ARC. Sample efficiency — ключевая нерешённая проблема ИИ. Простые архитектуры при тщательной кураторке данных могут превосходить гигантские LLM при минимальных затратах. Качество данных важнее объёма: целенаправленный отбор примеров, а не готовые датасеты, даёт значительный прирост, хотя требует большого труда. Модель — простой autoregressive transformer, обученный на ~100 примерах ARC, тогда как LLM используют миллиарды интернет-примеров, что делает сравнение некорректным в пользу последних. Это напоминает докомпьютерную эпоху с малыми моделями на ограниченных данных. Человеческое обучение устроено аналогично — анализ нескольких примеров перед решением новой задачи, — что делает подход биологически обоснованным, а не «обманом». Предложения: - Ввести запрет на офлайн-предобучение для честного сравнения и исключения «benchmaxxing» через огромные массивы данных. - Проверять обобщение на задачах вне ARC, а не только бить один бенчмарк. - Протестировать модель на ARC-AGI-3, где LLM достигают 99%, чтобы оценить переносимость результата. - Стремиться к системам непрерывного обучения без жёсткого разделения на «обучение» и «тест».
Show HN: I trained a 125M model to autocomplete piano on-device 🔥 Горячее
Я обучаю 125 млн‑параметрный трансформер, который в реальном времени подсказывает продолжение пианино‑партии (~108 нот/сек на iPhone 15). Ключевой прорыв — правильный MIDI‑токенизатор, агрессивная очистка датасета и DPO‑пост‑тренировка.
Я превратил MIDI‑события в компактный набор токенов: отдельные коды для NOTE, TIME_SHIFT, DURATION и VELOCITY. Такой формат гарантирует валидный синтаксис, устраняет «зависание» нот и позволяет модели генерировать ноты за один шаг, что критично для мобильных устройств. Обучение прошло на отфильтрованных 200 мелодиях, где я сортировал аккорды по тональности, чтобы избежать неоднозначности порядка нот.
Для ускорения я использовал 24‑шаговый тактовый деления, что покрывает обычные и тройные ритмы. После обучения применяю DPO‑корректировку, чтобы модель отдавала предпочтение более «музыкальным» продолжениям, что подтверждается в 70 % случаев в сравнениях Gemini. Теперь приложение RollTab умеет мгновенно подхватывать ваш ввод и развивать мелодию в стиле классических тем, от «Pokémon» до «Für Elise».
Запомните:
- Токенизация в виде
[NOTE, PITCH, VELOCITY, DURATION]+TIME_SHIFTделает генерацию быстрой и синтаксически корректной. - DPO‑пост‑тренировка повышает «музыкальность» вывода, а 125 млн параметров достаточно для 108 нот/сек на iOS.
- Приложение уже доступно бесплатно в App Store для MIDI‑клавиатур.
Комментарии (91)
Токенизация MIDI на события (NOTE, TIME_SHIFT, DURATION, VELOCITY) и пост-тренировка DPO с агрессивной очисткой данных — ключевые прорывы, а не архитектура модели. Они обеспечивают валидный синтаксис и качество генерации: ритм, музыкальная форма, естественность звучания, подтверждённые опытом @tom_vidal, @devonsolomon, @noman-land, @pil0u. Размер модели вторичен — качество определяется токенизацией и DPO, как отмечают @gaya3bollineni и @evalystai. Практические запросы: интеграция с внешними MIDI-устройствами (@Tepix), расширение токенизации для атаки, грациозных нот и педали (@davidajackson), генерация 3–4-частного барочного сопровождения с экспортом в редактируемый формат (@heikkilevanto), снижение скорости ради осмысленности через Chain-of-Thought (@subhajeet2107). Требуются данные о стоимости и объёме DPO-тренировки (@theschwa, @arkmm), доступ к весам модели (@abidlabs). Сравнение с Continuator (2003) и Anticipatory Music Transformer показывает: подход не нов, но реализация на устройстве с 125M параметров в реальном времени — новый уровень (@timmb, @bravura). Проект вписывается в тренд, выделяясь локальной реализацией (@speedgoose, @mare5x). Альтернатива — распознавание мелодии через микрофон (@leobg), но требует новой архитектуры. Критика: результаты сопоставимы с Markov-моделями, LLM не понимают музыку — предложена декомпозиция на гармонические и мелодические слои (@rajivayyangar). AI не заменяет интуицию музыканта, а ускоряет отсев мертвых идей (@joshuamerrill, @ghm2199).
BERT is just a single text diffusion step 🔥 Горячее
Недавно автор обнаружил, что дискретная языковая диффузия — это просто обобщение masked language modeling (MLM), которое используется в BERT с 2018 года. Gemini Diffusion от Google DeepMind генерирует текст, постепенно уточняя случайный шум, в отличие от традиционных GPT-стиль моделей, создающих текст слово за словом. Автор задался вопросом, можно ли дообучить BERT-подобную модель для генерации текста, и провел эксперимент для проверки этой концепции.
Архитектура Transformer изначально была encoder-decoder моделью, но в 2018 году разделилась на две ветви: encoder-only (BERT-style, двунаправленные) и decoder-only (GPT-style, авторегрессивные). Диффузионные модели для текста применяют принципы, аналогичные обработке изображений, но вместо добавления шума используют маскирование токенов. На прямом процессе постепенно увеличивается количество замаскированных токенов, а на обратном — модель учится восстанавливать исходный текст, предсказывая токены на различных этапах маскирования.
Комментарии (102)
- В 2021 году в статье arXiv:2107.03006 впервые отметили, что маскирование и диффузия текста фактически реализуют один и тот же процесс, и с тех пор моделирующие стороны ведут дискуссию о том, какой из них «настоящий» диффузионный процесс.
- Сторонники диффузии текста утверждают, что она более биологически правдоподобна, потому что человек, формулируя мысль, одновременно формулирует и слова, в то время как автопрегрессивные модели оперируют токенами последовательно, что якобы не соответствует тому, как работает мозг.
- Сторонники же автопрегрессивных моделей отвечают, что в действительности и люди, и модели делают одно и то же, и что внутреннее представление мысли не является дискретным, и потому нет никакой разницы между последовательным и диффузионным подходами.
- Сторонники диффузии текста также утверждают, что если мы хотим, чтобы модель могла бы редактировать или дополнять текст, то она должна уметь удалять и вставлять токены, что невозможно в рамках автопрегрессивного подхода.
- Сторонники автопрегрессивных моделей отвечают, что в действительности диффузионные модели не могут обучаться стабильно без помощи автопрегрессивного механизма, и что в конце концов, оба подхода требуют одни и те же вычислительные и временные затраты, и что поэтому вопрос остается открытым, какой подход лучше подходит для генерации текста.