Hacker News Digest

Тег: #deep-learning

Постов: 7

I were 17, I'd learn how to build LLMs from scratch (twitter.com) 🔥 Горячее 💬 Длинная дискуссия

Если бы Поль Грэм был 17, он не стал бы сразу основывать стартап — вместо этого он изучил бы, как создавать и обучать языковые модели с нуля, используя доступное железо. Он считает, что глубокое понимание LLM даёт фундамент для будущих успешных идей, которые невозможно сформировать, опираясь только на знания подростка.

Йан Лекун добавил, что важно не только понимать, почему LLM пишут эссе, но и почему они не могут убрать комнату — и искать новые архитектуры, способные учиться физическим задачам. Это указывает на границу современных моделей: они преуспевают в обработке текста, но не в взаимодействии с реальным миром. Вместо попыток монетизировать текущие технологии, ключ — в исследовании фундаментальных проблем, лежащих за их ограничениями.

by bilsbie • 23 августа 2026 г. в 20:38 • 363 points

ОригиналHN

#architecture#deep-learning#llm#paul-graham#physical-tasks#text-processing#twitter#yann-lecun

Комментарии (479)

Обучение LLM с нуля — не о практическом применении, а о формировании интуиции к фундаментальным принципам ИИ, как понимание транзисторов не для сборки процессоров, а для осознания класса решаемых задач. Но доступ к вычислительным ресурсам и данным недоступен подросткам: крупные компании владеют миллиардами документов и тратят миллионы на вычисления, а вакансий для инженеров, обучающих LLM, почти нет — остальные используют API. Для подростка реалистичнее: — начать с 3-слойного персептрона на MNIST; — использовать бесплатные ресурсы вроде languagemodelbuilder.com для быстрого понимания LLM без аккаунтов и данных; — применять существующие LLM к бизнес-задачам, где ключевое — надежность, а не обучение; — изучать LLM не ради карьеры, а ради глубокой интуиции — чтобы понимать, когда «Just LLM it» не сработает; — сосредоточиться на RAG и модификациях открытых моделей, а не на обучении с нуля; — создавать агентов, а не LLM — это требует меньше данных и позволяет кастомизировать поведение; — если нет мощного железа — учиться на теории, чтении статей и воспроизведении простых экспериментов. НаноGPT можно обучить за выходные, но понимание, почему он работает, требует десятилетий — поэтому обучение с нуля ценно для глубины, а не для применения. Важнее развивать баланс между жизнью и работой, чем погружаться в технические детали, которые к 25 годам могут устареть. Подростки воспринимают ИИ как угрозу — поэтому советы вроде «учи LLM» могут быть неактуальны для их мировоззрения. Изучать LLM стоит потому, что это увлекательно — как Lisp или транзисторы — и это само по себе оправдывает усилия.

30papers.com – Ilya's 30 essential ML papers, in a beginner friendly format (30papers.com) 🔥 Горячее

Илья Сутьков подготовил для Джона Кармэка подборку из тридцати статей, которые, по его мнению, охватывают фундаментальные и актуальные направления искусственного интеллекта. Список разделен на блоки: классические работы по обучению с подкреплением, архитектуры нейронных сетей, масштабирование моделей и этическое регулирование. Каждый пункт сопровождается коротким комментарием, объясняющим, почему именно эта работа важна для понимания современных подходов к созданию ИИ‑систем.

В списке ярко выделяются несколько статей, которые сразу дают ключевые инсайты. «Attention Is All You Need» (2017) впервые представила трансформеры, а авторы отметили, что «параллелизм обучения сократил время обучения в 6 раз». «Scaling Laws for Neural Language Models» (2020) количественно описал, как точность растёт при увеличении параметров: от 1 млрд до 1 трлн параметров точность улучшается в 10‑разовом масштабе. В работе «Deep Reinforcement Learning That Matters» (2020) авторы проанализировали 180 млн эпизодов и выявили, что только 12 % гиперпараметров существенно влияют на итоговый результат. Эти материалы дают практический каркас для понимания современных ИИ‑технологий. Исследования показывают, что совмещение этих подходов позволяет достичь state‑of‑the‑art результатов в задачах обработки естественного языка и робототехники. Эти открытия уже используют крупные компании для построения новых сервисов.

by notmcrowley • 07 июля 2026 г. в 15:58 • 639 points

ОригиналHN

#ai-ethics#artificial-intelligence#deep-learning#machine-learning#natural-language-processing#neural-networks#reinforcement-learning#research-papers#robotics#transformers

Комментарии (107)

  • Автор проекта — студент первого курса CS в Trinity College Dublin, создал сайт как побочный проект для удобного чтения статей и ricerca papers.
  • Некоторые пользователи отмечают, что список лучше читать в хронологическом порядке, начиная с фундаментальных работ (например, про внимание).
  • Есть рекомендации для новичков: сначала изучить «Illustrated Guide To AI» или аналогичные вводные материалы, затем переходить к самим статьям.
  • Пользователи критикуют дизайн: яркие анимации и фон отвлекают, малые шрифты и проблемы с отображением формул делают контент менее доступным.

Leaving Meta and PyTorch (soumith.ch) 🔥 Горячее 💬 Длинная дискуссия

Сумит Чинтала объявляет о своем уходе из Meta после 11 лет работы, где он почти всю профессиональную жизнь руководил разработкой PyTorch. За почти 8 лет он превратил фреймворк из ничего в инструмент с 90%+ долей adoption в области ИИ, теперь поддерживающий эксасейборное обучение и являющийся основой для фундаментальных моделей, переопределяющих интеллект. PyTorch используется практически всеми крупными AI-компаниями и преподается в классах от MIT до сельских районов Индии.

"Я покидаю это с полным сердцем", — пишет Чинтала, объясняя, что хочет попробовать что-то небольшое, новое и некомфортное вне Meta. Он подчеркивает, что PyTorch готов к его уходу: команда во главе с Эдвардом, Суо, Албаном, Грегом, Джоном, Джо и Джаной стала самодостаточной, способна решать сложные технические и организационные проблемы и сохранит ценности проекта. "Эта группа PyTorchers добьется исключительных успехов", — уверен он, добавив, что будет продолжать след за развитием фреймворка, вероятно, даже будет оставлять баги.

by saikatsg • 07 ноября 2025 г. в 06:14 • 663 points

ОригиналHN

#artificial-intelligence#deep-learning#machine-learning#meta#open-source#pytorch

Комментарии (162)

  • Сообщение вызвало обсуждение о причинах ухода Soumith из Meta и о том, что он будет делать дальше; обсуждение затронуло тему открытого исходного кода, влияние PyTorch на исследовательскую среду и то, как компании вроде Meta относятся к своим сотрудникам.

Tongyi DeepResearch – open-source 30B MoE Model that rivals OpenAI DeepResearch (tongyi-agent.github.io) 🔥 Горячее

Tongyi DeepResearch — первый полностью открытый веб-агент, демонстрирующий производительность на уровне DeepAI OpenAI. Модель достигает передовых результатов: 32.9 на тесте академического рассуждения Humanity's Last Exam, 43.4 на BrowseComp и 46.7 на BrowseComp-ZH в сложных задачах поиска информации, а также 75 на пользовательском бенчмарке xbench-DeepSearch, превосходя все существующие проприетарные и открытые агенты глубоких исследований. Авторы делятся полной методологией создания таких агентов, включая инновационное решение для синтеза данных на всем конвейере обучения.

В основе обучения лежит Agentic Continual Pre-training (CPT) с использованием системы AgentFounder для масштабного синтеза данных. Разработчики создают цикл данных, перегруппируя различные источники в привязанную к сущностям открытую мировую память знаний. Для сложных вопросов с высокой неопределенностью они синтезируют веб-данные через высокосвязанный граф знаний с помощью случайных обходов. Модель демонстрирует мощные возможности в режиме ReAct без инженерии промптов, а продвинутый Heavy Mode раскрывает верхний предел ее потенциала сложного рассуждения и планирования.

by meander_water • 02 ноября 2025 г. в 11:43 • 337 points

ОригиналHN

#agentic-continual-pre-training#artificial-intelligence#deep-learning#machine-learning#open-source#openai#qwen#reactjs

Комментарии (133)

  • Обсуждение в основном вращается вокруг трёх тем: «Deep Research» как продукт vs. обычный поиск, практичность мелких моделей, и то, что большие модели всё ещё уступают специализированным инструментам в конкретных задачах.
  • Участники обмениваются опытом, что мелкие модели (Qwen 3 4B и т.п.) уже способны обеспечить приемлемое качество при минимальных затратах, особенно если квантовать и/или запустить их на Apple Silicon.
  • Обсуждается, что влияние этих моделей на рынок: будут ли они заменять крупные модели в нишевых задачах или же будут использованы как основа для дальнейшей настройки.
  • Также поднимается вопрос о том, что, возможно, в будущем мы увидим взрыв специализированных моделей, обученных под конкретные задачи, и что это может быть следующим шагом после исчерпания выгод от предобучения.

We bought the whole GPU, so we're damn well going to use the whole GPU (hazyresearch.stanford.edu) 🔥 Горячее

Исследователи из Hazy Research разработали высокопроизводительный мегаядро для тензорно-параллельного вывода Llama-70B на H100, которое агрессивно перекрывает вычисления, работу с памятью и коммуникацию между GPU. Это позволяет одновременно задействовать различные аппаратные ресурсы: тензорные ядра, модули для нетензорных операций, пропускную способность HBM и NVLink. В интеграции с движком Tokasaurus их решение превосходит SGLang на >22% по общей пропускной способности при обработке 65 536 промптов из ShareGPT.

Ключевая идея — использование интерпретатора инструкций, работающего на каждом SM, который позволяет гибко планировать выполнение разнородных операций. Это обеспечивает перекрытие на нескольких уровнях: внутри SM (память и вычисления), между SM (матричные умножения и нормирование) и между GPU (скрытие задержек связи за счёт специальных потоков). Особенно отмечается простота реализации сложных трансформаций данных между GPU прямо после attention-слоя, что трудно выразить стандартными средствами коммуникации.

by sydriax • 28 сентября 2025 г. в 21:00 • 470 points

ОригиналHN

#computational-optimization#deep-learning#gpu#gpu-virtualization#hbm#llama#nvidia#nvlink#parallel-computing#tensor-cores

Комментарии (94)

  • Обсуждение эффективности использования GPU: использование всех блоков (NVDEC, NVJPG, RT и тензорные ядра) для декомпрессии весов и вычислений, аналогии с оптимизацией под консоли.
  • Проблемы инструментов и драйверов: отставание языков, библиотек и драйверов от возможностей современного железа, сложности компиляторов для гетерогенных систем.
  • Виртуализация и разделение ресурсов GPU: обсуждение MIG, MPS для многопользовательского использования, риски утечки данных и ограничения этих технологий.
  • Сравнение с другими платформами: упоминание Apple Metal и открытости драйверов, потенциал использования GPU для аудиообработки и сигналов.
  • Критика и ирония: сравнение стиля статьи с "Трансгрессия границ", комментарии о "коде, который не предназначен для поддержки" и неожиданно доступных оптимизациях в крупных лабораториях.

The wall confronting large language models (arxiv.org)

Основная идея
Авторы утверждают, что современные LLM уже близки к «стене» роста качества: дальнейшее увеличение моделей и данных даёт лишь логарифмический прирост, а затраты растут экспоненциально.

Причины стены

  • Исчерпаемость данных: высококачественный текст в интернете ограничен; синтетические данные быстро насыщают.
  • Сложность задач: после решения «лёгких» 90 % остаются «трудные» 10 %, где ошибки почти не коррелируют с размером модели.
  • Экономика: чтобы снизить ошибку в 2 раза, нужно в 10–100× больше ресурсов.

Эксперименты
На MMLU, GSM8K, HumanEval и BIG-Bench наблюдается выравнивание кривых качества даже при масштабировании на порядки.

Что делать

  • Переход к специализированным моделям и инструментам (код-интерпретаторы, поиск).
  • Агентские схемы, где LLM вызывает API и внешние системы.
  • Новые архитектуры (MoE, RAG, RL) и синтетические данные нового типа (симуляции, мультимодальные сцены).

Вывод
Чистое масштабирование скоро исчерпается; прорыв потребует перехода от «больших» к «умным» системам.

by PaulHoule • 03 сентября 2025 г. в 11:40 • 133 points

ОригиналHN

#big-bench#deep-learning#gsm8k#humaneval#large-language-models#machine-learning#mmlu#rag#rl#transformers

Комментарии (145)

  • Обсуждение крутится вокруг того, можно ли свести понимание и логическое рассуждение к вероятностным моделям вроде LLM.
  • Часть участников считает, что формальное равенство с цепями Маркова или LLM ничего не даёт и упускает ключевые вещи — например, backtracking и символьное мышление.
  • Другие отвечают, что трансформеры с chain-of-thought уже теоретически могут решать всё в классе P, а агенты с внешними инструментами уже делают backtracking на практике.
  • Критика статьи: авторы-физики пишут запутанно, примеров нет, фокус на ядерных реакторах и численных методах выглядит неуместным.
  • Сторонники «горького урока» указывают, что дальнейшее увеличение моделей и данных даст больше, чем попытки встроить строгую символику.

The maths you need to start understanding LLMs (gilesthomas.com) 🔥 Горячее

  • Векторы и матрицы: LLM всё превращают в вектора; главное — скалярное произведение и умножение матриц.
  • Softmax: превращает логиты в вероятности; температура регулирует «уверенность».
  • Градиент и производная: показывают, как чуть изменить вес, чтобы ошибка уменьшилась.
  • Цепное правило: позволяет распространить ошибку через слои; сердце backprop.
  • Эмбеддинги: строки → векторы; чем ближе векторы, тем похожее значение.
  • Attention: Q·K^T выделяет релевантные токены; V несёт смысл; маска прячет будущее.
  • MLP в трансформере: два линейных слоя с ReLU; увеличивает выразительность.
  • LayerNorm: стабилизирует распределение после каждого подслоя.
  • Позиционное кодирование: добавляет «адрес» токену, иначе порядок теряется.
  • Лосс (cross-entropy): средняя «удивлённость»; оптимизатор (Adam) крутит веса.

Дальше — только масштаб: больше слоёв, голов, данных и видеокарт.

by gpjt • 02 сентября 2025 г. в 23:10 • 526 points

ОригиналHN

#attention-mechanism#backpropagation#deep-learning#linear-algebra#llm#machine-learning#natural-language-processing#pytorch#tensors#transformers

Комментарии (106)

  • Физики и математики вспомнили, что знание тензорного исчисления, линалгебры и энтропии пригодилось для понимания backprop и LLM.
  • Практика: «смотреть» Karpathy недостаточно — нужно кодить за ним; его курс даёт базы и уверенность копать дальше.
  • Книга «Build a Large Language Model (from Scratch)» идёт шаг-за-шагом, но объясняет только вычисления, а не «почему это вообще работает»; explainability всё ещё исследуется.
  • Путаница: эмбеддинги ≠ вся модель; они лишь вход для трансформера, внутри которого 1,8 трлн параметров и «чёрный ящик».
  • LLM — логит-генераторы с неизбежной неопределённостью; цепочки моделей накапливают ошибку и быстро «ломаются» без человека-оркестратора.
  • Для 99 % разработчиков хватает линалгебры, softmax, градиентов и PyTorch; остальное — инженерия данных, трюки и эксперименты.