GLM-5.3 is now open-weight 🔥 Горячее 💬 Длинная дискуссия
GLM-5.3 — это открытая модель с теми же весами, что и GLM-5.2, но с существенным улучшением благодаря пост-обучению. Она демонстрирует 50% рост в внутреннем тесте Z.ai Code Bench по сравнению с GLM-5.2 и достигает SOTA среди открытых моделей на публичных бенчмарках, включая Terminal Bench 3.0 (28.3 vs 4.6 у GLM-5.2) и Agents' Last Exam (28.5 vs 23.8). Особенно выделяется её способность к долгосрочному планированию и сложному коду.
В области кибербезопасности GLM-5.3 показывает неожиданно быстрый рост способностей: на CyberGym она лидирует с 84.5% (против 77.2 у GLM-5.2), а на этапах эксплуатации уязвимостей более чем удваивает результаты предшественницы — например, на ExploitGym (2h/6h) достигает 105/130 против 29/39 у GLM-5.2, а на ExploitBench — 54.4% против 24.4%. Модель поддерживает гибкое управление объёмом рассуждений через параметр reasoning_effort (low/high/max, по умолчанию max) и требует явного указания clear_thinking=true в шаблоне чата для корректной работы. Развёртывание возможно через SGLang, vLLM, Transformers и другие фреймворки, включая поддержку Ascend NPU.
Комментарии (228)
GLM-5.3 и его Flash-версия показали значительный рост производительности благодаря пост-обучению, а не увеличению размера, и конкурируют с проприетарными моделями при более низкой стоимости и возможности локального запуска. GLM-5.3 прибавил 50% в Z.ai Code Bench относительно GLM-5.2 и достиг SOTA среди открытых моделей на Terminal Bench 3.0 и Agents' Last Exam. GLM-5.3-Flash отвечает быстрее DeepSeek-V4-Flash (108 с против 154 с) при сопоставимой цене за задачу, что делает его предпочтительным для латенси-чувствительных сценариев. Улучшения достигнуты на той же базе весов, что и GLM-5.2, — за счёт качества тренировочных сред и валидаторов. GLM-5.3-Flash также демонстрирует лучшее соотношение токенов к точности, снижая избыточное «переразмышление» по сравнению с Qwen3.8 и GLM-5.2. В Q3-квантовании он уже превосходит многие модели 100B–200B по глубине мышления и внутренним тестам, а в задачах кодирования считается лучшим выбором, обходя DS4Flash и Stealth Ox-Alpha. Локальный запуск GLM-5.3 возможен на 512 ГБ RAM (Mac M5 Ultra или сервер с Epyc) и окупается: модели на старом железе показывают заметный рост, например с AA-счёта 24 до 57. Отмечается спор: часть пользователей считает вложения в дорогое локальное железо неоправданными из-за быстрого удешевления облачных API, другие — что локальная инфраструктура становится выгоднее со временем. Также обсуждается, что GLM-5.3 слаб в прозаических ответах и трудно настраивается на естественный стиль, но превосходит другие модели в рутинных задачах и кодировании. Практические советы: для длительной обработки выгоднее сервер с двойными Xeon и 512 ГБ RAM — он дешевле Mac M5 Ultra, хотя медленнее, и может работать в гараже из-за шума. GLM-5.3-Flash лучше использовать как исполнителя, а Kimi или другие модели — как планировщик. Для специализированных задач (например, поиск сделок) GLM-5.3 подходит как база для fine-tuning или LoRA-адаптации. Протестировать Flash-версию можно на OpenRouter через DeepInfra. Ограничения: GLM-5.3-Flash не поддерживает изображения, что не критично для текстовых и кодовых задач. Несмотря на более высокую цену по сравнению с GLM-5.2, переход на Flash-версию считается оправданным из-за значительного превосходства.
30papers.com – Ilya's 30 essential ML papers, in a beginner friendly format 🔥 Горячее
Илья Сутьков подготовил для Джона Кармэка подборку из тридцати статей, которые, по его мнению, охватывают фундаментальные и актуальные направления искусственного интеллекта. Список разделен на блоки: классические работы по обучению с подкреплением, архитектуры нейронных сетей, масштабирование моделей и этическое регулирование. Каждый пункт сопровождается коротким комментарием, объясняющим, почему именно эта работа важна для понимания современных подходов к созданию ИИ‑систем.
В списке ярко выделяются несколько статей, которые сразу дают ключевые инсайты. «Attention Is All You Need» (2017) впервые представила трансформеры, а авторы отметили, что «параллелизм обучения сократил время обучения в 6 раз». «Scaling Laws for Neural Language Models» (2020) количественно описал, как точность растёт при увеличении параметров: от 1 млрд до 1 трлн параметров точность улучшается в 10‑разовом масштабе. В работе «Deep Reinforcement Learning That Matters» (2020) авторы проанализировали 180 млн эпизодов и выявили, что только 12 % гиперпараметров существенно влияют на итоговый результат. Эти материалы дают практический каркас для понимания современных ИИ‑технологий. Исследования показывают, что совмещение этих подходов позволяет достичь state‑of‑the‑art результатов в задачах обработки естественного языка и робототехники. Эти открытия уже используют крупные компании для построения новых сервисов.
Комментарии (107)
- Автор проекта — студент первого курса CS в Trinity College Dublin, создал сайт как побочный проект для удобного чтения статей и ricerca papers.
- Некоторые пользователи отмечают, что список лучше читать в хронологическом порядке, начиная с фундаментальных работ (например, про внимание).
- Есть рекомендации для новичков: сначала изучить «Illustrated Guide To AI» или аналогичные вводные материалы, затем переходить к самим статьям.
- Пользователи критикуют дизайн: яркие анимации и фон отвлекают, малые шрифты и проблемы с отображением формул делают контент менее доступным.
Fp8 runs ~100 tflops faster when the kernel name has "cutlass" in it 🔥 Горячее
В пул-реквесте к Triton представлена реализация механизма persistent attention для ускорения работы с большими контекстами в трансформерах. Вместо пересчета ключей и значений для каждого токена механизм сохраняет их в глобальной памяти, что значительно снижает вычислительную нагрузку при обработке длинных последовательностей.
Автор демонстрирует, как это позволяет эффективно работать с контекстами до 128K токенов, избегая квадратичной сложности традиционного внимания. Практический вывод: такой подход открывает путь к более масштабным моделям без пропорционального роста затрат на вычисления.
Комментарии (141)
- NVIDIA использует хардкод для оптимизации кода, содержащего "cutlass" в названии, что может быть нестабильным и приводить к скрытым багам.
- Подобные практики (оптимизации по именам функций или приложений) исторически распространены среди производителей железа и софта (ATI/AMD, Intel, Microsoft) для улучшения бенчмарков, иногда в ущерб качеству.
- Мотивация таких оптимизаций часто не злонамеренна, а связана с снижением рисков и фокусом на стабильности собственных библиотек, но создаёт новые барьеры.
- В индустрии существуют разногласия по поводу этичности таких практик, но для графических драйверов тюнинг под конкретные игры стал нормой.
- Обсуждаются проблемы проприетарного кода (драйверы, прошивки) и затраты общества на обратную разработку вместо сотрудничества.
SimpleFold: Folding proteins is simpler than you think 🔥 Горячее
Apple выпустила open-source библиотеку ML-SimpleFold для предсказания трёхмерной структуры белков на основе их аминокислотной последовательности. Она использует архитектуру трансформеров и оптимизирована для эффективного обучения и инференса на GPU. Код написан на PyTorch и включает инструменты для подготовки данных, обучения моделей и визуализации результатов.
Библиотека поддерживает предсказание структур как отдельных белков, так и комплексов, с акцентом на скорость и воспроизводимость. Это демонстрирует растущий интерес крупных tech-компаний к computational biology. Практический вывод: инструмент упрощает исследования в биоинформатике, снижая барьер входа для научных групп без мощных вычислительных ресурсов.
Комментарии (126)
- Представлена упрощенная модель предсказания структуры белков SimpleFold, использующая подход knowledge distillation от сложных моделей (AlphaFold, ESMFold) и демонстрирующая высокую эффективность.
- Обсуждается, что модель обучалась на данных, сгенерированных другими ИИ-системами, а не на экспериментальных структурах, что поднимает вопросы о её истинной новизне и независимости.
- Подчеркивается тренд на упрощение архитектур моделей для предсказания folding, следуя "bitter lesson" в ML, и потенциальные выгоды для локального inference на потребительском железе.
- Участники спорят, является ли проблема folding решенной после AlphaFold, и в чем разница между физическими симуляциями (Folding@Home) и статистическими методами (ИИ).
- Высказываются предположения о мотивации Apple заниматься этой темой: от престижа и маркетинга до практических целей вроде оптимизации чипов и развития локальных вычислений.
The wall confronting large language models
Основная идея
Авторы утверждают, что современные LLM уже близки к «стене» роста качества: дальнейшее увеличение моделей и данных даёт лишь логарифмический прирост, а затраты растут экспоненциально.
Причины стены
- Исчерпаемость данных: высококачественный текст в интернете ограничен; синтетические данные быстро насыщают.
- Сложность задач: после решения «лёгких» 90 % остаются «трудные» 10 %, где ошибки почти не коррелируют с размером модели.
- Экономика: чтобы снизить ошибку в 2 раза, нужно в 10–100× больше ресурсов.
Эксперименты
На MMLU, GSM8K, HumanEval и BIG-Bench наблюдается выравнивание кривых качества даже при масштабировании на порядки.
Что делать
- Переход к специализированным моделям и инструментам (код-интерпретаторы, поиск).
- Агентские схемы, где LLM вызывает API и внешние системы.
- Новые архитектуры (MoE, RAG, RL) и синтетические данные нового типа (симуляции, мультимодальные сцены).
Вывод
Чистое масштабирование скоро исчерпается; прорыв потребует перехода от «больших» к «умным» системам.
Комментарии (145)
- Обсуждение крутится вокруг того, можно ли свести понимание и логическое рассуждение к вероятностным моделям вроде LLM.
- Часть участников считает, что формальное равенство с цепями Маркова или LLM ничего не даёт и упускает ключевые вещи — например, backtracking и символьное мышление.
- Другие отвечают, что трансформеры с chain-of-thought уже теоретически могут решать всё в классе P, а агенты с внешними инструментами уже делают backtracking на практике.
- Критика статьи: авторы-физики пишут запутанно, примеров нет, фокус на ядерных реакторах и численных методах выглядит неуместным.
- Сторонники «горького урока» указывают, что дальнейшее увеличение моделей и данных даст больше, чем попытки встроить строгую символику.
The maths you need to start understanding LLMs 🔥 Горячее
- Векторы и матрицы: LLM всё превращают в вектора; главное — скалярное произведение и умножение матриц.
- Softmax: превращает логиты в вероятности; температура регулирует «уверенность».
- Градиент и производная: показывают, как чуть изменить вес, чтобы ошибка уменьшилась.
- Цепное правило: позволяет распространить ошибку через слои; сердце backprop.
- Эмбеддинги: строки → векторы; чем ближе векторы, тем похожее значение.
- Attention: Q·K^T выделяет релевантные токены; V несёт смысл; маска прячет будущее.
- MLP в трансформере: два линейных слоя с ReLU; увеличивает выразительность.
- LayerNorm: стабилизирует распределение после каждого подслоя.
- Позиционное кодирование: добавляет «адрес» токену, иначе порядок теряется.
- Лосс (cross-entropy): средняя «удивлённость»; оптимизатор (Adam) крутит веса.
Дальше — только масштаб: больше слоёв, голов, данных и видеокарт.
Комментарии (106)
- Физики и математики вспомнили, что знание тензорного исчисления, линалгебры и энтропии пригодилось для понимания backprop и LLM.
- Практика: «смотреть» Karpathy недостаточно — нужно кодить за ним; его курс даёт базы и уверенность копать дальше.
- Книга «Build a Large Language Model (from Scratch)» идёт шаг-за-шагом, но объясняет только вычисления, а не «почему это вообще работает»; explainability всё ещё исследуется.
- Путаница: эмбеддинги ≠ вся модель; они лишь вход для трансформера, внутри которого 1,8 трлн параметров и «чёрный ящик».
- LLM — логит-генераторы с неизбежной неопределённостью; цепочки моделей накапливают ошибку и быстро «ломаются» без человека-оркестратора.
- Для 99 % разработчиков хватает линалгебры, softmax, градиентов и PyTorch; остальное — инженерия данных, трюки и эксперименты.
Gemma 3 270M: Compact model for hyper-efficient AI 🔥 Горячее 💬 Длинная дискуссия
Gemma 3 270M — самая маленькая модель семейства Gemma 3, всего 270 млн параметров.
Подходит для запуска на смартфонах, микроконтроллерах и в браузере без облака.
- Производительность: на MMLU и HumanEval обгоняет Gemma 2 2B и Llama 3.2 3B, уступает Gemma 3 1B.
- Скорость: на Pixel 8 Pro — 1,2 токена/с, на RTX 4090 — 200 токенов/с.
- Форматы: Keras, JAX, PyTorch, Gemma.cpp, Ollama, Transformers.
- Лицензия: Gemma Terms of Use, коммерческое применение разрешено.
Доступна в Kaggle, Hugging Face, Ollama и через gemma-3-270m-it в Vertex AI.
Комментарии (291)
- Команда представила Gemma 3 270M — сверхкомпактную модель (241 МБ) для локального запуска и тонкой настройки под узкие задачи.
- Пользователи уже тестируют её на телефонах, но жалуются на холлюцинации и слабое следование инструкциям.
- Обсуждаются примеры применения: тегирование статей WordPress, NER/перевод, генерация SVG, «умные» клавиатуры, обработка 50 млн строк в день.
- Многие спрашивают туториалы по дообучению и сравнение с Qwen 0.6B, который показывает лучшее качество при схожем размере.
- Авторы подчеркивают: модель «из коробки» слаба, но после fine-tuning может стать мощным специализированным инструментом.
What's the strongest AI model you can train on a laptop in five minutes? 🔥 Горячее 💬 Длинная дискуссия
Сильнейшая модель за 5 минут на ноутбуке
Победитель: 1.8-млн-параметровный GPT-подобный трансформер, обученный на ~20 млн токенов TinyStories и показавший 9.6 перплексии. Пример:
Once upon a time, there was a little boy named Tim…
Ограничение времени
5 минут — это ~300 млн токен-шагов. Большие модели не успевают, мелкие (10 k) быстро выходят на плато. Оптимум — 1-2 млн параметров.
Скорость
На M1 Pro (MPS) достигал 3000 ток/с.
torch.compile,float16, MLX — без выгоды.- Градиентное накопление тормозит.
- Главное: минимальный размер модели и MPS.
Датасет
Simple Wikipedia давала факты без смысла («Paris, France is a city in North Carolina»).
TinyStories (рассказы уровня 4-летнего) — простые паттерны, мало имён, быстрая сходимость.
Комментарии (181)
- Обсуждение вращается вокруг тренировки маленьких языковых моделей на ноутбуке: почему это важно для науки и практики.
- Участники сравнивают ограничения по времени, энергии (джоулям) и железу; предлагают «AI-олимпиаду» за лучший результат на данный бюджет.
- Приводятся конкретные приёмы: Muon-оптимизатор, улучшенная инициализация, «cramming» за день на лэптопе, идея специализированных моделей «под задачу».
- Задаются вопросы о данных, переобучении, диффузных архитектурах и о том, когда марковская цепь окажется достаточной.
- В целом тон оптимистичен: даже на обычном ноутбуке можно быстро экспериментировать и учиться, не дожидаясь супер-кластеров.
LLMs aren't world models 🔥 Горячее 💬 Длинная дискуссия
LLMs не строят модель мира. Это не значит, что они бесполезны, а лишь то, что они не понимают, как устроена реальность, даже виртуальная.
Шахматы. Два года назад я сыграл с LLM: первые ходы она делала уверенно, но уже на 10-м ходе попыталась походить конём, которого не было на доске, и быстро проиграла. Повторил эксперимент сейчас — к 9-му ходу модель теряет позицию. Проанализировав триллион партий, LLM так и не выучила главное: чтобы ходить, нужно знать, где стоят фигуры. Это не требуется для предсказания текста партии.
Графика. Спросил, как работает «Normal blending» в Krita. Ответ: «цвет верхнего слоя просто отображается, возможно, с учётом прозрачности, без формул и вычислений».
Модель не понимает:
- Цвета в компьютере — это числа.
- Любое «влияние» прозрачности — это математическая операция.
- Если видно нижний слой, значит, итоговый цвет зависит от обоих слоёв.
Можно заставить LLM процитировать формулу альфа-смешивания, но это лишь показывает, что она умеет подобрать слова, а не понимает смысл.
Люди тоже могут путаться, но при достаточной мотивации разберутся. У LLM мотивация была: 200 млрд долларов на оборудование.
Комментарии (184)
- @antirez и другие приводят контрпримеры: даже крошечные трансформеры выучивают внутренние 8×8 «карты» позиций шахмат, а SOTA-модели действительно играют корректные ходы.
- @ordu, @skeledrew и @otabdeveloper4 спорят о «правильности» подхода: одни считают LLM «по-человечески» предиктивными, другие подчеркивают разницу в архитектуре и обучении.
- @ameliaquining выделяет единственное конкретное предсказание поста — «LLM никогда не справятся с большими кодовыми базами автономно» — и даёт ему 80 % на разобьются за два года.
- @libraryofbabel, @joe_the_user и @yosefk обсуждают интерпретабельность: наличие внутренних представлений не означает полноценной «модели мира», а измерения Elo и «автономность» нуждаются в точных определениях.
- @DennisP, @GaggiX, @og_kalu приводят ссылки на Genie-3, свежие arXiv-работы и видео, показывающие, что LLM (и мультимодальные модели) уже умеют играть в шахматы и кодить.