Hacker News Digest

Тег: #glm

Постов: 4

Models Are Getting Dumber on Purpose (w4g1.dev)

Модели сознательно «обнуляют» знания ради эффективности: активные параметры падают с сотен миллиардов до 13–40 млрд, но при этом их способность к рассуждению растёт. Например, GLM-5.2 с 40 млрд активных параметров на токен достигает 99,2 % на AIME 2026, а Qwen3.5 9B — 91,3 % при 17 млрд активных. При этом на простых фактических вопросах (SimpleQA) лучший результат — лишь 53 % у Gemini 2.5 Pro, а маленькие модели показывают 80–82 % галлюцинаций. Это происходит потому, что знания занимают «тяжёлый» объём весов (≈2 бита на факт), тогда как алгоритмы рассуждения сжаты до скромного набора процедур, которые легко передаются в компактные модели через синтетические данные и RL‑fine‑tuning.

Таким образом, современные системы хранят лишь «широту» знаний — общую картину мира, достаточную для выбора правильного источника, — а детали (версии API, даты релизов, редкие формулы) вынесены в внешние базы. Это делает их устойчивыми к устареванию фактов, но требует runtime‑подключения к актуальному контенту. В результате ошибки в знаниях становятся обычными данными, исправляемыми без переобучения, а «галлюцинации» превращаются в проверяемые ссылки, что радикально снижает риск уверенного, но неверного ответа. В будущем модель будет почти полностью полагаться на внешние источники, а её веса будут служить лишь гибким «интерпретатором» запросов.

by hruvhwe • 16 августа 2026 г. в 19:04 • 166 points

ОригиналHN

#aime#gemini#glm#qwen#simpleqa

Комментарии (104)

Тред обсуждает перспективы и ограничения моделей, намеренно «обнуляющих» знания для эффективности, и возможность использования плаггабельных моделей для решения конкретных задач. @kennywinker предлагает плаггабельные модели знаний, не требующие знания всех языков программирования. @gopalv и @stanac поддерживают идею систем из нескольких специализированных моделей как более эффективной альтернативы одной универсальной, причём @stanac отмечает, что плаггабельные модели требуют базовых для работы. @jimmaswell возражает: модели с большим объёмом параметров и разнообразным знанием работают лучше, даже если это неочевидно, и структура задачи может скрываться в неожиданных источниках, например, в древних китайских стихах. @lowsong опровергает утверждение автора, что перемещение информации из весов в контекст устраняет галлюцинации — это не гарантирует точности выводов.

GLM 5.2 beats Claude in our benchmarks (semgrep.dev) 🔥 Горячее 💬 Длинная дискуссия

Semgrep объявил Multimodal — платформу, объединяющую генеративный ИИ‑рассуждение с точными правилами обнаружения, что позволяет сканировать, триажировать и исправлять уязвимости в коде в одном рабочем процессе. Это часть новых решений в области защиты кода и цепочек поставок, интегрированных в их AppSec‑платформу и Workflows. Компания позиционирует сервис как способ, при котором злоумышленники «не могут захватить всё преимущество», подчёркивая, что комбинация машинного обучения и детерминированных правил повышает точность и скорость реагирования.

В рамках публичного теста на кибер‑бенчмарке Semgrep сравнил свой недавно выпущенный GLM 5.2 с Claude 3.5. По данным теста, GLM 5.2 набрал 84 % точности обнаружения, в то время как Claude 3.5 — лишь 71 %. Модель показала более высокий уровень обнаружения уязвимостей — около 15 % лучше, чем у Claude — и значительно снизила количество ложных срабатываний. Эти результаты подтверждают, что гибридный подход Semgrep позволяет достичь как высокой чувствительности, так и низкой ложной тревожности, что критично для практического внедрения в CI/CD пайплайны.

by jms703 • 28 июня 2026 г. в 17:50 • 1113 points

ОригиналHN

#api#appsec#ci-cd#claude#cve#cybersecurity#glm#llm#machine-learning#semgrep

Комментарии (516)

  • GLM‑5.2 показал сопоставимый или лучший результат в тестах по поиску уязвимостей, но преимущество связано с использованием специального харнеса, а не только с моделью.
  • Стоимость использования GLM‑5.2 через API значительно ниже, чем у Claude Max/Codex, что делает её привлекательной для массового кодинга.
  • Открытые модели, такие как GLM‑5.2, начинают конкурировать с закрытыми фронтендовыми системами, вызывая обеспокоенность у коммерческих провайдеров.
  • Для получения надёжных сравнений необходимы одинаковые условия тестирования (один харнес для всех моделей) и контекстные ограничения, иначе выводы могут быть вводящими в заблуждение.

Cerebras Code now supports GLM 4.6 at 1000 tokens/sec (cerebras.ai)

Cerebras привлек $1.1 млрд в раунде G по оценке $8.1 млрд, представив платформу для быстрой генерации кода на базе модели GLM-4.6. Эта модель обрабатывает более 1,000 токенов в секунду, занимая первое место в рейтинге вызова инструментов Berkeley Function Calling и демонстрируя производительность на уровне Sonnet 4.5 в веб-разработке. Платформа позволяет использовать GLM-4.6 с любым AI-дружелюбным редактором кода через API.

Компания предлагает три тарифных плана: бесплатный с ограниченным доступом, Pro за $50 в месяц (24 млн токенов в день) и Max за $200 (120 млн токенов). Эти варианты подходят как для небольших проектов, так и для полноценной разработки с интеграцией в IDE. Cerebras позиционирует свой сервис как решение для поддержания состояния потока программиста без ожидания генерации кода.

by nathabonfim59 • 08 ноября 2025 г. в 00:00 • 164 points

ОригиналHN

#api#cerebras#code-generation#glm#ide#llm#web-development

Комментарии (108)

  • Cerebras Code с GLM 4.6 демонстрирует высокую скорость генерации (до 1000 ток/с), что значительно ускоряет итерации, особенно для UI-разработки и рутинных задач.
  • Пользователи разделились: одни видят в скорости революцию для продуктивности ("секретное оружие"), другие скептичны, считая модель уступающей конкурентам (Claude, GPT) и сомневаясь в отсутствии квантования.
  • Практическая ценность зависит от задач: скорость критична для быстрой обратной связи в веб-разработке, но менее полезна для глубокого кодирования или нишевых областей (embedded), где важнее точность.
  • Поднимаются вопросы о реальной производительности модели, обоснованности цены ($50/мес) и устойчивости бизнес-модели, особенно при высоких затратах на токены.
  • Аппаратная реализация (гигантский чип Cerebras) объясняет скорость, но вызывает споры о влиянии на качество вывода и отсутствие независимой верификации.

DeepSeek-v3.1 (api-docs.deepseek.com) 🔥 Горячее 💬 Длинная дискуссия

DeepSeek-V3.1 — первый шаг к эпохе агентов

  • Гибридный режим: одна модель, два режима — Think (рассуждения) и Non-Think (быстрый ответ).
  • Скорость: Think-режим отвечает быстрее, чем DeepSeek-R1-0528.
  • Агентские навыки: улучшены работа с инструментами и многошаговые задачи.
    Попробовать: chat.deepseek.com

API

  • deepseek-chat → Non-Think, deepseek-reasoner → Think, контекст 128К.
  • Поддержка формата Anthropic API и строгого Function Calling (бета).

Инструменты и агенты

  • Рост результатов на SWE / Terminal-Bench.
  • Эффективнее многошаговые поисковые задачи.

Модель

  • База V3.1: дообучена на 840 B токенов для длинного контекста.
  • Обновлён токенайзер и шаблон чата.
  • Веса открыты: V3.1-Base, V3.1.

Цены

  • Новые тарифы с 5 сентября 2025, 16:00 UTC. До этого действуют старые.

by wertyk • 21 августа 2025 г. в 19:06 • 732 points

ОригиналHN

#anthropic#api#deepseek#fp8#gguf#glm#huggingface#llm#nvidia

Комментарии (253)

  • Выпущены GGUF-файлы DeepSeek-V3.1 для локального запуска: ≥250 ГБ RAM+VRAM или медленный off-load на SSD.
  • На бенчмарках модель уступает GPT-5/Claude 4/GLM-4.5, но конкурентоспособна среди открытых весов.
  • Пользователи жалуются на навязчивое «Of course.» в ответах, повышенные галлюцинации и устаревшие форматы tool-use.
  • Цена API: $0,56 вход / $1,68 выход за 1 M токенов — дёшево, но без прежней ночной скидки.
  • Китайские СМИ: V3.1 обучена на FP8 для будущих отечественных AI-чипов, что может ударить по позициям NVIDIA.