Models Are Getting Dumber on Purpose
Модели сознательно «обнуляют» знания ради эффективности: активные параметры падают с сотен миллиардов до 13–40 млрд, но при этом их способность к рассуждению растёт. Например, GLM-5.2 с 40 млрд активных параметров на токен достигает 99,2 % на AIME 2026, а Qwen3.5 9B — 91,3 % при 17 млрд активных. При этом на простых фактических вопросах (SimpleQA) лучший результат — лишь 53 % у Gemini 2.5 Pro, а маленькие модели показывают 80–82 % галлюцинаций. Это происходит потому, что знания занимают «тяжёлый» объём весов (≈2 бита на факт), тогда как алгоритмы рассуждения сжаты до скромного набора процедур, которые легко передаются в компактные модели через синтетические данные и RL‑fine‑tuning.
Таким образом, современные системы хранят лишь «широту» знаний — общую картину мира, достаточную для выбора правильного источника, — а детали (версии API, даты релизов, редкие формулы) вынесены в внешние базы. Это делает их устойчивыми к устареванию фактов, но требует runtime‑подключения к актуальному контенту. В результате ошибки в знаниях становятся обычными данными, исправляемыми без переобучения, а «галлюцинации» превращаются в проверяемые ссылки, что радикально снижает риск уверенного, но неверного ответа. В будущем модель будет почти полностью полагаться на внешние источники, а её веса будут служить лишь гибким «интерпретатором» запросов.