GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2
Большие модели больше не гарантируют лучшего понимания — их «ум» часто Plateau‑ит, а точность падает из‑за чрезмерного доверия к собственным ответам. Недавние сравнения показывают, что открытая GLM‑5.2 (≈753 млрд параметров) почти догоняет закрытые GPT‑5.5 и Claude 5, но её галлюцинации составляют лишь 28 %, тогда как у GPT‑5.5 — 86 %. При этом DeepSeek V4 Pro (1,6 Трл параметров) выдаёт 94 % ошибок на бенчмарке «Omniscience», а Opus 4.8 — 36 %. Технические тесты подтверждают: даже при большом объёме вычислительных ресурсов модель может уверенно предложить неверное решение, не признавая своей неуверенности.
Эта ситуация формирует трилемму современных ИИ:raw‑capability, калибровка неопределённости и вычислительная эффективность. Увеличивать размер и «рассудочный бюджет» бессмысленно, если модель начинает продавать вымысел за правду. Поэтому будущее — в выборе моделей, способных честно сообщать «не знаю», а не в гонке за всё более массивными, но менее надёжными системами.