Hacker News Digest

24 июля 2026 г. в 19:45 • artificialanalysis.ai • ⭐ 267 • 💬 148

OriginalHN

Opus 5 is currently #1 on Artificial Analysis Intelligence Leaderboard

Искусственная аналитика измеряет возможности моделей через девять оценок — GDPval‑AA v2, 𝜏³‑Banking, Terminal‑Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA‑Omniscience и AA‑LCR, где последние три помечаются светящейся лампочкой как модели‑рассуждающие. Индекс Openness нормализован от 0 до 100, а AA‑Omniscience принимает значения от –100 до 100, при том 0 означает равное число правильных и неверных ответов, а отрицательные баллы — больше ошибок. Метрика AA‑Briefcase Elo объединяет проходку рубрики, аналитическую и презентационную оценки, переводимые в Elo‑баллы.

Время отклика измеряется в секундах до генерации 500 токенов, включающее время получения первого токена, «раздумье» модели‑рассуждающего и скорость вывода; более низкое значение лучше. Стоимость за единицу интеллектуального задания рассчитывается как цена, деленная на полученный интеллектуальный балл, позволяя сравнивать экономию. Размер модели раскрывается двумя цифрами: общее количество параметров (в миллиардах) и активное количество параметров во время вывода, что особенно важно для моделей Mixture‑of‑Experts, где активные параметры существенно меньше общих. Для моделей с открытыми весами размер и активные параметры публикуются. Обзор сочетает балл, скорость и цену, помогая выбрать модель с оптимальным соотношением качества и стоимости.