Hacker News Digest

17 июля 2026 г. в 11:30 • kaggle.com • ⭐ 296 • 💬 165

OriginalHN

#agi#benchmark#deepmind#kaggle#llm#medley-bench#metaartw

Blatant AI slop just won a 25k USD DeepMind Kaggle Grand Prize

Kaggle и DeepMind провели хакатон по созданию бенчмарков для оценки когнитивных способностей ИИ, выходящих за рамки простого воспроизведения информации. Победителем в категории «Гран-при» стал MEDLEY-BENCH — метод, оценивающий не только правильность ответа, но и способность модели осознавать свои ошибки под социальным давлением. Это ключевой сдвиг: вместо проверки «знает ли модель ответ» — проверяется, «знает ли она, когда не знает». Участники представили более 1000 бенчмарков, охватывающих пять когнитивных направлений — от рассуждений до самосознания.

Среди отмеченных работ — MetaARTW, демонстрирующий, как некоторые LLM не могут распознавать картины и при этом не осознают этого. Участники подчеркнули необходимость согласованности между амбициозной целью создания AGI и масштабом оценочных систем: без широких, гибких тестов прогресс будет иллюзорным. Организаторы поощрили всех участников, особенно тех, кто представил не только успешные, но и провальные сценарии — как важную часть понимания ограничений современных моделей.