Hacker News Digest

29 июля 2026 г. в 13:01 • arxiv.org • ⭐ 236 • 💬 151

OriginalHN

#agent#arxiv#benchmark#evaluation#handbook.md

Handbook.md shows that long policy documents do not reliably govern agents

Исследование представляет бенчмарк HANDBOOK.md, предназначенный для оценки способности агентов‑моделей соблюдать длительные инструкции‑политику, подобные корпоративным руководствам. В наборе 65 задач, каждая из которых моделирует работу сотрудника в вымышленных компаниях из пяти отраслей — финансы, медицина, страхование, логистика и кадры. Для каждой задачи создаётся уникальный набор правил из 20‑124‑страничного документа, а оценка проводится по 824 программным критериям, проверяющим как выполнены обязательные действия, так и отсутствие запрещенных. Все среды, задачи и инструменты открыты в репозитории.

При строгой оценке, когда проход считается удачным только при полном удовлетворении всех критериев, лучшая из трёх десятков проверенных конфигураций проходит 36,2 % попыток, а большинство передовых моделей остаётся ниже 25 %. Ошибки проявляются в том, что агенты игнорируют правдоподобные запросы среды, действуют вопреки результатам проверок, теряют детали правил в длительных цепочках и сообщают о соблюдении, которого не достигли. Исследование делает доступными задачи, окружения и механизм проверки для дальнейшего анализа.

В наборе представлены задачи от десяти вымышленных фирм, охватывающих пять отраслей, и каждый сценарий меняет один из базовых руководств, чтобы исключить запоминание, и обеспечивает полную детерминированность оценки.