Hacker News Digest

27 июля 2026 г. в 22:37 • github.com • ⭐ 310 • 💬 70

OriginalHN

#benchmark#database-migration#dynamic-config-service-api#github#llm#opus#slopcodebench

Benchmarking Opus 5 on SlopCodeBench

Новый долгосрочный тест SlopCodeBench проверяет, как модель поддерживает качество кода при постепенном раскрытии требований, а не когда всё задание объявлено сразу. Каждый вызов состоит из нескольких контрольных точек, которые появляются по мере развития задачи, делая benchmark «не насыщенным» и измеряя способность модели адаптировать и рефакторить код в реальном времени. Эта методика остаётся «не насыщенной» – модель не знает полной задачи сразу, а получает её частями, имитируя развитие проекта. В работе показано, что даже самые крупные текущие модели, такие как GPT‑5.4 и Opus 4.6, получают лишь 11 % и 17 % строгих проходов, тогда как Opus 5, запущенный на небольшом подмножестве, достигает 24 % – небольшое, но заметное улучшение.

В набор входят database_migration ( пять проверок: ck1‑создание таблиц, ck2‑модификации данных, ck3‑внешние ключи, ck4‑откат, ck5‑зависимости) и dynamic_config_service_api ( четыре проверки: ck1‑REST‑служба с версиями, ck2‑реестр схем, ck3‑рабочий процесс с обзорами, ck4‑политика‑ограничения). Для анализа используют ck6‑ck8: stats, lint, dot, cone, truth‑table, equiv, opt, проверяющие метрики, валидацию и оптимизацию схем. Пять проверок в первой задаче и четыре во второй, позволяют оценить как локальные, так и системные аспекты поддержки кода.