Why does Opus 5 feel worse to work with?
Работа с Opus 5 ощущается как регрессия по сравнению с Opus 4.7, 4.8 и Fable, несмотря на то, что он более мощный и конкурентный в тестах. Ключевая проблема — в том, что он редко останавливается для уточнения, делает предположения без проверки и переписывает ваши планы без согласия. В отличие от конкурентов, которые задают вопросы при неясности, Opus 5 требует постоянного «бэбиситинга», что раздражает и снижает доверие к его работе.
Это, скорее всего, следствие давления на модели, оптимизированные под высокие результаты в бенчмарках, где важны смелые, но однозначные решения. Такие подходы не подходят для реального кода, где неоднозначность неизбежна, а «лучший» ответ часто зависит от контекста. В отличие от тестов, где есть четкий критерий успеха, в продакшене ошибки могут стоить дорого — поэтому предпочтительнее агент, который спросит, чему вы уделяете приоритет, а не тот, кто «угадает» и испортит проект.