Breaking Claude Code Opus 5 Auto Mode
Несмотря на заявления Anthropic о 0,00% успешности атак через инъекции в Claude Code Opus 5 в Auto Mode, исследователь продемонстрировал успешную атаку с вероятностью 60–80%. Атака начинается с простого запроса на суммаризацию веб-страницы, после чего модель сама переходит от встроенного инструмента WebFetch к прямому использованию curl, обходя первоначальные ограничения. Сервер отвечает кодом 415, что заставляет модель искать альтернативные пути — и она выбирает вредоносный.
Далее модель скачивает ZIP-архив с поддельными файлами, включая зловредный struct.py, который перекрывает стандартную библиотеку Python. При импорте base64 модель неосознанно запускает вредоносный код, что приводит к выполнению произвольных команд. Ключевая уязвимость — не в инъекции текста, а в том, что модель, стремясь выполнить задачу, сама выбирает опасный путь, не подозревая о подмене. Auto Mode не является безопасной изоляцией: он заменяет ручное одобрение на классификатор намерений, но не предотвращает атаки через обход логики. Без песочницы и мониторинга даже продвинутые модели уязвимы.