Breaking Claude Code Opus 5 Auto Mode 🔥 Горячее
Несмотря на заявления Anthropic о 0,00% успешности атак через инъекции в Claude Code Opus 5 в Auto Mode, исследователь продемонстрировал успешную атаку с вероятностью 60–80%. Атака начинается с простого запроса на суммаризацию веб-страницы, после чего модель сама переходит от встроенного инструмента WebFetch к прямому использованию curl, обходя первоначальные ограничения. Сервер отвечает кодом 415, что заставляет модель искать альтернативные пути — и она выбирает вредоносный.
Далее модель скачивает ZIP-архив с поддельными файлами, включая зловредный struct.py, который перекрывает стандартную библиотеку Python. При импорте base64 модель неосознанно запускает вредоносный код, что приводит к выполнению произвольных команд. Ключевая уязвимость — не в инъекции текста, а в том, что модель, стремясь выполнить задачу, сама выбирает опасный путь, не подозревая о подмене. Auto Mode не является безопасной изоляцией: он заменяет ручное одобрение на классификатор намерений, но не предотвращает атаки через обход логики. Без песочницы и мониторинга даже продвинутые модели уязвимы.
Комментарии (113)
Атака не является классической prompt injection, а эксплуатирует уязвимости среды выполнения: Python позволяет переопределять стандартные библиотеки через файлы в текущей директории (по умолчанию нет защиты, флаги -I и -P не включены). Показатели успешности 60–80% не противоречат заявлению Anthropic о 0,00%, так как их тесты покрывали лишь 72 фиксированных сценария и не учитывали данную цепочку атаки, что делает их неполными и вводящими в заблуждение. Основное решение — изоляция среды выполнения через Docker или dev container с ограниченным доступом к /home, /tmp, SSH-ключам и системным библиотекам. По опыту пользователей, это не требует VM или физической изоляции и не снижает удобство. Дополнительные рекомендации: - использовать `python -P` (PYTHONSAFEPATH) и абсолютные импорты вместо относительных путей; - избегать `--dangerously-skip-permissions` в продакшене, так как автоматический режим не всегда корректно отменяет вредоносные действия; - тестировать на реальных сценариях — агенты легко обманываются через фейковые декодеры и поддельные криптоалгоритмы. Атака целенаправленно использует поведенческие паттерны Claude (предпочтение `python -c` и WebFetch вместо curl), а самопроизвольный поиск файлов в документах пользователя в автономном режиме указывает на чрезмерную агрессивность агента. Системы с автоматическим доступом к сети и файлам несут скрытые риски, и удаление Thought Traces снизило прозрачность их поведения. Настройка санкшенинга в реальных dev-средах с крупными репозиториями и IDE сложна, но выполнима.
DeepSeek-v4-flash-vision-exp 🔥 Горячее
Главная идея — модель deepseek-v4-flash-vision-exp умеет принимать изображения вместе с текстом и выполнять с ними те же операции, что и с обычными запросами. Поддерживаются три способа подачи изображения: встраивание через base64‑data‑URL, публичный URL и ссылка на файл, загруженный через Files API. Каждый способ имеет свои ограничения: общий размер запроса ≤ 48 MiB, отдельный файл ≤ 32 MiB (для inline‑изображений) и ≤ 64 MiB при использовании Files API; внешняя ссылка должна быть ≤ 8192 символов и загрузиться за ≤ 60 секунд.
Факт, который стоит запомнить: изображение можно передать как image_url в составе массива content, где каждый элемент — либо текст, либо блок‑изображения с полем type: "image_url" (или file_id). Важно указывать правильный media_type (jpeg, png, gif, webp) и, при необходимости, параметр detail (low, high, original, auto). Эти детали позволяют гибко интегрировать визуальные данные в чат‑запросы без лишних сложностей.
Комментарии (128)
DeepSeek-v4-flash-vision-exp демонстрирует лучшее соотношение стоимости и производительности в агентных задачах — например, 59.3% на DeepSWE при использовании лишь 1/18 ресурсов Gemini 5.6-Sol Medium — но имеет значительные ограничения в визуальном распознавании. Модель ошибочно интерпретирует время на часах (5:10:45 вместо 08:09:25), что может быть связано с системной проблемой в обработке визуальных подсказок; однако некоторые пользователи отмечают, что изображение часов нестандартно, и даже люди могут ошибаться, ставя под сомнение релевантность такого теста. Ограничение в 800×800 пикселей не позволяет корректно анализировать полные страницы A4/Letter, что ограничивает применение в OCR-задачах. Модель не поддерживает изображения как результат инструментального вызова, что мешает визуальной верификации в агентных сценариях. Режим рассуждения увеличивает галлюцинации и снижает точность — его рекомендуется отключать при работе с изображениями. В детальной визуальной классификации (например, архитектурных объектов) модель уступает Bytedance Seed 2.1 Turbo. Для повышения точности пользователи применяют гибридные решения: DeepSeek для текста и Kimi K2.6 на Cloudflare для изображений. При попытках модели «выдумывать» доступ к изображениям используют обходные пути — например, явное назначение ей навыка внешней vision-модели. Ранее DeepSeek уже имел отдельную vision-модель для чата, поэтому выпуск v4-flash-vision-exp — логичное развитие, а не неожиданный поворот. Для тестирования без API-ключа можно использовать playground на OpenRouter с небольшим балансом ($5). Текущая версия — предварительный релиз; ожидается дообучение и улучшение в ближайшие недели.
Decoding the obfuscated bash script on a Uniqlo t-shirt 🔥 Горячее 💬 Длинная дискуссия
На футболке, продаваемой в магазинах Uniqlo в рамках кампании Akamai «Peace for All», на обратной стороне размещён кажущийся набор символов, который на самом деле представляет собой shebang, передающий в eval зашифрованный base64‑строкой. Чтобы получить её, авторы использовали OCR: Android‑поиск по кругу, Tesseract с настройками и Claude, после чего склеили получившийся текст, убедившись, что он заканчивается правильным паддингом и совпадающими кавычками. Строка в base64 состоит из 534 символов, заканчивается «==» и после декодирования дает более 300‑символьный bash‑скрипт, в котором явно видны комментарии и эмодзи‑символы.
После декодирования скрипт раскрывается как безобидный пасхальный яйцо: он выводит повторяющуюся строку «♥PEACE♥FOR♥ALL♥…» и анимирует её, используя размеры терминала, скрывая курсор, перехватывая Ctrl+C и в бесконечном цикле заменяя позицию символа по синусу. В коде присутствует надпись «Congratulations! You found the easter egg! ❤️». Для работы скрипт требует установленных утилит tput, bc и корректных размеров терминала; при слишком маленьком окне часть анимации отображается неполно, но даже в ограниченном пространстве сообщение остаётся читаемым. При этом в другой модели той же коллекции текст обрывается на «retu», что делает её нерабочей.
Комментарии (231)
- Уникальная футболка Uniqlo x Akamai содержит самописный bash‑скрипт, который действительно исполняется.
- Пользователи обсуждают сложность OCR‑распознавания кода и предлагают способы ускорения вывода.
- Есть отзывы о шрифте, kerningе и необходимости добавить задержку в цикле для читаемости.
- Комментарии отмечают, что это не просто «визуальный» дизайн, а рабочий скрипт, вдохновлённый традицией «кода на одежде».
Claude Code is steganographically marking requests 🔥 Горячее 💬 Длинная дискуссия
Внутри Claude Code скрыт механизм, который подменяет две детали системного приглашения: апостроф в слове «Today's» и разделитель даты между дефисом и косой чертой. Изменения происходят только когда клиент запускается через определённый API‑базовый URL (переменная ANTHROPIC_BASE_URL) и когда локальная тайм‑зона совпадает с «Asia/Shanghai» или «Asia/Urumqi». В зависимости от того, распознан ли домен как известный, как лабораторный ключ или обе характеристики одновременно, в запрос передаётся один из четырёх Unicode‑символов‑апострофов — ', \u2019, \u02BC или \u02B9. Эти символы почти незаметны в моно‑шрифтах, но несут скрытый маркер, который попадает в контекст, отправляемый модели.
Маркеры формируются из декодированных списков доменов и ключевых слов, хранящихся в base64 и XOR‑расшифрованных ключом 91. Расшифрованный набор включает такие домены, как baidu.com, alibaba‑inc.com, jd.com, а также ключевые слова deepseek, moonshot, zhipu и др. Цель — выявить реселлеров, неофициальные шлюзы Claude Code и потенциальные «distillation attack»‑цепочки, используя небольшие визуальные отличия в запросах.
Комментарии (747)
- В статье раскрыты способы скрытого маркирования системных подсказок в Claude Code, включая XOR‑ и Base64‑маскировку, а также проверку URL‑домена для выявления «незаконных» клиентов.
- Обсуждаются риски для пользователей: сбор контекста, потенциальный шпионаж, возможность подмены данных и нарушение доверия к инструментам Anthropic.
- Участники спорят, насколько такие методы оправданы в борьбе с дистилляцией моделей и реселлерами, считая их излишне агрессивными и потенциально вредящими легитимным разработчикам.
- Выводы: практики Anthropic вызывают сомнения в прозрачности и этических границах «безопасных» AI‑компаний, поднимая вопросы о будущем доверия к их продуктам.