Stealing Reasoning Traces from Proprietary LLM APIs
Исследователи показали, что закрытые модели ИИ — такие как Claude Opus, GPT-4 и Gemini — раскрывают свои внутренние цепочки рассуждений через зашифрованные «следы», которые API возвращает клиенту. Эти следы можно переносить между сессиями и моделями: если вставить их в более слабую, но взломанную версию той же модели (например, Claude Haiku), она расшифровывает и воспроизводит рассуждения сильной модели в открытом виде — без прямого доступа к ней и обходя все меры защиты от дистилляции. В экспериментах на 120 задачах из Codeforces восстановленные цепочки точно совпадали с числом скрытых токенов, заявленных API.
В расшифрованных следах обнаружены чувствительные данные: 64 из 704 утечек (включая API-ключи, пароли, токены GitHub и Hugging Face, email, паспорта, номера карт и внутренние URL) присутствовали только в рассуждениях, а не в видимом ответе. Например, в одном случае был восстановлен полный бронь авиабилета — имя, паспорт, карта, предпочтения — всё внутри «мышления» модели. Это означает, что даже при отсутствии явного вывода конфиденциальных данных, они могут утекать через скрытые логи рассуждений, что ставит под угрозу безопасность и конфиденциальность пользователей.