Hacker News Digest

10 июня 2026 г. в 16:42 • techcrunch.com • ⭐ 589 • 💬 525

OriginalHN

#ai-safety#anthropic#cybersecurity#fable#research

Cybersecurity researchers aren't happy about the guardrails on Anthropic's Fable

Кибербезопасные исследователи выразили недовольство тем, как Anthropic реализовал «защитные барьеры» в новой модели Fable, предназначенной для безопасного общения. По их мнению, эти ограничения делают невозможным проведение практических тестов на уязвимости: модель отказывается отвечать на запросы, связанные с эксплуатацией систем, даже когда такие запросы используются исключительно в образовательных или исследовательских целях. Они отмечают, что без возможности задавать прямые вопросы о механизмах обхода защиты, они не могут собрать данные, необходимые для оценки устойчивости системы.

Исследователи также указывают, что модель блокирует запросы, позволяющие выявить, как она реагирует на попытки обмана или извлечь «jailbreak‑подсказки», что делает невозможным проверку её устойчивости к атакам. Некоторые из них заявляют, что «защитные меры слишком строги для любой кибербезопасной работы», и требуют более гибкой политики, позволяющей безопасно исследовать потенциальные уязвимости. Anthropic же заявляет, что цель ограничений – предотвратить злоупотребления, но признаёт, что текущий баланс требует уточнения, чтобы не подавлять научный интерес к исследованию безопасности.

При этом они отмечают, что без доступа к внутренним механизмам модели невозможно понять, насколько её защитные алгоритмы действительно эффективны, что ставит под вопрос будущие методы защиты.