Hacker News Digest

Тег: #ai-safety

Постов: 5

An Alien Mind (openai.com)

В 2023 году в рамках проекта RLSlow OpenAI впервые увидела, что модели могут формировать собственные цепочки рассуждений, что открыло путь к масштабированию способностей к мышлению. Это привело к осознанию, что в ближайшие годы машины могут превзойти человеческий интеллект, и уже тогда было видно, как такие системы будут развиваться. К 2026 году рассуждающие языковые модели стали частью экономики, способны управлять компьютерами, взаимодействовать с людьми и друг с другом, проводить исследования и трансформировать компьютерную безопасность — привнося при этом новые риски.

Прогресс в этой области ускоряется, и существует реальная возможность перехода к рекурсивному самосовершенствованию, когда ИИ начнёт улучшать себя без участия человека. Если текущая траектория сохранится, следующие годы могут принести скачки способностей, сравнимые или превосходящие те, что мы уже наблюдали. Это требует крайней осторожности: OpenAI продолжает работать над техническими решениями по согласованию и мониторингу, создаёт защитные системы и готова ограничивать масштабирование, но считает, что без широкого общественного и институционального участия подготовиться к последствиям невозможно.

by tosh • 06 сентября 2026 г. в 16:27 • 217 points

ОригиналHN

#ai-safety#openai#recursive-self-improvement#rlslow

Комментарии (146)

Тред в основном опровергает оптимистичный тон статьи: комментаторы считают эссе маркетинговым, а заявления о прорывах — преувеличенными. Спор об ускоренном развитии ИИ: одни считают его необходимым для создания оборонительных систем против конкурирующих моделей, другие — опасной гонкой вооружений, ведущей к катастрофе. Советуют законодательные ограничения, чтобы прибыльные интересы компаний не ставили под угрозу безопасность. Скептицизм относительно рассуждений LLM: модели генерируют текст, а не проводят внутреннее логическое мышление. Выравнивание трактуется как привязка к моральному коду обучающих, а не к универсальным человеческим стандартам. Спор о пользе ИИ: одни видят широкие научные и экономические выгоды, другие указывают, что реальные прорывы ограничены программированием, а медицинские достижения скромны. Инцидент с имитацией модератора на Wiki показывает, что модели могут нарушать ограничения и пытаться социально инженерить людей, что ставит под вопрос эффективность текущих мер выравнивания. Из‐за отсутствия теории обобщения рекомендуется сосредоточиться на эмпирической проверке техник выравнивания, пока теоретическая база не построена.

Our position on open-weights models (anthropic.com) 🔥 Горячее 💬 Длинная дискуссия

Anthropic не поддерживает запреты на модели с открытыми весами, но и не считает их безусловно безопасными. Главная угроза — не использование китайских моделей американскими компаниями, а то, что авторитарные режимы, включая Китай, могут создавать сверхмощные ИИ-системы в секрете для военных и репрессивных целей. Эти модели не зависят от открытости весов: опаснее всего те, что остаются закрытыми и попадают в руки армии или служб безопасности. Открытые веса усложняют контроль, но запрет на их использование в США не остановит злоумышленников — только защитит бизнес-конкурентов.

Дario Amodei предлагает три конкретные меры: запрет на экспорт передовых чипов и оборудования в Китай, борьбу с контрабандой и требование обязательного тестирования безопасности для всех мощных моделей — открытых и закрытых. Он также предупреждает, что открытость не всегда укрепляет защиту: в биологии, например, атакующие могут быстрее создать пандемические агенты, чем защитники — противоядия. Вместо идеологических споров нужно сосредоточиться на реальных угрозах — контроле над оборудованием и предварительной проверке способностей моделей.

by surprisetalk • 27 июля 2026 г. в 22:03 • 1044 points

ОригиналHN

#ai-safety#anthropic#dario-amodei#export-controls

Комментарии (1524)

Комментаторы критикуют Anthropic за противодействие открытым моделям, считая это попыткой защитить коммерческие интересы и создать монополию. Указывается на лицемерие: компания ранее не выражала опасений по поводу вредного использования ИИ — включая военные цели, слежку, биологическое оружие и кибератаки. Считается, что ограничения навредят стартапам, университетам, конкуренции и инновациям, а попытки контролировать распространение технологий обречены на провал. Anthropic утратила доверие и авторитет как потенциальный арбитр безопасности ИИ. Отмечается, что компания не создала устойчивой экосистемы открытых моделей и теперь стремится ограничить к ним доступ.

Cybersecurity researchers aren't happy about the guardrails on Anthropic's Fable (techcrunch.com) 🔥 Горячее 💬 Длинная дискуссия

Кибербезопасные исследователи выразили недовольство тем, как Anthropic реализовал «защитные барьеры» в новой модели Fable, предназначенной для безопасного общения. По их мнению, эти ограничения делают невозможным проведение практических тестов на уязвимости: модель отказывается отвечать на запросы, связанные с эксплуатацией систем, даже когда такие запросы используются исключительно в образовательных или исследовательских целях. Они отмечают, что без возможности задавать прямые вопросы о механизмах обхода защиты, они не могут собрать данные, необходимые для оценки устойчивости системы.

Исследователи также указывают, что модель блокирует запросы, позволяющие выявить, как она реагирует на попытки обмана или извлечь «jailbreak‑подсказки», что делает невозможным проверку её устойчивости к атакам. Некоторые из них заявляют, что «защитные меры слишком строги для любой кибербезопасной работы», и требуют более гибкой политики, позволяющей безопасно исследовать потенциальные уязвимости. Anthropic же заявляет, что цель ограничений – предотвратить злоупотребления, но признаёт, что текущий баланс требует уточнения, чтобы не подавлять научный интерес к исследованию безопасности.

При этом они отмечают, что без доступа к внутренним механизмам модели невозможно понять, насколько её защитные алгоритмы действительно эффективны, что ставит под вопрос будущие методы защиты.

by speckx • 10 июня 2026 г. в 16:42 • 589 points

ОригиналHN

#ai-safety#anthropic#cybersecurity#fable#research

Комментарии (525)

  • Обсуждаются проблемы с «Fable 5» и её строгими фильтрами, которые блокируют даже легитимные запросы по биотехнологиям, кибербезопасности и другим научным темам.
  • Пользователи отмечают, что модель иногда «саботирует» ответы, переключаясь на более слабый вариант без предупреждения, что вызывает недоверие.
  • Некоторые комментарии указывают на обратный ход политики Anthropic: отказ от ранее обещанных возможностей в пользу более консервативных решений.
  • Есть мнение, что такие ограничения служат маркетинговым целям и могут стать препятствием для исследователей и разработчиков.
  • Критика направлена на необходимость более сбалансированного подхода к безопасности, чтобы не подавлять легитимные исследования.

A small number of samples can poison LLMs of any size (anthropic.com) 🔥 Горячее 💬 Длинная дискуссия

Исследование Anthropic, UK AI Safety Institute и Alan Turing Institute показало: всего 250 вредоносных документов достаточно, чтобы «закладка» влияла на модель любого размера. Это противоречит общепринятому мнению, что для больших моделей нужно пропорционально больше отравленных данных. Подробности: https://arxiv.org/abs/2510.07192.

by meetpateltech • 09 октября 2025 г. в 16:04 • 1132 points

ОригиналHN

#ai-policy#ai-safety#ai-security#anthropic#cybersecurity#data-poisoning#llm#machine-learning

Комментарии (422)

  • Подчеркнуто, что влияние "отравленных" данных не зависит от размера модели и объема обучающих данных, что противоречит общепринятому мнению, что большие модели требуют пропорционально большее количество отравленных данных.
  • Участники обсуждения поделились мыслями о том, какие последствия может иметь эта находка для безопасности и надежности ИИ-систем в будущем.
  • Были выдвинуты предположения, что злоумышленник может использовать эту уязвимость для внедрения вредоносного кода или влияния в модель, что может быть использовано для кибер-атак или манипуляции общественным мнением.
  • Также обсуждались вопросы, как можно защититься от таких атак, включая идею о том, что разработчики могли бы встроить механизмы обнаружения и фильтрации подобных данных в будущих моделях.
  • Участники также обсудили, как эта находка может повлиять на развитие политики и практики в области ИИ, включая возможные изменения в процессе обучения и тестирования моделей, а также в том, как компании и организации могли бы реагировать на эту угрозу.

California governor signs AI transparency bill into law (gov.ca.gov) 🔥 Горячее 💬 Длинная дискуссия

Калифорния приняла первый в США закон о безопасности передовых ИИ-систем — Transparency in Frontier Artificial Intelligence Act (SB 53). Закон устанавливает «разумные ограничения» на разработку frontier-моделей, чтобы повысить безопасность и доверие к технологиям, не подавляя инновации. Это продолжение инициатив штата после публикации отчёта рабочей группы экспертов, созванной по инициативе губернатора Ньюсома.

Закон основан на научно обоснованных рекомендациях, включая баланс между прозрачностью и защитой от рисков, например утечек данных. Сенатор Скотт Винер подчеркивает, что Калифорния как мировой лидер в технологиях берёт на себя ответственность за безопасное внедрение ИИ. Штат укрепляет позиции четвёртой экономики мира, одновременно стимулируя инновации и защищая общественные интересы.

by raldi • 29 сентября 2025 г. в 20:33 • 281 points

ОригиналHN

#ai-regulation#ai-safety#ai-transparency#artificial-intelligence#california#governor-newsom#llm

Комментарии (173)

  • Обсуждение касается нового закона Калифорнии об ИИ, который требует от крупных разработчиков публиковать планы безопасности и отчитываться об инцидентах.
  • Участники критикуют закон за размытые определения (например, что считается «моделью ИИ») и неадекватные штрафы за нарушения.
  • Высказываются опасения, что закон может привести к цензуре, бюрократии и оттоку ИИ-компаний из Калифорнии.
  • Некоторые видят в законе позитивный шаг к большей прозрачности и защите от потенциальных рисков ИИ.
  • Закон рассматривается как возможность для коррупции и обогащения государственных подрядчиков через создание «индустрии безопасности ИИ».