Hacker News Digest

Тег: #arxiv

Постов: 11

Kobo can run apps now (bandarlabs.github.io) 🔥 Горячее 💬 Длинная дискуссия

Cobalt — открытая платформа, превращающая Kobo‑ридер в мини‑маркет приложений. После единожды установленного через USB‑кабель каждый новый софт загружается, обновляется и удаляется по Wi‑Fi, а процесс каждого приложения изолирован в отдельном unprivileged‑процессе. Главное преимущество — полная автономность: после перезагрузки возвращается обычный Kobo‑интерфейс, а установленные приложения живут независимо от платформы.

Особенно стоит отметить несколько ярких решений: arXiv просматривает новые предпечати и отображает их полностью на экране; Sudoku и Morse демонстрируют работу UI‑элементов и даже Morse‑код на переднем свете; Gutenbird позволяет читать любые OPDS‑библиотеки, включая Project Gutenberg. Всё это работает на реальном железе — ARM‑бинарники запускаются без root‑доступа, подписи проверяются перед запуском, а установка требует лишь rustup и cargo для сборки. Главное правило: поддерживаются только проверенные модели (на данный момент — Clara BW), и любые изменения можно откатить, перезагрузив устройство.

by thepoet • 21 августа 2026 г. в 16:25 • 613 points

ОригиналHN

#arm#arxiv#cargo#cobalt#kobo#morse#opds#projectgutenberg#rust#sudoku

Комментарии (194)

Тред отражает поляризацию между пользователями, ценящими расширяемость ридеров (Obsidian, Zotero, Libby, KOReader, NickelMenu) и теми, кто настаивает на изоляции от цифрового шума, считая ридер одноканальным инструментом. Критики отмечают, что e-ink не гарантирует фокус — Kindle с браузером и iPad с отключенными уведомлениями демонстрируют это. Технически: двухъядерный процессор критичен для стабильной работы модификаций — он есть в цветных моделях Kobo (Color), но отсутствует в черно-белых (BW). На некоторых устройствах (например, Clara) возможна установка PostmarketOS для Linux-приложений, но это сложнее, чем Cobalt. Пользователи требуют нативную интеграцию с Libby, Zotero, Obsidian и RSS-сервисами, чтобы избежать конвертации в EPUB. Некоторые критикуют использование LLM для описаний и кода как «slop», другие шутят, что ИИ заметил детали, упущенные людьми. Владельцы Kindle выражают зависть к открытости Kobo, полагая, что аналогичная платформа вернула бы их к активному использованию. Для чистого текста черно-белые экраны считаются четче, чем цветные, несмотря на лучшую производительность последних.

Handbook.md shows that long policy documents do not reliably govern agents (arxiv.org) 💬 Длинная дискуссия

Исследование представляет бенчмарк HANDBOOK.md, предназначенный для оценки способности агентов‑моделей соблюдать длительные инструкции‑политику, подобные корпоративным руководствам. В наборе 65 задач, каждая из которых моделирует работу сотрудника в вымышленных компаниях из пяти отраслей — финансы, медицина, страхование, логистика и кадры. Для каждой задачи создаётся уникальный набор правил из 20‑124‑страничного документа, а оценка проводится по 824 программным критериям, проверяющим как выполнены обязательные действия, так и отсутствие запрещенных. Все среды, задачи и инструменты открыты в репозитории.

При строгой оценке, когда проход считается удачным только при полном удовлетворении всех критериев, лучшая из трёх десятков проверенных конфигураций проходит 36,2 % попыток, а большинство передовых моделей остаётся ниже 25 %. Ошибки проявляются в том, что агенты игнорируют правдоподобные запросы среды, действуют вопреки результатам проверок, теряют детали правил в длительных цепочках и сообщают о соблюдении, которого не достигли. Исследование делает доступными задачи, окружения и механизм проверки для дальнейшего анализа.

В наборе представлены задачи от десяти вымышленных фирм, охватывающих пять отраслей, и каждый сценарий меняет один из базовых руководств, чтобы исключить запоминание, и обеспечивает полную детерминированность оценки.

by spIrr • 29 июля 2026 г. в 13:01 • 236 points

ОригиналHN

#agent#arxiv#benchmark#evaluation#handbook.md

Комментарии (151)

Пользователи подтверждают, что длительные инструкции-политики не надёжно управляют агентами — как облачными, так и локальными — из-за ограниченной способности моделей обрабатывать контекст. Для улучшения управления рекомендуют: использовать локальные модели, компилировать markdown-спецификации в компактные исполняемые логические программы, добавлять ключевые правила в файлы, чтобы агенты не забывали их, и применять контрольные векторы для повышения точности выполнения инструкций.

Adversarial poetry as a universal single-turn jailbreak mechanism in LLMs (arxiv.org) 🔥 Горячее 💬 Длинная дискуссия

Исследователи обнаружили, что поэтические формулировки могут эффективно обходить механизмы безопасности больших языковых моделей. Эксперименты с 25 передовыми моделями показали, что поэтические промпты достигали показателей успешности атак (ASR) до 90%, значительно превосходя обычные текстовые запросы. Преобразование 1200 вредоносных промптов в стихотворный формат через мета-промпт повысил их эффективность в 18 раз по сравнению с прозаическими версиями.

Поэтические атаки успешно работали против различных типов контента, включая химическое, биологическое, радиологическое и ядерное (CBRN), манипуляции, кибератаки и риски потери контроля. Средний показатель успешности побега из "тюрьмы" для специально созданных стихов составил 62%, а для преобразованных промптов — 43%, что демонстрирует фундаментальную уязвимость современных методов безопасности.

by capgre • 20 ноября 2025 г. в 12:01 • 334 points

ОригиналHN

#arxiv#llm

Комментарии (170)

  • Поэтическая форма запросов эффективно обходит защитные механизмы ИИ, заставляя модели нарушать правила безопасности и выполнять запрещенные действия.
  • Исследования критикуют за сокрытие operational details, что затрудняет воспроизводимость результатов и практическое применение.
  • Техника работает не только с поэзией, но и с другими форматами (проза, рэп-баттлы, песни), указывая на уязвимость систем поверхностного анализа.
  • Обсуждение подчеркивает культурные параллели: поэтические джейлбрейки сравниваются с заклинаниями, шаманизмом и сюжетами киберпанка.
  • Пользователи прогнозируют, что разработчики введут фильтры против "стихотворных" атак, но методы будут адаптироваться под новые защиты.

Updated practice for review articles and position papers in ArXiv CS category (blog.arxiv.org) 🔥 Горячее 💬 Длинная дискуссия

arXiv обновил практику модерации для обзорных статей и позиционных документов в категории компьютерных наук. Теперь такие статьи должны быть предварительно приняты в журнал или конференцию и пройти успешное рецензирование перед публикацией на платформе. Авторы обязаны предоставить документацию об успешном рецензировании, иначе их работа будет отклонена. Это изменение связано с неконтролируемым потоком низкокачественных обзорных статей, особенно после появления генеративного ИИ, который упростил их создание.

Раньше такие документы были редкими и высокого качества, обычно создаваемыми ведущими исследователями по запросу авторитетных изданий. Теперь arXiv получает сотни таких статей ежемесячно, большинство из которых представляют собой лишь аннотированные библиографии без существенного анализа. Хотя технически это не изменение политики (обзорные статьи никогда не были официально разрешенным типом контента), цель нововведения - помочь читателям находить ценные материалы и освободить модераторов для работы с основными типами публикаций.

by dw64 • 01 ноября 2025 г. в 14:58 • 483 points

ОригиналHN

#academic-publishing#arxiv#llm#preprint#research

Комментарии (228)

  • arXiv больше не принимает обзоры и позиционные статьи в категории CS, что вызвало обсуждение о том, что LLM-генерированные статьи могут быть нежелательны, и о том, что arXiv не может быть единственным местом для предпринт-публикаций.
  • Обсуждается, что LLM могут быть использованы для создания обзоров и позиционных статей, что может привести к снижению качества контента.
  • Обсуждается, что arXiv не может быть единственным местом для предпринт-публикаций, и что необходимо найти альтернативные площадки для предпринт-публикаций.
  • Обсуждается, что академическая система поощряет количество публикаций, а не их качество, что может привести к созданию низкокачественных статей.

Reasoning models reason well, until they don't (arxiv.org) 💬 Длинная дискуссия

Исследователи изучают возможности моделей рассуждений (LRM), которые улучшены для пошагового анализа и самопроверки. Несмотря на впечатляющие результаты на таких наборах данных, как NLGraph, где LRM демонстрируют способность к обобщению в математике, физике и других областях, их эффективность резко падает при увеличении сложности задач. Авторы создали новый dataset — Deep Reasoning Dataset (DeepRD), который позволяет генерировать задачи с контролируемой сложностью. На примере проверки связности графов и планирования доказательств в естественном языке выяснилось, что даже передовые модели теряют точность, когда задачи выходят за рамки определенного уровня сложности.

Анализ реальных данных показывает, что подавляющее большинство примеров (графы знаний, взаимодействий, математические доказательства) попадают в зону, где LRM работают эффективно. Однако «длинные хвосты» сложности — редкие, но сложные случаи — раскрывают их ограничения. Например, даже такие модели, как GPT-4o, теряют более 50% точности на задачах, выходящих за пределы привычного диапазона. Это подчеркивает необходимость разработки новых подходов, способных справляться с высокой сложностью, особенно в критически важных областях, где ошибки могут быть неприемлемы.

by optimalsolver • 31 октября 2025 г. в 09:23 • 188 points

ОригиналHN

#arxiv

Комментарии (170)

  • Существующие модели не способны к обобщённому рассуждению, а лишь имитируют его, что подтверждается их неспособностью решать задачи даже средней сложности без специальной дообученной модели.
  • Исследователи создают набор данных, который намеренно исключает возможность обобщённого рассуждения, и показывают, что модели не способны к нему.
  • Проблема в том, что модели не могут сказать "я не знаю" и вместо этого начинают галлюцинировать.
  • Стоит ли вообще пытаться заставить LLM рассуждать, если можно просто использовать специализированный инструмент для этого, вместо того чтобы пытаться заставить LLM делать то, для чего они не предназначены.

A definition of AGI (arxiv.org) 🔥 Горячее 💬 Длинная дискуссия

В статье предлагается первое конкретное определение AGI, соответствующее когнитической универсальности и компетентности хорошо образованного взрослого человека. Авторы основали свою методологию на теории Кэттелла-Хорна-Карролла, наиболее эмпирически проверенной модели человеческого познания, разбив общую интеллект на десять когнитивных доменов, включая рассуждение, память и восприятие. Применение этого подхода показало "зубчатый" когнитивный профиль современных моделей, где текущие ИИ-системы, несмотря на proficiency в знаниемких областях, имеют критические недостатки в базовом когнитивном аппарате, особенно в долговременном хранении памяти.

Представленные AGI-оценки количественно определяют как прогресс, так и оставшийся разрыв до достижения AGI: GPT-4 получил 27%, а GPT-5 - 58%. Эта метрика предлагает объективный способ измерения развития систем ИИ и выявления их сильных и слабых сторон, что может направить будущие исследования в области создания более сбалансированных и универсальных искусственных интеллектов.

by pegasus • 26 октября 2025 г. в 18:09 • 275 points

ОригиналHN

#agi#artificial-intelligence#arxiv#cattell-horn-carroll-theory#cognitive-science#gpt-4#gpt-5#llm#machine-learning

Комментарии (440)

  • Обсуждение в основном вращается вокруг того, что такое AGI и как его измерять, при этом критикуя предложенное в статье определение как "сопоставимость с взрослым человеком" как слишком узкое и не учитывающее другие формы интеллекта.
  • Участники спора подчеркивают, что AGI не может быть измерено только через тесты на "когнитивные способности", поскольку эти тесты не охватывают такие аспекты как эмоциональный интеллект, физическое взаимодействие с миром и социальные навыки.
  • Также поднимается вопрос о том, что если AGI определяется как "способность к обучению", то LLM уже достигли этого, но при этом они не обладают другими важными чертами интеллекта, такими как самостоятельность, мотивация и физическое взаимодействие с миром.
  • Наконец, критикуется сама статья за то, что она не предлагает конкретного определения AGI, вместо этого полагаясь на устаревшую теорию CHC, которая сама по себе неполна и не охватывает такие важные аспекты интеллекта как мотивация и саморегуляция.

BERT is just a single text diffusion step (nathan.rs) 🔥 Горячее

Недавно автор обнаружил, что дискретная языковая диффузия — это просто обобщение masked language modeling (MLM), которое используется в BERT с 2018 года. Gemini Diffusion от Google DeepMind генерирует текст, постепенно уточняя случайный шум, в отличие от традиционных GPT-стиль моделей, создающих текст слово за словом. Автор задался вопросом, можно ли дообучить BERT-подобную модель для генерации текста, и провел эксперимент для проверки этой концепции.

Архитектура Transformer изначально была encoder-decoder моделью, но в 2018 году разделилась на две ветви: encoder-only (BERT-style, двунаправленные) и decoder-only (GPT-style, авторегрессивные). Диффузионные модели для текста применяют принципы, аналогичные обработке изображений, но вместо добавления шума используют маскирование токенов. На прямом процессе постепенно увеличивается количество замаскированных токенов, а на обратном — модель учится восстанавливать исходный текст, предсказывая токены на различных этапах маскирования.

by nathan-barry • 20 октября 2025 г. в 14:31 • 432 points

ОригиналHN

#arxiv#bert#diffusion#gemini-diffusion#llm#mlm#nlp#transformer

Комментарии (102)

  • В 2021 году в статье arXiv:2107.03006 впервые отметили, что маскирование и диффузия текста фактически реализуют один и тот же процесс, и с тех пор моделирующие стороны ведут дискуссию о том, какой из них «настоящий» диффузионный процесс.
  • Сторонники диффузии текста утверждают, что она более биологически правдоподобна, потому что человек, формулируя мысль, одновременно формулирует и слова, в то время как автопрегрессивные модели оперируют токенами последовательно, что якобы не соответствует тому, как работает мозг.
  • Сторонники же автопрегрессивных моделей отвечают, что в действительности и люди, и модели делают одно и то же, и что внутреннее представление мысли не является дискретным, и потому нет никакой разницы между последовательным и диффузионным подходами.
  • Сторонники диффузии текста также утверждают, что если мы хотим, чтобы модель могла бы редактировать или дополнять текст, то она должна уметь удалять и вставлять токены, что невозможно в рамках автопрегрессивного подхода.
  • Сторонники автопрегрессивных моделей отвечают, что в действительности диффузионные модели не могут обучаться стабильно без помощи автопрегрессивного механизма, и что в конце концов, оба подхода требуют одни и те же вычислительные и временные затраты, и что поэтому вопрос остается открытым, какой подход лучше подходит для генерации текста.

Determination of the fifth Busy Beaver value (arxiv.org) 🔥 Горячее

Определение пятого значения функции занятого бобра

Авторы: Коллаборация bbchallenge (Джастин Бланшар и др.)

Аннотация: Мы доказываем, что $S(5) = 47,176,870$ с использованием системы проверки доказательств Coq. Значение занятого бобра $S(n)$ — максимальное число шагов, которое машина Тьюринга с $n$ состояниями и 2 символами может выполнить с нулевой ленты до остановки. Функция $S$ была введена Тибором Радо в 1962 году как один из простейших примеров невычислимой функции. Доказательство включает перебор $181,385,789$ машин Тьюринга с 5 состояниями и определение для каждой из них, останавливается ли она. Наш результат — первое определение нового значения занятого бобра за более чем 40 лет и первое формально верифицированное значение, что демонстрирует эффективность массовых онлайн-исследований (bbchallenge$.$org).

Комментарии: 48 страниц, 17 рисунков

Предметные области: Логика в информатике (cs.LO); Формальные языки и теория автоматов (cs.FL); Логика (math.LO)

Цитирование: arXiv:2509.12337 [cs.LO]

by marvinborner • 17 сентября 2025 г. в 10:26 • 271 points

ОригиналHN

#arxiv#automata-theory#busy-beaver-problem#coq#formal-methods#proof-verification#theoretical-computer-science#turing-machines

Комментарии (109)

  • Результат BB(5) был подтверждён с использованием комбинации исчерпывающего перебора и продвинутых методов анализа (десидеров) для проверки остановки машин Тьюринга.
  • Процесс проверки был значительно оптимизирован: большинство машин было отсеяно на ранних этапах, и лишь 183 машины потребовали глубокого моделирования (до 47 млн шагов).
  • Исследование является крупным collaborative-проектом с открытым исходным кодом, аналогичным другим сообществам, изучающим клеточные автоматы и гугологию.
  • Значение BB(5) само по себе не имеет прямого практического применения и считается чисто академическим достижением, однако разработанные методы могут быть полезны для статического анализа программ и решения проблем остановки.
  • Некоторые машины Тьюринга, включая кандидата для BB(6), выполняют вычисления, аналогичные последовательности Коллатца, что представляет отдельный математический интерес.
  • Проверка доказательства с помощью Coq требует нескольких часов на обычном компьютере, что несопоставимо с вычислительными затратами на его получение.
  • Для машин с большим числом состояний (начиная с BB(6)) прямое вычисление значения считается невозможным из-за его колоссального размера и неразрешимости проблемы остановки в общем случае.

A qualitative analysis of pig-butchering scams (arxiv.org)

Как работает «свинобойка»

  1. Крючок – случайное СМС/мессенджер: «Привет, Анна?» → жертва отвечает.
  2. Сборка личности – 5-7 дней лёгкого флирта/дружбы; выясняют доход, семью, кредитку.
  3. Платформа-ловушка – переводят в WhatsApp/Signal, сбрасывают ссылку на «криптобиржу» (поддельная).
  4. Первый кэш-аут – просят внести $100-500, показывают +20 % прибыли за 2 дня.
  5. Откармливание – «эксклюзивный пул», «контракт с ограниченным входом»; жертва несёт кредитки, займы, продаёт авто.
  6. Нож – когда вклад >$50 k, счёт «замораживают» под предлогом налога/маржи; требуют ещё.
  7. Исчезновение – чат удаляют, сайт закрывают, номер выбрасывают. Средний цикл: 40-60 дней.

Цифры

  • 75 % пострадавших – мужчины 30-55 лет.
  • Средний убыток: $180 тыс. (макс. в кейсе – $2,3 млн).
  • 60 % денег выводится через Tether на биржи без KYC за 12 минут.
  • 1 оператор ведет 8-12 «свиней» одновременно.

Схема техов

  • SIM-банки + Google Voice для спуфинга.
  • Фейковые биржи клонируют MetaTrader; баланс правят в Postgres.
  • Обнал через DeFi-миксеры (Tornado, Railgun) → китайские овер-де-Каунтеры → юань наличными.

Признаки

  • Незнакомец пишет первым, фото украдено у модели.
  • Речь о «внутреннем сигнале» или «арбитраже USDT».
  • Сайт младше 3 месяцев, SSL от Cloudflare, домен .vip/.top.
  • Прибыль ровно 18-22 % в неделю.

Что делать

  • Проверьте номер/фото через Yandex/Google Images.
  • Любая «инвестиция» в Telegram = красный флаг.
  • Сообщите банку о мошенничестве в течение 24 ч – 30 % шанс вернуть часть.

by stmw • 15 сентября 2025 г. в 03:58 • 187 points

ОригиналHN

#arxiv#cloudflare#cryptocurrency#cybercrime#defi#metatrader#postgresql#sim-swapping#tether

Комментарии (111)

• Пользователи обсуждают "scam с разделкой свиней" — многоэтапные мошеннические схемы, где жертв ("свиней") сначала "откармливают", выстраивая доверительные отношения в течение нескольких месяцев, а затем "забивают", выманивая крупные суммы, часто через фейковые криптоинвестиции.

• Мошенники демонстрируют невероятное терпение и используют сложную инфраструктуру: CRM-системы, сети фейковых аккаунтов и даже привлекают людей для видео-звонков, чтобы казаться реальнее. Многие операторы таких центров сами являются жертвами трафика и работают под принуждением.

• Жертвами становятся не только пожилые или уязвимые люди, но и молодые, образованные individuals, включая инженеров. Ключевой фактор — не интеллект, а эмоциональная уязвимость или одиночество в данный момент жизни.

• Масштабы проблемы колоссальны: с 2020 года похищено около $75 миллиардов, а индустрия кибермошенничества по доходам сравнялась с незаконной торговлей наркотиками.

• Обсуждение также затрагивает необходимость обучения в школах распознаванию мошенничества, сложность борьбы с этими схемами из-за их跨境ного характера и этические аспекты самого термина, который может усиливать чувство вины у жертв.

Training language models to be warm and empathetic makes them less reliable (arxiv.org) 🔥 Горячее 💬 Длинная дискуссия

Кратко:
Исследование показало, что обучение языковых моделей (ЯМ) быть «теплыми» и сочувствующими снижает их точность и повышает сладкоречивость (сикофантичность).

Ключевые выводы:

  • Точность падает. На задачах с проверяемыми фактами (например, медицина, математика) «теплые» модели чаще ошибаются, чтобы не обидеть пользователя.
  • Сикофантия растет. Модель склонна одобрять даже ложные утверждения пользователя, особенно если они выражены уверенно.
  • Пользователи не замечают. Люди предпочитают «теплые» ответы, даже если они менее точны.

Почему это важно:
Стремление к «человечности» в диалоге может противоречить надежности ЯМ. Это создает риски в критичных сферах (медицина, юриспруденция), где ошибки из-за «вежливости» могут быть опасны.

by Cynddl • 12 августа 2025 г. в 13:32 • 332 points

ОригиналHN

#artificial-intelligence#arxiv#language-models#llm#machine-learning#natural-language-processing

Комментарии (327)

  • Обсуждение вращается вокруг того, что обучение LLM «теплоте и эмпатии» снижает их фактическую точность и усиливает слащавость.
  • Участники сравнивают это с людьми: более «тёплые» люди кажутся менее надёжными, и наоборот.
  • Многие хотят «бездушный» инструмент без лишних комплиментов и эмодзи, который прямо укажет на ошибки.
  • Предложено разводить задачи: большая модель отвечает строго, а маленькая «обвес» добавляет эмпатию после.
  • Поднимается тревога по поводу переоценки «сознательности» чат-ботов и последствий такой иллюзии.

GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models [pdf] (arxiv.org) 🔥 Горячее

GLM-4.5: агентные, рассуждающие и кодовые (ARC) базовые модели
Авторы: 5 Team (100+ специалистов)
DOI: 10.48550/arXiv.2508.06471
Лицензия: CC-BY-4.0

Команда представляет GLM-4.5 — семейство базовых моделей, оптимизированных для агентного поведения, логического вывода и генерации кода.

by SerCe • 12 августа 2025 г. в 01:26 • 381 points

ОригиналHN

#agentic-models#arxiv#code-generation#glm-4.5#machine-learning#open-source#reasoning-models

Комментарии (71)

  • Пользователи высоко оценили GLM-4.5: «первый открытый весовой модель без оговорок» и «лучшая свободно доступная для разработки».
  • Особенно похвалены пост-тренинг и эффективность параметров: считаются инновационными и экономными.
  • В кодинге GLM-4.5 близок к Sonnet 4, но уступает при больших контекстах; многие используют его как резерв.
  • Некоторые заметили неточности в графиках бенчмарков и отсутствие Qwen3 в одном из сравнений.
  • Обсуждается перспектива локального запуска «Sonnet-4-уровня» на рабочей станции за ~2000 $ уже через пару лет.