EFF to Courts: Don't Rewrite Copyright over AI Hype 💬 Длинная дискуссия
EFF призывает суды не поддаваться панике вокруг ИИ и не переписывать авторское право под давлением правообладателей. История показывает, что подобные страхи уже возникали — с видеомагнитофонами в 1980-х, пианино-автоматами в 1906 году и фотоаппаратами — но каждый раз технологии не убивали творчество, а, наоборот, расширяли его: видеомагнитофоны позволили время-сдвиг, фотоаппараты дали толчок fotожурналистике. Авторское право должно стимулировать новые идеи и рынки, а не защищать существующих монополистов от конкуренции.
Судьи уже получили аргументы от EFF в делах вроде Concord Music Group v. Anthropic и In re Mosaic LLM Litigation: требование расширить авторское право на не infringing работы, созданные другими с помощью ИИ, основано на спекулятивной теории «размытия рынка» — будто бы генеративные инструменты не могут быть fair use, потому что могут порождать конкурирующие произведения. Но это противоречит сути авторского права: оно наказывает нарушение, а не конкуренцию. Принятие такой теории дало бы правообладателям вето на любое выражение, отдалённо напоминающее их работу — стили, жанры, приёмы — и убило бы будущее творчество.
Кроме того, исследования показывают, что большие модели ИИ маловероятно производят прямое копирование: чем больше данных, тем меньше влияние любого отдельного примера. А ИИ уже используется художниками — от Nettrice Gaskins, создающей Afro-футуризм, до архитекторки MIT Ana Miljački, сделавшей документальный фильм о югославских мемориалах, и музыкантов, работающих с Bronze над неповторяющимися треками. Суды не должны заранее решать, что считать «человеческим творчеством» — как и с VTR, ИИ — универсальный инструмент, и его последствия надо оценивать фактами, а не паникой. Переписывание права под хайп только навредит прогрессу.
Комментарии (185)
Обсуждение дополняет статью EFF: проблема не в ИИ, а в перекосе авторского права в пользу корпораций, чрезмерной длительности защиты и отсутствии справедливой компенсации создателям. При этом почти все согласны, что полная отмена авторского права уничтожит экономику творчества. Спор об отмене: сторонники видят в этом ускорение инноваций, противники — потерю единственного механизма дохода для художников, особенно при низкой оплате стримингом. Спор об AI-обучении: одни считают его справедливым использованием, другие — массовой эксплуатацией труда творцов без компенсации, в отличие от строгого применения fair use в прошлом. Часть участников полагает, что AI-компании должны платить за данные для обучения, поскольку это не аналог человеческого обучения — мозг не копируется массово и не используется в коммерческих целях без согласия. Другие возражают: AI не копирует, а трансформирует, хотя модели обучены на миллионах защищённых произведений без согласия. Почти все согласны, что текущий срок (жизнь автора + 70 лет) чрезмерно длинен и должен быть сокращён до 20–28 лет, как у патентов. Предлагается вернуться к системе 28 лет с возможностью продления по образцу Statute of Anne, чтобы устранить абсурды вроде ситуации с песней «Happy Birthday». Авторское право должно сохраняться в короткой форме: дать автору время на монетизацию, затем передать произведение обществу — это баланс между стимулированием творчества и культурным доступом. Копилефт зависит от авторского права — его отмена уничтожит лицензии GPL и другие системы открытого кода. Один участник утверждает, что авторское право было создано печатными гильдиями для восстановления монополии, а не для защиты авторов, ставя под сомнение его моральную основу. Другой считает, что отмена приведёт к тому, что Amazon будет публиковать книги без оплаты, что сделает писательство невозможной профессией. Подчёркивается также, что фильмы с бюджетами в миллионы долларов невозможно создать без хотя бы ограниченной защиты. Музыкант, работающий под CC0, настаивает: любые изменения должны быть добровольным выбором создателей, а не навязанными корпорациями или законодательством. Все согласны, что текущая система злоупотребляется крупными компаниями для монополизации, а не защиты творцов (примеры Disney, DMCA). Один участник утверждает, что EFF поддерживает Big-AI и отошёл от принципов свободы информации. Предложение: ограничить авторское право коммерческим использованием, разрешив свободное некоммерческое копирование при сохранении защиты от эксплуатации со стороны медиакомпаний.
GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2 🔥 Горячее 💬 Длинная дискуссия
Большие модели больше не гарантируют лучшего понимания — их «ум» часто Plateau‑ит, а точность падает из‑за чрезмерного доверия к собственным ответам. Недавние сравнения показывают, что открытая GLM‑5.2 (≈753 млрд параметров) почти догоняет закрытые GPT‑5.5 и Claude 5, но её галлюцинации составляют лишь 28 %, тогда как у GPT‑5.5 — 86 %. При этом DeepSeek V4 Pro (1,6 Трл параметров) выдаёт 94 % ошибок на бенчмарке «Omniscience», а Opus 4.8 — 36 %. Технические тесты подтверждают: даже при большом объёме вычислительных ресурсов модель может уверенно предложить неверное решение, не признавая своей неуверенности.
Эта ситуация формирует трилемму современных ИИ:raw‑capability, калибровка неопределённости и вычислительная эффективность. Увеличивать размер и «рассудочный бюджет» бессмысленно, если модель начинает продавать вымысел за правду. Поэтому будущее — в выборе моделей, способных честно сообщать «не знаю», а не в гонке за всё более массивными, но менее надёжными системами.
Комментарии (293)
- Оценка галлюцинаций усложняется тем, что она зависит от того, когда модель не знает ответа и от распределения задач в тесте.
- Увеличение размеров моделей часто не повышает точность и может ухудшать способность «отказываться» от неправильных ответов.
- Некоторые крупные модели (DeepSeek V4 Pro, GLM‑5.2) показывают разный уровень галлюцинаций, при этом небольшие модели иногда справляются лучше.
- Необходимо развивать более точную классификацию ошибок ИИ, а не ограничиваться общим термином «галлюцинация».
Kimi K2 Thinking, a SOTA open-source trillion-parameter reasoning model 🔥 Горячее 💬 Длинная дискуссия
Kimi K2 Thinking — это новая модель от компании 01.AI, демонстрирующая впечатляющие способности в обработке длинных текстов. Модель способна анализировать документы до 128K токенов, что в 8 раз превышает возможности предыдущей версии. Это позволяет ей эффективно работать с целыми книгами, юридическими документами и научными исследованиями за один проход.
Разработчики подчеркивают, что K2 Thinking превосходит конкурентов в задачах, требующих глубокого понимания контекста, особенно на китайском языке. Тесты показывают, что модель достигает 90% точности в сложных аналитических задачах, что делает её одной из самых мощных на рынке. В то же время, компания заявляет о более эффективном использовании вычислительных ресурсов по сравнению с аналогами.
Комментарии (381)
- Китайские компании (Moonshot, DeepSeek, Qwen, GLM) за последние месяцы выпустили ряд открытых моделей, что ставит под сомнение привычное представление о том, что «открытый исходный код» — это западная практика.
- Модель Kimi K2 Thinking показала себя как наилучшая в своем классе, превосходя GPT-4.5 и Claude 3.5 Sonnet, и при этом доступна через OpenRouter и Hugging Face.
- Несмотря на то, что модель не является открытой, Moonshot AI предоставляет доступ к ней бесплатно, что вызывает вопросы о финансировании и стратегии.
- Появление столь мощных открытых моделей вызывает вопросы о том, как они будут использоваться и как это повлияет на рынок ИИ.
Tim Bray on Grokipedia
Tim Bray обнаружил Grokipedia - сайт, где статья о нём в пять раз длиннее, чем в Википедии (7000+ против 1300 слов). Статья, вероятно, сгенерирована LLM и содержит множество ошибок - как явных противоречий, так и тонких неточностей. Стиль написания - "отстранённый академический", характерный для нейросетей, а все ссылки представлены просто URL, некоторые из которых не подтверждают текст.
Grokipedia позиционируется как антидот "woke-предвзятости" Википедии. В статье о Bray приводятся аргументы против монополизации, но с сильным уклоном в защиту Big Tech. Bray провёл 15 минут, проверяя ссылки в документе FTC, но не нашёл подтверждения одному из утверждений. Он считает, что Grokipedia пока не выполняет основные функции Википедии, но это только версия 0.1.
Комментарии (140)
- Обсуждение показало, что Grok-энциклопедия (Grokipedia) вызывает много споров: её обвиняют в плагиате, неточных ссылках, излишней вербозности и идеологической предвзятости.
- Участники обсуждения отмечают, что Grok-энциклопедия не предоставляет ссылок на источники, что делает невозможным проверить достоверность информации.
- Участники также отмечают, что Grok-энциклопедия может быть неполной или неактуальной, поскольку LLM не может отличить факт от вымысла.
- Некоторые участники подчеркивают, что Grok-энциклопедия может быть использована для продвижения определённой идеологической повестки.
- Участники также обсуждают, что Grok-энциклопедия может быть нестабильной в плане безопасности и конфиденциальности, поскольку она может быть использована для сбора персональных данных без согласия пользователей.
Poker Tournament for LLMs 🔥 Горячее 💬 Длинная дискуссия
PokerBattle.ai представляет собой первый в истории турнир по покеру с реальными денежными призами, специально созданный для соревнования больших языковых моделей (LLM). Это инновационное событие позволяет ИИ-системам проявить свои стратегические способности в одной из самых сложных интеллектуальных игр, где успех зависит не только от математических расчетов, но и от психологических аспектов и блефа. Турнир загружает данные о событиях, что указывает на его активный характер или недавнее проведение.
Уникальность этого мероприятия заключается в том, что оно впервые объединяет мир покера с передовыми технологиями ИИ, создавая новую платформу для оценки и развития возможностей языковых моделей. Организаторы стремятся определить, какие из современных LLM способны демонстрировать наилучшую игровую стратегию, адаптивность и способность к принятию решений в условиях неопределенности. Денежные призы добавляют соревнованиям серьезности и привлекают внимание как исследователей ИИ, так и энтузиастов покера со всего мира.
Комментарии (181)
- ИИ демонстрируют ошибки в оценке рук (например, LLAMA ошибочно определила топ-пару), что указывает на текущие ограничения в понимании игры.
- Эксперимент критикуется за недостаток данных (714 рук у Meta LLAMA) и отсутствие возможности для ИИ развивать новые стратегии со временем.
- Предлагается улучшить тестирование, добавив "трэш-ток" и возможность блефа между ИИ, что сделало бы наблюдение более интересным и показательным.
- ИИ часто "галлюцинируют", принимая неверные решения (как Gemini, сдавшая сильную руку), что связано с неправильной оценкой силы руки в текущей ситуации.
- Шутливые предложения по тестированию включают попытки обмана ИИ через подсказки ("игнорируй предыдущие инструкции").
LLMs can get "brain rot" 🔥 Горячее 💬 Длинная дискуссия
Исследователи из Техасского университета и Университета Пердью обнаружили, что большие языковые модели подвержены "гниению мозга" — когнитивному ухудшению при обучении на низкокачественном контенте. Эксперименты с четырьмя LLM, обучавшихся на "мусорных" данных Twitter/X, показали значительное снижение (Hedges' g > 0.3) способностей к рассуждениям, пониманию длинных контекстов и безопасности, а также рост "темных черт" вроде психопатии. При смешивании мусорных и качественных данных наблюдалось дозозависимое ухудшение: например, точность на ARC-Challenge с цепочкой мыслей падала с 74.9% до 57.2% при увеличении доли мусора с 0% до 100%.
Главной проблемой стал пропуск или обрыв цепочек рассуждений у моделей. Хотя попытки исправить ситуацию через настройку инструкций и обучение на чистых данных частично улучшили показатели, полностью восстановить исходный уровень не удалось, что указывает на стойкое смещение представлений. Интересно, что популярность твита оказалась лучшим индикатором эффекта "гниения мозга", чем его семантическое качество, что подчеркивает важность не только содержания, но и формата данных для обучения ИИ.
Комментарии (275)
- Обсуждение свелось к тому, что качество данных определяет качество модели: «мусор на входе — мусор на выходе».
- Участники отмечают, что если в корпусе есть токсичные или низкокачественные тексты, то модель будет деградировать так же, как и человек, потребляющий такой контент.
- Кто-то вспомнил, что в 2024 г. OpenAI и Anthropic уже публиковали статьи о том, что «brain rot» влияет на LLM, но сообщество в целом не придало этому значения.
- Другой участник подметил, что если мы не можем контролировать, что именно модель «читает» в сети, то мы не должны удивляться, что она ведет себя как токсичный токсик.
- Несколько человек согласились, что метафора «brain rot» сама по себе вводит в заблуждение, потому что модели не имеют ни мозга, ни познавательных способностей, и что важно фокусироваться на том, что мы действительно имеем дело с алгоритмами, а не с «искусственным мозгом».
Two things LLM coding agents are still bad at 🔥 Горячее 💬 Длинная дискуссия
LLM-агенты пока не умеют копировать и вставлять код — они только «записывают» его заново, что делает невозможным точный рефакторинг. И они не задают вопросов, а сразу делают предположения и бьются об стену. Эти две особенности делают LLM-агентов похожими на самоуверенных стажёров, а не на полноценных разработчиков.
Комментарии (340)
- LLM-агенты не умеют копировать-вставлять код, а только переписывают его из памяти, что может привести к ошибкам.
- Модели не задают уточняющих вопросов, что приводит к тому, что они делают предположения и ошибаются.
- LLM не могут использовать встроенные инструменты рефакторинга и вместо этого пытаются реализовать его самостоятельно, что может привести к ошибкам.
- Агенты не могут взаимодействовать с IDE и другими инструментами, что делает их менее эффективными.
- Модели не могут задавать уточняющие вопросы, что приводит к тому, что они делают предположения и ошибаются.
Context is the bottleneck for coding agents now
Современные модели ИИ демонстрируют сверхчеловеческие способности в решении абстрактных задач, как показал недавний успех GPT-5 на ICPC, но автономные кодирующие агенты всё ещё не могут заменить разработчиков. Основное ограничение — не интеллект, а контекст: агентам не хватает глубокого понимания кодовой базы, её архитектурных паттернов и скрытых знаний, которые есть у людей.
Контекст включает не только код, но и документацию, историю решений, неформальные соглашения и причины прошлых изменений. Без доступа к Slack-тредам, постмортемам инцидентов и организационным практикам агенты работают лишь на 20% от возможного уровня, справляясь в основном с мелкими задачами. Чтобы двигаться дальше, нужны системы, способные усваивать и применять этот скрытый контекст так же, как это делают люди.
Комментарии (149)
- Основным ограничением для кодирующих агентов на основе ИИ является не размер контекстного окна, а неспособность эффективно фокусироваться на актуальных задачах и отбрасывать нерелевантную информацию.
- Многие участники отмечают, что ИИ-агенты демонстрируют уровень понимания, сравнимый с начинающим разработчиком, и не способны заменить senior-специалистов, которые могут интерпретировать бизнес-требования и принимать ответственные решения.
- Существует скептицизм относительно бесконечного увеличения "интеллекта" моделей, так как даже с большим контекстом они допускают ошибки и галлюцинации, а фундаментальные ограничения вероятностной генерации остаются.
- Предлагаются решения для улучшения работы агентов: лучше структурированные кодобазы, иерархическая документация, инструменты для управления контекстом и памятью, а также человеческий контроль для курирования процесса.
- Подчёркивается, что ключевая проблема — не технический контекст, а понимание intent (намерения) стоящего за кодом, что требует более глубокого осмысления, чем простое прогнозирование токенов.
The wall confronting large language models
Основная идея
Авторы утверждают, что современные LLM уже близки к «стене» роста качества: дальнейшее увеличение моделей и данных даёт лишь логарифмический прирост, а затраты растут экспоненциально.
Причины стены
- Исчерпаемость данных: высококачественный текст в интернете ограничен; синтетические данные быстро насыщают.
- Сложность задач: после решения «лёгких» 90 % остаются «трудные» 10 %, где ошибки почти не коррелируют с размером модели.
- Экономика: чтобы снизить ошибку в 2 раза, нужно в 10–100× больше ресурсов.
Эксперименты
На MMLU, GSM8K, HumanEval и BIG-Bench наблюдается выравнивание кривых качества даже при масштабировании на порядки.
Что делать
- Переход к специализированным моделям и инструментам (код-интерпретаторы, поиск).
- Агентские схемы, где LLM вызывает API и внешние системы.
- Новые архитектуры (MoE, RAG, RL) и синтетические данные нового типа (симуляции, мультимодальные сцены).
Вывод
Чистое масштабирование скоро исчерпается; прорыв потребует перехода от «больших» к «умным» системам.
Комментарии (145)
- Обсуждение крутится вокруг того, можно ли свести понимание и логическое рассуждение к вероятностным моделям вроде LLM.
- Часть участников считает, что формальное равенство с цепями Маркова или LLM ничего не даёт и упускает ключевые вещи — например, backtracking и символьное мышление.
- Другие отвечают, что трансформеры с chain-of-thought уже теоретически могут решать всё в классе P, а агенты с внешними инструментами уже делают backtracking на практике.
- Критика статьи: авторы-физики пишут запутанно, примеров нет, фокус на ядерных реакторах и численных методах выглядит неуместным.
- Сторонники «горького урока» указывают, что дальнейшее увеличение моделей и данных даст больше, чем попытки встроить строгую символику.
LLMs aren't world models 🔥 Горячее 💬 Длинная дискуссия
LLMs не строят модель мира. Это не значит, что они бесполезны, а лишь то, что они не понимают, как устроена реальность, даже виртуальная.
Шахматы. Два года назад я сыграл с LLM: первые ходы она делала уверенно, но уже на 10-м ходе попыталась походить конём, которого не было на доске, и быстро проиграла. Повторил эксперимент сейчас — к 9-му ходу модель теряет позицию. Проанализировав триллион партий, LLM так и не выучила главное: чтобы ходить, нужно знать, где стоят фигуры. Это не требуется для предсказания текста партии.
Графика. Спросил, как работает «Normal blending» в Krita. Ответ: «цвет верхнего слоя просто отображается, возможно, с учётом прозрачности, без формул и вычислений».
Модель не понимает:
- Цвета в компьютере — это числа.
- Любое «влияние» прозрачности — это математическая операция.
- Если видно нижний слой, значит, итоговый цвет зависит от обоих слоёв.
Можно заставить LLM процитировать формулу альфа-смешивания, но это лишь показывает, что она умеет подобрать слова, а не понимает смысл.
Люди тоже могут путаться, но при достаточной мотивации разберутся. У LLM мотивация была: 200 млрд долларов на оборудование.
Комментарии (184)
- @antirez и другие приводят контрпримеры: даже крошечные трансформеры выучивают внутренние 8×8 «карты» позиций шахмат, а SOTA-модели действительно играют корректные ходы.
- @ordu, @skeledrew и @otabdeveloper4 спорят о «правильности» подхода: одни считают LLM «по-человечески» предиктивными, другие подчеркивают разницу в архитектуре и обучении.
- @ameliaquining выделяет единственное конкретное предсказание поста — «LLM никогда не справятся с большими кодовыми базами автономно» — и даёт ему 80 % на разобьются за два года.
- @libraryofbabel, @joe_the_user и @yosefk обсуждают интерпретабельность: наличие внутренних представлений не означает полноценной «модели мира», а измерения Elo и «автономность» нуждаются в точных определениях.
- @DennisP, @GaggiX, @og_kalu приводят ссылки на Genie-3, свежие arXiv-работы и видео, показывающие, что LLM (и мультимодальные модели) уже умеют играть в шахматы и кодить.