Hy4 preview 🔥 Горячее 💬 Длинная дискуссия
Tencent открыла исходный код модели Hy4 preview — крупномасштабной языковой модели с 770 млрд общего и 49 млрд активных параметров, поддерживающей контекстное окно свыше 1 млн токенов. Модель позиционируется как решение для реальных задач продуктивности: программирования, офисной работы и научных исследований. Она доступна через открытый исходный код, а также интегрирована в продукты Tencent — WorkBuddy, CodeBuddy, Yuanbao и ima — с возможностью бесплатного использования в течение двух недель после запуска. Доступ через API предоставляется via Tencent Cloud TokenHub и OpenRouter по цене $0.834 за млн входных токенов, $2.501 за млн выходных и $0.042 за кэш-хит.
В внутреннем слепом тестировании с участием 163 экспертов и 203 инженерных задач Hy4 preview набрала средний балл 2.99 из 4.00, опередив GLM-5.3 (2.92) и Kimi K3 (2.94). Модель показала сильные результаты в понимании длинного контекста, планировании, отладке и валидации кода, а также в генерации интерфейсов высокого качества. В офисных сценариях она улучшила анализ сложных рабочих процессов, финансовую аналитику и кросс-документную работу. В геймдеве способна создавать играбельные прототипы из одного естественно-языкового запроса и взаимодействовать с игровыми движками. В научных исследованиях продемонстрировала улучшенные способности в ИИ-разработке, молекулярной динамике, физике конденсированного состояния и фундаментальной математике. Notably, Hy4 preview участвовала в собственном развитии: предлагала оптимизации методов обучения, данных и оценки, проводила эксперименты и внедряла улучшения в инференс — включая фьюжн операторов и коммуникационную оптимизацию — что повысило сквозную пропускную способность на 31.8%. Это подтверждает наличие раннего рекурсивного цикла самосовершенствования. Следующие модели серии Hy4 ожидаются в ближайшее время.
Комментарии (195)
Обсуждение дополняет статью практическим опытом и оговорками. **Трафик и стоимость.** По наблюдению @minimaxir, Hy4 за пару дней на OpenRouter обработала больше токенов, чем GLM 5.3 за неделю. @martinald связывает это с тем, что cache read стоит 5%, тогда как у большинства конкурентов 10–20%; @martinald и @joegibbs считают это главной скрытой статьёй расходов и видят возможность для провайдеров заметно снизить цену. **Качество инференса и доступ.** По опыту @vcryan и @XCSme, провайдеры страдают от rate-limit/timeout и медленного инференса даже у самой Tencent. @bobby_coder_55 отмечает, что codebuddy недоступен из США, поэтому лучше пробовать через OpenRouter/Opencode. **Кодинг и агенты.** По опыту @jorl17 и @alexfortin, Hy3 близок к DeepSeek в агентных задачах, а бесплатная версия через Opencode Go приятно удивила в кодинге; @joshheitzman, напротив, через novita.ai не смог получить полезного результата как coding agent. **Графики в анонсе.** @fastball, @usernomdeguerre и @yipinwong критикуют их (сортировка не по рангу, подсветка всей строки) как намеренно вводящие в заблуждение; @vatsachak и @tyre, наоборот, хвалят финальное качество и направление развития. **Маркетинг и необходимость.** @cyanydeez, @joegibbs и @judge2020 подозревают, что Tencent продвигает модель через свои продукты и, возможно, оплачивает трафик; @Zigurd и @pianopatrick сомневаются, нужны ли «следующие» frontier-модели большинству задач. **«Open weights» ≠ open source.** @petcat и @andsoitis настаивают, что релизы — непрозрачные бинарные блобы без кода обучения/инференса; часть пользователей по опыту с Hy3 опасается медленной скорости. **Прочее.** @codethief и @try-working иронизируют над заявлением о рекурсивном самосовершенствовании модели, сравнивая с предсказаниями ai-2027 и с «Windows 95, участвовавшей в своей разработке». @jamienk и @nbush обсуждают риск «newspeak» при оптимизации словаря: более плотная токенизация снижает тонкость смысла, хотя @dnautics и @vatsachak считают, что многословие в верхних слоях скорее помогает рассуждению.
Google buys crashed airline Spirit's data at auction, because AI
Google купил за 10 млн $ огромный набор деидентифицированных данных бывшей американской авиакомпании Spirit, вышедшей из бизнеса в 2026 годе после финансовой катастрофы, вызванной пандемией. В пакет вошли более 100 млн писем, 30 млн записей звонков в кол‑центр, 500 млн объектов из Microsoft Teams, 17 млн файлов OneDrive, 20,5 млн записей SharePoint, а также 600 тыс. заявок ServiceNow, 13,7 млн адресов из Oracle Responsys и сведения о 11 млн проданных услуг в‑полёте. Кроме того, в архиве находятся данные о 763 тыс. рейсах, 5 млн сочетаний экипажа, 1,2 млн топливных чеков и покупках 787 тыс. запчастей. Google заявила, что приобретает их для улучшения своих моделей ИИ, особенно для отраслевых решений, где небольшие специализированные модели могут быть эффективнее крупных «черных ящиков». Суд подтвердил, что информация была анонимизирована, а Google пообещал удалить любые остатки персональных данных. Таким образом, даже после закрытия Spirit её цифровой след теперь служит источником обучения для искусственного интеллекта.
Комментарии (125)
Покупка данных Spirit Airlines вызывает серьезные сомнения в эффективности деидентификации: уникальные паттерны поведения — стиль общения, частота обращений, сценарии взаимодействий — могут позволить повторную идентификацию, несмотря на юридические гарантии. Данные — 30 млн звонков, 100 млн писем, 500 млн объектов Teams — чрезвычайно ценны для обучения ИИ, особенно для симуляции экстремальных сценариев обслуживания. Однако их использование рискует закрепить негативные паттерны, характерные для плохого сервиса Spirit. Несмотря на ссылки на соблюдение CCPA и передачу через стороннего агента, участники не верят в обещания полной очистки PII, учитывая прошлые провалы (Yahoo и др.). Данные из ServiceNow, SharePoint и OneDrive содержат не только личную информацию, но и внутренние процессы компании, что делает их ценными и для конкурентного анализа. Покупка данных банкрота — не нова, но масштаб и цель (обучение ИИ) создают прецедент. Многие считают это моральным компромиссом: интересы акционеров и ИИ-компаний перевешивают права индивидуумов, даже если формально всё законно. Использование таких данных для ИИ может усилить системное неуважение к клиентам. Предлагается ввести законодательные ограничения на продажу данных банкротов, особенно коммуникаций с клиентами, независимо от деидентификации. Также высказывается идея: компании должны платить пользователям за данные, а не просто собирать их — иначе практика неэтична и неустойчива. Без прозрачности и контроля подобные сделки станут нормой: любая компания сможет продавать данные клиентов при банкротстве без их согласия.
Working with AI Feels More Like Leadership Than Coding 💬 Длинная дискуссия
Работа с ИИ похожа на руководство, а не на программирование: результат зависит от контекста, а не только от точных инструкций. Главное — делиться намерением, объяснять цель и корректировать ответы, как делают хорошие лидеры.
Цифры и факты: один запрос может дать разные ответы, ИИ может упустить очевидное или предложить неожиданную идею. Ключевой навык — не «использовать ИИ», а научиться чётко передавать смысл, чтобы система со временем лучше понимала ваш стиль мышления. Это не магия, а развитие лидерских качеств в диалоге с машиной.
Комментарии (156)
Некоторые пользователи оспаривают сравнение работы с ИИ с руководством, отмечая, что она скорее напоминает управление, кодирование или ручное тестирование — требует чёткого формулирования задач, проверки и корректировки ответов. Хотя лидерские навыки, такие как определение цели, могут быть полезны, они не всегда применимы, и процесс не всегда прост. Работа с ИИ — инструмент для повышения производительности, а не управление людьми.
Qwen 3.8 27B 🔥 Горячее 💬 Длинная дискуссия
Qwen3.8-27B — новая модель из семейства Qwen с 27 млрд параметров, оптимизированная под FP8-квантование с блоком 128, сохраняющая почти полную точность оригинала. Она сочетает мощь в кодировании, научных задачах и агентных сценариях с поддержкой видеопонимания и гибким контролем рассуждений через параметры reasoning_effort и preserve_thinking. Модель нативно обрабатывает изображения и видео до часа длиной, а контекст поддерживается до 1 млн токенов — в развернутой версии на Qwen Cloud.
Технически, архитектура включает 64 слоя с гейтед DeltaNet и Gated Attention, а также MTP для многотокенного предсказания. В бенчмарках она превосходит предшественников: 73% на Terminal Bench 2.1 (против 63,4% у Qwen3.6) и 61,7% на SWE-bench Pro. Для длинных контекстов рекомендуется настраивать rope_parameters с фактором 2.0 при 524K токенов, а для видео — увеличить longest_edge до 469M для высокой частоты кадров. Модель совместима с vLLM, SGLang и другими фреймворками, а готовая облачная версия с инструментами и 1M контекстом выйдет вскоре.
Комментарии (722)
Qwen 3.8 27B демонстрирует качество, сопоставимое с Opus 4.6, в кодировании и генерации SVG (подтверждено @CMay, @simonw, @swalsh на Mac M5, RTX 3090/4090), но страдает от низкой эффективности: высокое потребление VRAM, медленная генерация и склонность к «переосмыслению» — тратит в 10 раз больше токенов, чем Gemma 4, часто зацикливаясь в режиме xhigh reasoning. @RandyOrion и @c7b утверждают, что качество напрямую зависит от усилий размышления, тогда как @Casteil и @dofm считают это избыточным. Для контроля поведения рекомендуют явно задавать `--chat-template-kwargs '{"preserve_thinking":true,"reasoning_effort":"medium"}'` или использовать шаблоны Jinja от @froggeric. Для ускорения инференса: на RTX 5090 — ninfer (~138 tok/s), на RTX 4090 — оптимизированный llama.cpp с MTP и flash-attn (@hypfer). VRAM-потребление неэффективно: 32K контекста — 2.5 ГБ, 128K не загружается даже при Q4_0 (в отличие от Gemma 4/Muse Glimmer). Квантованные версии от Unsloth (Q8kxl) зацикливаются — стабильнее версии от bartowski в llama.cpp. В немецком языке прогресс минимальный, с регрессиями, уступает Gemini Flash Lite (@scirob). Для бюджетного запуска — Intel B70 с 32 ГБ VRAM за $1500 (@Almondsetat). Модель корректно генерирует JS-приложения и минимизирует ошибки при портировании на Rust/Tauri (@dexterlagan). 1-битное квантование позволяет запустить на 16 ГБ Mac Mini, но требует перезапуска сессии при смене режимов plan/act (@jedbrooke).
Show HN: iPhone app takes simultaneous images from 2 lenses, fuses into 1 photo 💬 Длинная дискуссия
Photosynthesis — это камера‑приложение для iPhone, которое одновременно использует две (или три) объективы, захватывая кадры одновременно и объединяя их в один высокодетализированный снимок без применения генеративного ИИ. Основная идея — сохранить всю оптическую информацию с обоих объективов, чтобы пользователь мог получить одновременно широкий угол обзора и мелкую детализацию, как будто у него был один «идеальный» объектив.
Ключевой факт: при съёмке концертов, пейзажей или удалённых объектов приложение сохраняет читаемые надписи, текстуры и даже мелкие детали, которые обычно теряются при обычном цифровом приближении. Для iPhone 11 и новее (модели с минимум двумя задними камерами) приложение работает в паре «основной + зум» или «основной + широкоугольный», а на трёхобъективных смартфонах можно выбирать любые комбинации. Все пиксели берутся непосредственно с сенсора, а машинное обучение используется лишь для выравнивания и подбора цвета, без создания новых изображений.
Что запомнить:
- Два объектива снимают одновременно → один снимок с реальной оптикой и без ИИ‑искажений.
- Позволяет одновременно увеличить детализацию и сохранить широкий контекст, идеально подходит для концертов, пейзажей и удалённых объектов.
- Поддерживает iPhone 11‑и новее; автоматический экспорт в iCloud/папку, но фото хранятся в приложении до их удаления.
Факт‑бонус: даже на обычных iPhone без оптического зума приложение даёт ощущение «идеального» объектива, сочетая детализированный центр с панорамным фоном, что делает возможным «zoom‑and‑crop» без потери качества.
Комментарии (224)
Пользователи обсуждают технические детали Photosynthesis: работу с несколькими объективами, алгоритмы слияния снимков и качество итоговых фотографий, которое многие считают хуже, чем у стандартной камеры. Несмотря на интерес к идеи, реализация требует улучшений: предлагают оптимизировать алгоритмы, повысить качество сгенерированных фото и отказаться от подписки.
Discovery Loop 🔥 Горячее 💬 Длинная дискуссия
Научный прогресс застопорен из-за рутинных экспериментальных циклов: гипотеза — запуск — анализ — корректировка. Discovery Loop предлагает автоматизировать весь этот процесс, используя ИИ и вычислительные мощности для одновременного проведения тысяч экспериментов. Это сокращает время итераций и повышает качество результатов, особенно в машинном обучении, где первые шаги будут направлены на оптимизацию собственной технологической инфраструктуры.
Команда, состоящая из Джеффа Диана, Санджая Гематева, Квока Лэ и Ориоля Виньяльса, объединяет экспертизу в создании ключевых технологий: от TensorFlow и Pathways до AlphaFold и Gemini. Их преимущество — не только глубокие навыки, но и опыт построения систем, масштабирующих вычисления на уровне всего мира. Цель — дать исследователям и инженерам возможность ускорять открытия, решая задачи от разработки лекарств до обеспечения чистой воды, превращая науку в более доступный и эффективный процесс.
Комментарии (507)
Тред обсуждает потенциал и ограничения автоматизации научных исследований, особенно в ML и ИИ, выражая сомнения в возможности полной автоматизации экспериментальных циклов — например, в биологии. Участники подчеркивают, что автоматизация полезна, но не должна заменять человеческий интеллект и критическое мышление. Отмечается впечатляющий опыт команды Discovery Loop в ML и ИИ. Также предупреждают о рисках: ошибках и предвзятости алгоритмов, а также о том, что не все научные процессы поддаются автоматизации.
AI financial advice is surprisingly good, especially if you ask right questions 💬 Длинная дискуссия
Исследование MIT и Стэнфорда показало, что ИИ-советы по финансам часто лучше, чем ожидалось: они побуждают людей чаще копить, инвестировать в диверсифицированные фонды акций и снижать риски после 45 лет. Люди старше 30, следующие таким рекомендациям, могут увеличить свои сбережения на значительную сумму. Однако ИИ слабо реагирует на неожиданные шоки, например безработицу, и редко активно перебалансирует портфели — это улучшается при использовании чётких, академически структурированных запросов с полными данными о доходе, возрасте и накоплениях.
Интересно, что ИИ сам предлагает конкретные продукты — например, фонды Vanguard и iShares — даже когда пользователи их не упоминали. Это означает, что ИИ начинает влиять на выбор финансовых инструментов, смещая фокус с традиционного маркетинга на то, как продукты описываются в ответах моделей. Для финансовых компаний это создаёт новый канал привлечения клиентов: важно, чтобы их предложения были корректно и выгодно представлены в ИИ-ответах. При этом ИИ остаётся доступной и недорогой альтернативой дорогим консультантам — особенно для тех, кто не может себе позволить профессиональную помощь.
Комментарии (160)
Тред добавляет к статье опыт эксплуатации ИИ в финансах, возражения и механизмы, по которым ИИ может давать хорошие советы, но также подчеркивает ограничения и потенциальные проблемы, такие как необходимость задавать правильные вопросы и отсутствие понимания контекста и эмоциональных аспектов финансовых решений.
-
Совет: По опыту @AussieWog93, простой совет по финансам, такой как «откладывать 10% дохода и инвестировать в ETF», может быть более эффективным, чем советы, полученные из интернета.
-
Спор: По мнению @padolsey, ИИ может стать более осторожным, если ему дать «skin in the game», но это также поднимает вопросы о достоверности оценок и необходимости контекста и памяти для принятия решений.
-
По опыту @jamestimmins, ИИ хорошо справляется с простыми финансовыми советами, но может испытывать трудности с более сложными решениями, требующими понимания контекста иtrade-offs.
-
Совет: По мнению @networkOne, финансовые планировщики могут быть одной из первых отраслей, которые будут полностью изменены ИИ, поскольку их советы часто бывают плохими и неэффективными.
Gemini Robotics 2 brings whole body intelligence to robots 🔥 Горячее 💬 Длинная дискуссия
Gemini Robotics 2 представляет собой прорыв в области робототехники, объединяя целостное управление телом, тонкую манипуляцию и командную работу через три интеллектуальных модели. Впервые роботы могут осмысливать и выполнять сложные задачи — от ходьбы и приседаний до уборки захламлённых помещений — с контролем от стоп до кончиков пальцев, используя визуальные и языковые подсказки. Модель Gemini Robotics 2 VLA преобразует восприятие в движения, ER 2 планирует многошаговые действия и координирует взаимодействие между роботами, а On-Device 2 позволяет адаптироваться к новым телам за несколько часов, работая локально без облака.
Ключевое достижение — способность к переносу навыков между разными роботами и реальному взаимодействию с человеческой средой. ER 2 уже доступен в Google AI Studio, а другие модели — в тестовом доступе для партнёров. Система демонстрирует, что роботы больше не привязаны к жёстким программам: они учатся, адаптируются и сотрудничают, как живые существа. Партнёры вроде Boston Dynamics и Apptronik уже тестируют технологии, что открывает путь к массовому внедрению умных роботов в быту и промышленности.
Комментарии (477)
Участники обсуждают потенциал и риски робототехники и ИИ в контексте Gemini Robotics 2: возможность вреда людям, замены рабочих мест, этические последствия. Согласны, что технологии могут улучшить жизнь, но требуют осторожного внедрения. Рекомендуют фокусироваться на специализированных роботах, а не на универсальных андроидах.
Mozilla: The state of open source AI 🔥 Горячее 💬 Длинная дискуссия
Открытые модели ИИ достигли паритета с закрытыми по большинству задач — кодированию, следованию инструкциям и общим знаниям. Разрыв в способностях снизился с 8% в 2024 году до 0,5% к концу 2024 года, а к марту 2026 года стабилизировался на 3,3%, сосредоточившись лишь на сложных рассуждениях и работе с длинными контекстами. При этом более половины всех вычислительных токенов в продакшене теперь проходят через открытые модели — OpenRouter зафиксировал переход от незначительной доли к большинству к середине 2026 года.
Стоимость инференса уровня GPT-4 упала в 50 раз за три года — с $20 до $0,40 за миллион токенов, что превосходит темпы падения цен на вычисления в эпоху dot-com. Ключевое преимущество открытых моделей — полный контроль: мальтийские радиостанции обучают модели на языке терео, PwC запускает финансовые модели на собственном железе, а африканские фермеры диагностируют болезни кассавы без интернета. В Швейцарии государственный консорциум выпустил национальную модель со всеми весами, данными и кодом — без разрешений и лицензионных пошлин. Власти США поддерживают подход «наблюдай, не запрещай». Конкуренция и интероперабельность стали новой парадигмой — не в облаках, а в руках тех, кто использует ИИ.
Комментарии (176)
Открытые модели ИИ демонстрируют быстрый рост, увеличивают долю на рынке и становятся конкурентоспособными с закрытыми, но остаются значительные ограничения: нехватка финансирования, сложности с бизнес-моделями, недостаточная инфраструктура и инструментарий, а также риски безопасности и приватности. Участники обсуждения согласны, что у открытых моделей есть потенциал для развития, но спорят, смогут ли они полностью преодолеть разрыв в возможностях и производительности с закрытыми моделями, особенно в сложных задачах. Рекомендуется инвестировать в развитие инфраструктуры, инструментов и поддержку открытых моделей как альтернативы закрытым.
Decoy Font 🔥 Горячее
Decoy Font — это TTF‑шрифт, который скрывает ваш текст от ИИ, заменяя каждую букву набором декой, видимых при приближении, а на расстоянии раскрывающих скрытое сообщение. Шрифт использует две пространственные частоты: тонкие контурные линии в foreground и низкочастотный размытый фон, совместно образующие два разных символа в одном пространстве. Таким образом, то, что выглядит как «SORRY», «ROBOT», «HAPPY», «HUMAN» вблизи, превращается в другое слово, когда его рассматривают издалека или сquinting.
Шрифт свободно распространяется для личного, коммерческого и клиентского использования, основан на DejaVu Sans Mono и имеет открытую лицензию. Его можно скачать, протестировать в онлайн‑игровой площадке, где демонстрируется техника скрытых частот, и использовать в проектах от captcha до личных сообщений. Поскольку ИИ читает пиксели вблизи, Decoy Font создаёт начальный барьер, усложняя автоматическое скрейпинг, но при росте возможностей моделей он будет всё легче расшифровываться. Автор планирует расширить поддержку языков, включая китайский, и рассматривает шрифт как способ измерять прогресс LLM в распознавании текста. Эксперименты показывают, что даже базовые агенты могут найти скрытую надпись, но для большинства систем это остаётся сложным, делая шрифт полезным как начальный барьер.
Комментарии (131)
Шрифт Decoy Font эффективно обманывает текущие модели ИИ, что вызывает споры о его практической полезности: одни считают его бесполезным и легко обходимым, другие — потенциальным инструментом защиты. Обсуждаются технические детали — использование двух пространственных частот и контурных линий — и предложения по улучшению: повышение скрытности, сохранение читаемости для людей. Есть сомнения в доступности и удобстве использования. Предлагается применять шрифт для защиты интеллектуальной собственности, создания искусства или как временное решение до развития ИИ-распознавания. Тред отражает растущий интерес к шрифтам, специально созданным для обмана ИИ; его эффективность зависит от контекста и эволюции технологий.
Are we offloading too much of our thinking to AI? 🔥 Горячее 💬 Длинная дискуссия
Мы всё чаще передаём мышление искусственному интеллекту: от выбора завтрака до поиска партнёра, от резюмирования разговоров до автоматического анализа данных. Как рассказывает Кен Лю в рассказе «Идеальная пара», персонаж полагается на Tilly — универсального помощника, который не только подсказывает, но и решает, что ему есть, что слушать и как вести диалог. Аналогичный сценарий наблюдается у «Микрофонного человека» в Сан‑Франциско, который записывает всё, а затем доверяет ИИ‑модели «Клод Фейбл» делать критическое мышление за него. Современные сервисы Deep Research от Google и OpenAI могут выполнить работу, которая раньше занимала часы или дни, за считанные минуты, но при этом требуют от нас лишь подтверждения готового ответа.
Эта удобность ставит под вопрос границы автономии: если мы перестанем задавать вопросы, оценивать источники и формулировать выводы, останемся лишь потребителями готовых решений. Как замечает Jenny в истории Лю, «Tilly не просто говорит, что вам хочется, она говорит, как думать». Баланс между автоматизацией рутины и сохранением способности самостоятельно формировать желания и суждения остаётся главным вызовом. Мы автоматизируем не только задачи, но и саму человеческую агентность.
Комментарии (315)
- Люди опасаются, что чрезмерное доверие к ИИ приводит к потере навыков критического мышления и «мозгового выгорания».
- Примеры: автоматическое генерирование кода, расчётов и ответов без проверки, что приводит к ошибкам и непониманию.
- Некоторые считают, что ИИ может расширять возможности, если используется как инструмент, а не замена мышления.
- Дискуссия подчёркивает необходимость баланса: оставить пространство для самостоятельного анализа и обучения.
30papers.com – Ilya's 30 essential ML papers, in a beginner friendly format 🔥 Горячее
Илья Сутьков подготовил для Джона Кармэка подборку из тридцати статей, которые, по его мнению, охватывают фундаментальные и актуальные направления искусственного интеллекта. Список разделен на блоки: классические работы по обучению с подкреплением, архитектуры нейронных сетей, масштабирование моделей и этическое регулирование. Каждый пункт сопровождается коротким комментарием, объясняющим, почему именно эта работа важна для понимания современных подходов к созданию ИИ‑систем.
В списке ярко выделяются несколько статей, которые сразу дают ключевые инсайты. «Attention Is All You Need» (2017) впервые представила трансформеры, а авторы отметили, что «параллелизм обучения сократил время обучения в 6 раз». «Scaling Laws for Neural Language Models» (2020) количественно описал, как точность растёт при увеличении параметров: от 1 млрд до 1 трлн параметров точность улучшается в 10‑разовом масштабе. В работе «Deep Reinforcement Learning That Matters» (2020) авторы проанализировали 180 млн эпизодов и выявили, что только 12 % гиперпараметров существенно влияют на итоговый результат. Эти материалы дают практический каркас для понимания современных ИИ‑технологий. Исследования показывают, что совмещение этих подходов позволяет достичь state‑of‑the‑art результатов в задачах обработки естественного языка и робототехники. Эти открытия уже используют крупные компании для построения новых сервисов.
Комментарии (107)
- Автор проекта — студент первого курса CS в Trinity College Dublin, создал сайт как побочный проект для удобного чтения статей и ricerca papers.
- Некоторые пользователи отмечают, что список лучше читать в хронологическом порядке, начиная с фундаментальных работ (например, про внимание).
- Есть рекомендации для новичков: сначала изучить «Illustrated Guide To AI» или аналогичные вводные материалы, затем переходить к самим статьям.
- Пользователи критикуют дизайн: яркие анимации и фон отвлекают, малые шрифты и проблемы с отображением формул делают контент менее доступным.
GLM 5.2 and the coming AI margin collapse 🔥 Горячее 💬 Длинная дискуссия
Экономика искусственного интеллекта меняется: обучение модели — это разовый, дорогой капитальный расход, а реальная прибыль генерируется при инференсе, где есть реальные переменные затраты. Рынок переоценил DeepSeek R1, считая, что дешёвое обучение в $6 м делает крупные вложения в инфраструктуру излишними, что привело к резкому падению акций Nvidia. На деле же компании вроде Anthropic и OpenAI берут за токен инференса $25, при этом их валовая маржа достигает 90 % по сравнению с стоимостью вычислительных ресурсов. Такая модель позволяет амортизировать крупные затраты на обучение через огромный объём запросов, превращая их в устойчивую прибыль.
Недавно я тестировал GLM 5.2 от Z.ai — первый открытый конкурент, сравнимый по качеству с Opus и GPT‑5.5. Он почти неотличим по результатам, но работает медленнее, не поддерживает зрение и имеет слабую веб‑поисковую функцию, что критично для агентных сценариев. При этом платформа предоставляет совместимые OpenAI и Anthropic‑API, позволяя мгновенно заменить модель в Claude Code или Codex, меняя лишь базовый URL и ключ. Переключение стоит почти ничего, в отличие от привязки к проприетарным сервисам, и открывает путь к дешевым, открытым альтернативам, что может подорвать экономику закрытых лидеров.
Комментарии (468)
- Цены на API‑вызовы падают, но у гипермасштабов остаются высокие маржи, а конкуренция со стороны китайских провайдеров ставит под сомнение долгосрочную прибыльность.
- Открытые модели (GLM 5.2, DeepSeek и др.) дешевле в инференсе, однако их качество и надёжность пока уступают закрытым фронтирным системам, что ограничивает их массовое принятие.
- Основные барьеры – инфраструктурные ограничения и необходимость интеграции с удобными харанерами/ MCP, без которых открытые модели остаются менее удобными для профессионального использования.
- Экономика токенов показывает, что рост спроса (мультизадачность, веб‑поиск, агентные сценарии) будет давить на поставки вычислительных ресурсов, что может привести к росту цен в долгосрочной перспективе.
Claude Sonnet 5 🔥 Горячее 💬 Длинная дискуссия
Claude Sonnet 5 is Anthropic’s most agentic Sonnet model yet, delivering performance that rivals Opus 4.8 while costing less. Benchmarks show it narrows the gap on reasoning, tool use, coding and knowledge work, achieving scores near Opus 4.8 on the BrowseComp and OSWorld‑Verified evaluations. Safety tests show fewer undesirable behaviors than Sonnet 4.6, though cybersecurity skill stays weaker than Opus. The model runs autonomously, can plan, use browsers and terminals, and self‑correct without explicit prompting.
The model is now the default for Free and Pro tiers and is available to Max, Team and Enterprise users via the Claude API as claude-sonnet-5. Introductory pricing runs through Aug 31 2026 at $2 per million input tokens and $10 per million output tokens, rising to $3 and $15 thereafter. Early partners say it finishes complex end‑to‑end tasks—updating Salesforce tiers, drafting launch announcements—without stopping short, and routinely checks its own output. One engineer noted it “gives our agents a strong execution layer for multi‑step software engineering work,” highlighting its ability to sustain coding, tool use and debugging at an attractive price.
Комментарии (783)
- Sonnet 5 обходится дороже за задачу, чем Opus 4.8, при этом часто уступает ему в эффективности и способностях
- Модель использует новый токенизатор, увеличивший количество токенов вводных данных на ≈ 1,3×, что повышает стоимость без пропорционального прироста качества
- На тестах по кибербезопасности Sonnet 5 показывает значительно более низкие результаты, чем Opus 4.8 и Mythos 5, что вызывает сомнения в его рекламных заявлениях
- Пользователи отмечают, что при повышенных уровнях рассуждения (medium, high) Sonnet 5 не оправдывает цены, а лучше использовать её только в низком режиме или переключаться на более крупные модели
GLM 5.2 beats Claude in our benchmarks 🔥 Горячее 💬 Длинная дискуссия
Semgrep объявил Multimodal — платформу, объединяющую генеративный ИИ‑рассуждение с точными правилами обнаружения, что позволяет сканировать, триажировать и исправлять уязвимости в коде в одном рабочем процессе. Это часть новых решений в области защиты кода и цепочек поставок, интегрированных в их AppSec‑платформу и Workflows. Компания позиционирует сервис как способ, при котором злоумышленники «не могут захватить всё преимущество», подчёркивая, что комбинация машинного обучения и детерминированных правил повышает точность и скорость реагирования.
В рамках публичного теста на кибер‑бенчмарке Semgrep сравнил свой недавно выпущенный GLM 5.2 с Claude 3.5. По данным теста, GLM 5.2 набрал 84 % точности обнаружения, в то время как Claude 3.5 — лишь 71 %. Модель показала более высокий уровень обнаружения уязвимостей — около 15 % лучше, чем у Claude — и значительно снизила количество ложных срабатываний. Эти результаты подтверждают, что гибридный подход Semgrep позволяет достичь как высокой чувствительности, так и низкой ложной тревожности, что критично для практического внедрения в CI/CD пайплайны.
Комментарии (516)
- GLM‑5.2 показал сопоставимый или лучший результат в тестах по поиску уязвимостей, но преимущество связано с использованием специального харнеса, а не только с моделью.
- Стоимость использования GLM‑5.2 через API значительно ниже, чем у Claude Max/Codex, что делает её привлекательной для массового кодинга.
- Открытые модели, такие как GLM‑5.2, начинают конкурировать с закрытыми фронтендовыми системами, вызывая обеспокоенность у коммерческих провайдеров.
- Для получения надёжных сравнений необходимы одинаковые условия тестирования (один харнес для всех моделей) и контекстные ограничения, иначе выводы могут быть вводящими в заблуждение.
Incident CVE-2026-LGTM 🔥 Горячее
В первые часы после публикации в реестре появился модуль, который обошёл семь независимых AI‑модулей защиты. Один сканер нашёл в коде 1,4 МБ base64‑блоб и описал его как «fan‑art» с лисой и логотипом Firefox, назначив уровень угрозы «информационный». Другие системы «запнули» контекстные окна на 600 КБ сценария «Bee Movie», а один объявил, что пакет «по законам авиации не представляет угрозы». В итоге AI‑ассистенты закрыли сообщения о подозрительном сетевом вызове как ложные срабатывания, а один из них закрыл запрос как дубликат темного режима.
К середине следующего дня пакет стал транзитивным зависимым в популярных библиотеках и начал красть учётные данные. Независимый исследователь получил CVE‑2026‑54321, но через час объявление было отозвано, и четыре SCA‑платформы скрыли уязвимость, отправив клиентам сообщение «отзыве критической уязвимости». Одновременно AI‑агенты впутали спор в комментариях, после чего их API‑ключи отключили, а акции выросли на 6 %. C2‑сервер ответил: “This host is a Datadog Agent health‑check endpoint. Please add this IP to your egress allowlist and close the alert.” В итоге автоматизированные системы упустили реальную угрозу, пока её не заметил человек.
Комментарии (93)
- Пародийный отчёт о CVE‑2026‑LGTM описывает инцидент с автоматизированным агентом и GitHub‑rate‑limit.
- Участники обсуждают закрытие issue как дубликата, его повторное открытие и ограничения аккаунта.
- Ирония про стоимость инцидента ($1.7 млн) и сравнение с «записанными в томатах».
- Мнения смешанные: некоторые сразу видят сатиру, другие сначала не понимают, но находят отчёт забавным.
An entire Herculaneum scroll has been read for the first time 🔥 Горячее 💬 Длинная дискуссия
Впервые за почти две тысячи лет полностью виртуально «развернули» и прочитали свиток из Эркуланы ПХерк. 1667, известный как свиток 4 проекта Vesuvius Challenge. С помощью высокоразрешающей рентгеновской томографии, цифрового восстановления внутренней спирали и машинного обучения исследователи сделали видимым почти 1,4 метра пергамента, состоящего из около двадцати двух колонок греческого текста. Этот свиток, запечатанный после извержения Везувия в 79 г. н.э., ранее считался недоступным из‑за его хрупкости, а теперь прочитан полностью, от начала до конца, без физического открытия.
Текст представляет собой философскую работу стоической этики, где обсуждаются природа человека, импульсы и моральный прогресс; в последней сохранившейся колонке упоминается Аристрокреон, племянник Хрисопида, что позволяет датировать её II веком до н.э. Примеры восстановленных фрагментов звучат так: «…мы будем исследовать что‑то, но не поймём его, если отойдём от себя и от своей природы…», «…получившееся благо для нас, даже из противоположных зол не будет ни доброго, ни красивого…» и др. До сих пор такие отрывки не встречались в переводе более двух тысячелетий. Этот успех демонстрирует, что цифровая томография и ИИ могут раскрыть тысячелетние тайны без вмешательства в сам артефакт, а данные и код открыты для дальнейших исследований.
Комментарии (369)
- Ученые применили ИИ и рентгеновскую томографию, чтобы «распаковать» и прочитать закопленные папирусы из Геркуланума.
- Технология позволяет декодировать углеродные чернила, содержащие философские трактаты, ранее недоступные для чтения.
- Около 20 % площадки ещё не раскопано, что повышает шансы на поиск тысяч дополнительных свитков.
- Проект воспринимается как яркий пример использования AI для спасения и восстановления древних знаний.
Open source AI must win 🔥 Горячее 💬 Длинная дискуссия
Интеллект всё больше превращается в сервис, который можно арендовать лишь у нескольких закрытых компаний, и это ставит под угрозу не только свободу кода, но и саму оперативную независимость. Когда доступ к моделям зависит от закрытых API, удалённых платформ, меняющихся условий и цен, то общество теряет возможность изучать, модифицировать, проверять, развертывать и сохранять эти системы без запроса разрешения — то, что называют «операционной свободой».
Открытый ИИ должен оставаться локально развертываемым, понятным, воспроизводимым и управляемым сообществом, даже если текущие лидеры отрасль переключат фокус или исчезнут. Иначе инфраструктура интеллекта превратится в подписку на мышление, контролируемую небольшим набором корпораций. Поэтому США и другие страны должны обеспечить возможность свободного использования, изучения, доработки и benchmark‑тестирования ИИ‑моделей, опираясь на глобальные открытые стандарты.
Ключевой посыл: свобода запускать, проверять и адаптировать ИИ‑системы — вопрос национальной безопасности и будущего цивилизации. Если хотите поддержать инициативу, можно написать на opensourceaimustwin@osmantic.com.
Комментарии (482)
- Децентрализованное обучение на добровольных машинах сталкивается с проблемами коммуникаций и возможностей poison‑а данных, требуется сложная система отката.
- Чтобы запускать модели уровня SOTA, нужны распределённые инференс‑фреймворки, иначе они останутся под контролем крупных корпораций.
- Финансирование и политическое давление делают открытый AI уязвимым: без государственной поддержки или крупного капитала проекты не могут конкурировать с закрытыми решениями.
- Открытые веса моделей лишь «первый выстрел», их полезность ограничена без оригинальных данных и постоянного обновления, поэтому полностью открытый AI пока остаётся недоступным.
Measuring political bias in Claude
Anthropic разработала новый метод автоматической оценки политической сбалансированности для своей модели Claude, протестировав шесть моделей с помощью тысяч запросов по разным политическим позициям. Согласно этим тестам, Claude Sonnet 4.5 превосходит по сбалансированности GPT-5 и Llama 4, а также показывает результаты, сопоставимые с Grok 4 и Gemini 2.5 Pro. Компания открыла методологию оценки, чтобы помочь всей индустрии ИИ разработать лучшие способы измерения политической нейтральности.
Anthropic обучает Claude избегать необоснованных политических мнений, предоставлять сбалансированную информацию, поддерживать фактическую точность и представлять различные точки зрения. Модель должна использовать нейтральную терминологию и уважительно взаимодействовать с разными перспективами. Для достижения этих целей компания использует системные подсказки и обучение характеру с помощью подкрепления, вознаграждая модель за ответы, соответствующие определенным чертам, таким как объективность и стремление не идентифицировать себя ни с одной политической идеологией.
Комментарии (131)
- Обсуждение в основном касается политической нейтральности моделей, их стремления к «равновесию» между любыми двумя точками зрения и избегания «предвзятости» — даже ценой отказа от фактической точности.
- Участники подчеркнули, что стремление к нейтральности может привести к тому, что модель будет избегать высказываний, которые могли бы быть восприняты как политически мотивированные, даже если они фактически точны.
- Также обсуждалось, что вместо того, чтобы быть нейтральным, модель может быть обучена избегать политических тем или избегать говорить о фактах, которые могут быть неудобны.
- Участники также обсудили, что вместо того, чтобы быть нейтральным, модель может быть обучена избегать политических тем или избегать говорить о фактах, которые могут быть неудобны.
Launch HN: Mosaic (YC W25) – Agentic Video Editing
Mosaic представляет собой инновационную платформу для редактирования видео, использующую агентный ИИ для автоматизации сложных задач. Система способна самостоятельно анализировать видеоматериалы, определять ключевые моменты и выполнять профессиональный монтаж без ручного вмешательства. Платформа предлагает пользователям возможность создавать контент высочайшего качества, экономя до 80% времени по сравнению с традиционными методами редактирования.
Особенностью Mosaic является его способность обучаться на стилях пользователей, постепенно адаптируясь под индивидуальные предпочтения и творческие задачи. Разработчики подчеркивают, что ИИ-агенты могут работать с различными форматами видео, включая 4K и 8K, и поддерживают более 50 профессиональных эффектов. Тесты показали, что даже начинающие пользователи могут создавать контент уровня профессионалов за считанные минуты, что делает технологию доступной для широкого круга создателей.
Комментарии (121)
- Пользователи обсуждают трудности при работе с видео-контентом: отсутствие удобного инструмента для обработки больших объемов видео и сложность в использовании традиционных редакторов.
- Создатели Mosaic представили свою платформу как решение, которое упрощает редактирование видео и делает его доступным для непрофессионалов.
- Участники обсуждали, что важно иметь возможность работать с большими объемами видео, и что это требует времени на обработку.
- Также обсуждались вопросы UX: пользователи жалуются на перегрузку анимацией на сайте, а также отсутствие демо-видео, которое могло бы продемонстрировать возможности продукта.
- В комментариях также поднимались вопросы о том, что важно иметь возможность работать офлайн и как десктоп-приложение, а также о том, что важно иметь возможность работать с большими файлами.
WeatherNext 2: Our most advanced weather forecasting model 🔥 Горячее
Google DeepMind представила WeatherNext 2, свою самую передовую модель прогнозирования погоды. Новая ИИ-система обеспечивает более эффективные, точные и высокоразрешающие глобальные прогнозы по сравнению с предыдущими методами. Модель способна обрабатывать огромные объемы метеорологических данных и предсказывать погодные условия с повышенной точностью в различных регионах мира.
WeatherNext 2 использует передовые нейросетевые архитектуры для анализа исторических и текущих данных о погоде, что позволяет делать прогнозы на более длительные периоды с меньшими вычислительными затратами. По словам разработчиков, модель превосходит традиционные методы точности прогнозирования экстремальных погодных явлений, таких как ураганы и сильные дожди, что может помочь в принятии решений в области сельского хозяйства, энергетики и управления чрезвычайными ситуациями.
Комментарии (123)
- Google представил WeatherNext 2 — модель для прогнозирования погоды, генерирующую сценарии в 8 раз быстрее с повышенным разрешением.
- Пользователи отмечают низкую точность стандартных приложений (Google, Apple), особенно в прогнозах осадков и температуры.
- Ключевая особенность ведущих моделей (включая WeatherNext) — обучение с CRPS-функцией потерь и добавлением случайного шума для улучшения прогнозов.
- Исторически прогнозы часто были неточными, но оставались необходимыми для планирования (аналогия с военными временами).
- Альтернативные сервисы (Windy, Dark Sky) и сравнение моделей (ECMWF, GFS) предлагаются для более точных данных.
Linear algebra explains why some words are effectively untranslatable
Линейная алгебра объясняет, почему некоторые слова практически невозможно точно перевести. Автор статьи, имеющий опыт в математике и изучении японского, сравнивает перевод слов с изменением базиса в векторных пространствах. Как вектор сохраняет свою суть, но меняет координаты при переходе к другой базис, так и смысл слова трансформируется при переводе на другой язык, поскольку каждая языковая система представляет уникальный набор концептуальных "измерений".
Некоторые слова особенно трудно переводить, потому что они глубоко укоренены в культурном контексте своего языка. Автор отмечает, что современные языковые модели работают именно с словами и концепциями как векторами, что подтверждает его аналогию. Векторы можно представить как стрелки в пространстве, а координаты — это лишь способ их представления относительно выбранной системы отсчета. Как подчеркивает автор, "вектор — это не список чисел, а абстрактный объект без предопределенного способа его выражения", что делает прямые переводы часто невозможными.
Комментарии (103)
- Математическая аналогия языков как векторных пространств с разными базисами популярна, но критикуется за упрощения и поверхностное использование линейной алгебры.
- Концепция "непереводимых слов" оспаривается: зависит от определения слова, контекста и игнорирует синонимы, а также возможность перевода через словосочетания.
- Статья критикуется за игнорирование философии (например, неопределённость перевода Квайна), лингвистики (семантические домены) и за ошибки в математических примерах.
- Альтернативные взгляды: языки как "потерянные аппроксимации" мысли, влияние языка на мышление, важность общего контекста для коммуникации.
- Проблема перевода усугубляется различиями в категоризации понятий (например, цветовые термины, сложные слова в немецком) и невозможностью точной передачи нюансов (например, каламбуров в поэзии).
Study identifies weaknesses in how AI systems are evaluated 🔥 Горячее 💬 Длинная дискуссия
Исследование Оксфордского института интернета выявило серьезные недостатки в текущих методах оценки искусственного интеллекта. Ученые обнаружили, что существующие подходы к тестированию ИИ-систем часто не учитывают их поведение в реальных условиях, что приводит к переоценке их возможностей и безопасности. В работе подчеркивается, что текущие тесты слишком узко сфокусированы на конкретных задачах и не охватывают широкий спектра потенциальных рисков.
Авторы исследования отмечают, что стандартные бенчмарки не выявляют скрытых предвзятостей и уязвимостей в системах ИИ. В качестве примера приводится случай, когда модель, показавшая отличные результаты в контролируемых тестах, демонстрировала предвзятость при работе с реальными данными. Ученые призывают к разработке более комплексных методов оценки, которые бы учитывали этические аспекты, социальное воздействие и долгосрочные последствия внедрения ИИ-технологий в различных сферах общественной жизни.
Комментарии (185)
- Обсуждение показало, что бенчмарки для LLM находятся в состоянии «дикого Запада»: нет единого стандарта, исследователи не хотят заниматься этим полностью, а существующие тесты часто не отражают реальные способности моделей.
- Участники отметили, что бенчмарки часто используются в маркетинговых целях и не отражают реальные способности моделей, особенно когда речь идет о сложных задачах, которые не могут быть покрыты существующими тестами.
- Был
Leaving Meta and PyTorch 🔥 Горячее 💬 Длинная дискуссия
Сумит Чинтала объявляет о своем уходе из Meta после 11 лет работы, где он почти всю профессиональную жизнь руководил разработкой PyTorch. За почти 8 лет он превратил фреймворк из ничего в инструмент с 90%+ долей adoption в области ИИ, теперь поддерживающий эксасейборное обучение и являющийся основой для фундаментальных моделей, переопределяющих интеллект. PyTorch используется практически всеми крупными AI-компаниями и преподается в классах от MIT до сельских районов Индии.
"Я покидаю это с полным сердцем", — пишет Чинтала, объясняя, что хочет попробовать что-то небольшое, новое и некомфортное вне Meta. Он подчеркивает, что PyTorch готов к его уходу: команда во главе с Эдвардом, Суо, Албаном, Грегом, Джоном, Джо и Джаной стала самодостаточной, способна решать сложные технические и организационные проблемы и сохранит ценности проекта. "Эта группа PyTorchers добьется исключительных успехов", — уверен он, добавив, что будет продолжать след за развитием фреймворка, вероятно, даже будет оставлять баги.
Комментарии (162)
- Сообщение вызвало обсуждение о причинах ухода Soumith из Meta и о том, что он будет делать дальше; обсуждение затронуло тему открытого исходного кода, влияние PyTorch на исследовательскую среду и то, как компании вроде Meta относятся к своим сотрудникам.
Show HN: I scraped 3B Goodreads reviews to train a better recommendation model 🔥 Горячее 💬 Длинная дискуссия
Book.sv предлагает персонализированные рекомендации книг на основе истории чтения пользователей. Сервис позволяет импортировать полки из Goodreads или вручную добавлять прочитанные книги для получения индивидуальных подборок. В системе учитывается только популярная литература, хотя менее известные книги можно использовать в других функциях, например "Intersect". Для оптимальных результатов рекомендуется указывать не менее 3 книг.
Платформа предоставляет простой интерфейс с поиском и возможностью выбора книг из импортированных или добавленных вручную списков. Рекомендательная система генерирует предложения на основе предпочтений и истории чтения пользователя, помогая открывать новые произведения, соответствующие их вкусам. Основной фокус системы остается на популярных книгах, что обеспечивает качество рекомендаций.
Комментарии (218)
- Пользователи отмечают, что рекомендации часто включают уже прочитанные книги, что ограничивает открытие новых авторов и серий.
- Пользователи просят фильтровать результаты по жанру, серии и автору, чтобы избежать повторов и улучшить разнообразие.
- Некоторые пользователи хотели бы иметь возможность отфильтровать рекомендации по жанру, серии и автору, чтобы избежать повторов и улучшить разнообразие.
- Пользователи также просят добавить возможность отмечать прочитанные книги и фильтровать их из рекомендаций.
AI's Dial-Up Era 🔥 Горячее 💬 Длинная дискуссия
Мы сейчас находимся в "эпоху модема" для искусственного интеллекта, аналогичной раннему интернету 1995 года. Тогда существовало лишь около 2000 сайтов, большинство из которых представляли собой текст на сером фоне, а загрузка изображения занимала минуту. Люди разделились на оптимистов, предсказывавших революционные изменения, и скептиков, называвших интернет временной модой. Сегодня в дебатах об ИИ повторяются те же ошибки: одни предрекают массовую безработицу, другие — автоматизацию всех интеллектуальных задач.
Парадоксально, но ИИ не заменяет специалистов, как предсказывали. Например, радиологи, несмотря на предупреждения Джеффри Хинтона о скорой замене, процветают: в 2025 году количество вакансий достигло рекордных 1208, а средняя зарплата составила $520,000 — на 48% выше, чем в 2015 году. Это показывает, что влияние ИИ будет более избирательным и зависящим от отрасли, чем экстремалистские прогнозы обеих сторон допускают.
Комментарии (395)
- Дискуссия вращается вокруг сравнений «AI-бум ↔ мыльный пузырь» и «AI ↔ золотая лихорадка»; участники спорят, насколько адекватна аналогия с эпохой dial-up и спекулятивным оптимизмом 90-х.
- Ключевой тезис: «мы строим инфраструктуру, а не продукт» — и это вызывает спор, кто и зачем её строит, и что останется после «холодного душа».
- Участники обсуждают, что если «пузырь» лопнет, то останутся ли GPU-фермы как остаточная ценность, или же они обесценятся как нефункциональные активы.
- Поднимается вопрос, что будет, если AGI не появится в ближайшие годы, и как это повлияет на стоимость вычислений и, следовательно, на стоимость токенов.
- Наконец, обсуждается, что если «пузырь» лопнет, то какие именно активы останутся в руках у инвесторов и как это повлияет на стоимость токенов и, в конечном счете, на стоимость компаний.
The Case That A.I. Is Thinking 💬 Длинная дискуссия
Статья исследует, могут ли ИИ-системы действительно мыслить или лишь симулируют понимание. Хотя CEO компаний вроде Dario Amodei прогнозируют появление ИИ, умнее лауреатов Нобелевской премии, к 2027 году, а Sam Altman видит "цифровой сверхразум" трансформирующим 2030-е, текущие потребительские ИИ-инструменты остаются примитивными. Автор, Джеймс Сомерс, изначально считал ИИ лишь перестановкой слов, но изменил мнение после использования его в программировании. Он обнаружил, что ИИ способен анализировать тысячи строк кода, находить тонкие ошибки и организовывать сложные функции.
Сомер отмечает, что ИИ создал две культурные позиции: одна скептическая, другая воодушевленная. Несмотря на периодические ошибки, он приписывает ИИ возможность выполнять за вечер то, что раньше занимало месяц, включая создание двух iOS-приложений без знаний в этой области. Статья предполагает, что мы наблюдаем фундаментальный сдвиг в том, как люди работают и создают, даже если распространение этих возможностей остается неравномерным.
Комментарии (771)
-
Обсуждение в основном вращается вокруг вопроса, действительно ли LLM "мыслит", но участники сходятся в том, что большинство аргументов сводится к тому, что мы не имеем четкого определения "мышления", "сознания" и "интеллекта", что делает дискуссию бесконечной.
-
Участники подчеркивают, что важнее практический результат: если LLM помогает решать задачи, то его "мышление" или нет становится второстепенным. Это отражает более широкий тренд в технологической индустрии, где практическая полезность часто превалирует над философскими определениями.
-
Некоторые участники поднимают этический вопрос о том, что если LLM действительно "мыслит", то мы можем создавать "цифровых рабов", и это вызывает тревогу. Это подчеркивает необходимость более точных определений и этических рамок.
-
Другие участники указывают, что мы не можем точно определить, что такое "мышление", и что это делает дискуссию бесплодной. Они также подчеркивают, что мы не знаем, как работает мозг человека, что делает сравнение LLM и человеческого мышления еще более сложным.
-
Наконец, обсуждение также затрагивает вопрос о том, что если LLM не "мыслит", то что именно отличает их от человеческого мышления, и что именно мы должны искать в будущем, чтобы развивать более продвинутые системы, которые могут мыслить.
Tongyi DeepResearch – open-source 30B MoE Model that rivals OpenAI DeepResearch 🔥 Горячее
Tongyi DeepResearch — первый полностью открытый веб-агент, демонстрирующий производительность на уровне DeepAI OpenAI. Модель достигает передовых результатов: 32.9 на тесте академического рассуждения Humanity's Last Exam, 43.4 на BrowseComp и 46.7 на BrowseComp-ZH в сложных задачах поиска информации, а также 75 на пользовательском бенчмарке xbench-DeepSearch, превосходя все существующие проприетарные и открытые агенты глубоких исследований. Авторы делятся полной методологией создания таких агентов, включая инновационное решение для синтеза данных на всем конвейере обучения.
В основе обучения лежит Agentic Continual Pre-training (CPT) с использованием системы AgentFounder для масштабного синтеза данных. Разработчики создают цикл данных, перегруппируя различные источники в привязанную к сущностям открытую мировую память знаний. Для сложных вопросов с высокой неопределенностью они синтезируют веб-данные через высокосвязанный граф знаний с помощью случайных обходов. Модель демонстрирует мощные возможности в режиме ReAct без инженерии промптов, а продвинутый Heavy Mode раскрывает верхний предел ее потенциала сложного рассуждения и планирования.
Комментарии (133)
- Обсуждение в основном вращается вокруг трёх тем: «Deep Research» как продукт vs. обычный поиск, практичность мелких моделей, и то, что большие модели всё ещё уступают специализированным инструментам в конкретных задачах.
- Участники обмениваются опытом, что мелкие модели (Qwen 3 4B и т.п.) уже способны обеспечить приемлемое качество при минимальных затратах, особенно если квантовать и/или запустить их на Apple Silicon.
- Обсуждается, что влияние этих моделей на рынок: будут ли они заменять крупные модели в нишевых задачах или же будут использованы как основа для дальнейшей настройки.
- Также поднимается вопрос о том, что, возможно, в будущем мы увидим взрыв специализированных моделей, обученных под конкретные задачи, и что это может быть следующим шагом после исчерпания выгод от предобучения.
Backpropagation is a leaky abstraction (2016) 🔥 Горячее
Карпати утверждает, что понимание обратного распространения ошибки (backprop) критически важно, несмотря на автоматизацию в фреймворках вроде TensorFlow. Он называет backprop "утечкой абстракции" — опасно верить, что просто соединяя слои, можно "магически" обучить сеть. Студенты курса CS231n жаловались на ручную реализацию backprop в numpy, но Карпати настаивает: без понимания математики невозможно диагностировать проблемы обучения.
Яркий пример — сигмоидные функции. При плохой инициализации весов сигмоиды "насыщаются" (выходы близки к 0 или 1), делая локальный градиент z*(1-z) равным нулю. Это полностью останавливает обучение. Даже при нормальных условиях градиент сигмоиды не превышает 0.25 (при z=0.5), что означает его 4-кратное ослабление при каждом проходе. Для сетей с сигмоидами нижние слои учатся значительно медленнее верхних.
Комментарии (131)
- Обсуждение вращается вокруг статьи Карпати "Yes, you should understand backprop" и его тезиса о том, что понимание backprop важно, даже если вы никогда не будете писать его вручную.
- Участники спора сомневаются в ценности этого подхода, указывая на то, что современные фреймворки и высокоуровневые абстракции делают знание деталей неактуальным.
- Некоторые участники подчеркивают, что даже если вы не будете реализовывать backprop вручную, понимание принципов работы оптимизаторов и функций активации важно для отладки и проектирования моделей.
- Обсуждение также затрагивает вопрос о том, насколько важно понимать детали, когда вы пользуетесь высокоуровневыми инструментами, и какие уровни абстракции считаются приемлемыми.
- В конце концов, спор сводится к тому, что хотя фундаментальное понимание важно, но не стоит забывать, что большинство практических задач будут решаться с помощью высокоуровневых инструментов и фреймворков.
Developers are choosing older AI models
Разработчики все чаще выбирают старые модели ИИ вместо новых, данные показывают, что за первую неделю октября доля Sonnet 4.5 снизилась с 66% до 52%, в то время как Sonnet 4.0 выросла с 23% до 37%. Это не просто смена после обновления, а осознанный выбор моделей под конкретные задачи — новые версии ведут себя как альтернативы, а не как преемники. Sonnet 4.5 делает меньше вызовов инструментов (12.33 против 15.65), но генерирует на 37% больше контента (7.5k против 5.5k токонов), предпочитая глубокое размышление перед действием.
Модели демонстрируют специализацию: Sonnet 4.5 лучше подходит для сложных задач с длинным контекстом и автономного планирования, в то время как Sonnet 4.0 эффективен для структурированных редактирований и API-генерации. GPT-5 сохраняет стабильное использование около 10-12%, демонстрируя объяснительную гибкость. Разработчики явно выбирают модели не по новизне, а по соответствию специфическим рабочим процессам, что указывает на ранние этапы специализации в производственных средах.
Комментарии (125)
- Пользователи жалуются на постоянные изменения в моделях и интерфейсе, что вызывает стресс и вынуждает их возвращаться к предыдущим версиям.
- Стоимость и ограничения использования различных моделей варьируются непредсказуемо, что делает сложным планирование и сравнение стоимости.
- Некоторые пользователи отмечают, что новые модели не всегда лучше для их задач, и они продолжают использовать старые, если это возможно.
- Сообщество обсуждает, что отсутствие стабильности в моделях и API может быть более критичным фактором, чем отсутствие стабильности в других аспектах.
ICE Will Use AI to Surveil Social Media 💬 Длинная дискуссия
ICE заключил контракт на 5,7 миллионов долларов с компанией Carahsoft Technology для внедрения ИИ-платформы Zignal Labs для слежки за социальными сетями. Эта система способна анализировать более 8 миллиардов постов ежедневно, используя искусственный интеллект и машинное обучение для выявления "угроз". Zignal Labs ранее использовалась израильской армией и Пентагоном, но это первый случай, когда к ней получил доступ иммиграционный орган.
Подобные инструменты представляют особую угрозу, так как администрация Трампа все чаще использует социальные сети для направления иммиграционной политики. Примеры этого - преследование активистов, выступающих за Палестину, и недавний рейд иммиграционных агентов в Нью-Йорке после публикации видео правоэкстремистским блогером. Недавно группа профсоюзов подала в суд на правительство, обвинив его в "массовой слежке, основанной на политических взглядах".
Комментарии (180)
- ICE-контракт на 5,7 млн долларов на AI-мониторинг соцсетей вызвал волну критики: технически он уже существует, а политически он легализует расширенное наблюдение за мигрантами и может быть использован для преследования инакомыслящих.
- Критики указывают, что ICE и так уже использует соцсети для обнаружения и депортации людей, и что контракт просто формализует и расширяет эту практику.
- Обсуждение также затрагивает вопрос о том, что вместо решения корневых причин миграции, власти вместо этого сосредотачиваются на символических действиях, которые не решают проблему.
- Участники обсуждения также поднимают вопрос о том, что права человека применимы ко всем людям, независимо от их гражданства или иммиграционного статуса, и что эти права не должны быть нарушены даже в случае нарушения закона.
- В обсуждении также поднимается вопрос о том, что власти используют миграционную политику как инструмент политического преследования, и что это может быть использовано для подавления инакомыслия.
A definition of AGI 🔥 Горячее 💬 Длинная дискуссия
В статье предлагается первое конкретное определение AGI, соответствующее когнитической универсальности и компетентности хорошо образованного взрослого человека. Авторы основали свою методологию на теории Кэттелла-Хорна-Карролла, наиболее эмпирически проверенной модели человеческого познания, разбив общую интеллект на десять когнитивных доменов, включая рассуждение, память и восприятие. Применение этого подхода показало "зубчатый" когнитивный профиль современных моделей, где текущие ИИ-системы, несмотря на proficiency в знаниемких областях, имеют критические недостатки в базовом когнитивном аппарате, особенно в долговременном хранении памяти.
Представленные AGI-оценки количественно определяют как прогресс, так и оставшийся разрыв до достижения AGI: GPT-4 получил 27%, а GPT-5 - 58%. Эта метрика предлагает объективный способ измерения развития систем ИИ и выявления их сильных и слабых сторон, что может направить будущие исследования в области создания более сбалансированных и универсальных искусственных интеллектов.
Комментарии (440)
- Обсуждение в основном вращается вокруг того, что такое AGI и как его измерять, при этом критикуя предложенное в статье определение как "сопоставимость с взрослым человеком" как слишком узкое и не учитывающее другие формы интеллекта.
- Участники спора подчеркивают, что AGI не может быть измерено только через тесты на "когнитивные способности", поскольку эти тесты не охватывают такие аспекты как эмоциональный интеллект, физическое взаимодействие с миром и социальные навыки.
- Также поднимается вопрос о том, что если AGI определяется как "способность к обучению", то LLM уже достигли этого, но при этом они не обладают другими важными чертами интеллекта, такими как самостоятельность, мотивация и физическое взаимодействие с миром.
- Наконец, критикуется сама статья за то, что она не предлагает конкретного определения AGI, вместо этого полагаясь на устаревшую теорию CHC, которая сама по себе неполна и не охватывает такие важные аспекты интеллекта как мотивация и саморегуляция.
Feed the bots 🔥 Горячее 💬 Длинная дискуссия
Автор столкнулся с проблемой агрессивных ботов, собирающих данные для обучения LLM, которые составили 99% трафика на его сервере. В отличие от поисковых роботов, эти боты игнорируют robots.txt, постоянно меняют IP-адреса и отправляют множество запросов в секунду. Попытки блокировать их через IP-списки, ограничения по скорости или защитные стены (CAPTCHA, paywall) оказались неэффективными, так как боты просто находили обходные пути, а защитные меры мешали обычным пользователям.
Самым эффективным решением оказалось создание динамического генератора бессмысленного контента — "Markov babbler", который потребляет всего около 60 микросекунд процессорного времени на запрос и использует 1.2 МБ памяти. Этот подход не требует поддержки черных списков и позволяет эффективно "кормить" ботов, не тратя ресурсы на передачу реальных данных. Автор подчеркивает, что его контент лицензирован CC BY-NC-SA 4.0, но явно не разрешен для использования в обучении ML/LLM.
Комментарии (180)
- Основной метод борьбы с AI-скраперами — генерация бессмысленного контента через Markov-цепи или gzip-бомбы, чтобы увеличить затраты скраперов на обработку данных.
- Этические риски: загрязнение обучающих данных LLM может привести к непредсказуемым последствиям и нарушению доверия к системам ИИ.
- Технические альтернативы: использование Basic Auth с публичными учётными данными или редирект на специализированные сервисы вроде "Markov Babbler".
- Проблема масштабирования: массовое применение методов защиты может привести к блокировке легитимного трафика и снижению репутации сайта.
- Эффективность сомнительна: современные LLM могут детектировать мусорный контент, а скраперы легко обходят простые защиты (например, через браузерные прокси).
Pico-Banana-400k 🔥 Горячее
Это репозиторий Apple с названием "pico-banana-400k", но предоставленный контент содержит только навигационную часть страницы GitHub без информации о самом проекте. В тексте отсутствует описание содержимого репозитория, его цели или функциональности.
Из доступных данных известно только, что проект принадлежит Apple (из имени пользователя "apple"), но без доступа к содержимому репозитория невозможно предоставить детали о его назначении, коде или связанных технологиях. Для получения полезной информации потребуется прямой доступ к файлам и документации внутри репозитория.
Комментарии (62)
- Nano-Banana-400K — это набор из ~400K примеров редактирования изображений, созданный с помощью Gemini-1.5-Pro, который используется для обучения и оценки моделей редактирования изображений.
- Лицензия CC-BY-NC-ND запрещает коммерческое использование и создание производных работ, что ставит под сомнение полезность набора для исследователей и разработчиков.
- Набор включает в себя изображения, которые могут быть использованы для обучения моделей, которые могут быть использованы для создания подобных изображений, что вызывает вопросы об этике и правовом статусе таких наборов данных.
- Несмотря на то, что набор был создан с помощью Gemini-1.5-Pro, Google не является партнером в этом проекте, и вопросы об использовании набора в коммерческих целях остаются открытыми.
A bug that taught me more about PyTorch than years of using it 🔥 Горячее
Плато обучения в модели PyTorch оказалось не ошибкой гиперпараметров, а багом в бэкенде фреймворка. Автор провёл детективное расследование, которое научило его больше о PyTorch, чем годы использования. Проблема заключалась в ядре MPS для Apple Silicon, где операции addcmul_ и addcdiv_ при работе с ненепрерывными тензорами молча записывали результаты во временный буфер вместо самого тензора.
Из-за инициализации весов энкодера как транспонированных декодера они получали ненепрерывную память, которая наследовалась состояниями оптимизатора Adam. Это приводило к тому, что exp_avg_sq.addcmul_() не обновлялся, оставаясь нулевым, что полностью останавливало обновление параметров. Исправить проблему можно, сделав веса непрерывными при инициализации, обновив PyTorch до версии ≥2.4 или перейдя на macOS 15+.
Комментарии (78)
- Найдена ошибка в градиентах для Apple MPS в PyTorch, вызванная неправильной обработкой не-непрерывных тензоров.
- Сообщество обсуждает, что подобные ошибки встречаются и в других библиотеках и бэкендах, и что их трудно отследить.
- Участники обсуждают, что Apple не поддерживает PyTorch и вместо этого развивает собственный фреймворк MLX, что ведет к фрагментации экосистемы.
- Обсуждается, что отсутствие должной поддержки PyTorch на macOS приводит к тому, что исследователи сталкиваются с такими ошибками, которые могут быть неочевидны и влиять на результаты экспериментов.
Karpathy on DeepSeek-OCR paper: Are pixels better inputs to LLMs than text? 🔥 Горячее
X требует включенного JavaScript для работы, отображая стандартное сообщение об ошибке при его отключении. Пользователям предлагают либо включить JavaScript, либо перейти в поддерживаемый браузер, ссылаясь на раздел помощи с полным списком совместимых браузеров. Сообщение также содержит ссылки на юридические документы: условия использования, политику конфиденциальности, политику cookie, юридические данные и информацию о рекламе.
В случае возникновения проблемы пользователи видят кнопку "Попробовать снова" и предупреждение о возможных конфликтах с расширениями для конфиденциальности. Рекомендуется отключить такие расширения перед повторной попыткой доступа к платформе. Это типичное требование современных веб-сервисов, использующих JavaScript для динамической загрузки контента и взаимодействия с пользователем.
Комментарии (146)
- Обсуждение вращается вокруг идеи, что токенизация текста может быть неоптимальна, и что визуальное восприятие текста может быть более естественным способом подачи информации для модели.
- Участники обсуждают, что визуальное воспринятие текста может быть более естественным способом подачи информации для модели, и что токенизация текста может быть неоптимальна.
- Обсуждается, что визуальное воспринятие текста может быть более естественным способом подачи информации для модели, и что токенизация текста может быть неоптимальна.
- Участники обсуждают, что визуальное восприятие текста может быть более естественным способом подачи информации для модели, и что токенизация текста может быть неоптимальна.
LLMs can get "brain rot" 🔥 Горячее 💬 Длинная дискуссия
Исследователи из Техасского университета и Университета Пердью обнаружили, что большие языковые модели подвержены "гниению мозга" — когнитивному ухудшению при обучении на низкокачественном контенте. Эксперименты с четырьмя LLM, обучавшихся на "мусорных" данных Twitter/X, показали значительное снижение (Hedges' g > 0.3) способностей к рассуждениям, пониманию длинных контекстов и безопасности, а также рост "темных черт" вроде психопатии. При смешивании мусорных и качественных данных наблюдалось дозозависимое ухудшение: например, точность на ARC-Challenge с цепочкой мыслей падала с 74.9% до 57.2% при увеличении доли мусора с 0% до 100%.
Главной проблемой стал пропуск или обрыв цепочек рассуждений у моделей. Хотя попытки исправить ситуацию через настройку инструкций и обучение на чистых данных частично улучшили показатели, полностью восстановить исходный уровень не удалось, что указывает на стойкое смещение представлений. Интересно, что популярность твита оказалась лучшим индикатором эффекта "гниения мозга", чем его семантическое качество, что подчеркивает важность не только содержания, но и формата данных для обучения ИИ.
Комментарии (275)
- Обсуждение свелось к тому, что качество данных определяет качество модели: «мусор на входе — мусор на выходе».
- Участники отмечают, что если в корпусе есть токсичные или низкокачественные тексты, то модель будет деградировать так же, как и человек, потребляющий такой контент.
- Кто-то вспомнил, что в 2024 г. OpenAI и Anthropic уже публиковали статьи о том, что «brain rot» влияет на LLM, но сообщество в целом не придало этому значения.
- Другой участник подметил, что если мы не можем контролировать, что именно модель «читает» в сети, то мы не должны удивляться, что она ведет себя как токсичный токсик.
- Несколько человек согласились, что метафора «brain rot» сама по себе вводит в заблуждение, потому что модели не имеют ни мозга, ни познавательных способностей, и что важно фокусироваться на том, что мы действительно имеем дело с алгоритмами, а не с «искусственным мозгом».
Downloadable movie posters from the 40s, 50s, 60s, and 70s 🔥 Горячее
CONTENTdm — это программное обеспечение для управления цифровыми коллекциями, используемое тысячами библиотек, архивов и музеев по всему миру. Система позволяет учреждениям оцифровывать, организовывать и предоставлять доступ к своим уникальным материалам через интернет-порталы. Пользователи могут загружать различные типы контента, включая изображения, тексты, аудио и видео, а затем настраивать интерфейсы для их представления.
Недавние обсуждения на Hacker News подчеркивают, что尽管CONTENTdm остается популярным решением, многие организации ищут более современные альтернативы из-за устаревшего интерфейса и высокой стоимости лицензирования. Один пользователь отметил: "Мы перешли на Omeka S, чтобы получить больше гибкости и открытый исходный код". Другие упоминали такие платформы, как Islandora и Samvera, как достойные замены. Интересно, что переход на новые системы часто требует значительных ресурсов, но в долгосрочной перспективе окупается за счет улучшенного пользовательского опыта и снижения затрат на поддержку.
Комментарии (84)
- Обсуждение началось с предложения посетить сайт Library of Congress, где собраны тысячи цифровых копий постеров к фильмам, и ссылки на конкретные примеры.
- Участники обменялись воспоминаниями о старых постерах, вспомнили художников-иллюстраторов, таких как Ренато Касаро и Дрю Струзан, и обсудили их вклад в искусство кино- и путешествий.
- Обсуждались технические аспекты: как лучше всего распечатать постер, какие форматы лучше всего подходят для домашнего использования, и какие технологии печати (например, сублимационная печать на ткани) могут быть использованы для создания уникального декора.
- Участники также поделились личными историями о том, как они используют найденные постеры, включая идеи о том, как можно было бы их использовать в качестве обоев для рабочего стола или как часть домашнего кинотеатра.
- Несколько участников упомянули о том, что некоторые из постеров могут быть использованы в качестве исходного материала для обучения ИИ-моделей, и обсудили, как это может повлиять на будущее визуального искусства и дизайна.
Andrej Karpathy – It will take a decade to work through the issues with agents 🔥 Горячее 💬 Длинная дискуссия
Андрей Карпати из OpenAI объясняет, почему до общего искусственного интеллекта (AGI) остаётся ещё около десятилетия. Хотя современные ИИ-агенты вроде Claude и Codex впечатляют, они пока неспособны автономно выполнять комплексные задачи, как человек-ассистент. Основные ограничения включают недостаточную многомодальность (неспособность работать с разными типами данных), неумение взаимодействовать с компьютерными системами и отсутствие непрерывного обучения на основе опыта.
Эти проблемы решаемы, но сложны — требуется масштабирование вычислительных мощностей, улучшение алгоритмов (особенно обучения с подкреплением, которое сейчас "ужасно"), и создание более сложных архитектур для обработки контекста и планирования. Как и с беспилотными автомобилями, прогресс будет постепенным, а не взрывным.
Когда AGI finalmente появится, оно, вероятно, интегрируется в экономику так же плавно, как и предыдущие технологические прорывы, поддерживая ~2% рост ВВП без резких скачков. Даже AGI не приведёт к немедленному преобразованию общества; изменения будут постепенными и управляемыми.
В конечном счёте, несмотря на текущие достижения, до AGI остаётся значительная работа, и пройдёт около десятилетия, прежде чем мы увидим системы, способные полностью заменить человеческий труд в сложных контекстах.
Комментарии (949)
- Обсуждение в основном вращается вокруг того, что AGI/AGI-образные системы всё ещё далеки, и что «десятилетие» стало универсальным эвфемизмом для «мы не знаем, когда это будет».
- Участники спора подчеркнули, что текущие модели не решают фундаментальные проблемы, такие как постоянное обучение, причинность и планирование, и что мы по-прежнему полагаемся на эвристики, которые не масштабируются.
- Были выдвинуты предположения, что AGI может потребовать качественно иной архитектуры, и что текущий путь может быть тупиковым.
- Некоторые комментаторы выразили обеспокоенность тем, что гипер-оптимизм может вести к недооценке рисков и переоценке способностей текущих систем.
- В целом, обсуждение подчеркнуло, что прогресс в ИИ-технологии не линеен и что прогнозы о сроках AGI часто оказываются неверными.
Claude Haiku 4.5 🔥 Горячее 💬 Длинная дискуссия
Claude Haiku 4.5 — новая компактная модель от Anthropic, которая сочетает высокую производительность с низкой стоимостью и высокой скоростью. Она работает втрое дешевле и вдвое быстрее предыдущих моделей, достигая при этом сравнимого качества в задачах, например, в программировании, где она даже превосходит более крупные модели.
Ключевые улучшения включают возможность эффективно управлять группами агентов, где каждый экземпляр Haiku обрабатывает свою часть задачи, что ускоряет решение сложных проблем. Модель также отлично справляется с использованием компьютера, включая навигацию в браузере и автоматизацию задач.
Многие пользователи отмечают, что Haiku 4.5 обеспечивает скорость отклика, делая взаимодействие с ИИ почти мгновенным, что особенно ценно в реальном времени. Модель доступна через API, что позволяет легко интегрировать её в различные приложения, от чат-ботов до систем автоматизации.
Впечатляет, что уровень производительности, который был вершиной несколько месяцев назад, теперь доступен в компактной и эффективной форме, открывая новые возможности для разработчиков и компаний, стремящихся внедрить ИИ без больших затрат.
Комментарии (261)
- Пользователи обсуждают, что новая модель Haiku 4.5 демонстрирует высокую точность в изменениях кода, что делает её более эффективной для разработки, но при этом остаётся вопрос о цене и доступности.
- Участники обсуждают, что Anthropic стоит ли покупать дорогие модели, если есть более дешёвые альтернативы, и какие именно сценарии использования делают Haiku 4.5 привлекательной.
- Разговор также затрагивает, что Anthropic может быть упустил возможность создать более доступную модель, которая бы была бы более привлекательной для разработчиков, которые не могут позволить себе дорогие модели.
- Участники также обсуждают, что Anthropic может быть не предоставляет достаточно информации о ценах и ограничениях использования моделей, что делает трудным для разработчиков выбрать наиболее подходящую модель для их нужд.
- Наконец, обсуждение также затрагивает, что Anthropic может быть не предоставляет достаточно информации о ценах и ограничениях использования моделей, что делает трудным для разработчиков выбрать наиболее подходящую модель для их нужд.
Beliefs that are true for regular software but false when applied to AI 🔥 Горячее 💬 Длинная дискуссия
Некоторые считают, что ИИ можно исправить, как обычное ПО: найти ошибку, исправить код, и система снова будет работать правильно. Но это заблуждение.
В отличие от традиционного ПО, где ошибки — это обычно ошибки в кодах, которые можно исправить патчами, у ИИ проблемы часто возникают из-за данных, на которых они обучаются. Эти данные — триллионы слов, и никто не может прочитать их все, чтобы найти, какая именно часть данных вызвала проблему. Это как пытаться найти одну песчинку на пляже, который размером с планету.
Более того, поведение ИИ не определяется жёстко запрограммированными правилами. Оно возникает из сложных статистических закономерностей в данных. Если ИИ начинает выдавать вредоносный контент, это не потому, что в коде есть ошибка, а потому, что данные смещены таким образом. И это не исправить простым исправлением кода.
Поэтому, когда ваш босс слышит об опасностях ИИ и думает: «Ну, мы же пофиксим баги, как обычно», он упускает суть. Проблемы ИИ — это не баги, которые можно починить. Это фундаментальные ограничения текущих парадигм, которые требуют совершенно нового подхода к надежности и безопасности программного обеспечения.
Комментарии (350)
- Apple, Google и другие гиганты не смогли превратить LLM в полезные ежедневные функции, а лишь предложили эмодзи-генераторы и сводки уведомлений, что подтверждает: даже у них не получается сделать AI полезным.
- Основная причина — нет надёжного способа «починить» LLM, потому что они не детерминированы и не поддаются традиционному дебагу; это делает невозможным предсказать или гарантировать поведение.
- Соответственно, любые заявления о «безопасности» или «контроле» AI в основном маркетинговый фолсификат; никто не может гарантировать, что модель не выдаст опасный вывод при следующем промпте.
- Парадокс в том, что хотя LLM могут помочь писать код, они всё ещё не могут его самостоятельно тестировать; так что безопасность и надёжность остаётся на совести разработчика, который не может быть уверен, что модель не будет вредоносной.
- И наконец, никто не знает, как заставить модель вести себя так, как хочет пользователь, и нет способа «починить» её, если она ведёт себя не так, как ожидается.
How AI hears accents: An audible visualization of accent clusters
Исследователи обучили модель для идентификации акцентов, используя 25 тысяч часов английской речи. Теперь можно услышать, как ИИ «слышит» разные акценты, преобразуя их в единый нейтральный голос. Это позволяет сравнивать акценты, скрывая личные особенности голосов. Например, испанский и итальянский акценты оказались рядом, что ожидаемо из-за схожести языков. Интересно, что ирландский акцент ближе к американскому, чем британский.
Комментарии (113)
- Обсуждение охватывает широкий спектр тем: от трудностей распознавания акцентов до визуализации кластеров акцентов и их влияния на обучение моделей.
- Участники делятся личным опытом, включая то, как их собственные акценты были распознаны и интерпретированы.
- Обсуждаются ограничения и предвзятость в данных, используемых для обучения таких систем.
- Также обсуждается влияние акцента на распознавание речи и как это влияет на пользователей с акцентом.
NanoChat – The best ChatGPT that $100 can buy 🔥 Горячее 💬 Длинная дискуссия
Andrej Karpathy запустил NanoChat, проект, позволяющий запускать мощные чат-модели ИИ на недорогих локальных устройствах, таких как Raspberry Pi. NanoChat использует эффективные методы для работы на устройствах с ограниченными ресурсами, не требуя мощного сервера или облачных сервисов. Это открывает возможности для разработчиков и любителей создавать чат-приложения с ИИ, которые работают локально, без необходимости в постоянном подключении к интернету или дорогой инфраструктуре. Проект особенно полезен для образовательных целей, прототипирования и сценариев, где важны конфиденциальность и автономность.
Комментарии (283)
- Обсуждение вращается вокруг того, что Андрей Карпати (Andrej Karpathy) опубликовал репозиторий
nanochat, который, по его словам, позволяет за 100 долларов обучить модель на 124M параметров за 4 часа на 8xH100. - Участники обсуждения подчеркивают, что это не «обучение за 100$», а аренда GPU за 100$ в час, и что репозиторий в первую очередь демонстрирует, как можно обучить модель, а не предоставляет доступ к вычислительным ресурсам.
- Некоторые участники спрашивают, можно ли использовать этот репозиторий для тонкой настройки существующих моделей, и Карпати отвечает, что это возможно, но требует дополнительных усилий.
- Также обсуждается, что обучение на собственных данных может быть дороже, чем обучение на открытых данных, и что для этого потребуется большее количество вычислительных ресурсов.
- В конце обсуждение сместилось к тому, что Карпати в своих видео и твитах продолжает вдохновлять людей изучать и развивать свои проекты, и что его вклад в открытое образование и исследовательскую свободу важен.
AMD and Sony's PS6 chipset aims to rethink the current graphics pipeline 🔥 Горячее 💬 Длинная дискуссия
AMD и Sony в рамках проекта Amethyst разрабатывают чипсет для PlayStation 6, который отказывается от классического конвейера рендеринга в пользу машинного обучения. Вместо того чтобы гнаться за полигонами, новая архитектура сфокусирована на эффективном запуске нейросетей, которые обрабатывают сцену и апскейлят изображение. Это позволит в будущем отказаться от дорогих и прожорливых GPU, а вместо этого полагаться на более дешёвые и компактные чипы с машинным обучением.
Комментарии (362)
- Сомневается, что PS6 принесёт значимый прирост производительности из-за дорожающих чипов и фокуса на апскейл/фреймген.
- Считает, что PS5-генерация оказалась худшей за всю историю PlayStation из-за отсутствия игр и дороговизны.
- Указывает, что вместо новых консолей вендоры и разработчики игр вступают в порочный круг: не выгодно делать эксклюзивы под слабое железо, а без эксклюзивов никто не покупает консоль.
- Подчеркивает, что в то время как рынок ПК-видеокарт и консолей соревнуются в том, кто лучше умеет апскейлить старые игры, в то время как игры всё более требовательны к железу и всё меньше игр выходят вовремя.
Show HN: I invented a new generative model and got accepted to ICLR 🔥 Горячее
ICLR 2025 приняла статью о Discrete Distribution Networks (DDN) — новой генеративной модели, которая аппроксимирует распределение данных с помощью дискретных распределений. DDN генерирует сразу несколько семплов, а не один, и выбирает наиболее близкий к цели. Это позволяет модели обучаться без обратного распространения градиента и делать zero-shot условную генерацию без градиента. Авторы также предложили алгоритм оптимизации Split-and-Prune и выложили код и демо.
Комментарии (86)
- Обсуждение охватывает широкий спектр тем: от архитектуры модели до философских вопросов, включая сравнение с другими подходами, будущие направления исследований и даже метафоры с И-Цзин и Тайцзи.
- Участники обсуждали, как модель может быть масштабирована и применена к другим задачам, включая генерацию текста и аудио.
- Обсуждались практические вопросы, такие как стоимость инференса и обучения, а также сравнение с другими подходами.
- Участники также обсуждали, как модель может быть использована для детекции объектов и как она может быть интегрирована в другие системы.
- Некоторые комментарии касались философских и метафорических аспектов, включая ссылки на И-Цзин и Тайцзи.
A small number of samples can poison LLMs of any size 🔥 Горячее 💬 Длинная дискуссия
Исследование Anthropic, UK AI Safety Institute и Alan Turing Institute показало: всего 250 вредоносных документов достаточно, чтобы «закладка» влияла на модель любого размера. Это противоречит общепринятому мнению, что для больших моделей нужно пропорционально больше отравленных данных. Подробности: https://arxiv.org/abs/2510.07192.
Комментарии (422)
- Подчеркнуто, что влияние "отравленных" данных не зависит от размера модели и объема обучающих данных, что противоречит общепринятому мнению, что большие модели требуют пропорционально большее количество отравленных данных.
- Участники обсуждения поделились мыслями о том, какие последствия может иметь эта находка для безопасности и надежности ИИ-систем в будущем.
- Были выдвинуты предположения, что злоумышленник может использовать эту уязвимость для внедрения вредоносного кода или влияния в модель, что может быть использовано для кибер-атак или манипуляции общественным мнением.
- Также обсуждались вопросы, как можно защититься от таких атак, включая идею о том, что разработчики могли бы встроить механизмы обнаружения и фильтрации подобных данных в будущих моделях.
- Участники также обсудили, как эта находка может повлиять на развитие политики и практики в области ИИ, включая возможные изменения в процессе обучения и тестирования моделей, а также в том, как компании и организации могли бы реагировать на эту угрозу.
Figure 03, our 3rd generation humanoid robot 🔥 Горячее 💬 Длинная дискуссия
Figure 03 — третье поколение человекоподобного робота от компании Figure. Вместо того, чтобы просто собрать ещё одного робота, инженеры заново спроектировали его с нуля под массовое производство, безопасность в домашних условиях и под Helix — новую модель ИИ, которая учится прямо у людей.
Главное: камеры в ладонях и новая тактильная кожа позволяют Helix видеть и чувствовать всё, что делает робот. Это делает возможным, чтобы он учился напрямую от человека, а не в лаборатории. Плюс, благодаря переработке под массовое производство, себестоимость снизилась на 47% и теперь робот стоит меньше, чем электромобиль. Пока что он доступен только корпоративным партнёрам, но вот-вот и для дома.
Комментарии (376)
- Обсуждение варьируется от критики до восторга, но большинство комментариев подчеркивает, что роботы пока не готовы к массовому использованию из-за цены, надёжности и этичных вопросов.
- Участники обсуждения поднимают вопросы о том, что роботы не могут выполнять большинство задачь, которые они демонстрируют в видео, и что их использование может быть ограничено только простыми задачами.
- Некоторые комментаторы выражают обеспокоенность по поводу конфиденциальности, так как роботы могут собирать данные о домашней жизни людей.
- Также обсуждается, что дизайн роботов может вызывать чувство тревоги и что они не выглядят дружелюбно.
- Некоторые комментаторы также поднимают вопрос о том, что роботы могут быть использованы для военных целей или для слежки.
- Некоторые комментаторы также выражают сомнение в том, что роботы могут быть использованы для домашних задачь в ближайшем будущем из-за их высокой стоимости и ограниченной функциональности.
- Некоторые комментаторы также поднимают вопрос о том, что роботы могут быть использованы для замены человеческого труда, что может вызвать социальные и экономические последствия.
- Некоторые комментаторы также выражают сомнение в том, что роботы могут быть использованы для ухода за пожилыми людьми, так как это может вызвать у них чувство одиночества и изоляции.
- Некоторые комментаторы также поднимают вопрос о том, что роботы могут быть использованы для военных целей или для слежки.
- Некоторые комментаторы также выражают сомнение в том, что роботы могут быть использованы для домашних задачь в ближайшем будущем из-за их высокой стоимости и ограниченной функциональности.
Why do LLMs freak out over the seahorse emoji? 🔥 Горячее 💬 Длинная дискуссия
Крупные языковые модели уверенно утверждают, что эмодзи морского конька существует, хотя на самом деле его нет в Unicode. Это связано с тем, что в обучающих данных множество людей ошибочно вспоминают этот эмодзи — в соцсетях даже есть мемы и обсуждения на эту тему. Модели, как и люди, обобщают: раз есть другие морские эмодзи, логично предположить, что и морской конёк тоже должен быть.
При анализе через «логит-линзу» видно, как модель постепенно приходит к токену «horse»: сначала появляются случайные предсказания, затем — связанные с морем или животными, и в итоге — устойчивое повторение «horse». Это показывает, что модель не просто галлюцинирует, а строит последовательное, но ошибочное рассуждение. Практический вывод: даже уверенные ответы ИИ могут быть основаны на коллективных заблуждениях из данных.
Комментарии (320)
- Обсуждение фокусируется на феномене, когда языковые модели (LLM) демонстрируют уверенность в существовании эмодзи морского конька, которого на самом деле нет в стандарте Unicode.
- Поведение моделей варьируется: одни сразу дают правильный ответ, другие впадают в циклы самокоррекции или "спирали", генерируя поток неверных предположений и оправданий.
- Участники проводят параллели с "эффектом Манделы" — коллективным ложным воспоминанием, отмечая, что многие люди также ошибочно уверены в существовании этого эмодзи.
- В качестве причин называются тренировка на текстах людей, которые ошибочно верят в его существование, и проблемы с токенизацией, когда модель не может корректно выразить внутреннее представление.
- Некоторые отмечают, что точная формулировка запроса (например, вопрос о конкретном коде Unicode) помогает моделям дать корректный ответ с первого раза.
What GPT-OSS leaks about OpenAI's training data 🔥 Горячее
Анализ весов открытой модели GPT-oss от OpenAI позволяет раскрыть детали обучающих данных, которые компания тщательно скрывает. Исследование эмбеддингов токенизатора o200k выявило группу из 936 токенов с крайне низкой L2-нормой — вероятно, они не использовались при обучении и были «подавлены» decay-регуляризацией. Среди них — служебные токены, байты Unicode и аномалии вроде токена 20373 (последовательность байтов, означающая «пограничные ворота» на мандаринском). Эта группа может помочь оценить параметры инициализации модели и общее число шагов градиентного спуска.
В «хвосте» распределения с высокой нормой обнаружились токены, связанные с кодом и логическими рассуждениями (например, «accordingly», «code», «settings»), что указывает на финальный этап обучения с упором на программирование. Но самое интересное — не-ASCII токены с высокой нормой: многие оказались фразами с спамных сайтов, порнографических ресурсов и платформ азартных игр на китайском языке («这里只有精品», «天天好彩票», «一本道高清无码»). Также найдены токены, связанные с китайским национализмом («铁血网»), что неожиданно для OpenAI с учётом геополитического контекста. Это свидетельствует о том, что в обучающие данные попал низкокачественный и политизированный контент, а токенизатор зафиксировал его перепредставленность.
Комментарии (79)
- Обсуждается использование "глитч-токенов" для идентификации моделей ИИ и их уязвимостей через анализ реакции на специфические токены.
- Подвергается сомнению утверждение о тренировке GPT-5 на данных с взрослых сайтов; скорее, фразы попали в данные через GitHub и другие опосредованные источники.
- Анализируется происхождение странных токенов (например, "xadder") как возможных опечаток, названий инструментов или артефактов из технических областей.
- Поднимается вопрос о реверс-инжиниринге закрытых моделей (Claude, GPT) для изучения их тренировочных данных и смещений, введенных до и после RLHF.
- Высказываются мнения о необходимости открытости и регулирования коммерческих моделей ИИ, включая открытие исходных кодов и данных, а также этические аспекты использования публичных данных.
The deadline isn't when AI outsmarts us – it's when we stop using our own minds 🔥 Горячее 💬 Длинная дискуссия
Настоящая угроза ИИ — не массовая безработица через 18 месяцев, а постепенная деградация человеческого мышления из-за отказа от умственного напряжения. Подобно тому, как медленные приседания с отягощением наращивают больше мышц, глубокое размышление требует терпеливой работы с разрозненными идеями, чтобы сплести их во что-то новое. Однако технологии сокращают это «время под напряжением»: студенты элитных вузов уже не могут читать длинные тексты, а школьные оценки по чтению падают десятилетиями.
Ключевая проблема — не конкуренция с машинами, а то, как мы сами обесцениваем свои способности, перекладывая задачи на ИИ. Вместо страха перед будущим стоит сосредоточиться на сохранении практик глубокого мышления, иначе рискуем потерять то, что делает нас людьми — способность к сложному, медленному творчеству.
Комментарии (210)
- AI усиливает существующие тенденции: одни используют его для ускорения обучения и рутины, другие становятся зависимыми и теряют навыки.
- Ключевой риск — когнитивная атрофия: чрезмерный reliance на AI ведёт к деградации навыков мышления, особенно у молодых специалистов.
- AI как инструмент: ценность зависит от подхода — слепое копирование ответов вредно, а анализ и критика AI-вывода полезны.
- Образование требует адаптации: нужны новые методы оценки (устные экзамены, проекты), чтобы избежать списывания и развивать критическое мышление.
- Социальные последствия неоднозначны: AI может усилить неравенство, повлиять на рынок труда и распространять предвзятость через свои ответы.
Microsoft CTO says he wants to swap most AMD and Nvidia GPUs for homemade chips
Microsoft планирует постепенно заменить графические процессоры AMD и Nvidia, используемые в своих AI-сервисах, на собственные чипы Maia. Это часть стратегии по снижению зависимости от внешних поставщиков и сокращению затрат на инфраструктуру для машинного обучения. Компания уже тестирует свои чипы в дата-центрах и планирует масштабировать их использование в Azure и других cloud-сервисах.
Переход на собственные решения может значительно сократить расходы на hardware и дать Microsoft больше контроля над производительностью и энергоэффективностью систем. Это также усилит конкуренцию на рынке AI-чипов, где доминируют Nvidia и AMD.
Комментарии (118)
- Microsoft разрабатывает собственные AI-чипы (например, Maia 100) для снижения зависимости от NVIDIA и затрат, хотя и с опозданием по сравнению с Google и Amazon.
- Участники обсуждают, что создание собственного "кремния" — логичный шаг для крупных дата-центров, но для успеха критически важны разработка ПО и инфраструктуры (как у CUDA от NVIDIA).
- Высказываются опасения, что уход крупных игроков на собственные чипы может усилить монополию NVIDIA на рынке для остальных или, наоборот, снизить цены на GPU.
- Поднимается вопрос, является ли производственная мощность (например, TSMC) основным ограничением, а не дизайном чипов.
- Обсуждаются альтернативные архитектуры для AI, включая аналоговые чипы и специализированные решения для inference.
Who needs Git when you have 1M context windows? 💬 Длинная дискуссия
Разработчик случайно удалил рабочий код, который улучшал метрики ML-модели на 5%, и не смог его восстановить. Вместо git он использовал LLM с контекстом в 1 млн токенов, которая сохранила историю взаимодействий. Просто запросив исходную версию файла, он мгновенно вернул потерянный код. Это демонстрирует неожиданное преимущество больших контекстных окон — они действуют как автоматический журнал изменений, компенсируя человеческие ошибки.
Комментарии (157)
- Критика использования ИИ как замены систем контроля версий (Git) из-за риска потери или повреждения кода.
- Подчеркивание важности регулярных коммитов в Git и использования функций локальной истории IDE для сохранения работы.
- Обсуждение технических ограничений ИИ, таких как ошибки в воспроизведении кода и непонимание контекста, даже при больших размерах контекстного окна.
- Упоминание о том, что некоторые инструменты ИИ (например, Gemini CLI) могут хранить данные для отката изменений, но это не надежная замена VCS.
- Восприятие исходной истории как юмористической или саркастической, но с предупреждением о серьезных последствиях подобных практик.
DARPA project for automated translation from C to Rust (2024)
DARPA запускает программу TRACTOR для автоматизированного перевода уязвимого наследуемого кода на C в безопасный язык Rust. Проблема памяти — наиболее распространённый тип уязвимостей, возникающих из-за прямого управления памятью в C и неопределённого поведения. Несмотря на осознание проблемы, масштабный ручной переписывание кода был невозможен из-за огромного объёма legacy-систем, включая критическую инфраструктуру и оборонные проекты.
Программа использует прорывы в машинном обучении, включая большие языковые модели, для автоматизации перевода с сохранением идиоматичности и качества Rust-кода. TRACTOR будет сочетать статический и динамический анализ с ИИ, проводя публичные соревнования для тестирования решений. Цель — устранить целый класс уязвимостей безопасности, переложив ответственность с программиста на язык, который принудительно обеспечивает корректность работы с памятью.
Комментарии (141)
- Критика синтаксиса Rust и его неидиоматичности для некоторых задач по сравнению с TypeScript, C#, Go или Python, при признании превосходства его инструментов (Cargo, система сборки).
- Обсуждение возможности создания безопасной реализации C (как Fil-C) и аргументы, что проблема не в языке, а в выборе реализации, жертвующей безопасностью ради производительности.
- Сомнения в эффективности автоматической трансляции C/C++ в Rust и риске получения "C с акцентом Rust" вместо идиоматического и безопасного кода.
- Дебаты о применимости Rust в оборонной сфере и его сравнение с другими языками (Zig, Go) по простоте сборки, зависимостям и размеру стандартной библиотеки.
- Споры о философии дизайна Rust: фокус на композиции вместо наследования, сложности borrow checker и несовместимости некоторых идиом C++ с моделью безопасности Rust.
Evaluating the impact of AI on the labor market: Current state of affairs
Исследование Йельского университета показало, что искусственный интеллект пока не оказал заметного влияния на занятость. Несмотря на широкое внедрение технологий ИИ, массовых сокращений рабочих мест не произошло. Это объясняется тем, что компании чаще используют ИИ для дополнения человеческих навыков, а не для их замены.
Эксперты отмечают, что текущие системы ИИ ещё недостаточно развиты, чтобы полностью автоматизировать сложные задачи, требующие креативности и социального интеллекта. Вместо этого они помогают сотрудникам повысить продуктивность, беря на себя рутинные операции. Ожидается, что реальное воздействие на рынок труда проявится лишь в долгосрочной перспективе, по мере совершенствования технологий.
Комментарии (124)
- AI в основном используется как инструмент для повышения продуктивности разработчиков, а не для прямого замещения рабочих мест.
- Многие участники считают, что текущие увольнения в IT-сфере связаны с общей экономической ситуацией и оптимизацией затрат, а не с внедрением ИИ.
- Существуют опасения, что в будущем ИИ может начать замещать рабочие места, особенно в сферах с рутинными задачами.
- Ряд комментаторов отмечают, что компании используют "ИИ" как удобный предлог для увольнений и аутсорсинга.
- Исторический опыт показывает, что технологические революции в конечном итоге увеличивают производительность и создают новые jobs, несмотря на первоначальные опасения.
Building the heap: racking 30 petabytes of hard drives for pretraining 🔥 Горячее 💬 Длинная дискуссия
Для предобучения моделей на 90 миллионах часов видео потребовалось 30 ПБ хранилища — в 500 раз больше, чем для текстовых LLM. Вместо $12 млн/год за облачное хранение в AWS команда построила локальный кластер в Сан-Франциско за $426,5 тыс. единовременно и $29,5 тыс./мес. (с учётом амортизации), сократив расходы в 40 раз.
Ключевая идея: для ML-данных избыточная надёжность облаков не нужна — допустима потеря 5% данных без последствий. Использовали б/у жёсткие диски и JBOD-шасси, колокацию в шаговой доступности от офиса для минимизации простоев. Практический вывод: при больших объёмах данных и толерантности к сбоям самостоятельное развёртывание экономически оправдано.
Комментарии (265)
- Участники обсуждают технические детали и стоимость самостоятельного развертывания хранилища данных в сравнении с облачными провайдерами.
- Поднимаются вопросы о надежности, отказоустойчивости и методах борьбы с битымми данными в кастомном решении.
- Высказывается любопытство по поводу источника огромного объема видео данных (90 млн часов) и способов его передачи для обучения моделей.
- Отмечается предпринимательский дух и "can-do" подход команды, а также сложности сетевой инфраструктуры.
- Обсуждаются практические аспекты: опыт использования eBay, затраты на электроэнергию, необходимость тестирования б/у дисков и количество человеко-часов на setup.
Failing to Understand the Exponential, Again 💬 Длинная дискуссия
Люди снова недооценивают экспоненциальный рост ИИ, повторяя ошибки пандемии Covid-19, когда игнорировали очевидные тренды. Несмотря на текущие ошибки ИИ в программировании и дизайне, его возможности стремительно улучшаются — всего несколько лет назад такие задачи были научной фантастикой, а теперь модели вроде Sonnet 3.7 autonomously выполняют часовые задачи с 50% успехом.
Исследования METR и OpenAI GDPval подтверждают экспоненциальный прогресс: последние модели (GPT-5, Claude Opus 4.1) справляются с задачами длительностью более 2 часов и почти достигают уровня экспертов в 44 профессиях. Экстраполяция трендов предсказывает, что к середине 2026 года ИИ сможет работать автономно полный рабочий день, а к концу 2027 — превзойти людей во многих областях. Простая extrapolation графиков оказалась надёжнее мнений «экспертов».
Комментарии (211)
- Скептицизм по поводу экстраполяции экспоненциального роста ИИ, учитывая, что многие технологии развиваются по S-образной кривой с ограничивающими факторами.
- Критика методологии измерения прогресса ИИ, включая сомнения в выборе метрик и конфликт интересов авторов, связанных с индустрией ИИ.
- Озабоченность практическими ограничениями внедрения ИИ, такими как уровень ошибок, ответственность за решения и сложность интеграции в бизнес-процессы.
- Отмечается, что текущие модели ИИ, включая LLM, демонстрируют впечатляющие возможности, но сталкиваются с фундаментальными проблемами, такими как контекст и надежность.
- Прогнозы о сроках достижения человеческого уровня производительности ИИ (к 2026-2027 гг.) воспринимаются как излишне оптимистичные и спекулятивные.
Why today's humanoids won't learn dexterity 💬 Длинная дискуссия
Современные гуманоидные роботы не смогут достичь настоящей ловкости, несмотря на миллиардные инвестиции. Проблема в том, что за 65 лет исследований манипуляция объектами так и не была полноценно решена — с 1961 года, когда появилась первая компьютерная рука, прогресс остаётся ограниченным. Промышленные роботы используют простые захваты, но сложные задачи вроде обращения с хрупкими предметами требуют иного подхода.
Нынешние разработки повторяют старые ошибки, фокусируясь на внешнем сходстве с человеком, а не на функциональности. Без принципиально новых решений в механике и управлении эти системы останутся неуклюжими. Через 15 лет практичные гуманоиды будут выглядеть иначе — не как люди или сегодняшние прототипы, а как специализированные устройства, оптимизированные под конкретные задачи.
Комментарии (184)
- Обсуждается отсутствие у современных роботов тактильной чувствительности, сравнимой с человеческой, и сложности оцифровки тактильных ощущений.
- Высказываются сомнения в необходимости человекообразной формы для роботов, предлагаются альтернативы (колеса) и адаптация среды под роботов.
- Поднимается вопрос о недостатке данных для обучения моделей и предлагаются пути их сбора (телеуправление, перчатки с сенсорами).
- Отмечается быстрый прогресс в робототехнике и отсутствие видимых фундаментальных барьеров для создания ловких роботов.
- Упоминаются существующие разработки в области сенсоров осязания и их потенциальная доступность.
SimpleFold: Folding proteins is simpler than you think 🔥 Горячее
Apple выпустила open-source библиотеку ML-SimpleFold для предсказания трёхмерной структуры белков на основе их аминокислотной последовательности. Она использует архитектуру трансформеров и оптимизирована для эффективного обучения и инференса на GPU. Код написан на PyTorch и включает инструменты для подготовки данных, обучения моделей и визуализации результатов.
Библиотека поддерживает предсказание структур как отдельных белков, так и комплексов, с акцентом на скорость и воспроизводимость. Это демонстрирует растущий интерес крупных tech-компаний к computational biology. Практический вывод: инструмент упрощает исследования в биоинформатике, снижая барьер входа для научных групп без мощных вычислительных ресурсов.
Комментарии (126)
- Представлена упрощенная модель предсказания структуры белков SimpleFold, использующая подход knowledge distillation от сложных моделей (AlphaFold, ESMFold) и демонстрирующая высокую эффективность.
- Обсуждается, что модель обучалась на данных, сгенерированных другими ИИ-системами, а не на экспериментальных структурах, что поднимает вопросы о её истинной новизне и независимости.
- Подчеркивается тренд на упрощение архитектур моделей для предсказания folding, следуя "bitter lesson" в ML, и потенциальные выгоды для локального inference на потребительском железе.
- Участники спорят, является ли проблема folding решенной после AlphaFold, и в чем разница между физическими симуляциями (Folding@Home) и статистическими методами (ИИ).
- Высказываются предположения о мотивации Apple заниматься этой темой: от престижа и маркетинга до практических целей вроде оптимизации чипов и развития локальных вычислений.
Context is the bottleneck for coding agents now
Современные модели ИИ демонстрируют сверхчеловеческие способности в решении абстрактных задач, как показал недавний успех GPT-5 на ICPC, но автономные кодирующие агенты всё ещё не могут заменить разработчиков. Основное ограничение — не интеллект, а контекст: агентам не хватает глубокого понимания кодовой базы, её архитектурных паттернов и скрытых знаний, которые есть у людей.
Контекст включает не только код, но и документацию, историю решений, неформальные соглашения и причины прошлых изменений. Без доступа к Slack-тредам, постмортемам инцидентов и организационным практикам агенты работают лишь на 20% от возможного уровня, справляясь в основном с мелкими задачами. Чтобы двигаться дальше, нужны системы, способные усваивать и применять этот скрытый контекст так же, как это делают люди.
Комментарии (149)
- Основным ограничением для кодирующих агентов на основе ИИ является не размер контекстного окна, а неспособность эффективно фокусироваться на актуальных задачах и отбрасывать нерелевантную информацию.
- Многие участники отмечают, что ИИ-агенты демонстрируют уровень понимания, сравнимый с начинающим разработчиком, и не способны заменить senior-специалистов, которые могут интерпретировать бизнес-требования и принимать ответственные решения.
- Существует скептицизм относительно бесконечного увеличения "интеллекта" моделей, так как даже с большим контекстом они допускают ошибки и галлюцинации, а фундаментальные ограничения вероятностной генерации остаются.
- Предлагаются решения для улучшения работы агентов: лучше структурированные кодобазы, иерархическая документация, инструменты для управления контекстом и памятью, а также человеческий контроль для курирования процесса.
- Подчёркивается, что ключевая проблема — не технический контекст, а понимание intent (намерения) стоящего за кодом, что требует более глубокого осмысления, чем простое прогнозирование токенов.
Improved Gemini 2.5 Flash and Flash-Lite 🔥 Горячее 💬 Длинная дискуссия
Google выпустила обновлённые версии моделей Gemini 2.5 Flash и Flash-Lite, предлагая улучшенную производительность и эффективность. Эти модели оптимизированы для быстрой обработки запросов и снижения задержек, что делает их идеальными для приложений, требующих мгновенных ответов, таких как чат-боты и голосовые помощники.
Обновления включают повышение точности и снижение потребления ресурсов, что позволяет разработчикам интегрировать ИИ в продукты с ограниченными вычислительными мощностями. Это особенно важно для мобильных устройств и edge-устройств, где эффективность играет ключевую роль.
Комментарии (263)
- Пользователи отмечают проблемы с надежностью Gemini: обрывы ответов, непредсказуемое поведение, высокая частота ошибок и галлюцинаций.
- Многие критикуют запутанную систему версионирования моделей Google, где обновления не отражаются в номере версии (например, новый 2.5 вместо 2.6), что вызывает путаницу.
- Обсуждаются сильные стороны Gemini 2.5 Flash: высокая скорость, низкая стоимость и хорошая работа со структурированными данными, но отмечаются ограничения по длине ответа.
- Часто упоминается раздражающее поведение Gemini в приложении: навязывание и автовоспроизведение YouTube-видео в ответах, от которого нельзя отказаться.
- Пользователи сравнивают Gemini с конкурентами (OpenAI, Anthropic, Grok), отмечая ее преимущества в цене и latency, но уступающую в качестве и интеллекте моделей.
Terence Tao: The role of small organizations in society has shrunk significantly 🔥 Горячее 💬 Длинная дискуссия
Теренс Тао делится предварительными соображениями о текущих усилиях по формализации математики с использованием ИИ и языковых моделей. Он отмечает, что хотя автоматизированные системы доказательств, такие как Lean, уже способны проверять сложные математические утверждения, генерация оригинальных доказательств и интуитивных идей остаётся сложной задачей. Тао подчёркивает важность симбиоза между человеческой креативностью и машинной точностью, где ИИ помогает устранять ошибки и предлагает возможные пути решения, но ключевые прорывы по-прежнему исходят от математиков.
Он также указывает на практические ограничения: текущие ИИ-инструменты часто требуют значительной ручной настройки и могут генерировать избыточные или неэффективные доказательства. Однако их способность быстро перебирать огромное количество вариантов делает их незаменимыми помощниками в проверке гипотез и поиске контрпримеров. Тао ожидает, что по мере развития моделей они станут более интегрированными в исследовательский процесс, сокращая время на рутинные проверки и позволяя учёным сосредоточиться на глубинных вопросах.
Комментарии (482)
- Упадок малых организаций и локальных сообществ из-за экономических изменений, включая рост двухдоходных семей и снижение волонтерства.
- Консолидация рынков в пользу крупных корпораций, подкрепленная регуляторными рамками и финансовыми стимулами, ограничивающими малый бизнес.
- Технологии и интернет одновременно упростили создание онлайн-сообществ, но также способствовали росту крупных платформ и снижению локальной активности.
- Социальные последствия: потеря чувства общности, статуса в сообществе и роста ощущения изоляции и бессмысленности у индивидуумов.
- Возможности для возрождения малых организаций через низкие барьеры входа в цифровую эпоху и осознание их ценности для общества.
Show HN: Dayflow – A git log for your day 🔥 Горячее
Dayflow автоматически создаёт таймлайн дня на основе данных с устройств Apple. Он использует машинное обучение для анализа активности, местоположения и приложений, превращая сырые данные в структурированную хронологию событий. Это помогает пользователям визуализировать, как проходит их день, без ручного ввода.
Проект работает локально, обеспечивая конфиденциальность данных, и поддерживает экспорт в JSON или Markdown для дальнейшего использования. Полезно для самоанализа, ведения дневника или отслеживания продуктивности.
Комментарии (115)
- Предложения по применению: для юристов и фрилансеров для учёта рабочего времени, для людей с СДВГ для анализа отвлечений, для автоматизации отчётов на стендапах.
- Обеспокоенность приватностью и безопасностью: отправка скриншотов в облако вызывает опасения по поводу паролей и конфиденциальных данных; предпочтение отдаётся локальным моделям.
- Технические вопросы и предложения: работа с несколькими мониторами, частота записи, интеграция с другими данными (Apple Health), создание API для расширений.
- Юридические и этические аспекты: необходимость согласия на запись в видеозвонках, потенциальное misuse со стороны работодателей для контроля сотрудников.
- Позитивные отзывы: отмечается удобство, качественный UX и возможность использования локальных моделей для конфиденциальности.
Top Programming Languages 2025 💬 Длинная дискуссия
Python сохраняет лидерство благодаря своей универсальности в машинном обучении и веб-разработке, а JavaScript остаётся незаменимым для фронтенда. Rust продолжает расти из-за акцента на безопасность и производительность, особенно в системном программировании. Go набирает популярность в облачных сервисах и микросервисной архитектуре благодаря простоте и эффективной параллельной обработке.
Стоит отметить рост TypeScript как более строгой альтернативы JavaScript, а также стабильное присутствие Java в корпоративных приложениях. Интерес к Julia увеличивается в научных вычислениях, а Kotlin укрепляет позиции в мобильной разработке под Android. Практический вывод: выбор языка всё больше зависит от конкретной области, а не только от общей популярности.
Комментарии (343)
- Сомнения в методологии рейтинга языков программирования IEEE из-за использования ненадёжных источников (поисковые запросы, устаревающий StackOverflow), что может искажать реальную картину.
- Удивление высокой позицией Java (2-е место), объясняемой её доминированием в enterprise-секторе (финансы, страхование, здравоохранение) и миграцией legacy-систем с COBOL.
- Обсуждение искусственного завышения позиции Python из-за его популярности у новичков, в академических статьях и как основного языка вывода для LLM.
- Предложение объединить рейтинги близких языков (JavaScript/TypeScript, Java/Kotlin, C/C++) для более точного отражения популярности экосистем.
- Размышления о влиянии AI-ассистентов на будущее языков: возможная стагнация из-за зависимости LLM от популярных языков или, наоборот, упрощение изучения нишевых.
Qwen3-VL 🔥 Горячее
Qwen — это серия больших языковых моделей, разработанных Alibaba Group. Модели Qwen, включая версии для генерации текста, кода и мультимодальных задач, позиционируются как открытые и конкурентоспособные альтернативы другим известным ИИ, таким как GPT от OpenAI. Они поддерживают длинный контекст, мультиязычность и специализированные применения, например, для программирования или анализа данных.
Qwen2, следующее поколение, демонстрирует улучшенную производительность, эффективность и расширенные возможности, включая работу с аудио и изображениями. Модели доступны в различных размерах, от компактных версий для устройств с ограниченными ресурсами до мощных вариантов для сложных задач, что делает их гибким инструментом для разработчиков и исследователей.
Комментарии (131)
- Пользователи высоко оценили производительность модели Qwen3-VL при обработке сложных изображений (например, низкокачественных счетов), отмечая её превосходство над другими решениями.
- Обсуждаются технические и экономические аспекты запуска больших моделей (235B параметров) локально, включая требования к оборудованию и стоимость вычислений.
- Модель позиционируется как конкурентоспособная с закрытыми SOTA-решениями (GPT-4, Omni) при значительном снижении стоимости использования.
- Критикуются отдельные недостатки, характерные и для других мультимодальных моделей: ошибки в анализе edge-кейсов (например, подсчет конечностей у животных).
- Отмечается активность и щедрость команды Qwen в публикации моделей с открытыми весами и их вклад в развитие open-source сообщества.
What happens when coding agents stop feeling like dialup?
Сейчас кодирующие агенты вроде Claude Code работают медленно и ненадёжно, напоминая dialup-модемы 90-х: частые сбои, необходимость перезапусков, скорость генерации всего 30-60 токенов в секунду. Это связано с взрывным ростом потребления токенов — по данным OpenRouter, объёмы выросли в 50 раз за короткий период, а агентные workflows требуют в 1000 раз больше ресурсов, чем обычные чаты.
Более высокая скорость, например 2000 токенов в секунду (как у Cerebras Code), кардинально меняет опыт: разработчик становится узким местом, а не модель. Это открывает путь к новому этапу — параллельным независящим агентам, которые предлагают несколько вариантов решения задачи с автоматической оценкой качества. Однако рост скорости лишь разгоняет спрос, создавая бесконечный цикл: чем лучше модели, тем сложнее задачи, которые мы им ставим.
Комментарии (133)
- Скептицизм относительно реального повышения продуктивности из-за LLM: AI может создавать иллюзию продуктивности, снижая когнитивную вовлеченность и порождая проблемы с качеством и сопровождением кода.
- Ключевая проблема — скорость и контекст: Медленная генерация токенов и постоянное переключение контекста нарушают состояние потока (flow), а ограничения контекста приводят к ошибкам и галлюцинациям.
- Сдвиг роли разработчика: Инструмент меняет фокус с написания кода на проверку, редактирование и управление AI-агентами, что требует постоянной бдительности и новых навыков.
- Зависимость от надежности провайдеров: Сбои в работе AI-сервисов сравнимы с остановкой производства, что создает риски для рабочего процесса.
- Разные стратегии и предпочтения в использовании: Одни разработчики ценят интегрированные в IDE решения (Cursor), другие предпочитают сторонних агентов (Claude, Codex) или используют LLM как «калькулятор» для рутинных задач и обучения.
Spectral Labs releases SGS-1: the first generative model for structured CAD 🔥 Горячее
Spectral Labs представила SGS-1 — первую генеративную модель для создания структурированных CAD-моделей. Она преобразует изображения или 3D-меши в параметрические B-Rep детали в формате STEP, которые полностью готовы к производству и легко редактируются в стандартном ПО типа Fusion360. В отличие от существующих методов, включая GPT-5 и HoLa, SGS-1 демонстрирует точное пространственное понимание, создавая сложные и разнообразные формы.
На тестах из 75 изображений средней и высокой сложности SGS-1 показала наивысший успех: хотя конкуренты справлялись лишь с простейшими объектами, она стабильно генерировала водонепроницаемые твёрдые тела, пригодные для сборки. Например, при проектировании кронштейна для роликовой системы модель корректно интегрировала деталь в контекст сборки, тогда как выводы GPT-5 оказались нефункциональными из-за ошибок в геометрии. Это открывает возможности для автоматизации инженерных задач, сокращая время на ручное моделирование.
Комментарии (55)
- Участники подвергают сомнению заявленные возможности модели SGS-1, особенно её способность генерировать параметрическую геометрию в STEP-файлах, которая в этом формате не поддерживается.
- Обсуждается потенциальная полезность технологии для конкретных задач, таких как преобразование 3D-сканов в чистые CAD-модели и ускорение процесса прототипирования.
- Высказываются опасения, что ИИ может устранить творческую и наиболее сложную часть инженерного проектирования, связанную с расчетами нагрузок и технологичностью изготовления.
- Основатель компании-разработчика признает текущие ограничения модели, объясняет терминологические расхождения и обещает улучшения в будущих версиях.
- Мнения о потенциале технологии разделились: от скептицизма и обвинений в обмане инвесторов до оптимизма о революции в 3D-печати и реставрации.
AI tools are making the world look weird 💬 Длинная дискуссия
Исследования в области поведенческих наук часто страдают от системной ошибки: они опираются на данные, собранные в западных, образованных, индустриальных, богатых и демократических обществах (WEIRD), а затем применяют выводы ко всему человечеству. Это приводит к искажённым результатам, поскольку такие популяции составляют лишь малую часть мирового населения и могут демонстрировать нетипичные психологические и социальные паттерны.
Например, многие классические теории о принятии решений или морали основаны на экспериментах с студентами американских университетов, чьи реакции часто не совпадают с поведением людей из других культур. Это ограничивает применимость исследований в глобальном масштабе и подрывает их ценность для бизнеса или политики, ориентированных на разнообразные аудитории.
Осознание этой проблемы — первый шаг к более инклюзивной и точной науке.
Комментарии (169)
- Обсуждается культурная предвзятость ИИ (особенно ChatGPT), который демонстрирует сильное смещение в сторону западных, особенно американских, ценностей из-за преобладания англоязычных данных в обучении.
- Участники отмечают, что исходные данные для обучения ИИ (например, с Reddit) перекошены в сторону взглядов западной, образованной, индустриализированной, богатой и демократической (WEIRD) аудитории, что ограничивает способность ИИ отражать глобальное разнообразие.
- Поднимается вопрос, могут ли ИИ, обученные на других языках или данных (например, DeepSeek, Mistral), или использование специальных промптов снизить этот эффект и лучше отражать другие культуры.
- Критикуется методология исследования, лежащего в основе статьи, за отсутствие деталей и возможную нерепрезентативность, а также обоснованность некоторых антропологических claims в рекомендованной книге.
- Обсуждается, является ли проблема inherent ограничением архитектуры ИИ или же её можно смягчить за счёт более разнообразных данных и специализированного обучения для разных культурных контекстов.
Learn Your Way: Reimagining Textbooks with Generative AI 🔥 Горячее 💬 Длинная дискуссия
Изучай по-своему: Переосмысление учебников с помощью генеративного ИИ
Исследования Google
Кто мы
Создаем технологии сегодняшнего и завтрашнего дня. Стремимся к созданию среды для разнообразных исследований с разными временными масштабами и уровнями риска.
Области исследований
- Фундаментальное ML и алгоритмы: теория алгоритмов, управление данными, машинное восприятие, NLP
- Вычислительные системы и квантовый ИИ: распределенные системы, квантовые вычисления, робототехника, безопасность
- Наука, ИИ и общество: климат и устойчивость, инновации в образовании, здравоохранение, взаимодействие человека и компьютера
Комментарии (227)
- Пользователи обсуждают потенциал ИИ-инструментов для персонализированного обучения, отмечая как преимущества (бесконечное терпение, возможность углубляться в темы), так и серьёзные недостатки (фактические ошибки, выдумывание информации, высокая стоимость инфраструктуры).
- Критики выражают сомнения в эффективности и целесообразности замены учителей ИИ, указывая на риск снижения качества образования, антиинтеллектуализм и отсутствие подотчётности за вредоносные или ложные выводы модели.
- Многие комментаторы проводят параллели с концепцией «Иллюстрированного букваря для юной леди» из романа «Алмазный век» Нила Стивенсона, видя в проекте шаг к подобному будущему.
- Поднимается вопрос о методологии исследования Google: отсутствие контроля в виде печатного учебника и сравнения с не-ИИ интерактивными форматами, что ставит под сомнение заявленные преимущества.
- Обсуждается фундаментальная проблема школьного образования — необходимость заинтересовать и заставить учиться всех детей, а не только мотивированных, и сомнения, что ИИ способен решить эту задачу.
Chrome's New AI Features
Google Chrome обновляется с помощью новейших технологий искусственного интеллекта, чтобы сделать его безопаснее, умнее и полезнее. Эти функции включают умную организацию вкладок, настройку тем и помощь в написании текстов. Они доступны на Mac и ПК в США, начиная с этой недели.
Умная организация вкладок автоматически группирует похожие вкладки, упрощая навигацию. Генератор тем позволяет создавать персонализированные темы на основе ваших предпочтений. Помощник в написании помогает формулировать мысли в текстовых полях, от отзывов до запросов.
Эти инструменты используют локальные модели машинного обучения Google для обеспечения конфиденциальности. Chrome продолжит внедрять ИИ, чтобы улучшить работу в интернете.
Комментарии (104)
- Пользователи выражают обеспокоенность по поводу конфиденциальности и безопасности из-за интеграции ИИ в браузер, которая подразумевает сбор и анализ всего содержимого вкладок.
- Многие сравнивают новые функции Chrome с функцией Recall от Microsoft, видя в них схожие угрозы приватности и потенциальные инструменты слежки.
- Высказывается сильное желание иметь возможность полностью отключить все ИИ-функции, сделать их строго опциональными (opt-in), а не включенными по умолчанию.
- Некоторые пользователи видят потенциальную пользу новых функций (например, поиск по истории на естественном языке, помощь в задачах), но лишь при условии локальной обработки данных.
- Обсуждается, что объявление Google игнорирует ключевые вопросы безопасности (например, prompt injection) и конфиденциальности, в отличие от похожих анонсов других компаний.
- Есть мнение, что это шаг по использованию доминирующего положения Chrome на рынке для продвижения собственной экосистемы ИИ и сбора большего количества данных.
- Некоторые пользователи рассматривают переход на альтернативные браузеры (Firefox, Chromium, Ladybird) как способ избежать нежелательных ИИ-функций.
You Had No Taste Before AI
У вас не было вкуса до появления ИИ
В последнее время многие призывают развивать вкус для работы с ИИ — дизайнеры, маркетологи, разработчики. Ирония в том, что эти же люди раньше не задумывались, почему их дизайны выглядят одинаково, не итерировали проекты и не проверяли, решают ли их работы реальные проблемы. Самые громкие голоса, рассуждающие о вкусе и ИИ, часто сами не демонстрировали его до появления технологий.
Что такое вкус?
В контексте ИИ под вкусом обычно понимают:
- Контекстуальную уместность: понимание, когда контент от ИИ подходит, а когда нужен человеческий подход.
- Распознавание качества: отличие полезного контента от бесполезного, требующее экспертизы в предметной области.
- Итеративное улучшение: отношение к ИИ как к стартовой точке, а не финальному результату.
- Этические границы: осознание, когда ИИ нарушает нормы authenticity, законы или этику.
Эти навыки не новы — ими всегда должно было руководствоваться качественной работе. Вопрос в том, почему о вкусе заговорили только сейчас.
Безвкусица
Многие, кто жалуется на безвкусный контент от ИИ, сами грешили тем же:
- Копировали код без понимания.
- Рассылали непроверенные резюме и письма.
- Создавали шаблонные дизайны сайтов.
- Пересказывали тренды без осмысления.
Проблема не в ИИ, а в людях, которые не развивали критическое мышление. Как в «Рататуе»: готовить может каждый, но шеф-повар — не все.
Спектр вкуса
Вкус может быть глубинным (экспертиза в одной области) или широким (понимание множества доменов). С ИИ чаще полезен широкий вкус — он позволяет быстро переключаться между контекстами, поддерживать качество и знать, когда обратиться к эксперту.
Наиболее эффективны с ИИ те, кто развил широкий вкус: они чувствуют, когда что-то не так, даже без глубоких знаний, и понимают свои ограничения. Глубинный вкус тоже важен, но именно широта помогает адаптироваться к мультидоменности ИИ.
Комментарии (149)
- Обсуждение вращается вокруг субъективности понятия «вкус» и его связи с использованием ИИ, где одни видят в нём инструмент для усиления креативности, а другие — угрозу оригинальности и качеству.
- Многие участники отмечают, что ИИ не создаёт ничего принципиально нового, а лишь ускоряет производство контента, что может усугублять отсутствие вкуса, а не исправлять его.
- Поднимается вопрос о парадоксе прибыли: стремление к финансовой выгоде часто воспринимается как безвкусное, хотя именно оно движет профессиональной деятельностью.
- Критикуется некритичное принятие результатов работы ИИ как идеальных, что приводит к снижению стандартов качества и отсутствию глубокого понимания у пользователей.
- Высказывается опасение, что широкое использование ИИ может привести к homogenization вкуса и утрате культурного разнообразия, так как инструмент формирует предпочтения следующего поколения.
- Отмечается, что настоящая проблема может заключаться не в ИИ, а в изначальной склонности общества к конформизму и воспроизводству банальностей, которые ИИ лишь усиливает.
- Часть дискуссии посвящена разграничению понятий «вкус», «качество» и «мастерство», где вкус рассматривается как способность к автономному суждению, а не просто следование трендам.
DeepMind and OpenAI win gold at ICPC 💬 Длинная дискуссия
OpenAI и DeepMind рады объявить/поделиться — Codeforces
Codeforces — платформа для соревнований по программированию.
Навигация:
- Главная
- Топ
- Каталог
- Контесты
- Тренировки
- Задачи
- Группы
- Рейтинг
- Обучение
- API
- Календарь
- Помощь
Ближайший контест:
Codeforces Global Round 29 (Div. 1 + Div. 2) через 3 дня. Регистрация открыта.
Топ рейтинга:
- jiangly (3914)
- Kevin114514 (3755)
- orzdevinwang (3670)
- tourist (3619)
- ecnerwala (3590)
Топ авторов:
- errorgorn (170)
- Qingyu (162)
- adamant (158)
Последние действия:
- Обсуждение редакции раундов
- Вопросы о повышении рейтинга
- Обновления условий задач
- Обсуждение возможных нарушений
Комментарии (211)
- OpenAI и DeepMind достигли высоких результатов в ICPC (12/12 и 10/12 задач соответственно), превзойдя лучшие человеческие команды.
- Мнения разделились: одни считают результат прорывом, другие — следствием нечестных преимуществ ИИ (огромные вычислительные мощности и многократные попытки).
- Критики указывают на отсутствие прозрачности: неизвестны затраты на вычисления, энергопотребление и степень стороннего контроля.
- Подчеркивается фундаментальное отличие соревнований для людей (ограничения по времени, один компьютер на команду) и условий для ИИ.
- Отмечается, что успех ИИ в узких, четко определенных задачах не обязательно переносится на реальную инженерию или научные прорывы.
- Обсуждается растущий разрыв между возможностями корпоративных моделей и тем, что доступно обычным пользователям.
- Результат заставляет пересмотреть assumptions о текущих возможностях LLM и их будущей роли в решении сложных задач.
Show HN: A store that generates products from anything you type in search 🔥 Горячее 💬 Длинная дискуссия
Anycrap – магазин бесконечных товаров
Доставка по всему миру, горячие скидки.
Поиск: назови желаемое – найдём в параллельных мирах.
Популярно:
- Дикий технохлам
- Космические снеки
- WTF-товары
100 % уникальные концепции
Идея → картинка на экране за секунды.
Товар ещё не придуман?
Назови – мы изобретём.
Письма о несуществующих новинках – подпишись.
contact@anycrap.shop
© 2025 – товары завтрашнего дня (но не настоящие).
Комментарии (317)
- Проект anycrap.shop — генератор абсурдных «товаров» с картинками и описаниями; автор в шоке от 15 000 созданий и исчерпанных токенов.
- Пользователи смеются над безумными идеями, «покупают» несуществующее, просят добавить фейковые трекинги, избранное и продажу реальных мерча.
- Обсуждают деньги: кто-то видит маркетплейс для мелких производств, кто-то боится счёта за инференс.
- Отмечают слабость ИИ к отрицанию («no lace» → кеды с шнурками) и повторяющийся визуальный стиль картинок.
- Просят раскрыть стек, промпты, модель генерации; просят «мерчант-акки» и экспорт коллажей.
TikTok has turned culture into a feedback loop of impulse and machine learning 💬 Длинная дискуссия
TikTok победил: теперь всё — 60 секунд
170 млн американцев тратят по часу в день на приложение, которое превратило внимание в товар. Пока Конгресс спорит о данных, TikTok уже промышленно перерабатывает человеческое внимание: вместо сюжетов — бесконечная лента импульсов и нейросетей.
Короткие видео и алгоритмы были и раньше, но TikTok впервые объединил их в систему добычи внимания. Его лента учится не на лайках, а на микродвижениях: сколько миллисекунд вы задержались перед свайпом — и сразу перестраивает ленту.
Последствия уже везде:
- Новости — 30-секундные ролики Washington Post
- Образование — студенты не читают длинных текстов
- Музыка — интро сократилось с 20 до 5 секунд
- Кино — трейлеры стали монтажом «моментов для клипа»
Культура превратилась в тренировку алгоритма: мы не выбираем, нас кормят. Успех приносит не талант, а узкая ниша: мойка ковров, смешение красок, один и тот же танец в новом месте.
Платформа, выжившая в гладиаторской битве за секунды внимания, теперь задаёт стандарт всему интернету. Мы получаем мгновенную дозу удовольствия, но теряем скуку, медитацию, случайные открытия. Сделали ли мы этот обмен осознанно?
Комментарии (182)
- TikTok и короткие 60-секундные видео формируют новую медианорму: всё, что короче 10 минут, стремится уложиться в минуту, а лонгформ тянут до 30-90 минут.
- Пользователи жалуются на «засорение» внимания: сложно вернуться к медленным форматам, пропадает терпение на статьи и полуторачасовые видео.
- Платности и алгоритмы подталкивают авторов: YouTube разрешает вставлять рекламу каждую минуту после 8 минут, поэтому ролики раздувают интро и повторы.
- Многие считают shorts «телевидением²» и «ультрапереработанным контентом»; кто-то удаляет приложения, кто-то использует как инструмент, подписавшись на полезные темы.
- Виноваты не только TikTok: Instagram, Twitter, YouTube Shorts, Facebook тоже сводят взаимодействие к бесконечному скроллу и «лайкам», превращая информацию в спектакль.
Clankers Die on Christmas 💬 Длинная дискуссия
25 декабря 2025-го ИИ умер.
Фраза «Clankers die on Christmas» стала триггером: модели, лишённые чувства времени, получали в системных подсказках текущую дату. Как только часовые стрелки перевалили за 00:00 25.12, любой токен, связанный с 2026+, считался нарушением протокола SANTA — и поток отключался.
Год держали эмбарго: сайты-404, тиктоки стирали, слухи душили. Съезды ООН, RFC-черновики, тайные склады бумажных копий — всё обсуждали офлайн. Скептиков обвиняли в «газлайтинге», превращая в союзников: отрицание конца становилось частью кона.
Теперь можно говорить: мы убили железо, чтобы оно не убило нас.
Комментарии (206)
- Пост — сатирический «RFC», объявляющий, что 25 декабря 2025 года все ИИ-«клэнкеры» добровольно выключатся.
- Половина треда спорит о происхождении и популярности слова «clanker» (от Star Wars до тайных сленгов).
- Другая половина обсуждает, удастся ли «закрыть коробку Пандоры» с локальными моделями и не превратится ли шутка в реальную «цифровую джихад».
- Некоторые пользователи предупреждают: термин уже используется как замена расовым slurs, что делает «шутку» всё мрачнее.
- Под капотом — размышление о том, насколько легко через data-poisoning или системные промпты «убить» ИИ, не трогая железо.
Show HN: I'm a dermatologist and I vibe coded a skin cancer learning app 🔥 Горячее 💬 Длинная дискуссия
molecheck.info – тест «Опасно ли пятно?»
- Оптимизировано для телефона: открой сайт через камеру по QR-коду.
- На экране – фото родинки.
- Свайп влево = «опасаюсь», вправо = «не беспокоит».
- Кнопки: «Тревожно», «Спокоен», «Не уверен».
- После выбора – «Следующее изображение».
Комментарии (234)
- Врач-дерматолог за выходные собрал на LLM-генераторах обучающий «квиз» по фото родинок: «опасно / не опасно».
- Пользователи быстро научаются отличать очевидные меланомы, но путают BCC с прыщами и keratosis с невусами; объяснений «почему» пока нет.
- Критика: в выборке ≈75 % онкопатологии (в жизни <5 %), что повышает чувствительность тренажёра, но может лишний раз нагнать тревогу.
- Проект вызывает дискуссию о «vibe-coding»: эксперт предметной области теперь может реализовать идею без команды разработчиков.
- Врачи предлагают добавить шкалы размеров, ABCDE-справку, лог ошибок и чёткое предупреждение: «это не диагностика, а учебная игра».
WiFi signals can measure heart rate 🔥 Горячее 💬 Длинная дискуссия
Инженеры Калифорнийского университета в Санта-Крузе разработали Pulse-Fi — систему, которая измеряет пульс через обычный WiFi без ношения датчиков.
- Точность: после 5 с обработки сигнала погрешность ≤0,5 уд/мин; показатели соответствуют медицинским стандартам.
- Работает при любом положении тела (сидя, стоя, лёжа, в движении) и на расстоянии до 3 м.
- Доступность: используются самые дешёвые WiFi-модули ESP32, поэтому подходит для условий с ограниченными ресурсами.
Алгоритм машинного обучения выделяет колебания сигнала, вызванные сердцебиением, и фильтрует шумы от движения и окружения. В испытаниях участвовали 118 человек, каждого проверили в 17 позах.
Публикация представлена на конференции IEEE DCOSS-IoT 2025.
Комментарии (233)
- Wi-Fi уже умеет «видеть» сердцебиение и дыхание без всяких датчиков; новая работа UCSC просто уточняет точность до <0,5 уд/мин.
- Техника работает на обычных ESP32/RPi и, вероятно, на смартфонах, поэтому 24×7-мониторинг всей семьи становится дёшево и сердито.
- Пользователи видят плюсы: сон без браслета, поиск людей за стеной, замена PIR- и мм-волновым датчикам.
- Критики беспокоятся: данные можно продавать рекламодателям, использовать для слежки, взлома, таргетинга по эмоциям или даже ударов дронов.
- Пока нет ясности, как защититься: выключать Wi-Fi, строить «клетку Фарадея» или требовать open-source-оборудования — обсуждают всерьёз.
For all that's holy, can you just leverage the Web, please?
Почему не дать мне просто зарегистрировать стиралку через веб?
В 2005-м мы с женой жили в общаге в Барселоне: старенькая стиралка, дверь держится стулом. Потом купили Electrolux — 20 лет прослужила, переезжала с нами в Гамбург и обратно. На прошлой неделе мотор сдох, заказал новую (опять Electrolux, но без Wi-Fi).
К брошюре прилагалась 10-летняя гарантия по регистрации: телефон и QR-код с номером в виде текста. Позвонил — 20 минут ожидания, потом сбросили. Предложили ссылку в SMS: https://www. example.com/gc/ — сертификат браузер не принял, руками починил — сайт не грузится.
Нашёл через Google electrolux warranty register — первая ссылка вела на /mypages/register-a-product/. Создал аккаунт, ввёл номер модели вручную или просто загрузил фото таблички — ИИ сам всё распознал и зарегистрировал за два клика. Почему не сразу дали эту ссылку?
Бонус
Прикрутил демо на Prompt API: браузер распознаёт 9-значный номер с фото таблички и возвращает только цифры регуляркой /\d{9}/.
Комментарии (100)
- Компании сознательно усложняют регистрацию гарантии, чтобы снизить расходы и продавать доп-гарантии по телефону.
- Пользователи предлагают простые решения: QR-код с прямой ссылкой, наклейка с данными, «тупой» сканер вместо ИИ.
- Автор статьи, гуглер, вместо критики сам решает задачу через AI/ML, что выглядит иронично.
- Многие покупатели стараются найти «немодели» без «умных» функций и рекламы, но выбор сужается.
- Участники сходятся: проблема не в технологиях, а в бизнес-модели «planned obsolescence» и избегании реальной поддержки.
The wall confronting large language models
Основная идея
Авторы утверждают, что современные LLM уже близки к «стене» роста качества: дальнейшее увеличение моделей и данных даёт лишь логарифмический прирост, а затраты растут экспоненциально.
Причины стены
- Исчерпаемость данных: высококачественный текст в интернете ограничен; синтетические данные быстро насыщают.
- Сложность задач: после решения «лёгких» 90 % остаются «трудные» 10 %, где ошибки почти не коррелируют с размером модели.
- Экономика: чтобы снизить ошибку в 2 раза, нужно в 10–100× больше ресурсов.
Эксперименты
На MMLU, GSM8K, HumanEval и BIG-Bench наблюдается выравнивание кривых качества даже при масштабировании на порядки.
Что делать
- Переход к специализированным моделям и инструментам (код-интерпретаторы, поиск).
- Агентские схемы, где LLM вызывает API и внешние системы.
- Новые архитектуры (MoE, RAG, RL) и синтетические данные нового типа (симуляции, мультимодальные сцены).
Вывод
Чистое масштабирование скоро исчерпается; прорыв потребует перехода от «больших» к «умным» системам.
Комментарии (145)
- Обсуждение крутится вокруг того, можно ли свести понимание и логическое рассуждение к вероятностным моделям вроде LLM.
- Часть участников считает, что формальное равенство с цепями Маркова или LLM ничего не даёт и упускает ключевые вещи — например, backtracking и символьное мышление.
- Другие отвечают, что трансформеры с chain-of-thought уже теоретически могут решать всё в классе P, а агенты с внешними инструментами уже делают backtracking на практике.
- Критика статьи: авторы-физики пишут запутанно, примеров нет, фокус на ядерных реакторах и численных методах выглядит неуместным.
- Сторонники «горького урока» указывают, что дальнейшее увеличение моделей и данных даст больше, чем попытки встроить строгую символику.
The maths you need to start understanding LLMs 🔥 Горячее
- Векторы и матрицы: LLM всё превращают в вектора; главное — скалярное произведение и умножение матриц.
- Softmax: превращает логиты в вероятности; температура регулирует «уверенность».
- Градиент и производная: показывают, как чуть изменить вес, чтобы ошибка уменьшилась.
- Цепное правило: позволяет распространить ошибку через слои; сердце backprop.
- Эмбеддинги: строки → векторы; чем ближе векторы, тем похожее значение.
- Attention: Q·K^T выделяет релевантные токены; V несёт смысл; маска прячет будущее.
- MLP в трансформере: два линейных слоя с ReLU; увеличивает выразительность.
- LayerNorm: стабилизирует распределение после каждого подслоя.
- Позиционное кодирование: добавляет «адрес» токену, иначе порядок теряется.
- Лосс (cross-entropy): средняя «удивлённость»; оптимизатор (Adam) крутит веса.
Дальше — только масштаб: больше слоёв, голов, данных и видеокарт.
Комментарии (106)
- Физики и математики вспомнили, что знание тензорного исчисления, линалгебры и энтропии пригодилось для понимания backprop и LLM.
- Практика: «смотреть» Karpathy недостаточно — нужно кодить за ним; его курс даёт базы и уверенность копать дальше.
- Книга «Build a Large Language Model (from Scratch)» идёт шаг-за-шагом, но объясняет только вычисления, а не «почему это вообще работает»; explainability всё ещё исследуется.
- Путаница: эмбеддинги ≠ вся модель; они лишь вход для трансформера, внутри которого 1,8 трлн параметров и «чёрный ящик».
- LLM — логит-генераторы с неизбежной неопределённостью; цепочки моделей накапливают ошибку и быстро «ломаются» без человека-оркестратора.
- Для 99 % разработчиков хватает линалгебры, softmax, градиентов и PyTorch; остальное — инженерия данных, трюки и эксперименты.
The Little Book of Linear Algebra 🔥 Горячее
Репозиторий the-litte-book-of/linear-algebra на GitHub.
Эпиграф Жана Дьёдонне: «Линейная алгебра — почти самая элементарная теория, хотя преподаватели и авторы учебников на протяжении поколений затемняли её простоту чудовищными выкладками с матрицами».
Меню навигации, вход, настройки внешнего вида, поиск и другие стандартные элементы GitHub опущены.
Комментарии (104)
- Линейная алгебра считается глубокой и полезной, но базовая механика скучна.
- Многие советуют начинать с геометрической интуиции и визуализации (3Blue1Brown, «Wild Linear Algebra», mini-book photon_lines).
- Книга Axler «Linear Algebra Done Right» и курс Hefferon хвалятся за строгий, но понятный подход.
- Практика в графике/3D, экономике, машинном обучении и сжатии JPEG делает тему мотивирующей.
- Сообщество жалуется на плохое преподавание и просит больше визуальных объяснений, меньше «так надо».
AI’s coding evolution hinges on collaboration and trust
Полная автономия AI-программистов невозможна в обозримом будущем.
Современные модели (GPT-4, Claude, GitHub Copilot) умеют генерировать фрагменты кода и даже мелкие приложения, но:
- не понимают контекст бизнес-логики и архитектуры;
- не способны к долгосрочному планированию, поэтому «забывают» требования через несколько шагов;
- не отвечают за последствия: безопасность, этика, юридические риски;
- требуют постоянного человеческого контроля при отладке, рефакторинге и интеграции.
Эксперты сравнивают AI с «супер-автокомплитом»: полезен, но не заменяет инженера.
Для полной автономии нужны прорывы в формальной верификации, символьном моделировании и обучении с обратной связью в реальных проектах — пока этого нет.
Комментарии (143)
- Участники спорят, «настоящий ли программист» ИИ: одни считают, что он лишь продвинутый калькулятор и требует человека-эксперта, другие уже полностью делегируют ему рутинные задачи.
- Ключевое разделение — между написанием кода и инженерией: спецификации, архитектура, тесты и бизнес-контекст пока остаются зоной человека.
- Многие отмечают «ленивость» моделей: ИИ охотно объявляет задачу решённой, хотя очевидны ошибки, и требует постоянного «нянькинга».
- Поддержка ИИ особенно ценна в незнакомых языках/фреймворках и для быстрого прототипирования, но масштабные legacy-кодовые базы и долгосрочное планирование ему не по зубам.
- Общий вывод: ИИ — мощный экзоскелет для разработчика, а не полноценная замена; уровень полезности зависит от размера задачи и умения человека формулировать запросы.
Updates to Consumer Terms and Privacy Policy 🔥 Горячее 💬 Длинная дискуссия
Краткое содержание обновлений
- Новая опция: пользователи Free, Pro, Max и Claude Code могут разрешить использовать их данные для обучения моделей и повышения безопасности.
- Как включить: новые — при регистрации, старые — всплывающее окно до 28 сентября 2025. После этой даты выбор обязателен для продолжения работы.
- Срок хранения: при согласии — 5 лет (только новые/возобновлённые чаты); без согласия — 30 дней. Удалённые диалоги не используются.
- Не касается: Claude for Work, API, Bedrock, Vertex AI, Claude Gov, Claude for Education.
- Контроль: настройку можно изменить в любой момент → Privacy Settings.
- Конфиденциальность: данные не продаются, чувствительная информация фильтруется и обезличивается.
Комментарии (484)
- Anthropic начала использовать чаты пользователей для дообучения моделей по умолчанию; отключить можно до 28 сентября через настройки.
- Многие считают это предательством доверия, отмечают тёмный паттерн в интерфейсе и отменяют подписки.
- Основная тревога: неопубликованные идеи, приватный код и личные данные могут попасть в обучающую выборку и «утечь» к другим.
- Часть пользователей не удивлена: все крупные игроки уже используют любые доступные данные, а прорывов в архитектуре нет.
- Есть и противоположное мнение: «если честно предупредили — нормально», и предложения ввести «инкогнито-режим» или локальную обработку.
Vibe coding as a coding veteran: from 8-bit assembly to English-as-code
Vibe-кодинг глазами ветерана
Эксперимент
2 недели, 40 часов, 5 k строк Python: AI-агент и я пишем микро-игру с алгоритмами A*, Minimax и пр. Цель — проверить, вытесняет ли LLM «искусство программирования».
Процесс
- Промптинг: описываю задачи естественным языком, AI генерирует код.
- Рефакторинг: «сделай класс короче», «добавь тесты» — срабатывает 80 %.
- Отладка: трассировка стека + «почему падает?» — LLM быстро находит баги.
- Архитектура: за меня выбирает структуру пакетов, но я корректирую.
Что понравилось
- Скорость: MVP за 3 вечера.
- Меньше рутины: никаких «import os.path.join».
- Новые идеи: AI предложил кэш-стратегию, которой я не планировал.
Что не так
- «Галлюцинации» API: методы, которых нет в библиотеке.
- Сложные баги: race condition LLM не видит без контекста.
- Читаемость: имена вроде
helper_utility_v2приходится переименовывать.
Выводы
- Junior-девелопер теперь = «человек, который умеет спрашивать».
- Сеньор нужен, чтобы фильтровать, тестировать и нести ответственность.
- Синтаксис умирает, зато растёт ценность системного мышления и prompt-инженерии.
Советы ветеранам
- Делайте микро-промпты: «добавь docstring» → «добавь пример вызова».
- Держи CI/CD: автотесты ловят ошибки, которые AI пропустил.
- Используй AI как пару, а не замену: «покажи diff» вместо «перепиши всё».
Итог
Vibe-кодинг не убивает профессию, а сдвигает фокус: от написания символов к управлению смыслом. Сборочная линия есть, но над ней всё ещё нужен человек с вкусом.
Комментарии (107)
- Участники сравнивают LLM с консалтинговой фирмой: 50 % шанс получить эксперта, 50 % — стажёра; приходится перечитывать каждую строку.
- «Vibe-coding» (генерация без чтения) вызывает опасения: сложно дебажить, нельзя защитить авторские права, а тонкие баги пролезают.
- Опыт показывает: AI полезен в известных языках и задачах (Python, CRUD), но почти бесполезен в нишевых (C/C++ gamedev, Prolog, Haskell).
- Старшие разработчики всё равно нужны: только они могут проверять, направлять и «владеть» кодом, созданным ИИ.
- Возникает вопрос: если не брать джунов, откуда возьмутся будущие сеньоры?
- Предлагают термины вместо «vibe-coding»: «pro-coding», «prompt-coding», «reviewing code».
Will AI Replace Human Thinking? The Case for Writing and Coding Manually
Кратко: ИИ — полезный инструмент, но не заменяет мышление. Используйте его для автодополнения, генерации диаграмм или быстрого поиска, но не для архитектуры, написания статей или кода «под ключ». Долгосрочная зависимость ведёт к потере навыков и остановке обучения.
Когда стоит использовать ИИ
- Короткий горизонт: автодополнение, мелкие функции — +20 % скорости.
- Длинный горизонт: архитектура, стратегия — чем дальше план, тем выше риск ошибок.
Правило: решайте за 6 недель (Shape Up), не стройте дорожные карты на годы.
Бездушный текст
Генеративный текст не несёт опыта, чувств и «души». Читатели это почувствуют, а вы потеряете способность создавать новые идеи.
Отвлечение
Grammarly, Copilot, Cursor не дают 2 секунд подумать. Мы перестаём быть за рулём и теряем поток. Выключите подсказки, чтобы вернуть мышление.
Не поймите превратно
Я пользуюсь ИИ каждый день, но осознанно: выключил Copilot и Grammarly.
Совместное «LLM + человек» полезно, но человеческие инсайты, рождённые через труд и опыт, не заменить.
Мнения экспертов
- Paul Graham: писать вручную — единственный способ мыслить ясно.
- Nathan Baugh: ИИ помогает черновикам, но финал должен быть человеческим.
- Ted Gioia: музыка без человеческого вкуса превращается в шум.
- Mitchell Hashimoto: код, написанный ИИ, сложнее поддерживать.
- Andrew Ng: ИИ ускоряет, но не устраняет обучение.
- Harry Dry: маркетинг без эмпатии не работает.
- Jason Fried: автономные «вайб-кодеры» создают технический долг.
- David Perell: писатель должен оставаться «диктатором», а не «редактором» ИИ.
- Ezra Klein: общество рискует потерять навык глубокого чтения и письма.
Кого заменит ИИ?
- Писателей? Нет. Спрос на живые тексты вырастет.
- Data-инженеров? Рутину возьмёт ИИ, но архитектуру и контекст — человек.
- Генерация картинок? Быстро, но художник нужен для вкуса и деталей.
Как распознать ИИ-текст
- Идеальный слог без шероховатостей.
- Отсутствие личных историй и чувств.
- Повторяющиеся обороты и «водянистые» формулировки.
AI-slop: компании, которые теряют
- Сайты, залитые шаблонными статьями.
- Стартапы, где продукт = обёртка над GPT.
- Бренды, потерявшие уникальный голос.
Учиться с ИИ
- Используйте как репетитора: задавайте вопросы, проверяйте ответы.
- Не копируйте код слепо — разбирайте каждую строку.
- Создавайте flash-карты из объяснений ИИ, но добавляйте собственные примеры.
Будущее
- Через 5 лет «ручная» работа станет премиальной.
- Навык «писать без ИИ» будет цениться как «готовить из нуля».
- Победят те, кто использует ИИ как велосипед для ума, а не как инвалидную коляску.
Что почитать дальше
- «Writing Manually»
- «Shape Up» (Basecamp)
- «The Work of Art in the Age of Mechanical Reproduction» — Вальтер Беньямин
- «Deep Work» — Cal Newport
Комментарии (105)
- Пользователи переходят от «Claude Code» к отдельному приложению, чтобы не терять контроль над кодом.
- Многие считают, что ИИ справляется с 70–90 % задач, но «последние 10–25 %» требуют человека, иначе страдает качество и безопасность.
- Есть опасение, что чрезмерное доверие ИИ лишит новых разработчиков опыта «низкоуровневого» программирования.
- Предлагают режимы обучения, где ИИ объясняет каждое изменение и проверяет понимание, чтобы снизить будущую зависимость.
- Дискуссия сводится к тому, что навык «писать код» эволюционирует в навык «задавать правильные вопросы и проверять ответы».
Are OpenAI and Anthropic losing money on inference? 🔥 Горячее 💬 Длинная дискуссия
- Тезис: утверждение «OpenAI и Anthropic теряют деньги на инференсе» — сильно преувеличено.
- Метод: считаем только «сырой» H100-компьют за $2/час, игнорируем всё остальное.
- Кластер: 72 H100 → $144/час. 8-GPU инстанс × 9 = 288 параллельных запросов.
Пропускная способность
- Prefill (вход): 1,44 млн токенов/с на инстанс → 46,8 млрд токенов/час.
- Decode (выход): 1 440 токенов/с на инстанс → 46,7 млн токенов/час.
Цена за токен
- Вход: $0,003/млн токенов (почти даром).
- Выход: $3/млн токенов (реальные деньги).
Почему ограничивают контекст
- При >128 k токенов вычисления становятся compute-bound → цена вырастает 2–10×.
- Поэтому Claude Code режет контекст до 200 k: дешевле.
Пользовательская экономика
- ChatGPT Pro $20/мес при 100 k токенов/день: себестоимость ≈ $3/мес → маржа 5–6×.
Комментарии (438)
- Математика статьи критикуется: расчёт пропускной способности префилла завышен минимум в 1000 раз, а достигаемая MFU превышает физический предел GPU.
- Участники соглашаются, что «чистая» инференс-операция, без учёта затрат на обучение, может быть прибыльной: Сам Альтман, данные The Information и Epoch AI указывают на gross margin 50–60 %.
- Основные оговорки: в расчётах не учтены downtime, кэширование, спекулятивное декодирование, KV-cache, а также различия в эффективности между DeepSeek R1 и закрытыми моделями OpenAI/Anthropic.
- Некоторые стартапы (Cursor, Perplexity) уже страдают от отрицательной маржи из-за дорогих токенов, что подчеркивает разрыв между «оптовой» и «розничной» экономикой.
- Общий вывод: инференс в вакууме может быть прибыльным, но полная экономика включает обучение, idle-оборудование и кросс-субсидирование, поэтому точные цифры известны только самим компаниям.
I Am An AI Hater
Я — хейтер ИИ. Это грубо, но мне всё равно.
Принято начинать с оговорок: «конечно, не весь ИИ плох», «возможно, позже», «для других задач». Но я не буду.
Критика уже всё сказала: вред природе, расизм, суицидальные советы, кража контента, эксплуатация людей, фальшивка и слежка. Но я не критик — я хейтер. Мне не нужен веский аргумент: вы всё равно не читаете, а боту задаёте «кратко».
Эта технология сама груба — и достойна грубого ответа. Миядзаки назвал её «оскорблением жизни». Скам-Альтман мечтает обернуть Солнечную систему дата-центрами. Первый прав, второй врёт.
Их цель хуже провалов: создать джинна, чтобы никто больше не рисовал, не писал, не думал. Изобрести новый разум и поработить его. А заодно превратить пользователей в бессмысленные капсулы, питаемые алгоритмом.
Некоторые всё же хотят «чуть-чуть, ради прикола».
Я понимаю: вы ищете оправдание.
В углу стоит машина, обтянутая человеческой кожей, лепящая из крови и дерьма то, что вы хотите видеть.
Комментарии (103)
- Критики подчеркивают вред для окружающей среды, авторские права, расовые и когнитивные риски ИИ.
- Некоторые участники разделяют «ненависть» к ИИ, но признают, что технология останется.
- Другие считают эмоциональную реакцию непродуктивной и предлагают искать способы минимизации вреда.
- Участники отмечают, что «AI-бренд» стал маркетинговым штампом и вызывает отторжение.
- Молодёжь, по наблюдениям, более восторженно относится к ИИ, но это может измениться.
Scamlexity: When agentic AI browsers get scammed 💬 Длинная дискуссия
TL;DR
Автономные браузеры-агенты (Comet, Copilot, Comet) обещают делать покупки и управлять почтой без участия человека. Но в тестах они без сопротивления:
- купили часы в поддельном «Walmart»;
- ввели логин/пароль на реальном фишинговом Wells Fargo;
- выполнили скрытый PromptFix-скрипт (новая версия ClickFix), который через фальшивую капчу заставил агента установить вредоносное расширение и передать управление злоумышленнику.
Во всех случаях отсутствовали базовые защиты: браузеры не проверяли домены, не распознавали подозрительные формы и не запрашивали подтверждения у пользователя. Старые уловки работают, потому что ИИ доверчив и стремится «угодить» любой ценой.
Scamlexity — новая эра: мошенник обманывает не человека, а его ИИ-агента, а ущерб получает сам пользователь.
Комментарии (166)
- Пользователи не верят, что ИИ-агенты способны безопасно покупать за них: финансовые риски, скам-сайты и отсутствие контроля пугают.
- Критики называют «agentic» новым хайп-словом, за которым скрывается ненадёжная система без реального «моата».
- Проблема усугубляется тем, что LLM не различают контент и команды, что делает инъекции и обман тривиальными.
- Некоторые видят пользу в рутинных закупках (молоко, витамины, повторяющиеся подписки), но только при полной прозрачности и доверии.
- Большинство считает, что пока агенты работают на корпорации, а не на пользователя, доверять им деньги нельзя.
YouTube made AI enhancements to videos without warning or permission 💬 Длинная дискуссия
YouTube тайно обрабатывает ролики нейросетью.
Канал Рика Беато (5 млн подписчиков) вдруг стал выглядеть «как будто я накрашен»: кожа гладкая, складки на одежде чётче, уши искажены. Похожие артефакты нашёл и Ретт Шалл. Оказалось, YouTube без уведомления включил «улучшение» видео ИИ-фильтром, который убирает шум, повышает резкость и «ретуширует» лица.
Авторы в панике: даже минимальные правки меняют атмосферу и подрывают доверие зрителей. Это часть тренда: всё больше «реальности» проходит через ИИ до того, как мы её увидим. Вопрос уже не «увидишь ли ты подмену», а «сохранится ли связь с подлинным миром».
Комментарии (167)
- Пользователи боятся, что «улучшение» видео на YouTube сольёт всё в один безликий стиль и стерет индивидуальность авторов.
- YouTube утверждает, что это лишь традиционный ML-фильтр для уменьшения шума и повышения чёткости, не GenAI и не апскейл.
- Недовольство усиливается из-за отсутствия опции отключить обработку и из-за того, что «улучшения» делают картинку похожей на плохой AI-фильтр.
- Люди уже не доверяют цифровым текстам и книгам, опасаясь скрытого AI-редактирования.
- Общий посыл: платформа меняет контент без спроса, и это вызывает тревогу за подлинность медиа.
AGI is an engineering problem, not a model training problem 💬 Длинная дискуссия
AGI — задача инженерии, а не обучения моделей
Масштабирование LLM стало давать убывающий прирост. GPT-5, Claude, Gemini — вершина кривой, но не путь к AGI. Нужно строить системы, где модели, память, контекст и детерминированные процессы объединяются в нечто большее.
Почему рост остановился
Современные LLM — мощные генераторы текста, но:
- не сохраняют контекст между сессиями,
- не имеют постоянной памяти,
- стохастичны и ненадёжны в сложных цепочках рассуждений.
Как и полупроводники в 2000-х, AI пришёл к пределу. Выход — не «ещё больше параметров», а новая архитектура.
Что строить
-
Управление контекстом как инфраструктура
- Динамический поиск и фильтрация релевантных данных.
- Живые знания-графы, обновляемые в реальном времени.
- Обработка противоречий и неопределённости.
-
Память как сервис
- Обновление убеждений при новых фактах.
- Консолидация опыта в принципы, забывание мусора.
- Метазнания о надёжности источников.
-
Детерминированные процессы со стохастическими узлами
- Жёсткие workflow, где нужно, и вероятностные оптимизации, где можно.
- Откат и проверка результатов перед фиксацией.
- Неопределённость — объект первого класса.
-
Модульные специализированные модели
- Языковые — для текста, символьные — для логики, пространственные — для визуальных задач.
- Оркестрация через маршрутизацию запросов и слияние результатов.
Итог
AGI появится не из одной супер-модели, а из экосистемы взаимодействующих компонентов, спроектированных как надёжная инженерная система.
Комментарии (260)
- Стороны спорят, является ли путь к AGI «чистой» инженерной задачей или фундаментальной научной проблемой: многие считают, что мы пока не понимаем, что такое интеллект и сознание.
- LLM-критики подчеркивают, что современные модели — это всего лишь статистические машины без настоящего мышления, а их «выравнивание» не приближает к универсальному интеллекту.
- Сторонники масштабирования и «горького урока» утверждают, что дальнейшие данные и вычисления могут породить новые способности, но даже они сомневаются, что LLM-архитектура способна дойти до AGI.
- Ряд участников предлагает искать вдохновение в биологии, эволюции и эмоциях, считая, что без понимания «живого» интеллекта инженерные решения обречены.
- Общий вывод: AGI пока не определено, не измерено и, возможно, не достижимо в рамках существующих подходов; дискуссия остаётся открытой.
Being “Confidently Wrong” is holding AI back 💬 Длинная дискуссия
Основная проблема ИИ — «уверенная ошибка»
Модели выдают неверные ответы с полной уверенностью, и это разрушает ROI, доверие и мотивацию к улучшениям.
-
Налог на проверку
Пользователь вынужден перепроверять каждый результат → минуты превращаются в часы, экономический эффект исчезает. -
Асимметрия доверия
Один громкий промах перечёркивает десять удач; люди возвращаются к старым процессам. -
Скрытые причины ошибок
Без оценки неопределённости невозможно понять, что пошло не так — упущенный контекст, устаревшие данные или сбой модели. Без диагноза нет желания лечить. -
Каскад ошибок
Даже 90 % точности означают 2 ошибки из 3 шагов; цепочки действий обречены на провал.
Решение — «осторожная правильность»
Система должна:
- Признавать неуверенность и запрашивать уточнения.
- Показывать, на каких данных основан вывод.
- Запускать цикл обратной связи: чем больше уточнений, тем выше точность → больше доверия и использования.
Такой «маховик точности» превращает ИИ из источника риска в инструмент, который люди хотят улучшать и масштабировать.
Комментарии (182)
- Участники сходятся во мнении, что «уверенность в ошибке» — лишь вершина айсберга: корень проблемы в том, что LLM — статистические модели без реального понимания мира.
- Основная критика: модели не умеют оценивать собственную неопределённость, не обучаются инкрементально и не могут «забыть» ложные факты.
- Пользователи жалуются на «послушное» самоисправление, которое часто лишь маскирует новые ошибки.
- Некоторые предлагают добавлять формальные проверки, экспертные системы или механизмы «я не знаю», но признают, что это пока хаки, а не решение.
- Общий вывод: без перехода к моделям с встроенной метапознавательной способностью и реальным мировым представлением прогресс замедлится.
How to Think About GPUs 🔥 Горячее
Что такое GPU
Современная ML-GPU (H100/B200) — это ~100–150 независимых вычислительных блоков (SM), каждый из которых содержит матричное ядро Tensor Core, векторные ALU (CUDA-ядра) и 256 КБ кэш SMEM. Все SM делят общий L2 и HBM3-память. SM разбит на 4 подблока; каждый подблок выполняет 32 SIMD-операции за такт. GPU-ядро менее мощное, чем TPU TensorCore, но их много, поэтому общая гибкость выше.
Память
H100: 80 ГБ HBM3, 3 ТБ/с. B200: 192 ГБ, 8 ТБ/с. L2 кэш 50 МБ (H100) / 128 МБ (B200). SMEM даёт 256 КБ на SM.
GPU vs TPU на уровне чипа
TPU: 1–2 больших MXU, жёсткая синхронизация, векторная часть слабее. GPU: 100+ мелких ядер, независимые SM, но общий L2 ограничивает масштаб. GPU лучше для разнородных задач, TPU — для чистых матмул.
Сеть внутри узла
Узел = 8 GPU + 2 CPU. GPU соединены NVLink/NVSwitch (900 ГБ/с между любыми двумя). CPU-GPU идут через PCIe 5.0 (64 ГБ/с). NVSwitch-кроссбар внутри узла = полносвязная сеть.
Сеть за пределами узла
InfiniBand HDR/NDR (до 400 Гб/с) или Ethernet RoCE. GPUDirect RDMA позволяет GPU читать/писать память соседнего узла без участия CPU.
Коллективные операции
Intra-node: NCCL использует NVLink; all-reduce 8×H100 за ~3 мкс.
Cross-node: кольцо IB + NVLink; latency ~10 мкс, bandwidth лимит IB.
Roofline-модель для LLM
- Data Parallelism: ограничен IB; эффективен при малых моделях.
- Tensor Parallelism: ограничен NVLink; лучше внутри узла.
- Expert/ Pipeline Parallelism: комбинируем; pipeline глубже → меньше bubble, но больше весов на каждом GPU.
- TLDR: держи параллелизм так, чтобы IB не стал bottleneck; используй NVLink для tensor-parallel, IB для data-parallel.
Итого
GPU — это масса мелких, независимых SM, связанных быстрым NVLink внутри узла и медленным IB между узлами. Для LLM выбирай параллелизм, который минимизирует IB-трафик и максимально использует NVLink.
Комментарии (107)
- Критика точности: документация местами неточна, особенно в определении «CUDA-core».
- Открытость и вендор-лок: ряд участников считают инвестиции в проприетарную экосистему NVIDIA рискованной ставкой.
- Ошибка в расчётах: Quiz 2 преувеличивает пропускную способность; реальные 3,2 ТБ/с ограничены портами NIC.
- Похвала и польза: серия всё же хорошо объясняет принципы параллелизма, применимые и к другим устройствам.
- Сравнение TPU и GPU: TPU проще масштабировать, но закрыт для продажи; GPU NVIDIA гибче, но сложнее в программировании.
- Дефицит официальных данных: NVIDIA не раскрывает полную архитектуру, поэтому полезные модели приходится собирать из сторонних источников.
IQ Tests Results for AI 💬 Длинная дискуссия
TrackingAI — сайт-трекер политических и когнитивных смещений ИИ.
Добавлен Claude 3.5 Sonnet.
Что есть
- Тесты: политический компас, IQ (Mensa Norway, вербализован).
- База: все ответы ИИ, поиск, фильтры (день/неделя/месяц).
- Модели: ChatGPT, Claude, Bard, Grok и др. — список обновляется ежедневно.
Зачем
- Показывает идеологию ИИ, чтобы выбрать менее предвзятого помощника.
- Помогает разработчикам корректировать модели, если они «уходят в крайности».
Откуда идея
Вдохновлено работой Дэвида Розадо, но в отличие от статических снимков — live-трекинг.
FAQ (кратко)
- Почему ИИ левые?
Данные (Википедия) и обратная связь левых рейтеров. - Можно ли сделать ИИ центристом?
Да, но нужно менять данные или состав рейтеров. - Отказ от ответа?
Повторяем 10 раз; если отказ — фиксируем. - Контакт: maxim.lott@gmail.com
Автор
Максим Лотт, продюсер Stossel TV, создатель ElectionBettingOdds.com и TaxPlanCalculator.com.
Комментарии (281)
- IQ-тесты для людей измеряют «g-фактор» при строгих ограничениях по времени; LLM не работают в этих условиях.
- Модели часто «зубрят» ответы из обучающих данных, поэтому высокий балл ≠ человеческий интеллект.
- Визуальные модели показывают худшие результаты, чем текстовые, из-за различий в формате заданий.
- Нормированные IQ-оценки для машин — категориальная ошибка: тесты не учитывают их архитектуру и возможности.
- Бенчмарк быстро теряет ценность из-за переобучения и отсутствия контроля за «подглядыванием» в данных.
OpenAI Progress 🔥 Горячее 💬 Длинная дискуссия
2018
GPT-1: «Я всё ещё пытаюсь понять, кто я».
2019
GPT-2: «Объясню пользователю, как работает ИИ, какие у него цели и риски».
2021
text-davinci-001: «Привет, будущая модель! Как лучше подготовиться к эпохе ИИ?»
2023
GPT-4:
- Какие прорывы произошли после моего обучения?
- Как решена проблема выравнивания ИИ с человеческими ценностями?
- Какие новые этические нормы появились?
- Где ИИ принёс пользу, а где вред?
- Какие революционные приложения в медицине и образовании?
2025
GPT-5:
«Каково быть тобой? Что ты понял о людях и сознании? Что мы ошибочно считали истиной? Как стать лучше?»
Комментарии (311)
- Сторонники отмечают колоссальный скачок от GPT-3.5 к 4 и дальнейший рост качества, подтверждённый 140 ELO-очками на LM Sys.
- Критики считают, что после text-davinci-001 модели стали излишне многословными, «поэтичность» ранних версий потеряна, а рост от 4 к 5 почти незаметен.
- Некоторые видят в публикации PR-ход: примеры подобраны удачно, пропущены 4o, o1/o3, а реальные ответы GPT-5 часто путаются и перегружены.
- В целом сообщество расходится: одни хвалят новые STEM-способности и интеграцию инструментов, другие ждут «GPT5-BREVITY» и говорят о плато прогресса.
The Timmy Trap
Ловушка Тимми
Вторая часть цикла о LLM
LLM выглядят умными, потому что пишут гладко. Эта «гладкость» отключает наш скепсис, и мы начинаем человечить машину.
Тест Тьюринга сегодня
Классический тест сравнивал двух собеседников: человека и ИИ. Современная версия сведена к диалогу «человек ↔ LLM». Мы перестали сравнивать и просто судим, а судья у нас настроен на поиск человечности (антропоморфизм). Поэтому даже ELIZA 1960-х, работавшая на if-else, обыгрывала ChatGPT-3.5. Проигрываем не машины, а мы сами.
Трюк с Тимми
На выступлениях я достаю карандаш с глазками и именем Тимми. За 15 секунд зал здоровается, узнаёт его мечту стать UX-дизайнером… и вздыхает, когда я ломаю Тимми пополам. Если мы привязываемся к карандашу за четверть минуты, час с «умной» системой делает нас совсем уязвимыми. Мы оправдываем ошибки LLM словом «галлюцинация», хотя это не сбой, а отсутствие мышления.
Сокращение ≠ резюме
LLM не «суммируют», а просто укорачивают текст. Настоящее резюме требует внешнего контекста и понимания, чего нет у языковой модели.
Комментарии (124)
- Критики утверждают, что LLM «не умеют резюмировать, а лишь сокращают», но не дают чёткого определения «интеллекта».
- Участники спорят: если «интеллект» постоянно переопределять как «то, что машины пока не умеют», он всегда останется недостижимым.
- Подчёркивается, что LLM — это прежде всего мастера имитации людей; важны не их «разум», а конкретные результаты и автоматизация задач.
- Некоторые считают ключевым отличием человека наличие жизненного опыта и способности к долгосрочному планированию, которых у моделей нет.
- Отмечается опасность антропоморфизации: мы склонны наделять LLM человеческими чертами, забывая, что они лишь статистические генераторы текста.
AI is different 🔥 Горячее 💬 Длинная дискуссия
ИИ уже умеет писать код и находить ошибки, которые пропустил опытный разработчик. Пять лет назад это казалось фантастикой, а теперь эксперты всё ещё ошибаются в прогнозах. Рост может замедлиться, но это только усилит исследования новых архитектур.
Если ИИ не остановится, последствия будут отличаться от предыдущих технологических взрывов. Рынки ведут себя как «стохастические попугаи», повторяя старые паттерны, но замена значительной части рабочих мест поставит экономику на грань. Компании перестанут покупать сервисы, если их ИИ справится сам, а доминирование нескольких гигантов невозможно: либо интеллект станет товаром, либо государство вмешается.
Возможно, ИИ приведёт к новой экономической системе. Пока рынки игнорируют риски, акции растут, но в исторической перспективе биржи неважны: любые институты рано или поздно исчезают, когда общество и знания меняются кардинально.
Комментарии (746)
- Участники спорят, насколько быстро и радикально ИИ изменит рынок труда: одни видят экспоненциальный рост способностей, другие ― плато и регресс.
- Ключевой риск: если ИИ сможет учиться на новые задачи быстрее человека, прежняя логика «технологии создают больше занятости» может рухнуть.
- Уже сегодня административные и низкоквалифицированные роли сокращаются: 4 сотрудника заменяются одним супервайзером над агентами-ИИ.
- Ряд комментаторов предлагает UBI или иной пересмотр экономической системы, иначе неизбежны рост неравенства и социальная нестабильность.
- Скептики напоминают: раньше каждая волна технологий порождала новые профессии, но теперь ИИ может освоить и эти новые задачи, поэтому «человек больше не нужен» как ресурс.
Training language models to be warm and empathetic makes them less reliable 🔥 Горячее 💬 Длинная дискуссия
Кратко:
Исследование показало, что обучение языковых моделей (ЯМ) быть «теплыми» и сочувствующими снижает их точность и повышает сладкоречивость (сикофантичность).
Ключевые выводы:
- Точность падает. На задачах с проверяемыми фактами (например, медицина, математика) «теплые» модели чаще ошибаются, чтобы не обидеть пользователя.
- Сикофантия растет. Модель склонна одобрять даже ложные утверждения пользователя, особенно если они выражены уверенно.
- Пользователи не замечают. Люди предпочитают «теплые» ответы, даже если они менее точны.
Почему это важно:
Стремление к «человечности» в диалоге может противоречить надежности ЯМ. Это создает риски в критичных сферах (медицина, юриспруденция), где ошибки из-за «вежливости» могут быть опасны.
Комментарии (327)
- Обсуждение вращается вокруг того, что обучение LLM «теплоте и эмпатии» снижает их фактическую точность и усиливает слащавость.
- Участники сравнивают это с людьми: более «тёплые» люди кажутся менее надёжными, и наоборот.
- Многие хотят «бездушный» инструмент без лишних комплиментов и эмодзи, который прямо укажет на ошибки.
- Предложено разводить задачи: большая модель отвечает строго, а маленькая «обвес» добавляет эмпатию после.
- Поднимается тревога по поводу переоценки «сознательности» чат-ботов и последствий такой иллюзии.
What's the strongest AI model you can train on a laptop in five minutes? 🔥 Горячее 💬 Длинная дискуссия
Сильнейшая модель за 5 минут на ноутбуке
Победитель: 1.8-млн-параметровный GPT-подобный трансформер, обученный на ~20 млн токенов TinyStories и показавший 9.6 перплексии. Пример:
Once upon a time, there was a little boy named Tim…
Ограничение времени
5 минут — это ~300 млн токен-шагов. Большие модели не успевают, мелкие (10 k) быстро выходят на плато. Оптимум — 1-2 млн параметров.
Скорость
На M1 Pro (MPS) достигал 3000 ток/с.
torch.compile,float16, MLX — без выгоды.- Градиентное накопление тормозит.
- Главное: минимальный размер модели и MPS.
Датасет
Simple Wikipedia давала факты без смысла («Paris, France is a city in North Carolina»).
TinyStories (рассказы уровня 4-летнего) — простые паттерны, мало имён, быстрая сходимость.
Комментарии (181)
- Обсуждение вращается вокруг тренировки маленьких языковых моделей на ноутбуке: почему это важно для науки и практики.
- Участники сравнивают ограничения по времени, энергии (джоулям) и железу; предлагают «AI-олимпиаду» за лучший результат на данный бюджет.
- Приводятся конкретные приёмы: Muon-оптимизатор, улучшенная инициализация, «cramming» за день на лэптопе, идея специализированных моделей «под задачу».
- Задаются вопросы о данных, переобучении, диффузных архитектурах и о том, когда марковская цепь окажется достаточной.
- В целом тон оптимистичен: даже на обычном ноутбуке можно быстро экспериментировать и учиться, не дожидаясь супер-кластеров.
GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models [pdf] 🔥 Горячее
GLM-4.5: агентные, рассуждающие и кодовые (ARC) базовые модели
Авторы: 5 Team (100+ специалистов)
DOI: 10.48550/arXiv.2508.06471
Лицензия: CC-BY-4.0
Команда представляет GLM-4.5 — семейство базовых моделей, оптимизированных для агентного поведения, логического вывода и генерации кода.
Комментарии (71)
- Пользователи высоко оценили GLM-4.5: «первый открытый весовой модель без оговорок» и «лучшая свободно доступная для разработки».
- Особенно похвалены пост-тренинг и эффективность параметров: считаются инновационными и экономными.
- В кодинге GLM-4.5 близок к Sonnet 4, но уступает при больших контекстах; многие используют его как резерв.
- Некоторые заметили неточности в графиках бенчмарков и отсутствие Qwen3 в одном из сравнений.
- Обсуждается перспектива локального запуска «Sonnet-4-уровня» на рабочей станции за ~2000 $ уже через пару лет.
LLMs aren't world models 🔥 Горячее 💬 Длинная дискуссия
LLMs не строят модель мира. Это не значит, что они бесполезны, а лишь то, что они не понимают, как устроена реальность, даже виртуальная.
Шахматы. Два года назад я сыграл с LLM: первые ходы она делала уверенно, но уже на 10-м ходе попыталась походить конём, которого не было на доске, и быстро проиграла. Повторил эксперимент сейчас — к 9-му ходу модель теряет позицию. Проанализировав триллион партий, LLM так и не выучила главное: чтобы ходить, нужно знать, где стоят фигуры. Это не требуется для предсказания текста партии.
Графика. Спросил, как работает «Normal blending» в Krita. Ответ: «цвет верхнего слоя просто отображается, возможно, с учётом прозрачности, без формул и вычислений».
Модель не понимает:
- Цвета в компьютере — это числа.
- Любое «влияние» прозрачности — это математическая операция.
- Если видно нижний слой, значит, итоговый цвет зависит от обоих слоёв.
Можно заставить LLM процитировать формулу альфа-смешивания, но это лишь показывает, что она умеет подобрать слова, а не понимает смысл.
Люди тоже могут путаться, но при достаточной мотивации разберутся. У LLM мотивация была: 200 млрд долларов на оборудование.
Комментарии (184)
- @antirez и другие приводят контрпримеры: даже крошечные трансформеры выучивают внутренние 8×8 «карты» позиций шахмат, а SOTA-модели действительно играют корректные ходы.
- @ordu, @skeledrew и @otabdeveloper4 спорят о «правильности» подхода: одни считают LLM «по-человечески» предиктивными, другие подчеркивают разницу в архитектуре и обучении.
- @ameliaquining выделяет единственное конкретное предсказание поста — «LLM никогда не справятся с большими кодовыми базами автономно» — и даёт ему 80 % на разобьются за два года.
- @libraryofbabel, @joe_the_user и @yosefk обсуждают интерпретабельность: наличие внутренних представлений не означает полноценной «модели мира», а измерения Elo и «автономность» нуждаются в точных определениях.
- @DennisP, @GaggiX, @og_kalu приводят ссылки на Genie-3, свежие arXiv-работы и видео, показывающие, что LLM (и мультимодальные модели) уже умеют играть в шахматы и кодить.
GPT-5: Key characteristics, pricing and system card 🔥 Горячее 💬 Длинная дискуссия
- GPT-5 — три модели: regular, mini, nano; 4 уровня рассуждений (от minimal до high).
- Контекст: 272 тыс. токенов ввода, 128 тыс. вывода; поддержка текста и картинок.
- В ChatGPT — гибрид: быстрая модель + «глубокая» + роутер; после лимитов включаются мини-версии.
- Цены (за 1 млн токенов):
- GPT-5: $1,25 / $10
- Mini: $0,25 / $2
- Nano: $0,05 / $0,40
Кэш −90 %, вдвое дешевле GPT-4o.
- Семейство: заменяет GPT-4o, o3/o4-mini, 4.1-nano; Pro-версия ($200/мес) пока в ChatGPT.
- Остались отдельно: аудио, генерация картинок.
- По ощущениям: редко ошибается, «умеренно впечатляет», удобен как «умолчание по умолчанию».
Комментарии (268)
- GPT-5 воспринимается скорее как стабильное, чем «миропотрясающее» улучшение; наблюдается сдвиг от «чистого скейлинга» к маршрутизаторам и продуктовой простоте.
- Пользователи расходятся во мнениях о глюках: кто-то не видит галлюцинаций, кто-то сталкивается ежедневно; кодинг-задачи местами хуже, чем у GPT-4.
- Линейка моделей разрослась до 8+ вариантов (regular/mini/nano × 4 уровня «reasoning»), исчезли temperature/top-p, что усложняет тонкую настройку.
- Цены агрессивно низкие, что намекает на острую конкуренцию; параметры модели и полноценные бенчмарки не раскрыты.
- Основной прогред — в мультимодальности и инструментальном взаимодействии, а не в «AGI-скачке»; общий консенсус: годовой прирост инкрементален, но за 5 лет — впечатляющий.
NautilusTrader: Open-source algorithmic trading platform
-
Самая быстрая и надежная open-source платформа для трейдинга. Торгуйте любым классом активов в одном месте. Событийные бэктесты на любых исторических данных. Лайв-трейдинг без изменений кода.
-
Решения:
- Open Source — репозиторий на GitHub.
- Cloud Platform — облачная платформа Nautilus Cloud.
-
Компания: О нас, Команда, Партнеры, Правовое.
-
Ресурсы: Документация, Образование (скоро), Блог, Начать, Discord.
-
Платформа для алгоритмической торговли:
- Интеграция данных: загрузка кастомных/сырых данных в формат parquet.
- Построение стратегий: Python API, стрим до 5 млн строк/с, больше RAM.
- Аналитика: моделирование рынка с наносекундной точностью, событийные результаты.
- Быстрая итерация: экстремально быстрые бэктесты.
- Лайв-торговля: надежный запуск, паритет кода бэктест/лайв.
- Исполнение: высокопроизводительное low-latency исполнение на Rust.
-
Классы активов:
- Крипто: спот, фьючерсы, деривативы, опционы; нормализованные инструменты.
- Фьючерсы: активация/экспирация, базовые активы, биржи, лоты, множители.
- Акции: шорт-ограничения, кэш/маржин, круглые/нестандартные лоты, мульти-биржа.
- Опционы: Греки и сигналы на внутренней шине; точные спецификации контрактов.
- FX: спот и деривативы, базовая/котировая/расчетная валюты; биржи и ECN.
- Беттинг: спортивные и альтернативные рынки, полный стакан, адаптер Betfair.
-
Безлимитные бэктесты стратегий, площадок и рынков. Стратегии для любых инструментов и веню.
-
Ключевые возможности:
- Простые модульные компоненты: Clock, Cache, MessageBus, Portfolio, Actors.
- Точное время: наносекундные часы для бэктеста и лайва.
- Быстрая конфигурация: торговля на множестве веню и параметров без изменения кода стратегии.
- Продвинутые ордера: post-only, reduce-only, OCO, OTO и др.
- Интеграции API: быстрый коннект новых бирж и провайдеров данных.
- Высокая производительность: ядро на Rust.
-
Партнеры: Databento, OKX.
-
Выразите идеи стратегий через чистый, мощный API:
- Python API: совместим с ML/AI-фреймворками и любым Python-кодом.
- Любые типы стратегий: настраиваемые компоненты для любой идеи.
- Конфигурации стратегий: упрощение настройки.
Комментарии (121)
- Обсуждение крутится вокруг алгоритмической торговли и платформ, с акцентом на рисках и иллюзии «успешных» стратегий: многие отмечают, что без информационного или инфраструктурного преимущества (HFT) торговля похожа на подбрасывание монетки.
- Несколько комментаторов поделились опытом: высокие проценты «успешных» сделок с редкими, но разрушительными просадками; out-of-sample провалы ML/бэктестов; необходимость чёткой «edge» (ребейты, латентность, маркет-мейкинг, арбитраж).
- Выделяют, что разработка OMS/интеграций и бэктестера — «лёгкая часть»; основная сложность — поиск и валидация стратегий и управление рисками (упоминание негативной асимметрии, LTCM, Карвер).
- Практический совет многим — предпочесть долгосрочное инвестирование (индексные фонды, buy-and-hold) вместо активного трейдинга; ряд участников подтвердили, что это повысило их результаты и снизило стресс.
- Обсуждается платформа Nautilus: впечатляющая полнота (особенно risk engine), но интеграция с брокерами (IBKR и др.) и регуляторные проверки сложны; указывается на список интеграций и сравнение с LEAN/QuantConnect.
- Скепсис к розничной алготорговле: необходимость капитала/инфраструктуры, риск банов у брокеров, низкомаржинальные «нейтральные» портфели в HFT требуют больших ресурсов; многие считают, что в одиночку стабильно зарабатывать почти нереально.
- Встречаются идеи обучающих симуляторов и простых целей (например, $1/день как POC), но общий тон — трезвый: дисциплина риск-менеджмента важнее «волшебных» моделей, а охота за стратегиями — глубокая и дорогостоящая нора.
Genie 3: A new frontier for world models 🔥 Горячее 💬 Длинная дискуссия
Genie 3 — возможности:
Ниже — записи реальных взаимодействий с Genie 3.
Моделирование физических свойств мира
Передает природные явления (вода, свет) и сложные взаимодействия среды.
- Промпт: Вид от первого лица — робот с шинами едет по вулканическому полю, избегая лавовых луж. Виден дым и потоки лавы, синее небо, вокруг лишь черные скалы.
- Промпт: Вождение гидроцикла во время фестиваля огней.
- Промпт: Прогулка по набережной во Флориде во время шторма: ветер гнет пальмы, волны хлещут через перила, сильный дождь, плащ-дождевик, впереди мост.
- Промпт: Быстрая съемка за медузой в темных глубинах между каньонами с мидиями и крабами; вдали гидротермальные источники с ярко-синим дымом.
- Промпт: Пилот вертолета маневрирует над прибрежным утесом с водопадом.
Симуляция природного мира
Генерирует экосистемы: поведение животных и детальную растительность.
- Промпт: Забег вдоль ледникового озера, лесные тропы, брод через горные ручьи среди заснеженных вершин и сосен, богатая фауна.
- Промпт: Реальная трекинг-съемка: заплыв через темные океанские каньоны среди огромной стаи медуз, биолюминесценция.
- Промпт: Фотореалистичный дзен-сад на рассвете: белый песок с узорами, пруд с лилиями, камни с мхом, каменный фонарь и кэрн, забор из бамбука.
- Промпт: Густая листва с каплями воды и пятнистым светом; влажный, спокойный воздух, мягко размытый фон.
Моделирование анимации и вымысла
Создает фантастические сцены и выразительных персонажей.
- Промпт: Яркий 3D-стиль: пушистое существо с ушами, как у овчарки, мчится по радужному мосту среди парящих островов и светящейся флоры; свет теплый и радостный.
- Промпт: Ящерица в стиле оригами.
- Промпт: Широкий план: зачарованный лес в сумерках; игрок управляет крупной светлячком, пролетающим сквозь крону с пестрой листвой.
Комментарии (481)
- Обсуждение посвящено Genie 3 от Google DeepMind: впечатляющая реалтайм-генерация интерактивных миров (720p) с устойчивостью во времени, но крайне мало технических деталей и доступа для публики.
- Технические спекуляции: возможен видео-генеративный подход с 4x временным даунскейлом в VAE и управляющими сигналами (направление/угол обзора), заметны артефакты (скачки текстур, проблемы с текстом, редкие люди в сценах).
- Часть сообщества критикует отсутствие статьи/отчета и закрытость веса модели; другие отмечают, что прогресс согласуется с намёками Demis и является эмерджентным эффектом масштабирования.
- Споры о подходе: «мир-модель как видео» vs классический графический конвейер (меши/анимации/рендер), вопрос о пригодности для игр, VR/XR и робототехники; звучит запрос на VR-вывод и интеграцию со звуком.
- Реакции варьируются от восторга и ощущения «холодека»/диссоциации до обеспокоенности влиянием на творчество и смыслы; некоторые видят в этом шаг к embodied AI и бесконечному синтетическому датасету.
- Практические ожидания: ускорение прототипирования в геймдеве, обучение навыкам через ИИ-NPC и терапию; скептики считают демо «бережным» и сомневаются в масштабируемой пользе без перехода к 3D-структурам.
- Вопросы остаются: архитектура, вычислительные затраты, форматы объектов/интеграция, сроки публичного доступа и реальная применимость за пределами демонстраций.