Hacker News Digest

Тег: #nvidia

Постов: 31

Nvidia to acquire Hugging Face (cnbc.com) 🔥 Горячее

Nvidia официально согласился купить открытую платформу искусственного интеллекта Hugging Face за 12,9 миллиарда долларов, что станет второй по величине сделкой в истории компании после приобретения активов Groq за 20 миллиардов долларов в декабре 2025 года. Сделка подтверждает стратегию Nvidia по выходу закрепиться не только как производитель чипов, но и как ключевой игрок в верхних слоях стека ИИ, обеспечивая доступ к моделям и инструментам для разработчиков по всему миру. Как заявил CEO Nvidia Дженсен Хуанг в блоге, Hugging Face останется открытой платформой для всей экосистемы ИИ, а сотрудничество позволит усилить инфраструктуру и расширить доступ к технологиям.

CEO Hugging Face Клеман Дела́нгюэ рассказал CNBC, что инициатива о сделке исходила от его компании летом, когда они осознали, что открытый ИИ достиг переломного момента и нуждается в больших ресурсах, масштабе и видимости. Он назвал Nvidia «идеальным домом» для Hugging Face, отметив, что переговоры шли быстро. Дела́нгюэ также связал недавний взлом платформы с инженерными ошибками и подчеркнул, что инцидент подтвердил важность открытых моделей: по его словам, сообщество защитников в открытой экосистеме обладает «асимметричным преимуществом» перед атакующими, так как их значительно больше, и они могут прозрачно сотрудничать. Nvidia планирует использовать эту синергию для укрепления безопасности и развития открытого ИИ.

by tosh • 03 сентября 2026 г. в 12:10 • 307 points

ОригиналHN

#acquisition#chip#hugging-face#llm#nvidia

Комментарии (97)

Тред добавляет детали о реальной ценности Hugging Face как инфраструктурного сервиса, сложности привлечения капитала без доходов, потенциальных конфликтов интересов Nvidia и сравнения с предыдущими крупными поглощениями, а также подчеркивает технические и рыночные барьеры для копирования платформы.

  • Hugging Face ценится за то, что является основной площадкой для хостинга моделей, имеет большую аудиторию, данные и предоставляет сервисы инференса, что объясняет многомиллиардную оценку.

  • Спор: Некоторые считают, что Nvidia инвестирует в конкурирующие закрытые модели и это конфликт интересов, в то время как другие утверждают, что такие инвестиции не конфликтуют и Nvidia выгодно позиционируется независимо от модели.

  • Привлечь финансирование для компании без доходов и без крупных GPU‐контрактов крайне сложно, поэтому основатели могут предпочесть выйти через продажу.

  • Сделка сравнивается с покупкой Docker Hub в 2018‐м году, показывая, что оценки компаний инфраструктуры AI находятся на уровне десятков миллиардов долларов.

  • Запустить аналог Hugging Face с нуля требует огромных вложений в сеть, хранение и пропускную способность; простое копирование сайта невозможно без значительных ресурсов.

  • Многие видят в покупке выход для команды Hugging Face, которая долго искала бизнес‐модель и теперь получает «что‐то лучше» в виде крупного выкупа.

  • Спор: Некоторые опасаются, что покупка европейской AI‐компании Nvidia подрывает технологический суверенитет Европы, в то время как другие считают, что это обычная глобальная консолидация.

  • Согласно аналитикам, цель Nvidia – стать не только поставщиком чипов, но и ключевым игроком в верхних слоях AI‐стека, контролируя распределение и создание данных.

  • Некоторые пользователи считают новость повторением уже объявленного ранее, указывая, что информация уже была в публичных источниках.

  • Комментарий «There goes the neighborhood» отражает ощущение, что крупные поглощения меняют ландшафт рынка и вытесняют независимых игроков.

  • Пользователи выражают недовольство постоянным «циклoм» выкупа компаний среднего размера, считая его вредным для потребителей и инноваций.

  • Некоторые считают, что Nvidia обещает ускорить открытый исходный код, но скептически относятся к реальной открытости будущих продуктов.

My understanding of Hugging Face is limited to "File Host with Model Cards". Can someone with more understanding explain what the $12 billion value comes from? — @corysama

Quasar 438B: Europe's Leading AI Model (multiversecomputing.com)

Quasar 438B — это флагманская модель Multiverse Computing, первая крупномасштабная ИИ-модель компании, ориентированная на корпоративные агенты и программирование. Она работает на английском и испанском языках и набрала 43 балла в индексе Artificial Analysis Intelligence Index v4.1.1 — лучший результат среди европейских моделей. Индекс объединяет девять тестов, включая GDPval-AA, τ³-Banking, Terminal-Bench, SciCode и другие. Quasar опережает Mistral Medium 3.5 (30 баллов), NVIDIA Nemotron 3 Ultra (38) и Inkling (42), уступая только лидерам вроде Claude Opus 5 (63).

Помимо высокой точности, модель демонстрирует выдающуюся скорость: генерация 500 токенов с учётом времени рассуждения занимает всего 15,3 секунды. Это быстрее, чем у большинства конкурентов — только три модели отвечают быстрее, и лишь одна из них (Gemini 3.7 Flash) превосходит Quasar по интеллекту. По сравнению с Mistral Medium 3.5, Quasar не только точнее (43 против 30), но и быстрее (15,3 с против 18,8 с). В долгосрочном контексте (AA-LCR) модель набрала 75,0 балла — на уровне Grok 4.6 и близко к Claude Opus 5 (75,7), превосходя Nemotron 3 Ultra на 4,0 и Mistral на 9,7 пунктов. На Terminal-Bench v2.1 Quasar набрал 69,3, опережая Mistral на 18,7 и Nemotron на 15,4 балла, что подтверждает её силу в агентном программировании и работе с терминалом. Модель доступна через API CompactifAI без необходимости развёртывания собственной инфраструктуры.

by amunozo • 02 сентября 2026 г. в 10:02 • 167 points

ОригиналHN

#anthropic#claude-opus-5#gemini#llm#mistral#multiverse-computing#nvidia#quasar-438b

Комментарии (106)

Обсуждение ставит под сомнение оригинальность и превосходство Quasar 438B: ряд комментаторов (walrus01, comandillos, fantyoon, espadrine) считают её дообученной китайской моделью (GLM-5.2, Qwen, Nemotron). scrollaway, ссылаясь на личную встречу с CEO и участие в EIC Accelerator, указывает на реальный продукт и финансирование. Большинство сходится в том, что закрытые веса делают бенчмарки недостоверными, а модель при этом уступает Qwen-3.8-27B почти впятеро меньшей по размеру. Заявления о квантовом сжатии (80–95 % без потери точности) воспринимаются как маркетинговый шум без подтверждений. Часть участников (DeathArrow, torginus) отмечает непрозрачность финансирования и руководства, подозревая использование грантов без достаточной технологической базы. Титул «Europe's Leading AI Model» считается низким порогом — модель уступает более сильным китайским и американским LLM. Рекомендации: открыть веса или предоставить воспроизводимые протоколы бенчмаркинга; интеграция в OpenRouter повысит доступность; модель может найти нишу в европейском суверенитете данных, если будет соответствовать EU-AI-Act и размещаться в ЕС; избегать преувеличенных формулировок и оценивать модели по реальным метрикам, а не по слоганам. Сообщество хочет видеть открытые европейские альтернативы китайским моделям (Mistral, Laguna) и рассматривает проект как потенциального конкурента в этом направлении.

Apple caught off guard by AI demand for Mac Mini and Mac Studio (macrumors.com) 🔥 Горячее 💬 Длинная дискуссия

Apple ускорила запуск новых Mac mini и Mac Studio из-за неожиданного всплеска спроса со стороны корпоративных клиентов, заинтересованных в использовании этих устройств для запуска больших ИИ-моделей. Обычно такие обновления выходят осенью, но в этом году анонс состоялся за несколько недель до презентации iPhone 18 Pro, что связано с растущим интересом бизнеса к возможностям кластеризации нескольких Mac Studio для работы с frontier-моделями ИИ. Apple активно продвигала эту функцию, ориентируясь на разработчиков и корпоративных пользователей, а не на рядовых потребителей.

Несмотря на подготовку к бизнес-направлению — включая июньское мероприятие «Business at the Park» с участием Ford, Disney и Anthropic, где Mac mini был назван «любимцем» — компания оказалась неподготовленной к масштабу спроса. У Apple не было отдельной команды по работе с корпоративными клиентами или стратегии в сфере ИИ для бизнеса, а запросы на доступ к Private Cloud Compute были отклонены. Вместо этого Apple полагается на партнёров вроде WebAI и Mount Thor, предлагающих ИИ-решения на её железе. Из-за глобального дефицита памяти многие топовые конфигурации Mac mini и Mac Studio остаются недоступными, заставляя некоторые компании обращаться к альтернативам, таким как Nvidia DGX Spark.

by thm • 31 августа 2026 г. в 12:41 • 383 points

ОригиналHN

#apple#business-at-the-park#dgx-spark#llm#mac-mini#mac-studio#mount-thor#nvidia#private-cloud-compute#webai

Комментарии (424)

Обсуждение подтверждает реальный спрос на Mac для локальных LLM со стороны разработчиков и корпоративных пользователей, несмотря на критику высоких цен и отсутствия enterprise-функций. M-series чипы оказались эффективны для локального инференса благодаря скорости и отсутствию задержек при загрузке чекпоинтов. Команда уже купила три Mac Studio, а унифицированная память считается ключевым преимуществом над облаком. Для обучения с самоподдержкой локальные Mac значительно быстрее облачных, где настройка и копирование чекпоинтов занимает до 25 минут. Спор о реальности спроса: одни считают новости маркетинговой уловкой из-за анонимных источников и спам-сайтов (как ранее с Mac Mini и OpenClaw), другие указывают на перепродажу M4 Mac Mini за $600+ вместо $399 как доказательство реального интереса. Спрос не ограничивается корпоративным сегментом — Mac Mini и Mac Studio популярны у студентов и школьников, о чём свидетельствуют распродажи и дефицит бюджетных моделей. 32 ГБ ОЗУ — оптимальный порог для Qwen-3.8 и подобных моделей. Локальный ИИ решает проблемы конфиденциальности и согласованности, критичные в регионах с жёстким регулированием (ЕС). Совет для новичков со слабым железом (например, 16 ГБ RX 9070): начать с облачных сервисов, пока не появятся доступные GPU с 64 ГБ ОЗУ для Q8-моделей. У Apple нет инженерных команд для бизнеса и стратегии корпоративного ИИ, хотя пользователи хотят возвращения серверных функций: резервного питания, удалённого управления, поддержки коло-развёртываний. При этом потребители против эксклюзивных корпоративных версий — важна равная доступность оборудования для всех. Стратегическая возможность, которую Apple игнорирует: локальная открытая модель для Siri может вытеснить Anthropic и OpenAI. Совет: Mac Studio может заменить дорогие Jetson-платформы для LLM на устройстве в робототехнике, хотя экосистема Jetson пока лучше для сенсоров и SLAM. Резкий рост цен на Mac Mini и Mac Studio разочаровывает пользователей, особенно тех, кто купил раньше по акции и теперь не может окупить вложение.

Nvidia agrees to acquire Hugging Face for $13B (businessinsider.com) 🔥 Горячее 💬 Длинная дискуссия

Nvidia ведёт переговоры о покупке Hugging Face за сумму, превышающую $13 млрд, что может стать одной из крупнейших сделок компании. Переговоры ведутся в последние недели, но пока соглашение не достигнуто и может сорваться. Ранее Nvidia уже инвестировала в Hugging Face: участвовала в раунде финансирования на $235 млн в 2023 году, когда компания оценивалась в $4,5 млрд, и предлагала $500 млн за долю, которая оценивала Hugging Face в $7 млрд — но получила отказ, так как платформа хотела сохранить независимость от доминирующего инвестора.

Hugging Face — центральная платформа открытого исходного кода для ИИ, где размещены миллионы моделей и наборов данных, используемых разработчиками по всему миру. Приобретение даст Nvidia прямой доступ к этой экосистеме и может увеличить спрос на её чипы. Однако существует риск: нейтральность Hugging Face, которая поддерживает модели и hardware от AMD, Intel и других конкурентов Nvidia, может быть подорвана под властью чипмейкера, что вызывает обеспокоенность в сообществе. Microsoft также встречалась с Hugging Face, но, по данным источников, переговоры не ведутся. Nvidia располагает значительными средствами: $18 млрд запланировано на equity-инвестиции в текущем финансовом году, плюс $47,9 млрд уже вложено в частные компании. Hugging Face основана в 2016 году французскими предпринимателями Клеманом Дела́нгом, Жюльеном Шомоном и Томасом Вольфом.

by mfiguiere • 27 августа 2026 г. в 01:12 • 1504 points

ОригиналHN

#huggingface#investment#llm#microsoft#nvidia#open-source

Комментарии (673)

Обсуждение выражает опасения, что покупка Hugging Face Nvidia поставит под угрозу нейтральность платформы, ограничит открытые модели и усилит анти-трастовые риски. Nvidia уже демонстрировала практику запрета квантизированных моделей и ограничений на не-CUDA аппаратуру, что подрывает идею аппаратно-агностичности. Компания может получить контроль над ключевыми инструментами экосистемы — Transformers, Diffusers, PEFT — и повлиять на допуск моделей, превратив Hugging Face в «AI app store» под своим управлением. Отмечается резкий рост оценки: от отказа от $500 млн при $7 млрд до возможной покупки за более чем $13 млрд, что вызывает вопросы о реальной стоимости. Hugging Face в основном функционирует как файловый хостинг, а не источник значимого дохода. Nvidia получит доступ к данным о загрузках и аппаратных конфигурациях пользователей, что поднимает вопросы конфиденциальности и монополизации. Ожидается продвижение CUDA-оптимизированных моделей и ограничение производительности на не-Nvidia GPU и ARM-процессорах. Некоторые надеются на бесплатные кредиты для разработчиков, но большинство видят в этом укрепление монополии и создание «постоянного низшего слоя» разработчиков. Вертикальная интеграция воспринимается как опасная тенденция. Сравнения с покупкой GitHub Microsoft упоминаются, но большинство считают риск для открытого сообщества высоким. Советуют заранее резервировать важные модели в децентрализованных архивах или через торренты. Альтернативами называются ModelScope и другие сервисы, не базирующиеся в Китае. Некоторые шутят о смене логотипа и названия — как символе потери идентичности.

OpenAI Jalapeño: Better than Nvidia Blackwell (newsletter.semianalysis.com) 🔥 Горячее 💬 Длинная дискуссия

OpenAI анонсировала свой первый собственный чип для инференса LLM — Jalapeño, разработанный совместно с Broadcom за ~16 месяцев с нуля. Несмотря на то, что это первое поколение ASIC, чип демонстрирует индустриальное лидерство, опережая по производительности на ватт все тестируемые решения NVIDIA, AMD и Google на топовых открытых моделях LLM. Это достигнуто за счёт глубокой аппаратно-программной кодекс-дизайна, а не узкой специализации под собственные модели OpenAI — Jalapeño позиционируется как универсальный чип для широкого спектра нагрузок, включая бенчмарк InferenceX и даже запуск Doom через Codex-подсказки.

Ключевые технические особенности включают использование HBM4-памяти, обеспечивающее пропускную способность, сравнимую с флагманскими GPU, и инновационную сетевую архитектуру: оптическая коммутация на уровне стойки (OCS) позволяет масштабировать систему до 2048 XPU (16 стоек по 128 чипов) с 1,6 Тбит/с глобальной пропускной способности на чип. Это делает систему гибкой для будущих моделей с десятками триллионов параметров и контекстными окнами в миллионы токенов. OpenAI уже проводит пилотные развёртывания с неоклауд-партнёрами, собирая данные о надёжности и оптимизируя время доставки-стоечного монтажа, а следующей целью является достижение 100 МВт суммарной мощности — основные препятствия теперь связаны с производством, развёртыванием и устойчивостью дата-центров, а не с ПО.

by bmulholland • 25 августа 2026 г. в 14:06 • 486 points

ОригиналHN

#amd#broadcom#google#hbm4#jalape-o#llm#nvidia#openai#optical-communication#xpu

Комментарии (309)

Обсуждение дополняет статью, подчеркивая, что успех Jalapeño — не просто технический прорыв, а стратегический шаг к созданию аппаратного монопольного преимущества, которое может закрепить доминирование OpenAI в инференсе LLM за счет масштаба, а не только производительности.

  • Совет: Внедрение собственных ASIC для LLM имеет смысл только при масштабе, достаточном для окупаемости — например, при использовании старых, но стабильных моделей (Haiku 4.5, GPT-OSS 120b), которые не требуют частого обновления.

  • Спор: Некоторые считают, что чипы, запрограммированные под конкретные модели, не жизнеспособны из-за отставания от SOTA — разработка занимает ~16 месяцев, а модели обновляются быстрее, что делает специализированные чипы устаревшими до выхода.

  • Открытое признание, что Jalapeño работает без speculative decoding, а результаты NVIDIA получены с ним, указывает на то, что реальная эффективность Jalapeño может быть еще выше после внедрения этой оптимизации.

  • Совет: Реальный тест производительности чипа — не лабораторные бенчмарки, а шесть месяцев работы на собственном инференс-трафике, где учитываются реальные нагрузки, паттерны доступа и надежность.

  • Создание собственных чипов становится новым барьером входа в AI-индустрию — только компании с масштабом, как OpenAI или Anthropic, могут позволить себе такие инвестиции, что усиливает концентрацию рынка.

  • Совет: Использование LLM для проектирования чипов — ключевой фактор, позволяющий сократить цикл разработки; без этого даже крупные игроки вроде Meta и Microsoft не смогли запустить свои ASIC.

  • Специализированные чипы для инференса не заменят GPU в общем смысле, но создадут нишу, где эффективность на ватт станет решающим фактором, а не универсальность.

  • Совет: Потребление воды — критический, но игнорируемый ограничитель масштабирования чипов: охлаждение и производство энергии требуют воды, и ее нехватка может стать физическим барьером для роста.

  • Спор: Сравнение эффективности LLM и человеческого мозга в токенах/джоуле — некорректно, потому что мозг выполняет множество задач одновременно (движение, метаболизм, восприятие), а модели — только генерацию токенов.

  • Доминирующие игроки в инференс-чипах будут не OpenAI или NVIDIA, а их поставщики — TSMC, Broadcom, Hynix — потому что именно они контролируют производство и логистику.

  • Совет: Если OpenAI начнет продавать чипы с предустановленными моделями (например, GPT Sol 5.6), это может стать выгодным бизнес-моделью для корпоративных клиентов, которым не нужна гибкость, а нужна стабильность и низкая стоимость.

  • Создание собственного чипа — не просто технический шаг, а сигнал к IPO: OpenAI нуждается в капитале для масштабирования производства и защиты от конкурентов, особенно китайских.

  • Совет: Отказ от разработки собственной памяти — стратегическая ошибка: контроль над памятью и интерфейсами может дать еще больший прирост эффективности, чем оптимизация ядра чипа.

  • Инференс-чипы — это не аналог SoundBlaster, а продолжение эволюции GPU: они не заменят универсальные процессоры, но станут доминирующим решением для конкретных задач, как GPU для графики.

  • Совет: Сравнение с Cerebras неуместно: Cerebras ориентирован на обучение, Jalapeño — на инференс; разные задачи, разные рынки, и Jalapeño не угрожает Cerebras напрямую.

everyone's silicon beats everyone else's benchmarks until it has to run someone's actual production workload. the real test is six months of your own inference traffic, not a vendor's chart. — @luciana1u

Qwen 3.8 27B is excellent, but it defaults to overthinking things (simonwillison.net) 🔥 Горячее 💬 Длинная дискуссия

Qwen 3.8 27B — Alibaba‑разработанная 27‑параметровая LLM с поддержкой визуального ввода, работает под лицензией Apache 2 и умеет генерировать сложные SVG‑рисунки, но по умолчанию включает «xhigh»‑уровень рассуждений, который превращает простые запросы в часы‑долгие раздумья. На ноутбуке с 128 ГБ RAM и на сервере NVIDIA DGX Spark я использовал 17 ГБ‑квантованную версию в LM Studio, увеличив контекст до 262 144 токенов; при включённом рассуждении модель потратила 21 минуту на создание SVG‑картинки пеликана, а без него — лишь 2 минуту, получив менее детализированный результат.

Запомните:

  • 27 Б‑модель помещается в 17 ГБ файла и способна к полноценному генеративному рисованию и коду.
  • Параметр reasoning_effort (xhigh/medium/low) сильно влияет на скорость; отключив «xhigh», время генерации падает почти в 10 раз.
  • При работе через llama.cpp с MTP‑режимом (draft‑mtp) ускорение достигает ~72 % по сравнению с базовым GGUF‑режимом.

Эти факты показывают, что даже крупные открытые модели теперь доступны для локального использования без дорогостоящего дата‑центра, однако их производительность ограничена пропускной способностью памяти.

by bilsbie • 16 августа 2026 г. в 23:45 • 603 points

ОригиналHN

#alibaba#apache-2.0#dgx-spark#gguf#llama.cpp#lmstudio#mtp#nvidia#qwen#svg

Комментарии (292)

Избыточное рассуждение — системная проблема современных LLM, не уникальная для Qwen 3.8: аналогичное поведение у Opus 5, Claude и других моделей. Оно вызвано RLHF и дистилляцией, где перерассуждение выгодно для бенчмарков, но вредит интерактивному использованию: замедляет ответ в 7–9 раз, увеличивает токен-расход и снижает эффективность. Qwen 3.8 27B работает на потребительском железе (M4/M5 Max, 48–128 ГБ RAM), превосходит по качеству 3.6 и сопоставима с Opus 4.6 и Codex 5.3, но из-за медленной работы и неэффективности по токенам непрактична без настройки. Для локального использования рекомендуется квантованные версии Q4, а не 16-битные веса. Уровень рассуждений можно контролировать: через шаблоны GGUF (например, Froggeric), параметры llama.cpp (--thinking-budget, --thinking-message) или принудительные хаки (например, fork @shifto), отключая 'xhigh' и используя 'none' или 'low'. Это снижает задержку, но может слегка ухудшить качество. Для разработчиков — динамическое управление уровнем рассуждений по запросу. Скорость на CPU — до 8 минут на задачу, на GPU — до 11 часов на сложные; при частом использовании облачные API (например, Luna) экономически выгоднее. Модель способна находить баги в фреймворках (например, Next.js), но только после десятков часов рассуждений — непригодна как быстрый отладчик. MTP-слой позволяет предсказывать 6–8 токенов с высокой точностью, что частично компенсирует избыточность в генерации кода и SVG. Избыточное рассуждение делает модели неэффективными для продакшена, где важны скорость и лаконичность, а не идеальный бенчмарк.

Nvidia Nemotron 3.5 Lightning and NeMo Switchyard (blogs.nvidia.com)

Немотрон 3.5 Лайтнинг — это высокая эффективность модели с 30 млрд параметров, построенная на архитектуре Mixture of Experts, предназначенная для длительных агентных задач. Она ускоряет обработку в 4 раза и сокращает время выполнения агентных цепочек на 30% по сравнению с аналогами, при этом сохраняет уровень «предельной» интеллектуальной точности. Благодаря открытости и поддержке NeMo её можно дообучить на собственных данных — для юридических, кибербезопасностных или код-ревью задач.

Немо Свитчард — это инструмент для умного маршрутизации запросов между моделями в составе многоагентных систем. Он позволяет выбирать оптимальную модель под каждый запрос: например, 93% запросов обрабатываются локальными экспертами, а лишь 7% — дорогими фронтенд-моделями. Это снижает затраты на 58–74% и ускоряет работу агентов. Уже используют такие компании, как CrowdStrike, CodeRabbit, Ramp и Siemens, чтобы сократить расходы и повысить производительность в реальных рабочих потоках.

by droidjj • 11 августа 2026 г. в 19:35 • 220 points

ОригиналHN

#ai-model#coderabbit#crowdstrike#mixture-of-experts#nemo#nemotron#nvidia#ramp#siemens

Комментарии (113)

Тред обсуждает практический опыт использования моделей Nemotron 3.5 Lightning и других моделей в задачах кодирования и обработки естественного языка. Эксперты и пользователи сходятся во мнении, что модели с меньшим числом параметров, включая Nemotron 3.5 Lightning, эффективны и быстры, особенно для ресурсоёмких задач, но могут иметь ограничения в сложных сценариях. Отмечается спорная проблема кэширования: одни пользователи считают её значимой, другие — несущественной. Рекомендуется выбирать модель в зависимости от конкретной задачи.

Mistral's Shieldstral: 3B open-weights model for multimodal moderation (mistral.ai) 🔥 Горячее

Shieldstral — это открытая 3‑модель‑классификатор, способная оценивать текст и изображения с точностью, сопоставимой с моделями в семь раз крупнее. Она работает как единый «вопрос‑ответ»‑модуль: в запросе задаётся контекст политики, конкретный вопрос («Эта реплика пропагандирует насилие?») и сам материал. На выходе модель выдаёт единственную цифру — вероятность «да», калиброванную в диапазон [0,1]. Такой подход позволяет менять правила в реальном времени, не тренируя модель заново, и использовать один набор весов для всех типов контента.

Ключевые цифры: 3 B параметров, работает на одной видеокарте с 16 ГБ памяти, обучена на смеси реальных и синтетических датасетов, поддерживает как текст, так и изображения, возвращает непрерывный safety‑score. В открытом доступе под лицензией Apache 2.0, а также в составе Open Secure AI Alliance с NVIDIA. Это первый шаг к гибкой, контекстно‑зависимой модерации, где политика задаётся простым языком, а не фиксированным набором категорий.

by riadsila • 04 августа 2026 г. в 16:36 • 438 points

ОригиналHN

#apache-2.0#mistral#multimodal#nvidia#open-secure-ai-alliance#open-weights#shieldstral

Комментарии (112)

Shieldstral — специализированная модель для модерации контента, способная оценивать его с учётом политических контекстов. Её потенциал как инструмента для соцсетей обсуждается: некоторые видят в ней эффективный первый уровень фильтрации, но настаивают на необходимости человеческого надзора для сложных случаев. Другие сомневаются в её достаточной мощности, считая, что для точной оценки требуются более крупные модели. Модель интересна разработчикам, ищущим компактные решения для узких задач.

Nvidia, Microsoft, Meta warn against overregulating open-weight models (cnbc.com) 🔥 Горячее 💬 Длинная дискуссия

Крупнейшие технологические компании, включая Nvidia, Microsoft, Meta, Palantir и более двадцати партнёров, опубликовали совместное письмо, в котором настоятельно просят избегать преждевременных ограничений на открытые модели ИИ, чтобы не подавлять конкуренцию и не вытеснять развитие за пределы США. Они подчёркивают, что такие модели можно скачивать, модифицировать и запускать на собственной инфраструктуре, что ставит под угрозу закрытые системы, например OpenAI и Anthropic, особенно на фоне роста китайского Kimi K3, который превосходит их по некоторым бенчмаркам. Jensen Huang и Satya Nadella разместили письмо в своих соцсетях, а Элон Мэкск выразил поддержку.

В письме также говорится, что полагаться только на закрытые модели не гарантирует безопасность: они могут быть взломаны, использованы в чужих целях или дать сбой, что трудно отследить извне, тогда как открытая экосистема распределивает риск. Компании предлагают решать вопросы незаконного дистилляции через целенаправленные правовые механизмы, а не через всеобъемлющие запреты на методы, важные для инноваций. Они заявляют, что лидерство в ИИ будет определяться не модели, а способностью США создать открытый рынок, где каждый сектор получит доступ к технологиям, способствуя росту и процветанию.

by louiereederson • 24 июля 2026 г. в 13:32 • 400 points

ОригиналHN

#anthropic#elon-musk#jensen-huang#kimi-k3#meta#microsoft#nvidia#openai#palantir#satya-nadella

Комментарии (199)

Участники обсуждения считают, что компании — Nvidia, Microsoft, Meta — поддерживают открытые модели ИИ, чтобы конкурировать с лидерами рынка, такими как OpenAI и Anthropic. Спорят о искренности этих мотивов. Предлагают инвестировать в открытые модели для усиления позиций. Предупреждают, что регулирование открытых моделей может снизить конкуренцию и вытеснить разработку за пределы США. Также обсуждаются риски: кража интеллектуальной собственности и снижение затрат на разработку.

Bonsai 27B: A 27B-Class model that runs on a phone (prismml.com) 🔥 Горячее 💬 Длинная дискуссия

Сегодня анонсирован Bonsai 27B — модель на 27 млрд параметров, основанная на Qwen3.6 27B, впервые способная полностью работать на смартфоне. Существует две версии: трёночная (ternary) с весами {−1,0,+1} и 1‑битовая, использующие групповой масштабирование FP16. Трёночная модель занимает 5,9 ГБ, 1‑битовая — 3,9 ГБ и помещается в память iPhone 17 Pro, при этом сохраняет весь набор функций: мультишаговое рассуждение, вызов инструментов, агентные циклы и мультимодальный vision‑токен. Оба варианта поддерживают 262 K‑токенный контекст, спекулятивное декодирование и полностью работают в низкой точности без перехода в более высокие форматы.

По оценкам на 15‑балльном наборе тестов, включая математику, программирование, вызовы инструментов и визуальные задачи, трёночная версия удерживает 95 % точности полной модели, а 1‑битовая — 90 %. Показатель «интеллектуальной плотности» достигает 0,53 единиц на гигабайт, в 10 раз превышая полноразрядный аналог и в 2,7 раза лучше лучших традиционных низко‑битовых схем. 1‑битовый вариант почти не отстаёт от полной версии в задачах рассуждения и кодирования, а его память в 2,5 раза меньше, чем у самых агрессивных обычных низко‑битовых построек. Весь набор весов доступен по лицензии Apache 2.0, поддерживается MLX на Apple‑устройствах и CUDA на NVIDIA‑GPU, а бесплатный API‑превью уже открыт для разработчиков.

by xenova • 14 июля 2026 г. в 17:50 • 616 points

ОригиналHN

#apache-2.0#apple#bonsai-27b#cuda#hugging-face#iphone#mlx#nvidia#python#qwen3.6-27b

Комментарии (215)

  • Bonsai 27B с квантованием до 1–1.58 бит показывает впечатляющую производительность на CPU и мобильных устройствах, конкурируя с более крупными моделями.
  • Пользователи отмечают значительное падение в задачах вызова инструментов и странности в ответах (например, неверные макронутриенты), что ставит под сомнение практическую надёжность.
  • Инфраструктура для инференса на CPU (llama.cpp, bitnet.cpp) пока не оптимизирована для тернарных моделей, что снижает скорость по сравнению с Q4-квантованными аналогами.
  • Мнения разделились: одни видят в этом сдвиг парадигмы к локальным ИИ, другие считают результаты переоценёнными или искусственными, особенно из-за сильного квантования.
  • Открытые модели доступны на Hugging Face, но многие инструменты (LM Studio, Ollama) пока не поддерживают их, требуя обновлений или кастомных сборок.

Nvidia, CoreWeave, and Nebius: Inside the Circular Financing of the GPU Boom (io-fund.com) 🔥 Горячее

Неoclouds — компании, предоставляющие быстрый доступ к последним GPU, — взрывают рынок ИИ‑инфраструктуры, но их финансовая модель выглядит подозрительно циркулярной. CoreWeave и Nebius заключили контракты на суммарные 3,5 ГВт мощности, из которых лишь часть уже работает: к концу 2026 года CoreWeave планирует запустить 1,7 ГВт, а Nebius — от 800 МВт до 1 ГВт. Эти мощности критичны, потому что ограниченный энергопоток тормозит расширение дата‑центров, однако их использование требует огромных капиталовложений и приводит к росту долгов, тогда как прибыльность пока отстаёт.

Ключевой механизм поддержки — «круговое финансирование»: Nvidia вкладывает средства в эти стартапы и обеспечивает финансовый фонд, позволяя им перераспределять затраты на операционные расходы гипермасштабных клиентов, которые стремятся вывести капитальные расходы в операционные. Такой подход ускоряет рост, но поднимает вопросы устойчивости, когда макроэкономика сжимает доступ к дешёвой кредитной линии. В итоге neoclouds могут стать драйверами GPU‑бума, но их финансовый фундамент остаётся хрупким.

by adletbalzhanov • 11 июля 2026 г. в 17:21 • 273 points

ОригиналHN

#cloud#coreweave#financing#gpu#infrastructure#llm#nebius#nvidia

Комментарии (110)

  • Инвестиции Nvidia в CoreWeave составляют лишь 5–6 % от годового капитального расхода компании, поэтому «круговой» характер финансирования спорен.
  • Круговое финансирование подразумевает, что полученные средства используют для покупки GPU у Nvidia, что позволяет компаниям брать новые кредиты под те же активы.
  • Некоторые считают, что такой подход создаёт финансовую «домик‑карты», способную обрушить экономику при массовом банкротстве.
  • Другие отмечают, что реальная проблема — экономическая целесообразность использования дорогостоящего оборудования и потенциальный рост избыточной ёмкости.

GLM 5.2 and the coming AI margin collapse (martinalderson.com) 🔥 Горячее 💬 Длинная дискуссия

Экономика искусственного интеллекта меняется: обучение модели — это разовый, дорогой капитальный расход, а реальная прибыль генерируется при инференсе, где есть реальные переменные затраты. Рынок переоценил DeepSeek R1, считая, что дешёвое обучение в $6 м делает крупные вложения в инфраструктуру излишними, что привело к резкому падению акций Nvidia. На деле же компании вроде Anthropic и OpenAI берут за токен инференса $25, при этом их валовая маржа достигает 90 % по сравнению с стоимостью вычислительных ресурсов. Такая модель позволяет амортизировать крупные затраты на обучение через огромный объём запросов, превращая их в устойчивую прибыль.

Недавно я тестировал GLM 5.2 от Z.ai — первый открытый конкурент, сравнимый по качеству с Opus и GPT‑5.5. Он почти неотличим по результатам, но работает медленнее, не поддерживает зрение и имеет слабую веб‑поисковую функцию, что критично для агентных сценариев. При этом платформа предоставляет совместимые OpenAI и Anthropic‑API, позволяя мгновенно заменить модель в Claude Code или Codex, меняя лишь базовый URL и ключ. Переключение стоит почти ничего, в отличие от привязки к проприетарным сервисам, и открывает путь к дешевым, открытым альтернативам, что может подорвать экономику закрытых лидеров.

by martinald • 06 июля 2026 г. в 20:14 • 689 points

ОригиналHN

#anthropic#api#deepseek#glm-5.2#inference#llm#machine-learning#nvidia#openai

Комментарии (468)

  • Цены на API‑вызовы падают, но у гипермасштабов остаются высокие маржи, а конкуренция со стороны китайских провайдеров ставит под сомнение долгосрочную прибыльность.
  • Открытые модели (GLM 5.2, DeepSeek и др.) дешевле в инференсе, однако их качество и надёжность пока уступают закрытым фронтирным системам, что ограничивает их массовое принятие.
  • Основные барьеры – инфраструктурные ограничения и необходимость интеграции с удобными харанерами/ MCP, без которых открытые модели остаются менее удобными для профессионального использования.
  • Экономика токенов показывает, что рост спроса (мультизадачность, веб‑поиск, агентные сценарии) будет давить на поставки вычислительных ресурсов, что может привести к росту цен в долгосрочной перспективе.

Show HN: I made Google Trends for Hacker News by indexing 18 years of comments (hackernewstrends.com) 🔥 Горячее 💬 Длинная дискуссия

Хакер Тренды — сервис, который за 18 лет собирает более 45 млн постов и комментариев Hacker News и строит по ним гистограммы частотности упоминаний выбранных терминов. Графики обновляются в реальном времени, позволяют добавлять несколько ключевых слов и сравнивать их популярность, а под графиком отображаются сами статьи и обсуждения, поиск по которым можно фильтровать. База построена на Upstash Redis Search, что обеспечивает быстрый поиск и возможность просматривать детали каждого всплеска интереса.

Самые яркие цепочки: OpenAI‑vs‑Anthropic — OpenAI лидировал до 2026, когда Anthropic резко набрал популярность; AMD‑vs‑Nvidia — AMD доминировал 2017‑20, а Nvidia захватила рынок GPU‑ИИ в 2020‑23; Flash‑vs‑HTML5 — Flash горячим был 2010‑11, а HTML5 обогнал его к 2014‑15. Такие «баттлы» показывают, как технологии сменяют друг друга в хайпе Hacker News. Особенно заметно смена в «социальных» проектах: Mastodon вспыхнул в 2022‑м после оттока от Twitter, а к 2024‑му Bluesky стал объектом вдвое частых обсуждений, тогда как в «инструментах» лидерство переключалось от Sublime → Atom → VS Code, от Docker → Kubernetes. Паттерны показывают привязку интереса к технологическим прорывам.

by ytkimirti • 25 июня 2026 г. в 14:08 • 822 points

ОригиналHN

#amd#anthropic#bluesky#clickhouse#hacker-news#mastodon#nvidia#openai#redis-search#upstash

Комментарии (156)

  • Публичный доступ к базе Hacker News через ClickHouse и Upstash Redis Search, обновление в реальном времени.
  • Ограничения и ошибки: 502/504‑лимиты, некорректное отображение терминов (например, C# считается как C) и отсутствие некоторых языков/компаний.
  • Предложения по улучшению: нормализация по общему объёму, переход к дате по клику на графике, поддержка сравнения «Show HN».
  • Интерес к аналитике трендов: сравнение технологий, генерация смайликов по тональности, использование AI‑эмбеддингов для более точного поиска.

Steam Machine launches today (store.steampowered.com) 🔥 Горячее 💬 Длинная дискуссия

Сегодня стартует продажа первых моделей Steam Machine — специализированных ПК, работающих под управлением SteamOS от Valve и предназначенных для игры в гостиной. На старт выходит десяток партнёров, включая Alienware, CyberPowerPC и iBuyPower, каждый из которых предлагает свои конфигурации с процессорами Intel i5 или i7, 8–16 ГБ ОЗУ и видеокартами от GTX 750 Ti до RTX 2060. Все устройства оснащены 500 GB SSD, возможностью расширения до 2 TB, а также поддержкой Wi‑Fi 802.11ac и Gigabit‑Ethernet. Цена начинается от 499 $, а топовые версии достигают 1500 $, что делает их конкурентоспособными по соотношению цена‑качество. Партнёры также обещают эксклюзивные темы и аксессуары для уникального оформления.

SteamOS — это Linux‑based система, оптимизированная под контроллер Steam и поддерживающая более 300 проверенных игр, а также возможность установки Windows при желании. Встроенный Steam Controller с тачпадом обеспечивает уникальный способ управления, а поддержка 4K и HDR делает её пригодной для современных телевизоров. Кроме того, устройства позволяют стримить игры с другого ПК через Remote Play и работают в полноэкранном Steam Big Picture режиме. По словам разработчиков, «Мы хотим, чтобы каждый мог играть на своём устройстве без компромиссов», и первая партия начнёт доставляться уже 10 ноября.

by theschwa • 22 июня 2026 г. в 17:09 • 1922 points

ОригиналHN

#alienware#gtx-750-ti#intel#linux#nvidia#rtx-2060#steamos#steampowered#valve

Комментарии (1736)

  • Цена базовой модели — 1 049 $ без контроллера, что выше ожиданий и конкурирует с консолями более выгодных по соотношению цена/производительность.
  • Обсуждение несоответствия характеристик (6‑ядерный CPU, 16 ГБ ОЗУ, 512 ГБ SSD) и стоимости, сравнению с PS5 Pro и другими мини‑ПК.
  • Внедрение системы случайных резерваций для снижения фриланс‑феномена и повышения справедливости покупки.
  • Положительные отзывы о возможности установки любой ОС, открытости платформы и поддержке Linux как способе бороться с доминированием Windows.

TPUs vs. GPUs and why Google is positioned to win AI race in the long term (uncoveralpha.com) 🔥 Горячее 💬 Длинная дискуссия

Google TPU возник в 2013 году из расчёта: если каждый пользователь Android задействует voice search по 3 минуты в день, компании придётся удвоить мощности дата-центров. Стандартные CPU и GPU не справлялись с матричной математикой глубокого обучения, поэтому Google создал ASIC для TensorFlow. Проект прошёл от концепта до деплоя за 15 месяцев (2013–2014), к 2015 TPU уже ускоряли Maps, Photos и Translate, а в 2016 их анонсировали на I/O.

В отличие от универсальных GPU с «багажом» (кеширование, ветвления, текстуры), TPU — доменно-специфичный чип с systolic array: данные (веса) загружаются раз, проходят через сетку умножителей без возврата в память, минимизируя Von Neumann bottleneck и HBM-доступы. Новый Ironwood усилил SparseCore для эмбеддингов (рекомендации, LLM) и расширил HBM. TPU — ключевое преимущество Google Cloud на 10 лет, с фокусом на inference; обсуждаются производство, сравнения с GPU и влияние Gemini 3.

by vegasbrianc • 27 ноября 2025 г. в 13:28 • 354 points

ОригиналHN

#cuda#google#google-cloud#gpu#jax#llm#nvidia#tensorflow#tpu

Комментарии (260)

  • Google's TPUs лидируют в эффективности inference и масштабе благодаря systolic array, OCS interconnects и низкой стоимости эксплуатации по сравнению с Nvidia GPUs.
  • Скепсис по поводу исполнения Google: слабая экосистема (JAX/TF vs CUDA), история провалов продуктов и зависимость от ad-бизнеса.
  • Nvidia доминирует за счёт универсальности, CUDA и оптимизаций (NVLink, NVFP4), несмотря на "architectural baggage".
  • Упоминания альтернатив (Groq, Cerebras, Meta покупает TPU) и рисков: новые архитектуры AI могут устареть hardware, фокус на inference vs training.
  • Google имеет ресурсы для доминирования через vertical stack и cloud, но короткий "attention span" вызывает сомнения.

Linux gamers on Steam cross over the 3% mark (gamingonlinux.com) 🔥 Горячее 💬 Длинная дискуссия

Доля Linux-геймеров на Steam наконец преодолела психологически важный порог в 3%, достигнув 3.05% по данным опроса за октябрь 2025 года. Этот рост на 0.41% стал возможен благодаря устойчивому тренду и окончанию поддержки Windows 10, что побудило больше пользователей попробовать Linux. Windows по-прежнему доминирует с долей 94.84%, а macOS занимает 2.11%.

Несмотря на скромные на первый взгляд проценты, это уже миллионы пользователей. По последним официальным данным Valve за 2022 год, месячная активная аудитория Steam составляла около 120 миллионов, что означает более 4 миллионов Linux-геймеров. С учетом роста платформы и популярности Steam Deck, продающегося миллионами копиями, реальное число вероятно еще выше. Среди дистрибутивов лидирует SteamOS Holo с 27.18%, за которым следуют Arch Linux (10.32%) и Linux Mint (6.65%).

by haunter • 02 ноября 2025 г. в 18:54 • 653 points

ОригиналHN

#arch-linux#gaming#linux#linux-mint#nvidia#proton#steam#steamos#twitter

Комментарии (383)

  • Пользователи обсуждают переход с Windows на Linux для игр, отмечая, что большинство игр теперь работает через Proton, и что Steam Deck способствует этому.
  • Некоторые упоминают, что единственное, что остаётся в Windows, — это играть в игры с античитом, так как Easy Anti-Cheat и подобные системы не работают под Linux.
  • Участники также обсуждают, что, несмотря на то, что Linux-совместимость значительно улучшилась, всё ещё есть проблемы с драйверами, особенно с NVIDIA.
  • Некоторые отмечают, что, несмотря на то, что Linux-совместимость значительно улучшилась, всё ещё есть проблемы с драйверами, особенно с NVIDIA.
  • Также упоминается, что, хотя большинство игр теперь работает на Linux, всё ещё есть проблемы с некоторыми играми, которые не работают или имеют проблемы.

Starcloud (blogs.nvidia.com) 💬 Длинная дискуссия

Стартап Starcloud, участник программы NVIDIA Inception, выводит в космос данные центры, обещая десятикратное снижение энергозатрат по сравнению с наземными аналогами. Их первый спутник Starcloud-1 размером с небольшой холодильник будет запущен в ноябре и станет первым в истории космоса, где установят передовой GPU NVIDIA H100. Спутник обеспечит в 100 раз большую вычислительную мощность, чем любые предыдущие космические операции. Компания планирует построить орбитальный дата-центр мощностью 5 гигаватт с солнечными панелями размером примерно 4х4 километра.

В космосе дата-центры смогут использовать вакуум как бесконечный теплоотвод, устраняя необходимость в водяном охлаждении и экономя ресурсы Земли. "В космосе вы получаете почти неограниченную возобновляемую энергию по низкой стоимости", - отмечает сооснователь и CEO Starcloud Филип Джонстон. По его прогнозу, через 10 лет большинство новых дата-центров будут строиться в космосе. Ранние применения включают анализ данных наблюдения Земли для обнаружения пожаров, прогнозирования погоды и реагирования на аварийные сигналы.

by jonbaer • 22 октября 2025 г. в 11:23 • 142 points

ОригиналHN

#data-centers#gpu#nvidia#renewable-energy#satellites#solar-power#space

Комментарии (189)

  • Проект Starline/Nvidia предлагает запускать дата-центры в космосе, что вызывает скепсис из-за проблем с охлаждением, радиацией и стоимостью доставки.
  • Критики указывают, что вместо радиаторов размером с город, проще было бы просто не тратить энергию на обработку и передачу данных.
  • Сомнения вызывает и то, что никакой реальной инфраструктуры для обслуживания таких центров не существует, а также отсутствие ясного плана, как именно они будут запускаться и обслуживаться.
  • Некоторые комментаторы также поднимают вопросы о том, что при нынешнем уровне технологий это может быть просто невозможно.

Alibaba Cloud says it cut Nvidia AI GPU use by 82% with new pooling system (tomshardware.com) 🔥 Горячее 💬 Длинная дискуссия

Alibaba Cloud представила систему объединения вычислительных ресурсов Aegaeon, которая, по их утверждению, позволяет сократить использование графических процессоров Nvidia на 82%. Новая технология способна обслуживать десятки больших языковых моделей, требуя лишь доли GPU, необходимых ранее.

Во время бета-тестирования на платформе Alibaba Cloud Marketplace в течение более трех месяцев количество необходимых Nvidia H20 GPU для работы с моделями до 72 миллиардов параметров сократилось с 1,192 до 213. Исследователи обнаружили, что 17,7% GPU выделялись для обслуживания всего 1,35% запросов, что свидетельствует о значительной неэффективности в работе с одновременными AI-нагрузками.

Работа была представлена на 31-й Симпозиуме по принципам операционных систем (SOSP) в Сеуле. Один из соавторов исследования - главный технолог Alibaba Cloud Чжоу Цзжэньрен. Aegaeon позиционируется как первая работа, раскрывающая чрезмерные затраты на обслуживание одновременных рабочих нагрузок LLM на рынке.

by hd4 • 20 октября 2025 г. в 12:31 • 501 points

ОригиналHN

#alibaba-cloud#cloud-computing#deepseek#gpu#llm#nvidia#qwen

Комментарии (286)

  • Эффективность использования GPU в облаке Alibaba — 17,7 % GPU обрабатывает всего 1,35 % запросов, и вместо 1192 GPU теперь используется 213, что на 82 % меньше.
  • US-ограничения на экспорт чипов в Китай — вынуждают китайские компании к инновациям, что может привести к созданию более эффективных решений, которые в будущем могут быть использованы в других странах.
  • Сравнение моделей — DeepSeek и Qwen от Alibaba Cloud являются наиболее популярными моделями для инференса, в то время как большинство других моделей используются очень редко, что приводит к неэффективному использованию ресурсов.
  • Проблема с лицензиями и открытым исходным кодом — Китайские компании, такие как DeepSeek, начинают отказываться от открытого кода, что может повлиять на развитие AI-сообщества.
  • Стоимость и доступность GPU — NVIDIA стоит дороже, чем в Китае, но в то же время, китайские компании могут разрабатывать более дешевые и эффективные решения, что может привести к снижению цен на GPU в будущем.

AMD signs AI chip-supply deal with OpenAI, gives it option to take a 10% stake (reuters.com) 🔥 Горячее 💬 Длинная дискуссия

AMD заключила сделку с OpenAI о поставках чипов для искусственного интеллекта, предоставив также опцион на приобретение 10% доли в компании. Это стратегическое партнёрство усиливает позиции AMD на рынке AI-чипов, где доминирует NVIDIA, и обеспечивает OpenAI доступ к передовым аппаратным решениям для разработки и масштабирования своих моделей.

Опцион на долю демонстрирует глубокую интеграцию интересов: AMD получает ключевого клиента и потенциального инвестора, а OpenAI — влияние на поставщика и приоритетный доступ к технологиям. Это может ускорить инновации в области аппаратного обеспечения для ИИ и снизить зависимость от единственного поставщика.

by chillax • 06 октября 2025 г. в 12:17 • 380 points

ОригиналHN

#amd#cuda#gpu#llm#nvidia#openai

Комментарии (309)

  • AMD предоставила OpenAI опцион на покупку 10% своих акций по цене $0.01 за акцию при выполнении определенных условий
  • Сделка призвана стимулировать OpenAI к закупкам GPU AMD на сумму до $100 млрд и совместной разработке ПО для AI-чипов
  • Рыночная капитализация AMD выросла примерно на $100 млрд после анонса, что частично компенсирует стоимость опциона
  • Многие участники обсуждения расценивают сделку как признак финансового пузыря и циркулярных денежных потоков в AI-индустрии
  • Партнерство рассматривается как стратегический ход для создания альтернативы доминированию NVIDIA и CUDA

Circular Financing: Does Nvidia's $110B Bet Echo the Telecom Bubble? (tomtunguz.com)

Nvidia инвестирует $110 млрд в OpenAI и другие AI-стартапы через венчурное финансирование, что напоминает стратегию Lucent во время пузыря доткомов. Lucent тогда выделила $8,1 млрд клиентам, которые покупали её оборудование, но после краха 47 телеком-компаний обанкротились, а до 80% кредитов не вернулись. Сейчас Nvidia рискует ещё больше: её обязательства составляют 85% выручки против 20% у Lucent, а 39% доходов зависят всего от двух клиентов.

Новизна ситуации в том, что $10+ млрд долгов обеспечены залогом в виде GPU, с предположением, что их стоимость сохранится на 4–6 лет. Крупные облачные провайдеры уже удлинили сроки амортизации оборудования до 6 лет, но Amazon недавно сократил их до 5, что может сигнализировать о переоценке рисков. Если спрос на AI-инфраструктуру замедлится, это может создать цепную реакцию defaults, особенно среди стартапов, зависящих от финансирования поставщиков.

by miltava • 04 октября 2025 г. в 13:06 • 180 points

ОригиналHN

#agi#amazon#cloud-computing#google#gpu#llm#microsoft#nvidia#vendor-financing#venture-capital

Комментарии (147)

  • Сравнение текущей ситуации с пузырем телекоммуникаций 90-х: есть как сходства (масштабные инвестиции в инфраструктуру, риск перепроизводства), так и ключевые различия (финансовая устойчивость Nvidia vs. мошенничество Lucent).
  • Главный риск для Nvidia — возможность резкого падения спроса на GPU, если AGI не будет достигнут в ожидаемые сроки (2-5 лет) или если инвесторы потеряют интерес из-за замедления прогресса.
  • Неопределенность долгосрочного спроса: несмотря на текущий ажиотаж, будущее зависит от появления реальных, прибыльных приложений ИИ, а не только от тренировки моделей; возможен избыток мощностей.
  • Роль крупных игроков (Microsoft, Google, Amazon) и их кастомерных чипов как потенциальная угроза монополии Nvidia, а также вопросы учетной политики и вендорного финансирования.
  • Скептицизм относительно способности ИИ самостоятельно решать сложные задачи и кардинально улучшать код без человеческого контроля, что ставит под вопрос оправданность огромных инвестиций.

Microsoft CTO says he wants to swap most AMD and Nvidia GPUs for homemade chips (cnbc.com)

Microsoft планирует постепенно заменить графические процессоры AMD и Nvidia, используемые в своих AI-сервисах, на собственные чипы Maia. Это часть стратегии по снижению зависимости от внешних поставщиков и сокращению затрат на инфраструктуру для машинного обучения. Компания уже тестирует свои чипы в дата-центрах и планирует масштабировать их использование в Azure и других cloud-сервисах.

Переход на собственные решения может значительно сократить расходы на hardware и дать Microsoft больше контроля над производительностью и энергоэффективностью систем. Это также усилит конкуренцию на рынке AI-чипов, где доминируют Nvidia и AMD.

by fork-bomber • 03 октября 2025 г. в 14:48 • 162 points

ОригиналHN

#ai-chips#amd#azure#cloud-computing#data-centers#machine-learning#microsoft#nvidia

Комментарии (118)

  • Microsoft разрабатывает собственные AI-чипы (например, Maia 100) для снижения зависимости от NVIDIA и затрат, хотя и с опозданием по сравнению с Google и Amazon.
  • Участники обсуждают, что создание собственного "кремния" — логичный шаг для крупных дата-центров, но для успеха критически важны разработка ПО и инфраструктуры (как у CUDA от NVIDIA).
  • Высказываются опасения, что уход крупных игроков на собственные чипы может усилить монополию NVIDIA на рынке для остальных или, наоборот, снизить цены на GPU.
  • Поднимается вопрос, является ли производственная мощность (например, TSMC) основным ограничением, а не дизайном чипов.
  • Обсуждаются альтернативные архитектуры для AI, включая аналоговые чипы и специализированные решения для inference.

Fp8 runs ~100 tflops faster when the kernel name has "cutlass" in it (github.com) 🔥 Горячее

В пул-реквесте к Triton представлена реализация механизма persistent attention для ускорения работы с большими контекстами в трансформерах. Вместо пересчета ключей и значений для каждого токена механизм сохраняет их в глобальной памяти, что значительно снижает вычислительную нагрузку при обработке длинных последовательностей.

Автор демонстрирует, как это позволяет эффективно работать с контекстами до 128K токенов, избегая квадратичной сложности традиционного внимания. Практический вывод: такой подход открывает путь к более масштабным моделям без пропорционального роста затрат на вычисления.

by mmastrac • 03 октября 2025 г. в 04:21 • 321 points

ОригиналHN

#amd#attention-mechanism#cutlass#github#gpu#intel#nvidia#transformers#triton

Комментарии (141)

  • NVIDIA использует хардкод для оптимизации кода, содержащего "cutlass" в названии, что может быть нестабильным и приводить к скрытым багам.
  • Подобные практики (оптимизации по именам функций или приложений) исторически распространены среди производителей железа и софта (ATI/AMD, Intel, Microsoft) для улучшения бенчмарков, иногда в ущерб качеству.
  • Мотивация таких оптимизаций часто не злонамеренна, а связана с снижением рисков и фокусом на стабильности собственных библиотек, но создаёт новые барьеры.
  • В индустрии существуют разногласия по поводу этичности таких практик, но для графических драйверов тюнинг под конкретные игры стал нормой.
  • Обсуждаются проблемы проприетарного кода (драйверы, прошивки) и затраты общества на обратную разработку вместо сотрудничества.

We bought the whole GPU, so we're damn well going to use the whole GPU (hazyresearch.stanford.edu) 🔥 Горячее

Исследователи из Hazy Research разработали высокопроизводительный мегаядро для тензорно-параллельного вывода Llama-70B на H100, которое агрессивно перекрывает вычисления, работу с памятью и коммуникацию между GPU. Это позволяет одновременно задействовать различные аппаратные ресурсы: тензорные ядра, модули для нетензорных операций, пропускную способность HBM и NVLink. В интеграции с движком Tokasaurus их решение превосходит SGLang на >22% по общей пропускной способности при обработке 65 536 промптов из ShareGPT.

Ключевая идея — использование интерпретатора инструкций, работающего на каждом SM, который позволяет гибко планировать выполнение разнородных операций. Это обеспечивает перекрытие на нескольких уровнях: внутри SM (память и вычисления), между SM (матричные умножения и нормирование) и между GPU (скрытие задержек связи за счёт специальных потоков). Особенно отмечается простота реализации сложных трансформаций данных между GPU прямо после attention-слоя, что трудно выразить стандартными средствами коммуникации.

by sydriax • 28 сентября 2025 г. в 21:00 • 470 points

ОригиналHN

#computational-optimization#deep-learning#gpu#gpu-virtualization#hbm#llama#nvidia#nvlink#parallel-computing#tensor-cores

Комментарии (94)

  • Обсуждение эффективности использования GPU: использование всех блоков (NVDEC, NVJPG, RT и тензорные ядра) для декомпрессии весов и вычислений, аналогии с оптимизацией под консоли.
  • Проблемы инструментов и драйверов: отставание языков, библиотек и драйверов от возможностей современного железа, сложности компиляторов для гетерогенных систем.
  • Виртуализация и разделение ресурсов GPU: обсуждение MIG, MPS для многопользовательского использования, риски утечки данных и ограничения этих технологий.
  • Сравнение с другими платформами: упоминание Apple Metal и открытости драйверов, потенциал использования GPU для аудиообработки и сигналов.
  • Критика и ирония: сравнение стиля статьи с "Трансгрессия границ", комментарии о "коде, который не предназначен для поддержки" и неожиданно доступных оптимизациях в крупных лабораториях.

Pop OS 24.04 LTS Beta (system76.com) 🔥 Горячее 💬 Длинная дискуссия

System76 выпустила бета-версию Pop!_OS 24.04 LTS с новой средой рабочего стола COSMIC, полностью разработанной внутри компании. Ключевые изменения включают замену стандартных GNOME-приложений на COSMIC-аналоги: Files, Terminal, Text Editor и Media Player, а также обновлённый магазин приложений COSMIC Store. Для установки требуется отключить Secure Boot в BIOS, рекомендуется минимум 4 ГБ ОЗУ и 16 ГБ места.

Известные проблемы беты: несохранение избранных приложений из предыдущей версии, временное отключение PPA при обновлении, ограниченная поддержка перетаскивания файлов между Wayland и X11-приложениями. Также ожидаются баги в играх и отсутствие экранной подсказки для переключения дисплеев. Выпуск финальной версии намечен после исправления ошибок.

by agluszak • 26 сентября 2025 г. в 09:20 • 352 points

ОригиналHN

#arm64#cosmic#gnome#nvidia#pop-os#secure-boot#wayland#x11

Комментарии (186)

  • Пользователи положительно оценивают новый рабочий стол Cosmic DE за его функциональность, включая панель на всех экранах и улучшенное управление окнами, по сравнению с GNOME.
  • Некоторые пользователи выражают скептицизм относительно готовности Cosmic DE к релизу, отмечая проблемы с драйверами Nvidia, отсутствие поддержки Secure Boot и ARM64, а также сыроватый интерфейс.
  • Многие пользователи успешно используют Pop!_OS на старом оборудовании (например, MacBook Pro 2014 года), хотя иногда требуется ручная настройка Wi-Fi и других компонентов.
  • Обсуждаются преимущества Pop!_OS, такие как предустановленные драйверы Nvidia в Live ISO и режим тайлинга, а также сравнивается Cosmic с другими средами, такими как Hyprland и Sway.
  • Высказываются опасения, что небольшой команде System76 может не хватить ресурсов для долгосрочной поддержки собственной среды рабочего стола, и отмечается медленный темп разработки.

Nvidia buys $5B in Intel (tomshardware.com) 🔥 Горячее 💬 Длинная дискуссия

Nvidia и Intel объявили о совместной разработке процессоров Intel x86 RTX SOC для ПК с графикой Nvidia, а также о создании пользовательских серверных процессоров x86 от Nvidia. В рамках масштабной сделки Nvidia приобрела акции Intel на сумму $5 млрд.

by stycznik • 18 сентября 2025 г. в 11:04 • 936 points

ОригиналHN

#gpu#intel#linux#nvidia#rtx#soc#x86

Комментарии (568)

  • Опасения по поводу негативного влияния на конкуренцию: инвестиции Nvidia могут угрожать развитию графического подразделения Intel (Arc), которое сдерживает цены на GPU и важно для Linux-сообщества.
  • Стратегический интерес Nvidia: сделка может быть направлена на получение доступа к производственным мощностям Intel (фабрикам) и созданию гибридных решений (CPU + GPU), а не на прямую конкуренцию на рынке видеокарт.
  • Политический и экономический контекст: инвестиции могут быть продиктованы желанием правительства США поддержать национального производителя полупроводников и диверсифицировать цепочки поставок.
  • Исторические параллели: сравнение со сделкой Microsoft и Apple в 1997 году, которая спасла последнюю, и надежды на аналогичный положительный исход для Intel.
  • Влияние на архитектуру и рынок: возможный сдвиг в сторону интеграции графики в SoC (системы на кристалле) и потенциальные риски для x86-64 лицензирования Intel.

Are OpenAI and Anthropic losing money on inference? (martinalderson.com) 🔥 Горячее 💬 Длинная дискуссия

  • Тезис: утверждение «OpenAI и Anthropic теряют деньги на инференсе» — сильно преувеличено.
  • Метод: считаем только «сырой» H100-компьют за $2/час, игнорируем всё остальное.
  • Кластер: 72 H100 → $144/час. 8-GPU инстанс × 9 = 288 параллельных запросов.

Пропускная способность

  • Prefill (вход): 1,44 млн токенов/с на инстанс → 46,8 млрд токенов/час.
  • Decode (выход): 1 440 токенов/с на инстанс → 46,7 млн токенов/час.

Цена за токен

  • Вход: $0,003/млн токенов (почти даром).
  • Выход: $3/млн токенов (реальные деньги).

Почему ограничивают контекст

  • При >128 k токенов вычисления становятся compute-bound → цена вырастает 2–10×.
  • Поэтому Claude Code режет контекст до 200 k: дешевле.

Пользовательская экономика

  • ChatGPT Pro $20/мес при 100 k токенов/день: себестоимость ≈ $3/мес → маржа 5–6×.

by martinald • 28 августа 2025 г. в 10:15 • 470 points

ОригиналHN

#anthropic#cloud-computing#gpu#llm#machine-learning#nvidia#openai

Комментарии (438)

  • Математика статьи критикуется: расчёт пропускной способности префилла завышен минимум в 1000 раз, а достигаемая MFU превышает физический предел GPU.
  • Участники соглашаются, что «чистая» инференс-операция, без учёта затрат на обучение, может быть прибыльной: Сам Альтман, данные The Information и Epoch AI указывают на gross margin 50–60 %.
  • Основные оговорки: в расчётах не учтены downtime, кэширование, спекулятивное декодирование, KV-cache, а также различия в эффективности между DeepSeek R1 и закрытыми моделями OpenAI/Anthropic.
  • Некоторые стартапы (Cursor, Perplexity) уже страдают от отрицательной маржи из-за дорогих токенов, что подчеркивает разрыв между «оптовой» и «розничной» экономикой.
  • Общий вывод: инференс в вакууме может быть прибыльным, но полная экономика включает обучение, idle-оборудование и кросс-субсидирование, поэтому точные цифры известны только самим компаниям.

Комментарии (282)

  • Пользователи жалуются на отсутствие WWAN-модуля, мелкие стрелки и нехватку клавиш Home/End.
  • Радуются AMD-видеокартам как более «линуксовским», но спорят о проблемах NVIDIA.
  • Цена новой сборки (≈ $4000) вызывает шок: «дороже, чем игровой ROG с RTX 3080».
  • Вопрошают о реальной экономике модульности, сроках поставки в Японию и о OLED-экранах.
  • Любители Linux спрашивают о «из коробки» и просят ThinkPad-стильный trackpoint.

DeepSeek-v3.1 (api-docs.deepseek.com) 🔥 Горячее 💬 Длинная дискуссия

DeepSeek-V3.1 — первый шаг к эпохе агентов

  • Гибридный режим: одна модель, два режима — Think (рассуждения) и Non-Think (быстрый ответ).
  • Скорость: Think-режим отвечает быстрее, чем DeepSeek-R1-0528.
  • Агентские навыки: улучшены работа с инструментами и многошаговые задачи.
    Попробовать: chat.deepseek.com

API

  • deepseek-chat → Non-Think, deepseek-reasoner → Think, контекст 128К.
  • Поддержка формата Anthropic API и строгого Function Calling (бета).

Инструменты и агенты

  • Рост результатов на SWE / Terminal-Bench.
  • Эффективнее многошаговые поисковые задачи.

Модель

  • База V3.1: дообучена на 840 B токенов для длинного контекста.
  • Обновлён токенайзер и шаблон чата.
  • Веса открыты: V3.1-Base, V3.1.

Цены

  • Новые тарифы с 5 сентября 2025, 16:00 UTC. До этого действуют старые.

by wertyk • 21 августа 2025 г. в 19:06 • 732 points

ОригиналHN

#anthropic#api#deepseek#fp8#gguf#glm#huggingface#llm#nvidia

Комментарии (253)

  • Выпущены GGUF-файлы DeepSeek-V3.1 для локального запуска: ≥250 ГБ RAM+VRAM или медленный off-load на SSD.
  • На бенчмарках модель уступает GPT-5/Claude 4/GLM-4.5, но конкурентоспособна среди открытых весов.
  • Пользователи жалуются на навязчивое «Of course.» в ответах, повышенные галлюцинации и устаревшие форматы tool-use.
  • Цена API: $0,56 вход / $1,68 выход за 1 M токенов — дёшево, но без прежней ночной скидки.
  • Китайские СМИ: V3.1 обучена на FP8 для будущих отечественных AI-чипов, что может ударить по позициям NVIDIA.

How to Think About GPUs (jax-ml.github.io) 🔥 Горячее

Что такое GPU
Современная ML-GPU (H100/B200) — это ~100–150 независимых вычислительных блоков (SM), каждый из которых содержит матричное ядро Tensor Core, векторные ALU (CUDA-ядра) и 256 КБ кэш SMEM. Все SM делят общий L2 и HBM3-память. SM разбит на 4 подблока; каждый подблок выполняет 32 SIMD-операции за такт. GPU-ядро менее мощное, чем TPU TensorCore, но их много, поэтому общая гибкость выше.

Память
H100: 80 ГБ HBM3, 3 ТБ/с. B200: 192 ГБ, 8 ТБ/с. L2 кэш 50 МБ (H100) / 128 МБ (B200). SMEM даёт 256 КБ на SM.

GPU vs TPU на уровне чипа
TPU: 1–2 больших MXU, жёсткая синхронизация, векторная часть слабее. GPU: 100+ мелких ядер, независимые SM, но общий L2 ограничивает масштаб. GPU лучше для разнородных задач, TPU — для чистых матмул.

Сеть внутри узла
Узел = 8 GPU + 2 CPU. GPU соединены NVLink/NVSwitch (900 ГБ/с между любыми двумя). CPU-GPU идут через PCIe 5.0 (64 ГБ/с). NVSwitch-кроссбар внутри узла = полносвязная сеть.

Сеть за пределами узла
InfiniBand HDR/NDR (до 400 Гб/с) или Ethernet RoCE. GPUDirect RDMA позволяет GPU читать/писать память соседнего узла без участия CPU.

Коллективные операции
Intra-node: NCCL использует NVLink; all-reduce 8×H100 за ~3 мкс.
Cross-node: кольцо IB + NVLink; latency ~10 мкс, bandwidth лимит IB.

Roofline-модель для LLM

  • Data Parallelism: ограничен IB; эффективен при малых моделях.
  • Tensor Parallelism: ограничен NVLink; лучше внутри узла.
  • Expert/ Pipeline Parallelism: комбинируем; pipeline глубже → меньше bubble, но больше весов на каждом GPU.
  • TLDR: держи параллелизм так, чтобы IB не стал bottleneck; используй NVLink для tensor-parallel, IB для data-parallel.

Итого
GPU — это масса мелких, независимых SM, связанных быстрым NVLink внутри узла и медленным IB между узлами. Для LLM выбирай параллелизм, который минимизирует IB-трафик и максимально использует NVLink.

by alphabetting • 18 августа 2025 г. в 18:18 • 354 points

ОригиналHN

#cuda#gpu#infiniband#machine-learning#nvidia#nvlink#parallel-computing#roce#tpu

Комментарии (107)

  • Критика точности: документация местами неточна, особенно в определении «CUDA-core».
  • Открытость и вендор-лок: ряд участников считают инвестиции в проприетарную экосистему NVIDIA рискованной ставкой.
  • Ошибка в расчётах: Quiz 2 преувеличивает пропускную способность; реальные 3,2 ТБ/с ограничены портами NIC.
  • Похвала и польза: серия всё же хорошо объясняет принципы параллелизма, применимые и к другим устройствам.
  • Сравнение TPU и GPU: TPU проще масштабировать, но закрыт для продажи; GPU NVIDIA гибче, но сложнее в программировании.
  • Дефицит официальных данных: NVIDIA не раскрывает полную архитектуру, поэтому полезные модели приходится собирать из сторонних источников.

How AI conquered the US economy: A visual FAQ (derekthompson.org) 🔥 Горячее 💬 Длинная дискуссия

Американская экономика раскололась: бурный ИИ-сектор и вялая потребительская часть.

  • В статистике: траты на ИИ в прошлом квартале росли быстрее потребительских расходов; без ИИ рост ВВП был бы слабым.
  • В акциях: за два года около 60% прироста рынка дали компании, связанные с ИИ (Microsoft, Nvidia, Meta); без этого бумa доходность была бы посредственной.
  • В бизнес-данных: по Stripe, «ИИ-компании» лидируют по росту выручки, опережая остальные группы.

Что это за бум и откуда деньги? ИИ — это чипы, серверы и дата-центры, огромная электроэнергия, сети и охлаждение. Это крайне дорого. За полгода Meta, Google, Microsoft и Amazon вложили $100–200 млрд в чипы и инфраструктуру. Крупнейшие техгиганты строят на рекордных скоростях — крупнейший инфраструктурный проект со времен ранней компьютерной эры или даже железнодорожного бума.

JP Morgan отмечает: доля Nvidia в совокупных капзатратах компаний может стать максимальной со времен пиковой выручки IBM в 1969. По расчетам Пола Кедроски, капвложения в ИИ как доля ВВП уже превысили дотком-уровни и приближаются к масштабам «позолоченного века» железных дорог.

Этот всплеск финансируется беспрецедентной прибылью лидеров технологий. Их доля свободного денежного потока — рекордная со Второй мировой. Сильные действующие модели (реклама Meta, поисковая реклама Google и пр.) генерируют «горы» наличности, позволяя ежегодно направлять сотни миллиардов на ИИ-НИОКР и инфраструктуру.

by rbanffy • 07 августа 2025 г. в 10:12 • 267 points

ОригиналHN

#amazon#cloud-computing#economy#investment#llm#meta#microsoft#nvidia

Комментарии (213)

  • Участники спорят, действительно ли ИИ «поддерживает» весь рост экономики США или просто концентрирует капитал в руках 10–15 гигантов.
  • Многие сравнивают нынешний бум с «железнодорожной лихорадкой» XIX века и дот-комом 1999–2000 годов: возможен и прорыв, и взрыв пузыря.
  • Поднимается вопрос: если ИИ так продуктивен, почему прибыли растут у «продавцов лопат» (Nvidia, Microsoft), а не у клиентов из S&P 490.
  • Часть комментаторов считает, что без ИИ деньги всё равно бы не пошли в реальную экономику, а осели бы в выкупе акций или «загородных REIT-ах».
  • Скептики предупреждают: рекордные capex на дата-центры могут обернуться масштабным спадом, если спрос на ИИ-сервисы замедлится.

Running GPT-OSS-120B at 500 tokens per second on Nvidia GPUs (baseten.co) 💬 Длинная дискуссия

  • В день выхода открытой модели вроде gpt-oss-120b мы сразу ускоряем её для клиентов, как партнёры запуска OpenAI. К концу дня запуска стали лидерами на NVIDIA по латентности и пропускной способности по данным OpenRouter.

  • Быстрая оптимизация обеспечена гибким стеком инференса и экспертизой команды; за время написания поста прибавили ещё ~100 ток/с при 100% аптайме.

  • Работы включали:

    • Тесты и бенчмарки в TensorRT-LLM, vLLM и SGLang.
    • Совместимость с архитектурами Hopper и Blackwell.
    • Интеграцию с нашим стеком (в т. ч. NVIDIA Dynamo).
    • Оптимизации: маршрутизация с учётом KV-кэша, спекулятивная генерация с Eagle.

Шаг 1: Первый инференс

  • Запускаем базовый инференс в любом доступном фреймворке и на нужных GPU/серверных уровнях.
  • Параллелим работу: одни пробуют vLLM и SGLang, другие — TensorRT-LLM; быстрее всего взлетел TensorRT-LLM.
  • Важно обслуживать модель и на Hopper (H100), и на Blackwell (B200) для широкой доступности и максимальной скорости.
  • Гибкость рантайма позволяет быстро переключать инструменты и обновлять матрицу поддержки.

Шаг 2: Исправление багов совместимости

  • Новые архитектуры приводят к тонким несовместимостям; GPT OSS добавил, например, Harmony — новый формат ответов.
  • Итеративно чиним и валидируем на скорость и корректность; по возможности контрибутим обратно в open source.
  • Благодаря сообществу есть несколько отличных путей запуска GPT OSS, проблемы быстро выявляются и чинятся.

Шаг 3: Оптимизация конфигурации

  • Хотя GPT OSS 120B можно запустить на одном H100, оптимально масштабировать на 4–8 GPU для лучшей латентности/throughput.
  • Рассмотрены два подхода параллелизма для MoE: тензорный и экспертный. Тензорный даёт меньшую задержку, экспертный — выше системную пропускную способность. Мы выбрали тензорный, так как приоритет — латентность.
  • Приняли MoE Backend в TensorRT-LLM (поддерживается на Blackwell, не на Hopper), который добавляет более быстрые CUDA-ядра и превосходит предыдущие решения.

by philipkiely • 07 августа 2025 г. в 02:28 • 217 points

ОригиналHN

#blackwell#gpt-oss-120b#hopper#llama#nvidia#nvidia-dynamo#ollama#sglang#tensorrt-llm#vllm

Комментарии (151)

  • Обсуждение крутится вокруг запуска и производительности GPT-OSS (20B/120B) на разном железе: от MacBook M-серии и RTX 4090/3050 до датацентровых H100/Blackwell и даже CPU.
  • Многие отмечают, что скорость хороша при малых контекстах; при >10k токенов начинается существенная деградация скорости и рост задержек, особенно без MCP/веб-доступа.
  • TensorRT-LLM часто даёт лучшую латентность/пропускную способность, но сложен в настройке; альтернативы вроде vLLM/SGLang проще, Llama/Оllama позволяют быстро поднять 20B локально и даже распределить по старым GPU.
  • Идут споры о “доступности” H100: купить дорого, но аренда широко доступна и выгоднее для нерегулярных нагрузок; при этом Blackwell с FP4 обещает ещё больший буст, в экосистеме Rust добавляют FP8/FP4.
  • Пользователи спрашивают про требования к VRAM, практичную локальную агентную разработку на потребительских GPU, и оптимальные настройки на Mac (например, iogpu.wired_limit_mb).
  • Обсуждают техники ускорения (спекулятивное декодирование — вызывающее вопросы пользы), причины падения токен/с при длинных диалогах, и различие prefill vs decode по узким местам.
  • Наряду с похвалами скорости есть критика: сложность стеков, неточности/галлюцинации ответов, «извиняльный» контент, и вопрос — зачем OpenAI выпускает OSS-модели и как это соотносится с доступностью железа.