Hacker News Digest

Тег: #gpu

Постов: 29

Paint.net 5.2 alpha now runs on Linux (forums.paint.net)

Paint.NET 5.2 Alpha (build 9739) представляет собой значительный шаг в развитии популярного редактора изображений, включающий оптимизацию производительности и улучшения в интерфейсе. Основное внимание уделено стабильности и отзывчивости — особенно при работе с большими файлами и сложными слоями. Внедрена новая система рендеринга, основанная на GPU, что ускоряет масштабирование, вращение и применение фильтров в реальном времени. Также обновлён интерфейс: улучшена читаемость, переработаны панели инструментов и добавлена поддержка темной темы по умолчанию.

Разработчик Rick Brewster подчеркивает, что это промежуточная версия для тестирования, и призывает пользователей сообщать о багах. В частности, исправлены утечки памяти в плагинах и улучшена совместимость с высокодетализированными дисплеями (4K+). Новая версия также включает экспериментальную поддержку OpenEXR для профессиональной работы с HDR-изображениями. Хотя функционал пока не завершён, альфа-версия уже демонстрирует потенциал для замены некоторых профессиональных инструментов в среднем сегменте.

by judah • 02 сентября 2026 г. в 17:18 • 188 points

ОригиналHN

#gpu#linux#openexr#paint.net#rick-brewster

Комментарии (143)

Paint.net более 16 лет остаётся закрытым проектом, хотя многие ошибочно считают его открытым. Поддержка Linux реализована через Wine, а не нативно; формулировка «работает на Linux» вводит в заблуждение, правильнее — «работает через Wine». Сборка экспериментальная и баговая, полагаться на неё в продакшене не стоит. Запуск стал возможен благодаря переписанному слою Direct2D в Wine, что сняло главный технический барьер прошлых попыток. В сообществе реакция неоднозначная: часть пользователей рада возможности запуска и отмечает удобный UX по сравнению с GIMP и Krita, другие критикуют автора за саму попытку запуска PDN на Linux. На Bluesky спор разделил людей на тех, кто считает критику необоснованной, и тех, кто осуждает автора. Исторически Paint.net до 2007 года был MIT‐лицензированным проектом; закрытие кода произошло после конфликтов из‐за указания авторства. Вместо него рекомендуются открытые альтернативы: Pinta (наследник старого кода Paint.net), Krita (мощнее, но тяжелее) и GIMP (полностью открытый). Оценки стоимости создания открытого клона с помощью LLM — несколько недель работы и подписок — остаются спекуляцией.

GPU World (gpuworld.org) 🔥 Горячее 💬 Длинная дискуссия

К 2040 году каждый человек получит доступ к эквиваленту современного B300 GPU, что позволит запускать передовые LLM вроде Fable или Sol круглосуточно. Это не приведёт к сингулярности — ИИ останется быстрее и дешевле, но не превзойдёт человеческий уровень — однако масштаб доступа изменит всё. Образование станет персонализированным: каждый ребёнок получит бесконечно терпеливого репетитора, способного адаптироваться к его стилю обучения, что особенно преобразит развивающиеся страны, где сегодня не хватает учителей. Здравоохранение получит ИИ-диагностов, способных анализировать симптомы и предлагать лечение на уровне лучших специалистов, снижая смертность в отдалённых регионах. Социальные сети, вероятно, трансформируются: вместо лент новостей и алгоритмов вовлечения появятся ИИ-ассистенты, помогающие фильтровать информацию, вести диалоги и проверять факты — что может уменьшитьpolarisation, но усилить зависимость от посредников в общении. Риск тотального наблюдения реален: если такие системы будут централизованы и контролироваться государствами или корпорациями, каждый получит не только помощника, но и постоянного наблюдателя. Однако децентрализованные модели и локальная обработка на устройствах могут сбалансировать власть. В итоге мир не станет утопией или дистопией — он станет более справедливым в доступе к знаниям и услугам, но потребует новых институтов, этики и регулирования, чтобы мощь ИИ служила людям, а не наоборот.

by simonpure • 01 сентября 2026 г. в 03:16 • 308 points

ОригиналHN

#decentralization#education#ethics#gpu#healthcare#llm#regulation#socialmedia#surveillance

Комментарии (184)

Доступ к мощным GPU не приведёт к социальному прорыву без решения базовых проблем: неравенства в грамотности, энергопотреблении и контроле над технологиями. LLM — не фундаментальная технология вроде интернета или парового двигателя: их применение ограничено из-за неразрешимых проблем с надёжностью, а пользу получают в основном опытные пользователи. Большинство людей не смогут эффективно использовать GPU из-за низкой грамотности и отсутствия технического бэкграунда. Технологии распределяются неравномерно — GPU, как и интернет, будут усиливать существующее неравенство, особенно под контролем крупных корпораций. Глобальная раздача 500-ваттных GPU увеличит энергопотребление более чем вдвое, что физически невозможно без революции в энергетике. Нужна производительность уровня B300 при 1/100 нынешних энергозатрат, иначе мир перегреется. Смартфоны уже содержат GPU, но используются для игр и соцсетей, а не для локальных LLM — инфраструктура пока не развита. Дешевизна и скорость моделей не равны интеллекту: его рост зависит и от архитектурных прорывов, не только от вычислительной мощности. Конкурсы с призами за AI-генерируемые истории — не демократизация, а способ собрать дешёвый обучающий материал для AI-компаний. Требования раскрывать использование LLM бессмысленны: участники не будут раскрывать, а проверка без инструментов невозможна. Будущее — за локальными малыми моделями (Qwen 3.8, Llama 3.1) на специализированных чипах: если они станут быстрее и дешевле, GPU и дата-центры подешевеют, а доступ к ИИ станет массовым без колоссального энергопотребления. Большинство людей не будут использовать ИИ для образования или творчества — они будут смотреть TikTok, играть в Candy Crush и скроллить ленты, как и с телевизором. История показывает: даже при равном доступе к технологиям социальные структуры не меняются. Фантастика (Азимов, Тчайковский) предсказала эти проблемы, но её игнорируют — технологии развиваются без учёта этических и социальных последствий. Производство и распределение чипов уровня B300 к 2040 году требует ресурсов, которые, как еда, вода и образование, распределяются неравномерно.

Why your local LLM feels dumber than it is (forum.level1techs.com) 🔥 Горячее 💬 Длинная дискуссия

Локальный LLM часто кажется «глупым», хотя модель теоретически способна на большее. Причина — различия в реализации вывода: каждый набор железа и программного обеспечения (GPU‑архитектура, драйверы, библиотеки) вычисляет логиты по‑своему, а небольшие отклонения в вероятностях следующего токена приводят к заметно другим результатам.

Ключевой эксперимент сравнил пять вариантов квантования (W8A16, FP8, INT8, AWQ W4A16, NVFP4) на одинаковом наборе весов. Самый «умный» вариант — W8A16 — показал наименьшее количество переключений токенов (≈ 5 % при 88 k контекста), тогда как NVFP4 отставал с ~50 % ошибок. Кроме того, только FP8 и INT8 корректно выполнили цепочку команд Cisco, остальные сгенерировали «show run» вместо правильного «show arp». Эти данные подтверждают, что даже при одинаковых весах результат сильно зависит от выбранного бэкенда и настроек декодера.

Запомните: небольшие изменения в logits → кардинальные различия в поведении; правильный sampler (temp ≈ 1.0, top‑p ≈ 0.95) и совместимый attention‑kernel (например, Triton ATTN) могут вернуть до 50 % точности, а неправильный набор параметров делает модель «глухой».

by felineflock • 22 августа 2026 г. в 18:14 • 392 points

ОригиналHN

#attention#awq#fp8#gpu#int8#logits#nvfp4#quantization#sampler#triton

Комментарии (152)

Тред подтверждает, что качество моделей чаще страдает от ошибок конфигурации, чем от алгоритмов квантования: потеря chat-template в GGUF приводит к молчаливому падению рантайма на ChatML, а агрессивное сжатие KV-cache — к потере логики. Рекомендуется проверять токены шаблона перед обвинением модели. Для сохранения точности избегайте квантования KV-cache — используйте не хуже Q8, жертвуя скоростью. Даже Q4-квантованные модели (например, Qwen 3.8 27B) могут работать на уровне Gemini Flash при мощном железе (RTX 5090, M4 Pro), но стабильность зависит от рантайма. Споры о качестве Qwen 3.8 27B: @tharkun__ успешно использовал её на слабом железе, @velcrovan столкнулся с крахами на M4 Pro. llama.cpp и ik_llama.cpp предотвращают ошибки tool calls за счёт грамматического принуждения — функция недоступна в некоторых рантаймах. Ollama критикуют за недостаточное признание авторов llama.cpp, но остаётся удобным выбором для Windows из-за проблем с VLLM. Дефолтное квантование в популярных рантаймах деградирует логику по сравнению с FP16, особенно на длинных контекстах. Тяжёлые модели (Qwen 3.8 27B/37B) успешно запускаются на локальных GPU (5090, M4 Pro) с высокой скоростью (до 800 TPS на RTX 5090 с ninfer), подтверждая возможность локального инференса.

Cerebras CS-4 (cerebras.ai) 🔥 Горячее 💬 Длинная дискуссия

Cerebras CS-4 — новая rack‑scale система, в которой три ускорителя Wafer‑Scale Engine 3 Turbo (WSE‑3T) работают совместно, обеспечивая до 30‑кратного ускорения вывода по сравнению с GPU‑решениями. Каждый WSE‑3T в два раза быстрее предыдущего поколения, а благодаря новым системам питания, охлаждения и ввода‑вывода производительность на один чип возрастает в 10 раз при том же энергопотреблении.

Ключевые цифры: до 1 000 токенов / сек на моделях > 10 трлн параметров, 30‑кратное ускорение вывода, 10‑кратное увеличение пропускной способности на ватт, а latency между воркерами сокращена до 2 мкс, что делает интерактивный декодинг возможным даже при десятках триллионов параметров. Архитектура Nexus разделяет стационарную инфраструктуру (питание, охлаждение, сеть) от модульных вычислительных «бэкендов», позволяя развернуть систему за часы вместо дней.

Запомните: CS‑4 — первый в мире ускоритель, способный обслуживать гигантские модели в реальном времени, при этом потребляя в 2‑3 раза меньше энергии на токен, чем традиционные GPU‑кластеры.

by sunils34 • 19 августа 2026 г. в 00:28 • 396 points

ОригиналHN

#cerebras#cs-4#energy-efficiency#gpu#high-performance-computing#latency#model-inference#rack-scale-system#token#wafer-scale-engine

Комментарии (237)

Cerebras CS-4 — нишевое решение для инференса с высокой стоимостью и энергопотреблением (162 кВт), не предназначенное для массового рынка. Его 2x ускорение по сравнению с Groqvidia недостаточно для массового перехода, а заявления о 30x превосходстве над GPU неполны — не указаны модели, количество, цена и энергопотребление GPU. Десктопная версия невозможна: загрузка модели в SRAM стоит ~$100K. Система рискованна для критических нагрузок — при потере питания WSE-3T становится бесполезной. Cerebras работает с корпоративными клиентами, используя open-weight модели, что отражает бизнес-модель, а не технологическое лидерство. Отсутствие SLA на отказоустойчивость усугубляет риски. Эффективность KV-кэширования критична для глубоких контекстов — иначе задержки становятся неприемлемыми. Инференс на Cerebras не означает превосходства над GPT-5.6: параметры модели и производительность инференса — разные вещи. OpenAI и Anthropic должны приобрести Cerebras, чтобы создать аппаратный барьер, как Google и Apple; AMD могла бы выиграть от покупки, чтобы оспорить монополию Nvidia. Аппаратная оптимизация для LLM только начинается — в ближайшие 5–10 лет ожидается экспоненциальный рост эффективности железа и ПО, снижающий зависимость от GPU. Критика маркетингового стиля («path to deploy») не делает продукт хуже — это человеческая работа, а не LLM.

Linux 7.3 improves performance when running out of vRAM (pixelcluster.dev) 🔥 Горячее 💬 Длинная дискуссия

Игра, превышающая доступный объём видеопамяти, не обречена на крах — главное ограничение — производительность, а не стабильность. При нехватке VRAM данные выгружаются в системную оперативку, а доступ к ней через PCIe‑4.0x16 (≈ 32 ГБ/с) ограничивает пропускную способность до ~1 ГБ за кадр, что делает невозможным удержание 30 fps, если требуется больше.

Ключевой нюанс — не все обращения одинаковы: небольшие буферы команд и часто используемые данные могут оставаться в CPU‑памяти без катастрофических потерь, особенно если они умеют кэшироваться. Поэтому оптимизация доступа и более тесное взаимодействие драйвера с приложением позволяют смягчить удар по FPS, делая «переполнение» VRAM менее болезненным.

by flaburgan • 18 августа 2026 г. в 07:51 • 441 points

ОригиналHN

#gpu#kernel#linux#memory#overcommit#pcie-4.0x16#performance#vram

Комментарии (197)

Обсуждение смещает фокус с производительности на стабильность при нехватке RAM/VRAM. Пользователи отмечают критические различия в работе драйверов NVIDIA и AMD под Wayland: старые NVIDIA (750 Ti) вызывают краши композиторов при исчерпании VRAM, тогда как AMD (RX 480) бесшовно выгружает в системную память. Проблемы с утечками и стабильностью под Wayland/Vulkan сохраняются и на новых NVIDIA (2080). Для предотвращения зависаний рекомендуют systemd-oomd или Magic SysRq 'f'. Спор о том, какая ОС лучше справляется с нехваткой памяти: @krisknez утверждает, что Windows не фризит, но @alightsoul и @qwertox опровергают — Windows также зависает при активном swap или ресурсоёмких браузерах (Chromium); @adrian_b считает, что отказ от swap в Linux решает проблему. Поведение macOS неоднозначно: @inventor7777 отмечает сохранение отзывчивости (Ctrl+C работает) на M4 Max даже с артефактами, @LoganDark — сильную деградацию и необходимость перезагрузки после загрузки LLM. Улучшения Linux 7.3 менее значимы для LLM inference, чем для игр — в играх паттерны использования VRAM менее предсказуемы и требуют сложного управления памятью. Рекомендация: выделять 32 ГБ swap на быстрых SSD для комфортной работы с ВМ и тяжёлыми процессами. В Ubuntu 24 OOM-killer по умолчанию часто убивает Firefox, даже если память потребляют другие процессы — вызывает раздражение.

Auto-research with codex: How I achieved a 232x Faster Kernel (sankalp.bearblog.dev) 🔥 Горячее

Главная идея: автогенерация кода для QR‑разложения через блоковый алгоритм Хоусакера ускоряет вычисления в 232 раз по сравнению с базовым решением.

Ключевой факт: использование «кода‑максимизации» (Codex‑maxxing) позволило сгенерировать ядро, которое работает в FP16, но сохраняет FP32‑точность проверок.

Для ускорения важно разбивать матрицу на блоки, применять параллельный Householder‑алгоритм и постоянно генерировать новые варианты кода, отсекая те, что не дают прироста.

Оптимальная стратегия включает:

  • небольшие предварительные ядра, которые быстро тестируются;
  • итеративное улучшение через мутацию и отбор;
  • внедрение идеи разнообразия (idea diversity) для выхода из локальных максимумов.

Эти приёмы сделали возможным достижение рекордного ускорения в конкурсе GPU‑режима.

by tosh • 15 августа 2026 г. в 11:00 • 395 points

ОригиналHN

#codex#fp16#gpu#householder#parallel-computing

Комментарии (86)

LLM-агенты эффективно оптимизируют код (в 2–8 раз быстрее), генерируя SIMD/AVX/CUDA ядра, при наличии строгих верификаторов и профайлеров (VTune, NSIGHT) в цикле benchmark → profile → verify. Без автоматической проверки pass/fail агенты не могут корректно оценить ошибки и завершают задачу ложно успешно. GPU-ядра хорошо поддаются автоматизации благодаря легко проверяемой корректности и «hill-climbable» структуре. Однако генерируемый код часто чрезмерно узкоспециализирован: 8 из 10 топ-решений в соревнованиях ломались на OOD-данных, требуя ручной доработки экспертов. Гипероптимизация ошибочно сужает задачу, тогда как истинная оптимизация требует понимания памяти или параллелизма. LLM превосходят большинство людей, но редко достигают абсолютного пика, достигаемого экспертами после глубокой ручной доработки. Советуют: сначала генерировать unit-тесты с 100% path coverage и golden values, затем оптимизировать с анализом flamegraphs. Использовать итеративный подход (back and forth) через SKILL.md, а не one-shot. LLM склонны к излишней сложности при недостатке данных — например, Opus 5 сгенерировал сложную размотку цикла, пропустив простое решение. «Loop engineering» с LLM может быть сложнее ручной оптимизации из-за галлюцинаций. Технический контекст: Cholesky быстрее, но применим только к положительно определённым матрицам; QR универсален и необходим для собственных значений — это объясняет выбор в статье.

Muse Code and Muse Spark 1.2 (research.meta.ai) 🔥 Горячее 💬 Длинная дискуссия

Muse Code — бета‑агент для терминала, работающий на новой модели Muse Spark 1.2. Он умеет планировать изменения, писать и проверять код в больших репозиториях, используя несколько постоянных подагентов, которые остаются активными в течение всей сессии. Это позволяет сократить задержки и избежать повторного сбора информации, а благодаря локальному событию‑логу каждый шаг можно воспроизвести после сбоя.

Muse Spark 1.2 — улучшенная версия модели, обученная на значительно большем объёме кода и более разнообразных сценариев. Она лучше справляется с генерацией целых репозиториев, автогенерацией тестов и длительными задачами, а также проходит «самообучение»: генерирует сложные задачи, оценивает решения и использует полученные данные для дальнейшего дообучения. В тестах на оптимизацию GPU‑ядер модель достигла заметных ускорений, применяя специализированные схемы фьюзии и тайлинга, что подтверждает её способность к длительным, многошаговым улучшениям.

by paulkrush • 05 августа 2026 г. в 19:15 • 267 points

ОригиналHN

#gpu#meta#muse-code#muse-spark#self-training

Комментарии (167)

Пользователи обсуждают потенциал и ограничения Muse Code и Muse Spark 1.2, выражая скептицизм по поводу их качества, безопасности и маркетинговых заявлений Meta. Отмечаются риски: отсутствие открытых весов, возможная утечка данных, неясные условия использования и политика конфиденциальности. Сравниваются с Claude Code, OpenAI’s Terra и DeepSeek V4 Flash — споры идут о достоверности таких сравнений и соотношении цены и возможностей. В целом, модель признаётся перспективной, но требующей дальнейшей проверки и улучшения. Рекомендуется использовать с осторожностью.

DeepSeek V4 Flash on a Single AMD MI300X (github.com) 🔥 Горячее

Главная идея — первый рабочий запуск DeepSeek‑V4‑Flash‑0731 на одной видеокарте AMD MI300X без дополнительной квантовки или оффлоу. Модель полностью помещается в 156,7 GiB HBM3, а благодаря 192 GiB памяти и 5,3 TB/s пропускной способности достигается пропускная способность до ≈ 8 K токенов/сек при предзаполнении и 168,6 токенов/сек в медиане однопоточного декодирования. При 8‑х одновременных потоках суммарный вывод достигает 542 токенов/сек, а пиковый 64‑потоковый баст‑запрос укладывается в 830 токенов/сек без OOM и ошибок движка. Контекст поддерживается до 256 K токенов (архитектура теоретически позволяет 1 M).

Ключевые факты, которые стоит запомнить:

  • 156,7 GiB весов — полностью в HBM, без offload‑квантовки;
  • ≈ 8 K tok/s предзаполнение (6 988–7 019 tok/s в продакшн‑профиле);
  • 542 tok/s суммарный вывод при 8‑х потоках, 830 tok/s при 64‑потоковом басте;
  • Исправления касаются FP8‑формата MI300X, MoE‑маршрутизации, CPU‑KV синхронизации и специфичных ядер ROCm.

Эти детали позволяют использовать MI300X как дешевый (в 2–3 раза) альтернативный вариант к NVIDIA‑решениям для тяжёлых LLM‑задач.

by zhoutong • 04 августа 2026 г. в 10:00 • 347 points

ОригиналHN

#amd#deepseek#fp8#gpu#hbm3#llm#mi300x#moe#rocm#token-throughput

Комментарии (87)

DeepSeek V4 Flash можно запускать на AMD MI300X, но с ограничением контекстного окна с 1M до 256k — по опыту @monster_truck, это не снижает качество. @Tepix считает MI300X неподходящей как OAM-модуль, но @WhitneyLand отмечает, что модель работает, хоть и с ограничениями. MI350P — альтернатива с 144GB памяти, но меньшей, чем у MI300X. @fergusfinn советует использовать MI300X с высоким HBM и делится опытом работы с 2xMI300X. Производительность MI300X всё ещё ниже, чем у H800 (15k токенов/сек).

A walk through of the DeltaNet family of linear attention variants (blog.doubleword.ai) 🔥 Горячее

В статье показано, как простые предположения о скрытом состоянии приводят к формуле линейного внимания, известной как Kimi Delta Attention (KDA), которая вытекает из семейства DeltaNet и используется в моделях Qwen и Kimi. Ключевой приём — заменить softmax на умножение на деградирующие матрицы и добавить корректирующий вектор ошибки, что позволяет обновлять состояние рекуррентно и хранить лишь текущий стейт. При этом запросы масштабируются по (d_k^{-1/2}), а ключи нормализованы, чтобы их внутреннее произведение оставалось в пределах одного скаляра. Такой подход превращает квадратичную зависимость от длины последовательности в линейную, а также делает возможным кэширование ключей и значений без роста памяти.

В результате получаем O(1) память и возможность обрабатывать запросы за константное время, а также β‑параметр, задающий экспоненциальный спад, который делает внимание устойчивым к очень длинным контекстам. Реализация KDA в Triton использует кусочные схемы: внутри чанка вычисляются диагональные взаимодействия, а между ними решается триангулярная система, что позволяет параллелить расчёты на GPU. Такой подход лежит в основе эффективного прямого прохода, используемого в последних версиях Qwen и Kimi, и демонстрирует, как простая идея о скрытом состоянии может породить мощный линейный механизм внимания.

by AnhTho_FR • 28 июля 2026 г. в 16:02 • 251 points

ОригиналHN

#deltaattention#deltanet#gpu#kimi#linearattention#memory#o1#qwen#triton

Комментарии (106)

Тред обсуждает сложность и интуитивность математической нотации в статье, а также доступность понимания машинного обучения и линейного внимания. Многие находят нотацию запутанной, но некоторые — полезной и ясной. Пользователи делятся трудностями в освоении темы, предлагают ресурсы и примеры, выражают благодарность за обмен опытом. Споры идут о степени сложности разработки линейного внимания и Kimi Delta Attention: одни считают их несложными, другие — требующими глубоких знаний. Некоторые сомневаются в их новизне, называя их комбинацией существующих идей. @dr_kretyn рекомендует bra-ket нотацию как более интуитивную, особенно для физиков.

Nvidia, CoreWeave, and Nebius: Inside the Circular Financing of the GPU Boom (io-fund.com) 🔥 Горячее

Неoclouds — компании, предоставляющие быстрый доступ к последним GPU, — взрывают рынок ИИ‑инфраструктуры, но их финансовая модель выглядит подозрительно циркулярной. CoreWeave и Nebius заключили контракты на суммарные 3,5 ГВт мощности, из которых лишь часть уже работает: к концу 2026 года CoreWeave планирует запустить 1,7 ГВт, а Nebius — от 800 МВт до 1 ГВт. Эти мощности критичны, потому что ограниченный энергопоток тормозит расширение дата‑центров, однако их использование требует огромных капиталовложений и приводит к росту долгов, тогда как прибыльность пока отстаёт.

Ключевой механизм поддержки — «круговое финансирование»: Nvidia вкладывает средства в эти стартапы и обеспечивает финансовый фонд, позволяя им перераспределять затраты на операционные расходы гипермасштабных клиентов, которые стремятся вывести капитальные расходы в операционные. Такой подход ускоряет рост, но поднимает вопросы устойчивости, когда макроэкономика сжимает доступ к дешёвой кредитной линии. В итоге neoclouds могут стать драйверами GPU‑бума, но их финансовый фундамент остаётся хрупким.

by adletbalzhanov • 11 июля 2026 г. в 17:21 • 273 points

ОригиналHN

#cloud#coreweave#financing#gpu#infrastructure#llm#nebius#nvidia

Комментарии (110)

  • Инвестиции Nvidia в CoreWeave составляют лишь 5–6 % от годового капитального расхода компании, поэтому «круговой» характер финансирования спорен.
  • Круговое финансирование подразумевает, что полученные средства используют для покупки GPU у Nvidia, что позволяет компаниям брать новые кредиты под те же активы.
  • Некоторые считают, что такой подход создаёт финансовую «домик‑карты», способную обрушить экономику при массовом банкротстве.
  • Другие отмечают, что реальная проблема — экономическая целесообразность использования дорогостоящего оборудования и потенциальный рост избыточной ёмкости.

TPUs vs. GPUs and why Google is positioned to win AI race in the long term (uncoveralpha.com) 🔥 Горячее 💬 Длинная дискуссия

Google TPU возник в 2013 году из расчёта: если каждый пользователь Android задействует voice search по 3 минуты в день, компании придётся удвоить мощности дата-центров. Стандартные CPU и GPU не справлялись с матричной математикой глубокого обучения, поэтому Google создал ASIC для TensorFlow. Проект прошёл от концепта до деплоя за 15 месяцев (2013–2014), к 2015 TPU уже ускоряли Maps, Photos и Translate, а в 2016 их анонсировали на I/O.

В отличие от универсальных GPU с «багажом» (кеширование, ветвления, текстуры), TPU — доменно-специфичный чип с systolic array: данные (веса) загружаются раз, проходят через сетку умножителей без возврата в память, минимизируя Von Neumann bottleneck и HBM-доступы. Новый Ironwood усилил SparseCore для эмбеддингов (рекомендации, LLM) и расширил HBM. TPU — ключевое преимущество Google Cloud на 10 лет, с фокусом на inference; обсуждаются производство, сравнения с GPU и влияние Gemini 3.

by vegasbrianc • 27 ноября 2025 г. в 13:28 • 354 points

ОригиналHN

#cuda#google#google-cloud#gpu#jax#llm#nvidia#tensorflow#tpu

Комментарии (260)

  • Google's TPUs лидируют в эффективности inference и масштабе благодаря systolic array, OCS interconnects и низкой стоимости эксплуатации по сравнению с Nvidia GPUs.
  • Скепсис по поводу исполнения Google: слабая экосистема (JAX/TF vs CUDA), история провалов продуктов и зависимость от ad-бизнеса.
  • Nvidia доминирует за счёт универсальности, CUDA и оптимизаций (NVLink, NVFP4), несмотря на "architectural baggage".
  • Упоминания альтернатив (Groq, Cerebras, Meta покупает TPU) и рисков: новые архитектуры AI могут устареть hardware, фокус на inference vs training.
  • Google имеет ресурсы для доминирования через vertical stack и cloud, но короткий "attention span" вызывает сомнения.

AI's Dial-Up Era (wreflection.com) 🔥 Горячее 💬 Длинная дискуссия

Мы сейчас находимся в "эпоху модема" для искусственного интеллекта, аналогичной раннему интернету 1995 года. Тогда существовало лишь около 2000 сайтов, большинство из которых представляли собой текст на сером фоне, а загрузка изображения занимала минуту. Люди разделились на оптимистов, предсказывавших революционные изменения, и скептиков, называвших интернет временной модой. Сегодня в дебатах об ИИ повторяются те же ошибки: одни предрекают массовую безработицу, другие — автоматизацию всех интеллектуальных задач.

Парадоксально, но ИИ не заменяет специалистов, как предсказывали. Например, радиологи, несмотря на предупреждения Джеффри Хинтона о скорой замене, процветают: в 2025 году количество вакансий достигло рекордных 1208, а средняя зарплата составила $520,000 — на 48% выше, чем в 2015 году. Это показывает, что влияние ИИ будет более избирательным и зависящим от отрасли, чем экстремалистские прогнозы обеих сторон допускают.

by nowflux • 03 ноября 2025 г. в 21:01 • 440 points

ОригиналHN

#agi#artificial-intelligence#cloud-computing#gpu#llm#machine-learning

Комментарии (395)

  • Дискуссия вращается вокруг сравнений «AI-бум ↔ мыльный пузырь» и «AI ↔ золотая лихорадка»; участники спорят, насколько адекватна аналогия с эпохой dial-up и спекулятивным оптимизмом 90-х.
  • Ключевой тезис: «мы строим инфраструктуру, а не продукт» — и это вызывает спор, кто и зачем её строит, и что останется после «холодного душа».
  • Участники обсуждают, что если «пузырь» лопнет, то останутся ли GPU-фермы как остаточная ценность, или же они обесценятся как нефункциональные активы.
  • Поднимается вопрос, что будет, если AGI не появится в ближайшие годы, и как это повлияет на стоимость вычислений и, следовательно, на стоимость токенов.
  • Наконец, обсуждается, что если «пузырь» лопнет, то какие именно активы останутся в руках у инвесторов и как это повлияет на стоимость токенов и, в конечном счете, на стоимость компаний.

Starcloud (blogs.nvidia.com) 💬 Длинная дискуссия

Стартап Starcloud, участник программы NVIDIA Inception, выводит в космос данные центры, обещая десятикратное снижение энергозатрат по сравнению с наземными аналогами. Их первый спутник Starcloud-1 размером с небольшой холодильник будет запущен в ноябре и станет первым в истории космоса, где установят передовой GPU NVIDIA H100. Спутник обеспечит в 100 раз большую вычислительную мощность, чем любые предыдущие космические операции. Компания планирует построить орбитальный дата-центр мощностью 5 гигаватт с солнечными панелями размером примерно 4х4 километра.

В космосе дата-центры смогут использовать вакуум как бесконечный теплоотвод, устраняя необходимость в водяном охлаждении и экономя ресурсы Земли. "В космосе вы получаете почти неограниченную возобновляемую энергию по низкой стоимости", - отмечает сооснователь и CEO Starcloud Филип Джонстон. По его прогнозу, через 10 лет большинство новых дата-центров будут строиться в космосе. Ранние применения включают анализ данных наблюдения Земли для обнаружения пожаров, прогнозирования погоды и реагирования на аварийные сигналы.

by jonbaer • 22 октября 2025 г. в 11:23 • 142 points

ОригиналHN

#data-centers#gpu#nvidia#renewable-energy#satellites#solar-power#space

Комментарии (189)

  • Проект Starline/Nvidia предлагает запускать дата-центры в космосе, что вызывает скепсис из-за проблем с охлаждением, радиацией и стоимостью доставки.
  • Критики указывают, что вместо радиаторов размером с город, проще было бы просто не тратить энергию на обработку и передачу данных.
  • Сомнения вызывает и то, что никакой реальной инфраструктуры для обслуживания таких центров не существует, а также отсутствие ясного плана, как именно они будут запускаться и обслуживаться.
  • Некоторые комментаторы также поднимают вопросы о том, что при нынешнем уровне технологий это может быть просто невозможно.

Alibaba Cloud says it cut Nvidia AI GPU use by 82% with new pooling system (tomshardware.com) 🔥 Горячее 💬 Длинная дискуссия

Alibaba Cloud представила систему объединения вычислительных ресурсов Aegaeon, которая, по их утверждению, позволяет сократить использование графических процессоров Nvidia на 82%. Новая технология способна обслуживать десятки больших языковых моделей, требуя лишь доли GPU, необходимых ранее.

Во время бета-тестирования на платформе Alibaba Cloud Marketplace в течение более трех месяцев количество необходимых Nvidia H20 GPU для работы с моделями до 72 миллиардов параметров сократилось с 1,192 до 213. Исследователи обнаружили, что 17,7% GPU выделялись для обслуживания всего 1,35% запросов, что свидетельствует о значительной неэффективности в работе с одновременными AI-нагрузками.

Работа была представлена на 31-й Симпозиуме по принципам операционных систем (SOSP) в Сеуле. Один из соавторов исследования - главный технолог Alibaba Cloud Чжоу Цзжэньрен. Aegaeon позиционируется как первая работа, раскрывающая чрезмерные затраты на обслуживание одновременных рабочих нагрузок LLM на рынке.

by hd4 • 20 октября 2025 г. в 12:31 • 501 points

ОригиналHN

#alibaba-cloud#cloud-computing#deepseek#gpu#llm#nvidia#qwen

Комментарии (286)

  • Эффективность использования GPU в облаке Alibaba — 17,7 % GPU обрабатывает всего 1,35 % запросов, и вместо 1192 GPU теперь используется 213, что на 82 % меньше.
  • US-ограничения на экспорт чипов в Китай — вынуждают китайские компании к инновациям, что может привести к созданию более эффективных решений, которые в будущем могут быть использованы в других странах.
  • Сравнение моделей — DeepSeek и Qwen от Alibaba Cloud являются наиболее популярными моделями для инференса, в то время как большинство других моделей используются очень редко, что приводит к неэффективному использованию ресурсов.
  • Проблема с лицензиями и открытым исходным кодом — Китайские компании, такие как DeepSeek, начинают отказываться от открытого кода, что может повлиять на развитие AI-сообщества.
  • Стоимость и доступность GPU — NVIDIA стоит дороже, чем в Китае, но в то же время, китайские компании могут разрабатывать более дешевые и эффективные решения, что может привести к снижению цен на GPU в будущем.

When you opened a screen shot of a video in Paint, the video was playing in it (devblogs.microsoft.com) 🔥 Горячее

В старых версиях Windows, включая Windows 98, при захвате скриншота видеофайла и открытии его в Paint происходило удивительное явление: видео продолжало воспроизводиться. Это не магия, а особенность работы устаревших форматов видео и компонентов системы. Формат AVI того времени хранил видео и аудио данные в одном файле без сложного сжатия, что позволяло приложениям вроде Paint, использующим DirectShow, воспроизводить его напрямую из скриншота.

Пользователь вспоминает: "В старой версии Windows (кажется, Win98) если делал скриншот видео, открывал его в Paint, и видео играло!" Это работало из-за того, что Paint мог интерпретировать необработанные видеоданные в файле скриншота. Однако в современных системах это больше невозможно из-за усложнения форматов видео и изоляции приложений. Этот "баг" стал забавной особенностью, демонстрирующей эволюцию мультимедийных возможностей Windows.

by birdculture • 16 октября 2025 г. в 19:57 • 361 points

ОригиналHN

#avi#directshow#drm#gpu#overlay#video#win98#windows

Комментарии (64)

  • Обсуждение началось с воспоминаний о том, как раньше видео отображалось через наложение (overlay), а не через композитинг, и как это влияло на скриншоты и захват видео.
  • Участники вспомнили, что в старых системах цветовая палитра была ограничена, и конкретный цвет использовался как "зеленый экран", потому что видео наложение не могло быть захвачено скриншотом.
  • Были упомянуты такие детали, как то, что в старых версиях Windows и Linux можно было установить видео как фон рабочего стола, и как это использовалось в Winamp и других программах.
  • Также обсуждались сопутствующие темы, такие как то, как DRM может влиять на возможность сделать скриншоты, и как технология наложения используется в современных мобильных GPU для энергосбережения.

iPad Pro with M5 chip (apple.com) 💬 Длинная дискуссия

Новый iPad Pro от Apple оснащён мощнейшим чипом M5, который обеспечивает значительный скачок в производительности искусственного интеллекта. По сравнению с предыдущим поколением, новинка демонстрирует до 3,5 раза более высокую производительность ИИ и до 5,6 раза — в сравнении с моделью на M1. Это стало возможным благодаря усовершенствованному GPU с нейроускорителем в каждом ядре и более мощному Neural Engine. Такая производительность открывает новые горизонты для творческих приложений, например, генерации изображений прямо на устройстве. Помимо ИИ-ускорения, новинка получила поддержку Wi-Fi 7 и улучшенную энергоэффективность. Устройство уже доступно для предзаказа.

by chasingbrains • 15 октября 2025 г. в 13:10 • 176 points

ОригиналHN

#apple#artificial-intelligence#gpu#ipad#m5#wifi-7

Комментарии (210)

  • Основная критика направлена на ограничения iPadOS и App Store, которые мешают использованию планшетов как полноценных рабочих устройств, особенно для профессиональных задач и разработки.
  • Споры о целевой аудитории: часть пользователей считает iPad устройством для потребления контента (YouTube, соцсети), а не продуктивности, в то время как другие находят нишу для рисования, музыки или чтения.
  • Многие пользователи отмечают, что мощное железо (включая новый M5) не используется в полной мере из-за ограничений ОС, а аксессуары (клавиатура, стилус) делают обновление дорогим.
  • Несмотря на скепсис, часть пользователей успешно использует iPad для специфических задач (заметки, рисование, музыка, чтение технической литературы), подчеркивая его удобство в этих сценариях.

Apple M5 chip (apple.com) 🔥 Горячее 💬 Длинная дискуссия

Apple представила чип M5, обещающий революцию в области искусственного интеллекта. Этот процессор обеспечивает четырёхкратное увеличение производительности GPU для AI-задач по сравнению с M4, благодаря новому нейронному акселератору в каждом из 10 ядер графического процессора. Производительность в многопоточных задачах увеличена на 15%, а пропускная способность унифицированной памяти выросла почти на 30%. Новый 16-ядерный Neural Engine работает на 30% быстрее. Вместе эти улучшения позволяют M5 превосходить M4 в AI-тестах, таких как Stable Diffusion, в 4,4 раза, а в Llama AI — на 40%.

Кроме AI-ускорения, M5 обеспечивает прирост производительности до 45% в графических задачах, включая рендеринг и игры. Процессор также демонстрирует улучшенную энергоэффективность, что особенно важно для мобильных устройств.

Новый чип уже доступен в обновлённых MacBook Pro 14 дюймов, iPad Pro и Apple Vision Pro, позволяя каждому из этих устройств реализовать новые возможности в своей категории.

by mihau • 15 октября 2025 г. в 13:02 • 1198 points

ОригиналHN

#5g#apple#gpu#ipad-pro#llm#m5#macbook-pro#neural-engine#ram

Комментарии (1290)

  • Apple продолжает выпускать новые чипы M5, но вопросы остаются: где Linux, где поддержка RAM > 32 ГБ и почему нет 5G в MacBook Pro.
  • Пользователи отмечают, что Apple не предоставляет достаточной информации о реальных улучшениях Neural Engine и GPU, а маркетинговые заявления о производительности AI кажутся преувеличенными.
  • Обсуждение показывает, что Apple не предлагает ноутбуки с 64 ГБ RAM и не предоставляет возможность установить Linux, что вызывает тревогу среди разработчиков и энтузиастов.
  • Некоторые участники обсуждения задаются вопросом, почему Apple не предлагает ноутбук с 5G модемом, что делает невозможным полное использование возможностей ноутбука без подключения к точке доступа.
  • Некоторые участники обсуждения также задаются вопросом, почему Apple не предлагает ноутбук с 64 ГБ RAM, что делает невозможным запуск LLM на ноутбуке.

AMD signs AI chip-supply deal with OpenAI, gives it option to take a 10% stake (reuters.com) 🔥 Горячее 💬 Длинная дискуссия

AMD заключила сделку с OpenAI о поставках чипов для искусственного интеллекта, предоставив также опцион на приобретение 10% доли в компании. Это стратегическое партнёрство усиливает позиции AMD на рынке AI-чипов, где доминирует NVIDIA, и обеспечивает OpenAI доступ к передовым аппаратным решениям для разработки и масштабирования своих моделей.

Опцион на долю демонстрирует глубокую интеграцию интересов: AMD получает ключевого клиента и потенциального инвестора, а OpenAI — влияние на поставщика и приоритетный доступ к технологиям. Это может ускорить инновации в области аппаратного обеспечения для ИИ и снизить зависимость от единственного поставщика.

by chillax • 06 октября 2025 г. в 12:17 • 380 points

ОригиналHN

#amd#cuda#gpu#llm#nvidia#openai

Комментарии (309)

  • AMD предоставила OpenAI опцион на покупку 10% своих акций по цене $0.01 за акцию при выполнении определенных условий
  • Сделка призвана стимулировать OpenAI к закупкам GPU AMD на сумму до $100 млрд и совместной разработке ПО для AI-чипов
  • Рыночная капитализация AMD выросла примерно на $100 млрд после анонса, что частично компенсирует стоимость опциона
  • Многие участники обсуждения расценивают сделку как признак финансового пузыря и циркулярных денежных потоков в AI-индустрии
  • Партнерство рассматривается как стратегический ход для создания альтернативы доминированию NVIDIA и CUDA

Circular Financing: Does Nvidia's $110B Bet Echo the Telecom Bubble? (tomtunguz.com)

Nvidia инвестирует $110 млрд в OpenAI и другие AI-стартапы через венчурное финансирование, что напоминает стратегию Lucent во время пузыря доткомов. Lucent тогда выделила $8,1 млрд клиентам, которые покупали её оборудование, но после краха 47 телеком-компаний обанкротились, а до 80% кредитов не вернулись. Сейчас Nvidia рискует ещё больше: её обязательства составляют 85% выручки против 20% у Lucent, а 39% доходов зависят всего от двух клиентов.

Новизна ситуации в том, что $10+ млрд долгов обеспечены залогом в виде GPU, с предположением, что их стоимость сохранится на 4–6 лет. Крупные облачные провайдеры уже удлинили сроки амортизации оборудования до 6 лет, но Amazon недавно сократил их до 5, что может сигнализировать о переоценке рисков. Если спрос на AI-инфраструктуру замедлится, это может создать цепную реакцию defaults, особенно среди стартапов, зависящих от финансирования поставщиков.

by miltava • 04 октября 2025 г. в 13:06 • 180 points

ОригиналHN

#agi#amazon#cloud-computing#google#gpu#llm#microsoft#nvidia#vendor-financing#venture-capital

Комментарии (147)

  • Сравнение текущей ситуации с пузырем телекоммуникаций 90-х: есть как сходства (масштабные инвестиции в инфраструктуру, риск перепроизводства), так и ключевые различия (финансовая устойчивость Nvidia vs. мошенничество Lucent).
  • Главный риск для Nvidia — возможность резкого падения спроса на GPU, если AGI не будет достигнут в ожидаемые сроки (2-5 лет) или если инвесторы потеряют интерес из-за замедления прогресса.
  • Неопределенность долгосрочного спроса: несмотря на текущий ажиотаж, будущее зависит от появления реальных, прибыльных приложений ИИ, а не только от тренировки моделей; возможен избыток мощностей.
  • Роль крупных игроков (Microsoft, Google, Amazon) и их кастомерных чипов как потенциальная угроза монополии Nvidia, а также вопросы учетной политики и вендорного финансирования.
  • Скептицизм относительно способности ИИ самостоятельно решать сложные задачи и кардинально улучшать код без человеческого контроля, что ставит под вопрос оправданность огромных инвестиций.

Fp8 runs ~100 tflops faster when the kernel name has "cutlass" in it (github.com) 🔥 Горячее

В пул-реквесте к Triton представлена реализация механизма persistent attention для ускорения работы с большими контекстами в трансформерах. Вместо пересчета ключей и значений для каждого токена механизм сохраняет их в глобальной памяти, что значительно снижает вычислительную нагрузку при обработке длинных последовательностей.

Автор демонстрирует, как это позволяет эффективно работать с контекстами до 128K токенов, избегая квадратичной сложности традиционного внимания. Практический вывод: такой подход открывает путь к более масштабным моделям без пропорционального роста затрат на вычисления.

by mmastrac • 03 октября 2025 г. в 04:21 • 321 points

ОригиналHN

#amd#attention-mechanism#cutlass#github#gpu#intel#nvidia#transformers#triton

Комментарии (141)

  • NVIDIA использует хардкод для оптимизации кода, содержащего "cutlass" в названии, что может быть нестабильным и приводить к скрытым багам.
  • Подобные практики (оптимизации по именам функций или приложений) исторически распространены среди производителей железа и софта (ATI/AMD, Intel, Microsoft) для улучшения бенчмарков, иногда в ущерб качеству.
  • Мотивация таких оптимизаций часто не злонамеренна, а связана с снижением рисков и фокусом на стабильности собственных библиотек, но создаёт новые барьеры.
  • В индустрии существуют разногласия по поводу этичности таких практик, но для графических драйверов тюнинг под конкретные игры стал нормой.
  • Обсуждаются проблемы проприетарного кода (драйверы, прошивки) и затраты общества на обратную разработку вместо сотрудничества.

We bought the whole GPU, so we're damn well going to use the whole GPU (hazyresearch.stanford.edu) 🔥 Горячее

Исследователи из Hazy Research разработали высокопроизводительный мегаядро для тензорно-параллельного вывода Llama-70B на H100, которое агрессивно перекрывает вычисления, работу с памятью и коммуникацию между GPU. Это позволяет одновременно задействовать различные аппаратные ресурсы: тензорные ядра, модули для нетензорных операций, пропускную способность HBM и NVLink. В интеграции с движком Tokasaurus их решение превосходит SGLang на >22% по общей пропускной способности при обработке 65 536 промптов из ShareGPT.

Ключевая идея — использование интерпретатора инструкций, работающего на каждом SM, который позволяет гибко планировать выполнение разнородных операций. Это обеспечивает перекрытие на нескольких уровнях: внутри SM (память и вычисления), между SM (матричные умножения и нормирование) и между GPU (скрытие задержек связи за счёт специальных потоков). Особенно отмечается простота реализации сложных трансформаций данных между GPU прямо после attention-слоя, что трудно выразить стандартными средствами коммуникации.

by sydriax • 28 сентября 2025 г. в 21:00 • 470 points

ОригиналHN

#computational-optimization#deep-learning#gpu#gpu-virtualization#hbm#llama#nvidia#nvlink#parallel-computing#tensor-cores

Комментарии (94)

  • Обсуждение эффективности использования GPU: использование всех блоков (NVDEC, NVJPG, RT и тензорные ядра) для декомпрессии весов и вычислений, аналогии с оптимизацией под консоли.
  • Проблемы инструментов и драйверов: отставание языков, библиотек и драйверов от возможностей современного железа, сложности компиляторов для гетерогенных систем.
  • Виртуализация и разделение ресурсов GPU: обсуждение MIG, MPS для многопользовательского использования, риски утечки данных и ограничения этих технологий.
  • Сравнение с другими платформами: упоминание Apple Metal и открытости драйверов, потенциал использования GPU для аудиообработки и сигналов.
  • Критика и ирония: сравнение стиля статьи с "Трансгрессия границ", комментарии о "коде, который не предназначен для поддержки" и неожиданно доступных оптимизациях в крупных лабораториях.

SimpleFold: Folding proteins is simpler than you think (github.com) 🔥 Горячее

Apple выпустила open-source библиотеку ML-SimpleFold для предсказания трёхмерной структуры белков на основе их аминокислотной последовательности. Она использует архитектуру трансформеров и оптимизирована для эффективного обучения и инференса на GPU. Код написан на PyTorch и включает инструменты для подготовки данных, обучения моделей и визуализации результатов.

Библиотека поддерживает предсказание структур как отдельных белков, так и комплексов, с акцентом на скорость и воспроизводимость. Это демонстрирует растущий интерес крупных tech-компаний к computational biology. Практический вывод: инструмент упрощает исследования в биоинформатике, снижая барьер входа для научных групп без мощных вычислительных ресурсов.

by kevlened • 26 сентября 2025 г. в 18:01 • 450 points

ОригиналHN

#alphafold#apple#bioinformatics#esmfold#gpu#knowledge-distillation#machine-learning#protein-folding#pytorch#transformers

Комментарии (126)

  • Представлена упрощенная модель предсказания структуры белков SimpleFold, использующая подход knowledge distillation от сложных моделей (AlphaFold, ESMFold) и демонстрирующая высокую эффективность.
  • Обсуждается, что модель обучалась на данных, сгенерированных другими ИИ-системами, а не на экспериментальных структурах, что поднимает вопросы о её истинной новизне и независимости.
  • Подчеркивается тренд на упрощение архитектур моделей для предсказания folding, следуя "bitter lesson" в ML, и потенциальные выгоды для локального inference на потребительском железе.
  • Участники спорят, является ли проблема folding решенной после AlphaFold, и в чем разница между физическими симуляциями (Folding@Home) и статистическими методами (ИИ).
  • Высказываются предположения о мотивации Apple заниматься этой темой: от престижа и маркетинга до практических целей вроде оптимизации чипов и развития локальных вычислений.

Qwen3-Omni: Native Omni AI model for text, image and video (github.com) 🔥 Горячее

Команда Alibaba Cloud представила Qwen3-Omni — первую в мире модель, способную одновременно обрабатывать текст, аудио, изображения и видео, а также генерировать речь в реальном времени. Она работает как единая end-to-end система, без необходимости разделения задач на отдельные модули, что повышает эффективность и снижает задержки.

Модель поддерживает мультимодальный ввод и вывод, включая распознавание объектов на видео, анализ аудиодорожек и синтез голоса с естественной интонацией. Это открывает возможности для создания более интерактивных приложений, таких как голосовые ассистенты с визуальным контекстом или системы автоматизированного контент-модерации.

by meetpateltech • 22 сентября 2025 г. в 17:50 • 522 points

ОригиналHN

#alibaba-cloud#computer-vision#github#gpu#llm#multimodal-ai#natural-language-processing#real-time-processing#speech-recognition#speech-synthesis

Комментарии (132)

  • Обсуждается мультимодальная модель Qwen3 с поддержкой голосового ввода/вывода, переводом в реальном времени и впечатляющими демонстрациями.
  • Участники отмечают её доступность для локального запуска (70GB весов) и потенциал для интеграции в умный дом и другие приложения.
  • Поднимаются вопросы о производительности на разных языках, "нативной поддержке видео" и сравнении с закрытыми моделями типа Gemini.
  • Высказываются опасения о возможном доминировании Китая на рынке открытых AI-моделей и реакции на это со стороны США.
  • Обсуждаются технические аспекты: необходимое железо (GPU), квантование, портирование на macOS и стоимость использования.

Nvidia buys $5B in Intel (tomshardware.com) 🔥 Горячее 💬 Длинная дискуссия

Nvidia и Intel объявили о совместной разработке процессоров Intel x86 RTX SOC для ПК с графикой Nvidia, а также о создании пользовательских серверных процессоров x86 от Nvidia. В рамках масштабной сделки Nvidia приобрела акции Intel на сумму $5 млрд.

by stycznik • 18 сентября 2025 г. в 11:04 • 936 points

ОригиналHN

#gpu#intel#linux#nvidia#rtx#soc#x86

Комментарии (568)

  • Опасения по поводу негативного влияния на конкуренцию: инвестиции Nvidia могут угрожать развитию графического подразделения Intel (Arc), которое сдерживает цены на GPU и важно для Linux-сообщества.
  • Стратегический интерес Nvidia: сделка может быть направлена на получение доступа к производственным мощностям Intel (фабрикам) и созданию гибридных решений (CPU + GPU), а не на прямую конкуренцию на рынке видеокарт.
  • Политический и экономический контекст: инвестиции могут быть продиктованы желанием правительства США поддержать национального производителя полупроводников и диверсифицировать цепочки поставок.
  • Исторические параллели: сравнение со сделкой Microsoft и Apple в 1997 году, которая спасла последнюю, и надежды на аналогичный положительный исход для Intel.
  • Влияние на архитектуру и рынок: возможный сдвиг в сторону интеграции графики в SoC (системы на кристалле) и потенциальные риски для x86-64 лицензирования Intel.

Are OpenAI and Anthropic losing money on inference? (martinalderson.com) 🔥 Горячее 💬 Длинная дискуссия

  • Тезис: утверждение «OpenAI и Anthropic теряют деньги на инференсе» — сильно преувеличено.
  • Метод: считаем только «сырой» H100-компьют за $2/час, игнорируем всё остальное.
  • Кластер: 72 H100 → $144/час. 8-GPU инстанс × 9 = 288 параллельных запросов.

Пропускная способность

  • Prefill (вход): 1,44 млн токенов/с на инстанс → 46,8 млрд токенов/час.
  • Decode (выход): 1 440 токенов/с на инстанс → 46,7 млн токенов/час.

Цена за токен

  • Вход: $0,003/млн токенов (почти даром).
  • Выход: $3/млн токенов (реальные деньги).

Почему ограничивают контекст

  • При >128 k токенов вычисления становятся compute-bound → цена вырастает 2–10×.
  • Поэтому Claude Code режет контекст до 200 k: дешевле.

Пользовательская экономика

  • ChatGPT Pro $20/мес при 100 k токенов/день: себестоимость ≈ $3/мес → маржа 5–6×.

by martinald • 28 августа 2025 г. в 10:15 • 470 points

ОригиналHN

#anthropic#cloud-computing#gpu#llm#machine-learning#nvidia#openai

Комментарии (438)

  • Математика статьи критикуется: расчёт пропускной способности префилла завышен минимум в 1000 раз, а достигаемая MFU превышает физический предел GPU.
  • Участники соглашаются, что «чистая» инференс-операция, без учёта затрат на обучение, может быть прибыльной: Сам Альтман, данные The Information и Epoch AI указывают на gross margin 50–60 %.
  • Основные оговорки: в расчётах не учтены downtime, кэширование, спекулятивное декодирование, KV-cache, а также различия в эффективности между DeepSeek R1 и закрытыми моделями OpenAI/Anthropic.
  • Некоторые стартапы (Cursor, Perplexity) уже страдают от отрицательной маржи из-за дорогих токенов, что подчеркивает разрыв между «оптовой» и «розничной» экономикой.
  • Общий вывод: инференс в вакууме может быть прибыльным, но полная экономика включает обучение, idle-оборудование и кросс-субсидирование, поэтому точные цифры известны только самим компаниям.

Dissecting the Apple M1 GPU, the end (rosenzweig.io) 🔥 Горячее 💬 Длинная дискуссия

В декабре 2020-го Хектор Мартин запустил Asahi Linux, а я, работая над Panfrost, лишь хотел подсказать. В итоге купил Mac mini и начал реверсить GPU. Через пару недель нарисовал треугольник, потом — компилятор шейдеров, а после сессии за несколько дней поднял OpenGL-драйвер.

Год улучшал драйвер, пока игры не пошли под macOS. Параллельно Asahi Lina писала kernel-драйвер; в декабре 2022-го у нас впервые заработала графика в Linux.

В 2023-м, заканчивая универ, я решил:

  • довести M1-драйвер до ума;
  • сделать полноценный OpenGL 4.6 и Vulkan;
  • запустить Proton-игры.

Через месяц после выпуска — OpenGL 3.1, затем ES 3.1. Добавил эмуляцию geometry/tessellation, в январе 2024-го сдал OpenGL 4.6. Vulkan 1.3 прошёл за пару недель, 1.4 вышел в день публикации спецификации. Karol Herbst добавил OpenCL 3.0. Подключил sparse-текстуры — заработал Direct3D 12 через Proton.

Цели выполнены: драйверы в Mesa, игры идут, миф о несовместимости Vulkan с Apple развеян.

by alsetmusic • 27 августа 2025 г. в 01:44 • 698 points

ОригиналHN

#apple#asahi#gpu#linux#m1#opencl#opengl#opengl-4.6#vulkan#vulkan-1.3

Комментарии (158)

  • Alyssa за 5 лет с нуля довела Vulkan-драйвер для Apple Silicon до upstream, чем вдохновила всё open-source-сообщество.
  • Учёба, работа в Collabora и «хобби»-проект — комментаторы поражаются, как она всё успевала.
  • С августа она в Intel и, судя по резюме, занимается open-source-графикой Xe-HPG.
  • Многие жалеют, что она уходит из Asahi, но считают переход новым вызовом, а не «уходом».
  • Появились вопросы о будущем Asahi на M3/M4 и о том, почему Apple не мешает проекту, в отличие от других.

The issue of anti-cheat on Linux (2024) (tulach.cc) 💬 Длинная дискуссия

Почему античиты не работают в Linux

Доля геймеров на Linux растёт благодаря Steam Deck и надоедливым «фичам» Windows. Однако почти все сетевые хиты с античитом не запускаются или не подключаются к серверам: PUBG, Call of Duty, Rust, R6 Siege, EA FC 24, Destiny 2, Valorant, League of Legends и даже FACEIT/ESEA для CS2.

Как работают читы и античиты

Чит либо внешний процесс, читающий/писующий память игры, либо внедрённая DLL. ОС не даёт процессам трогать чужую память благодаря виртуальному адресному пространству: каждая программа «думает», что владеет всей ОЗУ, а процессор и ядро переводят виртуальные адреса в реальные.

Античиты борются с этим двумя путями:

  1. Пользовательский режим – сканируют память, читают файлы, ловят подозрительные потоки. Легко обойти, если у чита есть root-доступ.
  2. Ядро (kernel) – драйвер внутри ядра Windows имеет полный доступ к железу и памяти, может скрывать свои структуры и блокировать вмешательство. Vanguard, EAC, BattlEye и пр. работают именно так.

Почему это невозможно в Linux

  • Linux — открытая система. Любой может собрать своё ядро, поставить патч, изменить ABI.
  • Античиту нужен стабильный, неизменяемый и закрытый интерфейс ядра. В Linux этого нет: модуль, собранный под 6.9, не загрузится под 6.10, а пользователь может вообще отключить модульные загрузки.
  • Даже если разработчик выпустит проприетарный модуль, сообщество его не примет: безопасность, GPL-лицензия, репутационные риски.
  • Попытки «запечатать» Linux (secure boot + immutable образ) противоречат свободе системы и всё равно не гарантируют, что пользователь не пересоберёт ядро без проверок.

Что можно сделать

  1. Играть в поддерживаемые игры: Apex, Fortnite, CS2, Elden Ring и др. уже работают через Proton.
  2. Двойная загрузка или VFIO-виртуалка – запуск Windows в виртуальной машине с проброской GPU (сложно, но работает).
  3. Облачный гейминг – GeForce NOW, Xbox Cloud и т.д.
  4. Ждать – пока разработчики не придумают античит, который не требует закрытого ядра (маловероятно).

Вывод: пока Linux остаётся открытой системой, современные kernel-level античиты там жить не смогут.

by todsacerdoti • 22 августа 2025 г. в 01:09 • 129 points

ОригиналHN

#anti-cheat#cloud-gaming#gaming#gpu#kernel#linux#proton#secure-boot#virtualization

Комментарии (226)

  • Критики считают, что анти-чит на уровне ядра — это по сути rootkit, который подрывает безопасность и конфиденциальность.
  • Многие предлагают альтернативы: доверительные сообщества, выделенные игровые машины, серверные проверки или облачные платформы.
  • Подчеркивается, что Linux по дизайну даёт пользователю полный контроль, что делает невозможным эффективный, но инвазивный анти-чит.
  • Некоторые игроки готовы пожертвовать безопасностью ради «честной» игры, но большинство участников обсуждения считают такой обмен неприемлемым.

How to Think About GPUs (jax-ml.github.io) 🔥 Горячее

Что такое GPU
Современная ML-GPU (H100/B200) — это ~100–150 независимых вычислительных блоков (SM), каждый из которых содержит матричное ядро Tensor Core, векторные ALU (CUDA-ядра) и 256 КБ кэш SMEM. Все SM делят общий L2 и HBM3-память. SM разбит на 4 подблока; каждый подблок выполняет 32 SIMD-операции за такт. GPU-ядро менее мощное, чем TPU TensorCore, но их много, поэтому общая гибкость выше.

Память
H100: 80 ГБ HBM3, 3 ТБ/с. B200: 192 ГБ, 8 ТБ/с. L2 кэш 50 МБ (H100) / 128 МБ (B200). SMEM даёт 256 КБ на SM.

GPU vs TPU на уровне чипа
TPU: 1–2 больших MXU, жёсткая синхронизация, векторная часть слабее. GPU: 100+ мелких ядер, независимые SM, но общий L2 ограничивает масштаб. GPU лучше для разнородных задач, TPU — для чистых матмул.

Сеть внутри узла
Узел = 8 GPU + 2 CPU. GPU соединены NVLink/NVSwitch (900 ГБ/с между любыми двумя). CPU-GPU идут через PCIe 5.0 (64 ГБ/с). NVSwitch-кроссбар внутри узла = полносвязная сеть.

Сеть за пределами узла
InfiniBand HDR/NDR (до 400 Гб/с) или Ethernet RoCE. GPUDirect RDMA позволяет GPU читать/писать память соседнего узла без участия CPU.

Коллективные операции
Intra-node: NCCL использует NVLink; all-reduce 8×H100 за ~3 мкс.
Cross-node: кольцо IB + NVLink; latency ~10 мкс, bandwidth лимит IB.

Roofline-модель для LLM

  • Data Parallelism: ограничен IB; эффективен при малых моделях.
  • Tensor Parallelism: ограничен NVLink; лучше внутри узла.
  • Expert/ Pipeline Parallelism: комбинируем; pipeline глубже → меньше bubble, но больше весов на каждом GPU.
  • TLDR: держи параллелизм так, чтобы IB не стал bottleneck; используй NVLink для tensor-parallel, IB для data-parallel.

Итого
GPU — это масса мелких, независимых SM, связанных быстрым NVLink внутри узла и медленным IB между узлами. Для LLM выбирай параллелизм, который минимизирует IB-трафик и максимально использует NVLink.

by alphabetting • 18 августа 2025 г. в 18:18 • 354 points

ОригиналHN

#cuda#gpu#infiniband#machine-learning#nvidia#nvlink#parallel-computing#roce#tpu

Комментарии (107)

  • Критика точности: документация местами неточна, особенно в определении «CUDA-core».
  • Открытость и вендор-лок: ряд участников считают инвестиции в проприетарную экосистему NVIDIA рискованной ставкой.
  • Ошибка в расчётах: Quiz 2 преувеличивает пропускную способность; реальные 3,2 ТБ/с ограничены портами NIC.
  • Похвала и польза: серия всё же хорошо объясняет принципы параллелизма, применимые и к другим устройствам.
  • Сравнение TPU и GPU: TPU проще масштабировать, но закрыт для продажи; GPU NVIDIA гибче, но сложнее в программировании.
  • Дефицит официальных данных: NVIDIA не раскрывает полную архитектуру, поэтому полезные модели приходится собирать из сторонних источников.

PCIe 8.0 announced by the PCI-Sig will double throughput again (servethehome.com) 💬 Длинная дискуссия

PCI-SIG анонсировала PCIe 8.0

  • Пропускная способность вдвое выше PCIe 7.0: до 256 ГТ/с на линию.
  • Технология: PAM4, 32 ГТ/с, 0,5 В амплитуда, < 1 Вт/лейн энергопотребление.
  • Обратная совместимость с предыдущими поколениями.
  • Спецификация выйдет в 2027 г., первые продукты — 2028–2029 гг.
  • Цели: ИИ-акселераторы, HPC, NVMe-накопители, 800 Гбит/с сети.

by rbanffy • 09 августа 2025 г. в 22:41 • 160 points

ОригиналHN

#cpu#datacenters#gpu#hpc#llm#nvme#pam4#pci-express#pci-sig#ram

Комментарии (188)

  • Кто-то предлагает «перевернуть» архитектуру: пусть GPU-PCB станет материнской платой, а CPU с памятью встаёт в PCIe-слот.
  • Обсуждают, что PCIe-спецификация всегда на три поколения впереди реальных продуктов: сейчас в работе уже Gen 8.
  • Пользователи жалуются на нехватку линий PCIe в десктопах и мечтают о GPU-сокете с собственными слотами RAM.
  • EE и другие специалисты считают это скорее проблемой экосистемы и совместимости, чем чисто инженерной.
  • Упоминают, что в дата-центрах (DGX, DPU, NVMe-«без-сервера») похожая идея уже реализована.