Hacker News Digest

Тег: #cuda

Постов: 6

Geolocating a random island using geometry and CUDA programming (yassa9.github.io) 🔥 Горячее

Главная идея – выявление острова по геометрии трёх земельных объектов на снимке. Сначала определяют координаты трёх точек (остров, правый и левый островки) через GUI‑кликер, затем сравнивают их форму с реальными полигонами земельного покрытия, отфильтровав всё, что не подходит по широте, плотности и кластеру.

Ключевые факты

  • В снимке видны три земные массы: P0 – сам остров, P1 – правый островок, P2 – левый передний с горой.
  • При поиске использованы глобальные полигоны land‑polygons‑split‑4326 (≈ 882 МБ), отфильтрованы по тропикам (‑30° ≤ широта ≤ 30°), затем отсеяны участки с более чем 10 соседями в 5 км и оставлены только кластеры из минимум трёх точек на расстоянии ≤ 20 км.
  • Последний оставшийся полигон совпадает с островом Oan (остров в Палау), координаты ≈ 7° 21′ 48.4″ N, 151° 45′ 20.7″ E (7.363444, 151.755750).
  • На снимке камера смотрит на север‑запад (θ ≈ 325°), что подтверждается вычислением азимута между P0 и P1.

Запомните: тропический диапазон, ограничение по количеству близких соседей и поиск кластеров из трёх близких точек – это то, что превращает геометрию фото в реальное место.

by yassa9 • 19 августа 2026 г. в 12:19 • 308 points

ОригиналHN

#azimuth#clustering#cuda#geolocation#geometry#land-polygons-split-4326

Комментарии (55)

Метод геолокации по топографии (TERCOM) — проверенная военная технология с 1960-х годов, независимая от RF-помех, позже использованная NASA JPL для точной посадки Mars 2020. Аналогичные подходы terrain matching применяются в критически важных системах. OpenStreetMap ценен для OSINT-геолокации в населённых зонах благодаря детализации объектов. Геолокация без GPS возможна через анализ визуальных паттернов ландшафта — как в Geoguessing, где эксперты опираются на данные Google Earth. Современные системы, включая Palantir, вероятно, используют не только геометрическое сопоставление, но и модели компьютерного зрения, обученные на миллиардах геолокированных изображений. Для повышения точности требуется доработка фильтра «eyeball halo»: текущие топ-кандидаты не проходят визуальную проверку. Учёт приливов важен — они могут искажать контуры островов, что не учитывалось в статье. Технология — не новинка, а эволюция старых решений, демонстрирующая, как ограничения прошлого порождали надёжные инженерные подходы. Использование CUDA и геометрического анализа позволяет воссоздать ручные методы с помощью современных вычислений. Споры возникли вокруг иронии публикации метода после статьи о предотвращении технологий для полицейского государства — некоторые считают, что любая технология может быть использована в таких целях. Также есть сомнения в аутентичности кода: комментаторы предполагают его генерацию LLM, несмотря на заявление автора, поскольку стиль не соответствует Pangram. Использование визуальных паттернов и карт для геолокации — это не только технический приём, но и форма цифрового любопытства, вдохновляющая на изучение географии и программирования.

Bonsai 27B: A 27B-Class model that runs on a phone (prismml.com) 🔥 Горячее 💬 Длинная дискуссия

Сегодня анонсирован Bonsai 27B — модель на 27 млрд параметров, основанная на Qwen3.6 27B, впервые способная полностью работать на смартфоне. Существует две версии: трёночная (ternary) с весами {−1,0,+1} и 1‑битовая, использующие групповой масштабирование FP16. Трёночная модель занимает 5,9 ГБ, 1‑битовая — 3,9 ГБ и помещается в память iPhone 17 Pro, при этом сохраняет весь набор функций: мультишаговое рассуждение, вызов инструментов, агентные циклы и мультимодальный vision‑токен. Оба варианта поддерживают 262 K‑токенный контекст, спекулятивное декодирование и полностью работают в низкой точности без перехода в более высокие форматы.

По оценкам на 15‑балльном наборе тестов, включая математику, программирование, вызовы инструментов и визуальные задачи, трёночная версия удерживает 95 % точности полной модели, а 1‑битовая — 90 %. Показатель «интеллектуальной плотности» достигает 0,53 единиц на гигабайт, в 10 раз превышая полноразрядный аналог и в 2,7 раза лучше лучших традиционных низко‑битовых схем. 1‑битовый вариант почти не отстаёт от полной версии в задачах рассуждения и кодирования, а его память в 2,5 раза меньше, чем у самых агрессивных обычных низко‑битовых построек. Весь набор весов доступен по лицензии Apache 2.0, поддерживается MLX на Apple‑устройствах и CUDA на NVIDIA‑GPU, а бесплатный API‑превью уже открыт для разработчиков.

by xenova • 14 июля 2026 г. в 17:50 • 616 points

ОригиналHN

#apache-2.0#apple#bonsai-27b#cuda#hugging-face#iphone#mlx#nvidia#python#qwen3.6-27b

Комментарии (215)

  • Bonsai 27B с квантованием до 1–1.58 бит показывает впечатляющую производительность на CPU и мобильных устройствах, конкурируя с более крупными моделями.
  • Пользователи отмечают значительное падение в задачах вызова инструментов и странности в ответах (например, неверные макронутриенты), что ставит под сомнение практическую надёжность.
  • Инфраструктура для инференса на CPU (llama.cpp, bitnet.cpp) пока не оптимизирована для тернарных моделей, что снижает скорость по сравнению с Q4-квантованными аналогами.
  • Мнения разделились: одни видят в этом сдвиг парадигмы к локальным ИИ, другие считают результаты переоценёнными или искусственными, особенно из-за сильного квантования.
  • Открытые модели доступны на Hugging Face, но многие инструменты (LM Studio, Ollama) пока не поддерживают их, требуя обновлений или кастомных сборок.

TPUs vs. GPUs and why Google is positioned to win AI race in the long term (uncoveralpha.com) 🔥 Горячее 💬 Длинная дискуссия

Google TPU возник в 2013 году из расчёта: если каждый пользователь Android задействует voice search по 3 минуты в день, компании придётся удвоить мощности дата-центров. Стандартные CPU и GPU не справлялись с матричной математикой глубокого обучения, поэтому Google создал ASIC для TensorFlow. Проект прошёл от концепта до деплоя за 15 месяцев (2013–2014), к 2015 TPU уже ускоряли Maps, Photos и Translate, а в 2016 их анонсировали на I/O.

В отличие от универсальных GPU с «багажом» (кеширование, ветвления, текстуры), TPU — доменно-специфичный чип с systolic array: данные (веса) загружаются раз, проходят через сетку умножителей без возврата в память, минимизируя Von Neumann bottleneck и HBM-доступы. Новый Ironwood усилил SparseCore для эмбеддингов (рекомендации, LLM) и расширил HBM. TPU — ключевое преимущество Google Cloud на 10 лет, с фокусом на inference; обсуждаются производство, сравнения с GPU и влияние Gemini 3.

by vegasbrianc • 27 ноября 2025 г. в 13:28 • 354 points

ОригиналHN

#cuda#google#google-cloud#gpu#jax#llm#nvidia#tensorflow#tpu

Комментарии (260)

  • Google's TPUs лидируют в эффективности inference и масштабе благодаря systolic array, OCS interconnects и низкой стоимости эксплуатации по сравнению с Nvidia GPUs.
  • Скепсис по поводу исполнения Google: слабая экосистема (JAX/TF vs CUDA), история провалов продуктов и зависимость от ad-бизнеса.
  • Nvidia доминирует за счёт универсальности, CUDA и оптимизаций (NVLink, NVFP4), несмотря на "architectural baggage".
  • Упоминания альтернатив (Groq, Cerebras, Meta покупает TPU) и рисков: новые архитектуры AI могут устареть hardware, фокус на inference vs training.
  • Google имеет ресурсы для доминирования через vertical stack и cloud, но короткий "attention span" вызывает сомнения.

AMD signs AI chip-supply deal with OpenAI, gives it option to take a 10% stake (reuters.com) 🔥 Горячее 💬 Длинная дискуссия

AMD заключила сделку с OpenAI о поставках чипов для искусственного интеллекта, предоставив также опцион на приобретение 10% доли в компании. Это стратегическое партнёрство усиливает позиции AMD на рынке AI-чипов, где доминирует NVIDIA, и обеспечивает OpenAI доступ к передовым аппаратным решениям для разработки и масштабирования своих моделей.

Опцион на долю демонстрирует глубокую интеграцию интересов: AMD получает ключевого клиента и потенциального инвестора, а OpenAI — влияние на поставщика и приоритетный доступ к технологиям. Это может ускорить инновации в области аппаратного обеспечения для ИИ и снизить зависимость от единственного поставщика.

by chillax • 06 октября 2025 г. в 12:17 • 380 points

ОригиналHN

#amd#cuda#gpu#llm#nvidia#openai

Комментарии (309)

  • AMD предоставила OpenAI опцион на покупку 10% своих акций по цене $0.01 за акцию при выполнении определенных условий
  • Сделка призвана стимулировать OpenAI к закупкам GPU AMD на сумму до $100 млрд и совместной разработке ПО для AI-чипов
  • Рыночная капитализация AMD выросла примерно на $100 млрд после анонса, что частично компенсирует стоимость опциона
  • Многие участники обсуждения расценивают сделку как признак финансового пузыря и циркулярных денежных потоков в AI-индустрии
  • Партнерство рассматривается как стратегический ход для создания альтернативы доминированию NVIDIA и CUDA

How to Think About GPUs (jax-ml.github.io) 🔥 Горячее

Что такое GPU
Современная ML-GPU (H100/B200) — это ~100–150 независимых вычислительных блоков (SM), каждый из которых содержит матричное ядро Tensor Core, векторные ALU (CUDA-ядра) и 256 КБ кэш SMEM. Все SM делят общий L2 и HBM3-память. SM разбит на 4 подблока; каждый подблок выполняет 32 SIMD-операции за такт. GPU-ядро менее мощное, чем TPU TensorCore, но их много, поэтому общая гибкость выше.

Память
H100: 80 ГБ HBM3, 3 ТБ/с. B200: 192 ГБ, 8 ТБ/с. L2 кэш 50 МБ (H100) / 128 МБ (B200). SMEM даёт 256 КБ на SM.

GPU vs TPU на уровне чипа
TPU: 1–2 больших MXU, жёсткая синхронизация, векторная часть слабее. GPU: 100+ мелких ядер, независимые SM, но общий L2 ограничивает масштаб. GPU лучше для разнородных задач, TPU — для чистых матмул.

Сеть внутри узла
Узел = 8 GPU + 2 CPU. GPU соединены NVLink/NVSwitch (900 ГБ/с между любыми двумя). CPU-GPU идут через PCIe 5.0 (64 ГБ/с). NVSwitch-кроссбар внутри узла = полносвязная сеть.

Сеть за пределами узла
InfiniBand HDR/NDR (до 400 Гб/с) или Ethernet RoCE. GPUDirect RDMA позволяет GPU читать/писать память соседнего узла без участия CPU.

Коллективные операции
Intra-node: NCCL использует NVLink; all-reduce 8×H100 за ~3 мкс.
Cross-node: кольцо IB + NVLink; latency ~10 мкс, bandwidth лимит IB.

Roofline-модель для LLM

  • Data Parallelism: ограничен IB; эффективен при малых моделях.
  • Tensor Parallelism: ограничен NVLink; лучше внутри узла.
  • Expert/ Pipeline Parallelism: комбинируем; pipeline глубже → меньше bubble, но больше весов на каждом GPU.
  • TLDR: держи параллелизм так, чтобы IB не стал bottleneck; используй NVLink для tensor-parallel, IB для data-parallel.

Итого
GPU — это масса мелких, независимых SM, связанных быстрым NVLink внутри узла и медленным IB между узлами. Для LLM выбирай параллелизм, который минимизирует IB-трафик и максимально использует NVLink.

by alphabetting • 18 августа 2025 г. в 18:18 • 354 points

ОригиналHN

#cuda#gpu#infiniband#machine-learning#nvidia#nvlink#parallel-computing#roce#tpu

Комментарии (107)

  • Критика точности: документация местами неточна, особенно в определении «CUDA-core».
  • Открытость и вендор-лок: ряд участников считают инвестиции в проприетарную экосистему NVIDIA рискованной ставкой.
  • Ошибка в расчётах: Quiz 2 преувеличивает пропускную способность; реальные 3,2 ТБ/с ограничены портами NIC.
  • Похвала и польза: серия всё же хорошо объясняет принципы параллелизма, применимые и к другим устройствам.
  • Сравнение TPU и GPU: TPU проще масштабировать, но закрыт для продажи; GPU NVIDIA гибче, но сложнее в программировании.
  • Дефицит официальных данных: NVIDIA не раскрывает полную архитектуру, поэтому полезные модели приходится собирать из сторонних источников.

The Framework Desktop is a beast (world.hey.com) 🔥 Горячее 💬 Длинная дискуссия

Framework Desktop — компактный 4,5-литровый ПК, который почти не шумит даже под полной нагрузкой. Внутри — мобильный AMD Ryzen AI Max 395+ (16 ядер Zen5, 5,1 ГГц), и он оказывается быстрее старого Ryzen 9 7950X в большом корпусе.

Корпус разукрашивается 21 сменной плиткой, можно печатать свои. Внешне — свежий минимализм вместо алюминия и RGB.

По производительности:

  • Docker-тест HEY: почти вдвое быстрее Beelink SER8 и на 40 % опережает M4 Max.
  • Geekbench 6 multi-core: на уровне M4 Max, заметно выше M4 Pro и Core i9-14900K.
  • Одноядерка уступает Apple ≈20 %, но для многопоточных задач это лидер.

Цена выше, чем у Beelink, но пока это единственный безвентиляторный 395+ на рынке.

by lemonberry • 08 августа 2025 г. в 20:19 • 390 points

ОригиналHN

#amd#cuda#docker#llm#ryzen

Комментарии (353)

  • Framework Desktop с Ryzen AI Max+ 395 даёт 64–128 ГБ единой памяти, позволяя запускать крупные LLM без дискретной видеокарты и дешевле, чем Mac Studio, но дороже Mini.
  • Производительность ниже CUDA-карт Nvidia и M4 Max, зато выше, чем у iGPU Intel и старых решений.
  • Многие сомневаются в цене и форм-факторе: за те же деньги можно взять Minisforum, Beelink, HP Z2 Mini или собрать полноценный десктоп.
  • Пока CUDA-стека нет, AMD-совместимость с популярными AI-фреймворками ограничена.
  • Ремонтопригодность и модульность Framework оценили, но в десктоп-сегменте это не уникально.