Hacker News Digest

Тег: #cpu

Постов: 5

Xiaomi: New CPU matches Apple cores single threaded, much faster multithreaded (twitter.com) 🔥 Горячее 💬 Длинная дискуссия

Xiaomi’s новое процессорное ядро Xring O3 демонстрирует резкий сдвиг в архитектуре мобильных чипов: оно превосходит Apple по многопоточной производительности и оснащено 44 МБ кэша — больше, чем у большинства ноутбучных Intel-процессоров. Ядра C1-Ultra имеют 21 порт выполнения, включая шесть для SIMD-операций по 128 бит, что превышает количество портов у современных Intel и AMD. Хотя AMD Zen 5 опережает в обработке 512-битных векторов, для ARM это рекордная ширина SIMD.

Основной тренд — взрывной рост числа исполнительных юнитов и кэша. Процессоры теперь нацелены на параллельную обработку тысяч независимых операций в цикл: сложения, умножения, матричные вычисления через SME2 и SVE2. Это не просто ускорение — это переосмысление вычислений под задачи ИИ и высокопроизводительных вычислений. Большинство транзисторов теперь тратятся не на частоту, а на параллелизм и объём кэша, что делает мобильные чипы конкурентоспособными даже с десктопными решениями.

by tosh • 24 августа 2026 г. в 15:08 • 920 points

ОригиналHN

#amd#apple#arm#core#cpu#intel#simd#sme2#sve2#xiaomi

Комментарии (658)

Обсуждение дополняет статью, подчеркивая, что производительность на бумаге не гарантирует реальную эффективность из-за термических ограничений, отсутствия данных о потреблении энергии и зависимости от экосистемы, а не только от архитектуры процессора.

  • Спор: Некоторые отмечают, что Xring O3 использует готовое ARM-ядро C1-Ultra, как и MediaTek, и Xiaomi не создавала собственную архитектуру ядра, лишь настраивала интерконнекты и физическую реализацию на TSMC 3nm.

  • Спор: Хотя многопоточная производительность выше, однопоточная уступает Apple M5 Max, что ставит под сомнение утверждение о полном превосходстве, особенно в реальных сценариях использования.

  • Все согласны, что ключевой метрикой является производительность на ватт, а не абсолютная скорость — многие отмечают, что высокая мощность и кэш не имеют значения, если устройство перегревается и деградирует под нагрузкой.

  • Реальные результаты в смартфоне с ограничениями охлаждения и энергопотребления могут быть на 20-30% ниже лабораторных, как это было с MediaTek Dimensity 9500, что делает текущие цифры сомнительными.

  • Большой кэш в 44 МБ указывает на то, что узким местом теперь является не вычислительная мощность, а задержка доступа к памяти — это подтверждается несколькими участниками, ссылающимися на архитектурные ограничения.

  • Разработчики отмечают, что реальный успех зависит не только от железа, но и от поддержки Linux-ядра, драйверов, инструментов и стабильности экосистемы — всё это пока неизвестно для Xiaomi Xring O3.

  • Большинство считают, что Apple остаётся лидером в энергоэффективности и интеграции железа с ПО, и даже при высоких цифрах в бенчмарках Xiaomi не дотягивает до целостности ecosystem Apple.

  • Несколько участников подчеркивают, что данные пока основаны на прототипе, а не на финальном продукте в телефоне — это делает любые выводы преждевременными.

  • Совет: Стоит ждать независимых тестов и анализа тепловых кривых, а не полагаться на анонсы — как отмечает @StrLght, третьих сторонных данных пока нет, и это критично для оценки.

  • Совет: Сравнивать только с Apple не имеет смысла — экосистема iOS/macOS и управление ресурсами важнее, чем цифры в Geekbench, как пишет @bee_rider — переключение ОС не основывается на бенчмарках.

  • Совет: Интересно, что производительность GPU близка к M5, но в Android-устройствах она будет сильно ограничена драйверами и термическим лимитом — как отмечает @simjnd, это снижает практическую ценность.

  • Спор: Некоторые считают, что Xiaomi не может использовать TSMC и вынуждена использовать китайские литографические процессы с низким выходом годных кристаллов — что объясняет редкость таких чипов, как пишет @hn_submit.

  • Китайский прогресс в полупроводниках — это реальность, но его масштабирование и надёжность остаются под вопросом, особенно в контексте безопасности и архитектурных уязвимостей, как в случае Loongson, упомянутых @angry_octet.

  • Потребительский опыт с Xiaomi — хороший, особенно по соотношению цены и производительности, как отмечают @rawoke083600 и @otterley, но это не означает технологическое превосходство над Apple.

  • Совет: Стоит смотреть на видео с анализом кристалла и кривыми производительности-потребления, как предлагает @picture — там можно увидеть реальные термические характеристики, а не только цифры бенчмарков.

Missing the most important metric: processing power per watt.I have some server CPUs laying around that can also beat Apple CPUs. But putting them in a compact, densely packed, sealed box (aka a phone) would result in a fireball and almost no battery life. — @strictnein

Running Gemma 4 26B at 5 tokens/sec on a 13-year-old Xeon with no GPU (neomindlabs.com)

На сервере в подвале, построенном из старого хранилища HP с двумя процессорами Xeon E5‑2690 v2 (Ivy Bridge, 2013) и без видеокарты, запущена открытая модель Gemma 4 26B‑A4B в квантовании Q8_0 и генерирует текст со скоростью около пяти токенов в секунду. Оборудование стоит менее трёхсот долларов, использует лишь AVX1, а не более новые AVX2/FMA3, и работает на DDR3‑памяти. Это удалось благодаря модификации проекта ik_llama.cpp, где убраны зависимости от AVX2 и добавлены fallback‑пути, позволяющие модели работать на пред‑AVX2 процессорах. Автор оригинального форка опирался на специфические оптимизации, но их пришлось обойти, перепаковав веса и отключив run‑time‑repack. Декодирование со скоростью около 5,2 токенов в секунду, оценка промпта — около 16 токенов в секунду. Чтобы запустить, собрать ik_llama.cpp без --run-time-repack и с отключённым GGML_USE_IQK_MULMAT, чтобы избежать зависимостей от AVX2. Это показывает, что даже железо, вышедшее из эксплуатации десяти лет назад, может стать сервером генерации, если правильно подобрать компиляцию и параметры.

Такая реализация подтверждает, что старый сервер может выполнять задачи современных моделей, если правильно адаптировать код, и подчёркивает ценность ручного анализа вместо покупки подписки, и показывает, насколько важен глубокий технический подход.

by neomindryan • 15 июля 2026 г. в 15:34 • 227 points

ОригиналHN

#avx1#cpu#gemma#gemma-4-26b#ik-llama.cpp#neomindlabs#q8-0#server#xeon

Комментарии (150)

Тред дополняет статью реальными кейсами запуска моделей на старом железе, обсуждением эффективности и стоимости таких решений.

  • Запуск больших моделей на старом железе без GPU возможен, но скорость генерации токенов может быть низкой (5-9 токенов/секунду).

  • Спор: Некоторые участники дискуссии считают, что запуск моделей локально нецелесообразен из-за высокой стоимости электроэнергии и низкой эффективности, в то время как другие делают это ради свободы, приватности и эксперимента.

  • Совет: Для запуска моделей на старом железе может потребоваться оптимизация кода и подбор специальных параметров, а также важно учитывать стоимость электроэнергии.

  • Использование inference провайдеров может быть более экономически эффективным, чем запуск моделей локально на старом железе.

  • Спор: Некоторые участники считают, что прогресс в области моделей и железа позволит запускать более крупные модели на более старом железе в будущем.

How are the thermals? I noticed that running any serious workload locally heats system fast. — @haute_cuisine

%CPU utilization is a lie (brendanlong.com) 🔥 Горячее

%CPU — обманка
Система показывает 50 % загрузки, но реально сервер выполняет 60–100 % максимально возможной работы.

Эксперимент
Ryzen 9 5900X (12 ядер / 24 потока), Turbo включён.
Скрипт запускал stress-ng двумя способами:

  • 24 потока по 1–100 % нагрузки;
  • 1–24 потока по 100 %.

Результаты

  • Общий CPU-тест: при 50 % «утилитой» реальная работа 60–65 %.
  • 64-битная математика: 65–85 %.
  • Умножение матриц: 80–100 %.

Почему так

  1. Hyper-threading: после 12 потоков «ядра» делят ресурсы, прирост стремится к нулю.
  2. Turbo: частота падает с 4.9 до 4.3 ГГц при росте загрузки, поэтому «утил» растёт быстрее реальной работы.

Вывод
Полагаться на линейный рост %CPU — ошибка. При эффективной загрузке (>50 %) показания занижены, и различия между процессорами могут быть огромными.

by BrendanLong • 03 сентября 2025 г. в 00:01 • 388 points

ОригиналHN

#cpu#hyper-threading#memcached#postgresql#stress-ng#turbo

Комментарии (134)

  • Участники сходятся во мнении, что «%CPU» — это не ложь, а линейная мера нелинейной реальности: SMT, Turbo, общие ресурсы и ожидание памяти делают 60 % «загрузки» фактически пределом.
  • Практики SRE подтверждают: модели очередей по CPU% работают лучше «старой мудрости», но только если понимать, что 50–60 % уже «почти всё».
  • Несколько человек вспомнили, как менеджеры требовали «увеличить сервер», увидев 100 %, хотя процессор простаивал в busy-wait или ждал I/O.
  • Подчёркивается, что IPC, latency, power-draw и прямое нагрузочное тестирование приложения дают более точную картину, чем сырые проценты.
  • Утилита stress-ng удобна для синтетики, но не для production-бенчмарков; реальные приложения (Postgres, Memcached) ломаются раньше, чем показывает 100 % CPU.

It is worth it to buy the fast CPU (blog.howardjohn.info) 💬 Длинная дискуссия

Купи быстрый процессор

Современные CPU стали шокирующе быстрыми, но большинство по-прежнему используют старые мобильные чипы, теряя продуктивность.

Подписка на AI-инструменты вроде Cursor стоит $480/год, а топовый Ryzen 9 9950X — всего $500. Амортизация за 3 года = $170/год: дешевле, чем AI, и выгода очевидна.

Бенчмарки

  • Корпоративный ноутбук 2024 (i7-1165G7, 2020 г.)
  • Лучший ThinkPad 2024 (Ryzen 7840U)
  • Десктоп 2025 (Ryzen 9950X)

Разница — >10× на компиляции ядра Linux и TLS-операциях. 3 с против 30 с или 300 мс — это кардинально меняет опыт.

Правило:

  • Десктоп ≈ 3× быстрее ноутбука
  • Топ-CPU 2025 ≈ 3× быстрее топа 2022
  • Новые облачные VM тоже 2-3× быстрее за ту же цену

Если вы оправдываете AI-подписку, оправдайте и лучший инструмент — быстрый CPU.

by ingve • 24 августа 2025 г. в 06:03 • 186 points

ОригиналHN

#amd#cloud#compilation#cpu#intel#linux#productivity#ram#ryzen#ssd

Комментарии (371)

  • Почти все согласны: «быстрый процессор = меньше ожидания компиляции → выше продуктивность», и ROI для старших разработчиков окупается за недели.
  • Но выгода сильно зависит от задач: многие уже компилят в облаке/сервере, а фронтенд-сборки всё равно тормозят из-за однопоточных инструментов.
  • Некоторые 10-летние CPU (i7-4770, Phenom II) всё ещё «достаточно быстры», если добавить RAM и SSD; апгрейд не всегда оправдан.
  • Ноутбуки ограничены теплопакетом: «топ-чип в лэптопе ≠ тот же чип в десктопе».
  • Итог: берите максимально быстрый десктоп, если компилируете локально; если работаете в облаке — экономьте деньги и нервы.

PCIe 8.0 announced by the PCI-Sig will double throughput again (servethehome.com) 💬 Длинная дискуссия

PCI-SIG анонсировала PCIe 8.0

  • Пропускная способность вдвое выше PCIe 7.0: до 256 ГТ/с на линию.
  • Технология: PAM4, 32 ГТ/с, 0,5 В амплитуда, < 1 Вт/лейн энергопотребление.
  • Обратная совместимость с предыдущими поколениями.
  • Спецификация выйдет в 2027 г., первые продукты — 2028–2029 гг.
  • Цели: ИИ-акселераторы, HPC, NVMe-накопители, 800 Гбит/с сети.

by rbanffy • 09 августа 2025 г. в 22:41 • 160 points

ОригиналHN

#cpu#datacenters#gpu#hpc#llm#nvme#pam4#pci-express#pci-sig#ram

Комментарии (188)

  • Кто-то предлагает «перевернуть» архитектуру: пусть GPU-PCB станет материнской платой, а CPU с памятью встаёт в PCIe-слот.
  • Обсуждают, что PCIe-спецификация всегда на три поколения впереди реальных продуктов: сейчас в работе уже Gen 8.
  • Пользователи жалуются на нехватку линий PCIe в десктопах и мечтают о GPU-сокете с собственными слотами RAM.
  • EE и другие специалисты считают это скорее проблемой экосистемы и совместимости, чем чисто инженерной.
  • Упоминают, что в дата-центрах (DGX, DPU, NVMe-«без-сервера») похожая идея уже реализована.