Xiaomi: New CPU matches Apple cores single threaded, much faster multithreaded 🔥 Горячее 💬 Длинная дискуссия
Xiaomi’s новое процессорное ядро Xring O3 демонстрирует резкий сдвиг в архитектуре мобильных чипов: оно превосходит Apple по многопоточной производительности и оснащено 44 МБ кэша — больше, чем у большинства ноутбучных Intel-процессоров. Ядра C1-Ultra имеют 21 порт выполнения, включая шесть для SIMD-операций по 128 бит, что превышает количество портов у современных Intel и AMD. Хотя AMD Zen 5 опережает в обработке 512-битных векторов, для ARM это рекордная ширина SIMD.
Основной тренд — взрывной рост числа исполнительных юнитов и кэша. Процессоры теперь нацелены на параллельную обработку тысяч независимых операций в цикл: сложения, умножения, матричные вычисления через SME2 и SVE2. Это не просто ускорение — это переосмысление вычислений под задачи ИИ и высокопроизводительных вычислений. Большинство транзисторов теперь тратятся не на частоту, а на параллелизм и объём кэша, что делает мобильные чипы конкурентоспособными даже с десктопными решениями.
Комментарии (658)
Обсуждение дополняет статью, подчеркивая, что производительность на бумаге не гарантирует реальную эффективность из-за термических ограничений, отсутствия данных о потреблении энергии и зависимости от экосистемы, а не только от архитектуры процессора.
-
Спор: Некоторые отмечают, что Xring O3 использует готовое ARM-ядро C1-Ultra, как и MediaTek, и Xiaomi не создавала собственную архитектуру ядра, лишь настраивала интерконнекты и физическую реализацию на TSMC 3nm.
-
Спор: Хотя многопоточная производительность выше, однопоточная уступает Apple M5 Max, что ставит под сомнение утверждение о полном превосходстве, особенно в реальных сценариях использования.
-
Все согласны, что ключевой метрикой является производительность на ватт, а не абсолютная скорость — многие отмечают, что высокая мощность и кэш не имеют значения, если устройство перегревается и деградирует под нагрузкой.
-
Реальные результаты в смартфоне с ограничениями охлаждения и энергопотребления могут быть на 20-30% ниже лабораторных, как это было с MediaTek Dimensity 9500, что делает текущие цифры сомнительными.
-
Большой кэш в 44 МБ указывает на то, что узким местом теперь является не вычислительная мощность, а задержка доступа к памяти — это подтверждается несколькими участниками, ссылающимися на архитектурные ограничения.
-
Разработчики отмечают, что реальный успех зависит не только от железа, но и от поддержки Linux-ядра, драйверов, инструментов и стабильности экосистемы — всё это пока неизвестно для Xiaomi Xring O3.
-
Большинство считают, что Apple остаётся лидером в энергоэффективности и интеграции железа с ПО, и даже при высоких цифрах в бенчмарках Xiaomi не дотягивает до целостности ecosystem Apple.
-
Несколько участников подчеркивают, что данные пока основаны на прототипе, а не на финальном продукте в телефоне — это делает любые выводы преждевременными.
-
Совет: Стоит ждать независимых тестов и анализа тепловых кривых, а не полагаться на анонсы — как отмечает @StrLght, третьих сторонных данных пока нет, и это критично для оценки.
-
Совет: Сравнивать только с Apple не имеет смысла — экосистема iOS/macOS и управление ресурсами важнее, чем цифры в Geekbench, как пишет @bee_rider — переключение ОС не основывается на бенчмарках.
-
Совет: Интересно, что производительность GPU близка к M5, но в Android-устройствах она будет сильно ограничена драйверами и термическим лимитом — как отмечает @simjnd, это снижает практическую ценность.
-
Спор: Некоторые считают, что Xiaomi не может использовать TSMC и вынуждена использовать китайские литографические процессы с низким выходом годных кристаллов — что объясняет редкость таких чипов, как пишет @hn_submit.
-
Китайский прогресс в полупроводниках — это реальность, но его масштабирование и надёжность остаются под вопросом, особенно в контексте безопасности и архитектурных уязвимостей, как в случае Loongson, упомянутых @angry_octet.
-
Потребительский опыт с Xiaomi — хороший, особенно по соотношению цены и производительности, как отмечают @rawoke083600 и @otterley, но это не означает технологическое превосходство над Apple.
-
Совет: Стоит смотреть на видео с анализом кристалла и кривыми производительности-потребления, как предлагает @picture — там можно увидеть реальные термические характеристики, а не только цифры бенчмарков.
Missing the most important metric: processing power per watt.I have some server CPUs laying around that can also beat Apple CPUs. But putting them in a compact, densely packed, sealed box (aka a phone) would result in a fireball and almost no battery life. — @strictnein
Running Gemma 4 26B at 5 tokens/sec on a 13-year-old Xeon with no GPU
На сервере в подвале, построенном из старого хранилища HP с двумя процессорами Xeon E5‑2690 v2 (Ivy Bridge, 2013) и без видеокарты, запущена открытая модель Gemma 4 26B‑A4B в квантовании Q8_0 и генерирует текст со скоростью около пяти токенов в секунду. Оборудование стоит менее трёхсот долларов, использует лишь AVX1, а не более новые AVX2/FMA3, и работает на DDR3‑памяти. Это удалось благодаря модификации проекта ik_llama.cpp, где убраны зависимости от AVX2 и добавлены fallback‑пути, позволяющие модели работать на пред‑AVX2 процессорах. Автор оригинального форка опирался на специфические оптимизации, но их пришлось обойти, перепаковав веса и отключив run‑time‑repack. Декодирование со скоростью около 5,2 токенов в секунду, оценка промпта — около 16 токенов в секунду. Чтобы запустить, собрать ik_llama.cpp без --run-time-repack и с отключённым GGML_USE_IQK_MULMAT, чтобы избежать зависимостей от AVX2. Это показывает, что даже железо, вышедшее из эксплуатации десяти лет назад, может стать сервером генерации, если правильно подобрать компиляцию и параметры.
Такая реализация подтверждает, что старый сервер может выполнять задачи современных моделей, если правильно адаптировать код, и подчёркивает ценность ручного анализа вместо покупки подписки, и показывает, насколько важен глубокий технический подход.
Комментарии (150)
Тред дополняет статью реальными кейсами запуска моделей на старом железе, обсуждением эффективности и стоимости таких решений.
-
Запуск больших моделей на старом железе без GPU возможен, но скорость генерации токенов может быть низкой (5-9 токенов/секунду).
-
Спор: Некоторые участники дискуссии считают, что запуск моделей локально нецелесообразен из-за высокой стоимости электроэнергии и низкой эффективности, в то время как другие делают это ради свободы, приватности и эксперимента.
-
Совет: Для запуска моделей на старом железе может потребоваться оптимизация кода и подбор специальных параметров, а также важно учитывать стоимость электроэнергии.
-
Использование inference провайдеров может быть более экономически эффективным, чем запуск моделей локально на старом железе.
-
Спор: Некоторые участники считают, что прогресс в области моделей и железа позволит запускать более крупные модели на более старом железе в будущем.
How are the thermals? I noticed that running any serious workload locally heats system fast. — @haute_cuisine
%CPU utilization is a lie 🔥 Горячее
%CPU — обманка
Система показывает 50 % загрузки, но реально сервер выполняет 60–100 % максимально возможной работы.
Эксперимент
Ryzen 9 5900X (12 ядер / 24 потока), Turbo включён.
Скрипт запускал stress-ng двумя способами:
- 24 потока по 1–100 % нагрузки;
- 1–24 потока по 100 %.
Результаты
- Общий CPU-тест: при 50 % «утилитой» реальная работа 60–65 %.
- 64-битная математика: 65–85 %.
- Умножение матриц: 80–100 %.
Почему так
- Hyper-threading: после 12 потоков «ядра» делят ресурсы, прирост стремится к нулю.
- Turbo: частота падает с 4.9 до 4.3 ГГц при росте загрузки, поэтому «утил» растёт быстрее реальной работы.
Вывод
Полагаться на линейный рост %CPU — ошибка. При эффективной загрузке (>50 %) показания занижены, и различия между процессорами могут быть огромными.
Комментарии (134)
- Участники сходятся во мнении, что «%CPU» — это не ложь, а линейная мера нелинейной реальности: SMT, Turbo, общие ресурсы и ожидание памяти делают 60 % «загрузки» фактически пределом.
- Практики SRE подтверждают: модели очередей по CPU% работают лучше «старой мудрости», но только если понимать, что 50–60 % уже «почти всё».
- Несколько человек вспомнили, как менеджеры требовали «увеличить сервер», увидев 100 %, хотя процессор простаивал в busy-wait или ждал I/O.
- Подчёркивается, что IPC, latency, power-draw и прямое нагрузочное тестирование приложения дают более точную картину, чем сырые проценты.
- Утилита stress-ng удобна для синтетики, но не для production-бенчмарков; реальные приложения (Postgres, Memcached) ломаются раньше, чем показывает 100 % CPU.
It is worth it to buy the fast CPU 💬 Длинная дискуссия
Купи быстрый процессор
Современные CPU стали шокирующе быстрыми, но большинство по-прежнему используют старые мобильные чипы, теряя продуктивность.
Подписка на AI-инструменты вроде Cursor стоит $480/год, а топовый Ryzen 9 9950X — всего $500. Амортизация за 3 года = $170/год: дешевле, чем AI, и выгода очевидна.
Бенчмарки
- Корпоративный ноутбук 2024 (i7-1165G7, 2020 г.)
- Лучший ThinkPad 2024 (Ryzen 7840U)
- Десктоп 2025 (Ryzen 9950X)
Разница — >10× на компиляции ядра Linux и TLS-операциях. 3 с против 30 с или 300 мс — это кардинально меняет опыт.
Правило:
- Десктоп ≈ 3× быстрее ноутбука
- Топ-CPU 2025 ≈ 3× быстрее топа 2022
- Новые облачные VM тоже 2-3× быстрее за ту же цену
Если вы оправдываете AI-подписку, оправдайте и лучший инструмент — быстрый CPU.
Комментарии (371)
- Почти все согласны: «быстрый процессор = меньше ожидания компиляции → выше продуктивность», и ROI для старших разработчиков окупается за недели.
- Но выгода сильно зависит от задач: многие уже компилят в облаке/сервере, а фронтенд-сборки всё равно тормозят из-за однопоточных инструментов.
- Некоторые 10-летние CPU (i7-4770, Phenom II) всё ещё «достаточно быстры», если добавить RAM и SSD; апгрейд не всегда оправдан.
- Ноутбуки ограничены теплопакетом: «топ-чип в лэптопе ≠ тот же чип в десктопе».
- Итог: берите максимально быстрый десктоп, если компилируете локально; если работаете в облаке — экономьте деньги и нервы.
PCIe 8.0 announced by the PCI-Sig will double throughput again 💬 Длинная дискуссия
PCI-SIG анонсировала PCIe 8.0
- Пропускная способность вдвое выше PCIe 7.0: до 256 ГТ/с на линию.
- Технология: PAM4, 32 ГТ/с, 0,5 В амплитуда, < 1 Вт/лейн энергопотребление.
- Обратная совместимость с предыдущими поколениями.
- Спецификация выйдет в 2027 г., первые продукты — 2028–2029 гг.
- Цели: ИИ-акселераторы, HPC, NVMe-накопители, 800 Гбит/с сети.
Комментарии (188)
- Кто-то предлагает «перевернуть» архитектуру: пусть GPU-PCB станет материнской платой, а CPU с памятью встаёт в PCIe-слот.
- Обсуждают, что PCIe-спецификация всегда на три поколения впереди реальных продуктов: сейчас в работе уже Gen 8.
- Пользователи жалуются на нехватку линий PCIe в десктопах и мечтают о GPU-сокете с собственными слотами RAM.
- EE и другие специалисты считают это скорее проблемой экосистемы и совместимости, чем чисто инженерной.
- Упоминают, что в дата-центрах (DGX, DPU, NVMe-«без-сервера») похожая идея уже реализована.