H3-metal – Native MiniMax-H3 inference for Apple Silicon 🔥 Горячее
GitHub-проект h3.c реализует нативную инференс-систему для модели MiniMax H3 на Apple Silicon, используя Metal для максимальной производительности на M3 Max и M5 Max. Система работает по принципу вертикальных слоёв: сначала загрузка метаданных, затем оптимизация вычислений — от кодирования промптов до генерации видео и аудио с условием по первому и последнему кадру. Поддерживается интерактивный режим, где промпты, условия и модели остаются в памяти между запросами, что ускоряет повторные генерации. Можно задавать опорные изображения через !ref-image, управлять последовательностью ссылок и сохранять результаты в MP4 без перезагрузки модели.
Оптимизации включают специализированные Metal-ядрa: для внимания — компиляция матриц 7168×5376 в статические тензоры, что даёт прирост до 0.8% скорости; для FC1 и FC2 — целочисленные (int8) масштабы с точной квантизацией, сохраняющие байт-идентичность вывода. При длине последовательности ≤2048 строк применяются оптимизированные 128-потоковые редукции, уменьшающие чтения памяти. Для экономии памяти слои модели загружаются по частям — трансформер, кодировщик и декодеры не живут одновременно в Unified Memory. Команда --profile показывает временные метрики, а --show отображает промежуточные кадры в терминале (Kitty, iTerm2). Использование --layers 45 и --reuse 2 снижает время генерации на 30–40% без потери качества.
Комментарии (87)
Пользователи делятся опытом использования модели MiniMax H3 на устройствах Apple с M5 Pro, M5 Max и Mac Studio: модель эффективна при достаточном объёме памяти, но требует значительных ресурсов и долго генерирует видео. Спорят о необходимости 64 ГБ против 128 ГБ ОЗУ для комфортной работы. Рекомендуют оптимизировать работу через ComfyUI и аналогичные инструменты. Модель подходит для генерации видео и изображений, но неэффективна на устройствах с ограниченной памятью.
Show HN: Run an 80B Qwen in 4.3 GB of RAM on a Mac, and a 35B on an iPhone
Swiftlet — это рантайм на Swift + Metal, позволяющий запускать гибридные модели Qwen3‑Next и Qwen3.5/3.6 MoE на обычных iOS‑устройствах. Вместо того, чтобы держать весь параметр в памяти, в RAM остаётся лишь небольшая плотная «ядровая» часть, а остальные эксперты потоково читаются из хранилища, что делает возможным работу 35‑B и даже 80‑B моделей на iPhone 17 (примерно 2,5 ГБ RAM, 1 токен/сек).
Ключевые приёмы: чтение экспертов через pread в ограниченный пул слотов, выгрузка по LFU + recency, фиксированный stride‑пакетный ввод‑вывод и мгновенная компиляция шейдеров. Архитектурно проект поддерживает альтернативные схемы внимания (Gated DeltaNet, gated GQA), int4/int8‑квантование в Metal и полную систему установки, кэширования и обработки разговоров. В результате на Mac‑е 35‑B модель потребляет лишь 2,6 ГБ RAM и генерирует 7‑11 токен/сек, а 80‑B — 4,3 ГБ и 4,5‑5 токен/сек.
Комментарии (115)
Тред обсуждает запуск крупных моделей на устройствах с ограниченными ресурсами — iPhone и Mac. По опыту @leonickson, на Mac с 32 ГБ RAM увеличение кэша до 8 ГБ не ускоряет работу — узкое место — GPU, а не RAM. @adrianco советует увеличивать RAM-кэш на устройствах с 24–32 ГБ RAM — это может значительно ускорить работу. @dghlsakjg видит в этом прогресс и предполагает будущее запуска моделей на дешёвом оборудовании, например, SSD за $200. @jarek83 и @arjie спорят о реалистичности запуска 1T-параметровых моделей на таком оборудовании, указывая на ограничения и стоимость. @throwawayffffas и @leonickson обсуждают износ SSD при использовании для моделей; @throwawayffffas отмечает, что у него SSD работает долго без проблем.
Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac 🔥 Горячее 💬 Длинная дискуссия
Запуск модели Gemma 4 26B‑A4B в памяти около 2 ГБ позволяет выполнять её на любом Apple Silicon‑Mac, даже с 8 ГБ ОЗУ. TurboFieldfare использует собственный Swift‑Metal‑рантайм, который хранит общий ядро объёмом 1.35 ГБ и кэш KV в FP16, а остальные эксперты потоково читает с SSD, делая возможным работу 14.3‑ГБ модели без полной загрузки. Рунтайм, установщик, командная строка и нативное приложение написаны на Swift 6.2 и Metal 4, поддерживают macOS 26+ и не являются обёрткой вокруг MLX или llama.cpp; в открытом экспериментальном журнале собрано 103 измерения по ядрам, кэшу, вводу и декодированию, а также ссылки на быстрый старт, локальный сервер, бенчмарки, вкладки сообщества, дизайн системы и список экспериментов.
Лицензия – Apache 2.0, а веса модели скачиваются отдельно с Hugging Face и находятся под собственными условиями, проект не связан с Google. Назван в честь дрозда‑певчего, автор Andrey Mikhaylov посвящает его жене‑птицеводке и призывает поддерживать местную дикую природу, напоминая, что иногда просто прикоснуться к траве и послушать птиц – самое красивое, что можно сделать. Эти результаты подтверждают, что даже на устройствах с ограниченной памятью можно достичь почти полной производительности, а поддержка местных сообществ помогает сохранять природу для будущих поколений.
Комментарии (288)
Тред описывает опыт запуска модели Gemma 4 26B на Apple Silicon Mac — от MacBook Air с 8 ГБ ОЗУ до MacBook Pro с 64 ГБ. Модель умещается в ~2 ГБ памяти, что позволяет запускать её даже на устройствах с ограниченной памятью, что полезно для локального AI-использования. При наличии 64 ГБ ОЗУ и быстрого SSD достигаются высокие скорости обработки даже при нагрузке на систему. Некоторые сомневаются в целесообразности такого подхода при достаточном объёме ОЗУ, опасаясь замедления. Для macOS 15 требуется удалить или изменить строки кода, связанные с языковой версией, чтобы избежать ошибок компиляции.
Claude Sonnet will ship in Xcode 🔥 Горячее 💬 Длинная дискуссия
Xcode 26 Beta 7
- macOS 15.4+ требуется
- Swift 6.1 и Swift 6.0.3 включены
- iOS 18.4, macOS 15.4, watchOS 11.4, tvOS 18.4, visionOS 2.4 SDK обновлены
Новое
- Swift Testing теперь по умолчанию
- Preview canvas работает без симулятора
- Metal debugger поддерживает mesh shaders
- Instruments добавлен шаблон Swift Concurrency
Исправлено
- SourceKit-LSP не крашится при больших проектах
- Simulator корректно отображает Dynamic Island
- TestFlight теперь принимает билды с App Intents
Известные проблемы
- CarPlay симулятор не запускается
- XCTest может зависать при parallel testing
- SwiftUI
.animation(.default)ломает navigation transitions
Устарело
- Interface Builder для watchOS storyboards
- bitcode полностью удалён
Скачать
Комментарии (362)
- Apple добавил в Xcode бета-версию интеграции с Claude (Sonnet 4) и GPT-5, но модели не поставляются в комплекте: нужен оплаченный аккаунт у Anthropic/OpenAI и передача кода на внешние серверы.
- Пользователей беспокоят приватность, утечки исходников и отсутствие офлайн-режима; многие считают, что Apple «Sherlock’нула» сторонние плагины.
- Критика Xcode усилилась: баги, медлительность и плохой UX остаются нерешёнными, а встроенный ИИ не компенсирует недостатки.
- Наблюдается ирония: Microsoft, первой внедрившей Copilot, теперь теряет эксклюзивность, поскольку Apple, Google и JetBrains внедряют собственные или альтернативные модели.