Hacker News Digest

Тег: #metal

Постов: 4

H3-metal – Native MiniMax-H3 inference for Apple Silicon (github.com) 🔥 Горячее

GitHub-проект h3.c реализует нативную инференс-систему для модели MiniMax H3 на Apple Silicon, используя Metal для максимальной производительности на M3 Max и M5 Max. Система работает по принципу вертикальных слоёв: сначала загрузка метаданных, затем оптимизация вычислений — от кодирования промптов до генерации видео и аудио с условием по первому и последнему кадру. Поддерживается интерактивный режим, где промпты, условия и модели остаются в памяти между запросами, что ускоряет повторные генерации. Можно задавать опорные изображения через !ref-image, управлять последовательностью ссылок и сохранять результаты в MP4 без перезагрузки модели.

Оптимизации включают специализированные Metal-ядрa: для внимания — компиляция матриц 7168×5376 в статические тензоры, что даёт прирост до 0.8% скорости; для FC1 и FC2 — целочисленные (int8) масштабы с точной квантизацией, сохраняющие байт-идентичность вывода. При длине последовательности ≤2048 строк применяются оптимизированные 128-потоковые редукции, уменьшающие чтения памяти. Для экономии памяти слои модели загружаются по частям — трансформер, кодировщик и декодеры не живут одновременно в Unified Memory. Команда --profile показывает временные метрики, а --show отображает промежуточные кадры в терминале (Kitty, iTerm2). Использование --layers 45 и --reuse 2 снижает время генерации на 30–40% без потери качества.

by swyx • 11 августа 2026 г. в 01:22 • 384 points

ОригиналHN

#apple#c#github#h3.c#metal

Комментарии (87)

Пользователи делятся опытом использования модели MiniMax H3 на устройствах Apple с M5 Pro, M5 Max и Mac Studio: модель эффективна при достаточном объёме памяти, но требует значительных ресурсов и долго генерирует видео. Спорят о необходимости 64 ГБ против 128 ГБ ОЗУ для комфортной работы. Рекомендуют оптимизировать работу через ComfyUI и аналогичные инструменты. Модель подходит для генерации видео и изображений, но неэффективна на устройствах с ограниченной памятью.

Show HN: Run an 80B Qwen in 4.3 GB of RAM on a Mac, and a 35B on an iPhone (github.com)

Swiftlet — это рантайм на Swift + Metal, позволяющий запускать гибридные модели Qwen3‑Next и Qwen3.5/3.6 MoE на обычных iOS‑устройствах. Вместо того, чтобы держать весь параметр в памяти, в RAM остаётся лишь небольшая плотная «ядровая» часть, а остальные эксперты потоково читаются из хранилища, что делает возможным работу 35‑B и даже 80‑B моделей на iPhone 17 (примерно 2,5 ГБ RAM, 1 токен/сек).

Ключевые приёмы: чтение экспертов через pread в ограниченный пул слотов, выгрузка по LFU + recency, фиксированный stride‑пакетный ввод‑вывод и мгновенная компиляция шейдеров. Архитектурно проект поддерживает альтернативные схемы внимания (Gated DeltaNet, gated GQA), int4/int8‑квантование в Metal и полную систему установки, кэширования и обработки разговоров. В результате на Mac‑е 35‑B модель потребляет лишь 2,6 ГБ RAM и генерирует 7‑11 токен/сек, а 80‑B — 4,3 ГБ и 4,5‑5 токен/сек.

by leonickson • 03 августа 2026 г. в 16:54 • 250 points

ОригиналHN

#gated-deltanet#gqa#int4#metal#moe#qwen3#qwen3-next#qwen3.5#qwen3.6#swift

Комментарии (115)

Тред обсуждает запуск крупных моделей на устройствах с ограниченными ресурсами — iPhone и Mac. По опыту @leonickson, на Mac с 32 ГБ RAM увеличение кэша до 8 ГБ не ускоряет работу — узкое место — GPU, а не RAM. @adrianco советует увеличивать RAM-кэш на устройствах с 24–32 ГБ RAM — это может значительно ускорить работу. @dghlsakjg видит в этом прогресс и предполагает будущее запуска моделей на дешёвом оборудовании, например, SSD за $200. @jarek83 и @arjie спорят о реалистичности запуска 1T-параметровых моделей на таком оборудовании, указывая на ограничения и стоимость. @throwawayffffas и @leonickson обсуждают износ SSD при использовании для моделей; @throwawayffffas отмечает, что у него SSD работает долго без проблем.

Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac (github.com) 🔥 Горячее 💬 Длинная дискуссия

Запуск модели Gemma 4 26B‑A4B в памяти около 2 ГБ позволяет выполнять её на любом Apple Silicon‑Mac, даже с 8 ГБ ОЗУ. TurboFieldfare использует собственный Swift‑Metal‑рантайм, который хранит общий ядро объёмом 1.35 ГБ и кэш KV в FP16, а остальные эксперты потоково читает с SSD, делая возможным работу 14.3‑ГБ модели без полной загрузки. Рунтайм, установщик, командная строка и нативное приложение написаны на Swift 6.2 и Metal 4, поддерживают macOS 26+ и не являются обёрткой вокруг MLX или llama.cpp; в открытом экспериментальном журнале собрано 103 измерения по ядрам, кэшу, вводу и декодированию, а также ссылки на быстрый старт, локальный сервер, бенчмарки, вкладки сообщества, дизайн системы и список экспериментов.

Лицензия – Apache 2.0, а веса модели скачиваются отдельно с Hugging Face и находятся под собственными условиями, проект не связан с Google. Назван в честь дрозда‑певчего, автор Andrey Mikhaylov посвящает его жене‑птицеводке и призывает поддерживать местную дикую природу, напоминая, что иногда просто прикоснуться к траве и послушать птиц – самое красивое, что можно сделать. Эти результаты подтверждают, что даже на устройствах с ограниченной памятью можно достичь почти полной производительности, а поддержка местных сообществ помогает сохранять природу для будущих поколений.

by gitpusher42 • 29 июля 2026 г. в 15:05 • 823 points

ОригиналHN

#gemma#github#huggingface#macos#metal#swift#turbo-fieldfare

Комментарии (288)

Тред описывает опыт запуска модели Gemma 4 26B на Apple Silicon Mac — от MacBook Air с 8 ГБ ОЗУ до MacBook Pro с 64 ГБ. Модель умещается в ~2 ГБ памяти, что позволяет запускать её даже на устройствах с ограниченной памятью, что полезно для локального AI-использования. При наличии 64 ГБ ОЗУ и быстрого SSD достигаются высокие скорости обработки даже при нагрузке на систему. Некоторые сомневаются в целесообразности такого подхода при достаточном объёме ОЗУ, опасаясь замедления. Для macOS 15 требуется удалить или изменить строки кода, связанные с языковой версией, чтобы избежать ошибок компиляции.

Claude Sonnet will ship in Xcode (developer.apple.com) 🔥 Горячее 💬 Длинная дискуссия

Xcode 26 Beta 7

  • macOS 15.4+ требуется
  • Swift 6.1 и Swift 6.0.3 включены
  • iOS 18.4, macOS 15.4, watchOS 11.4, tvOS 18.4, visionOS 2.4 SDK обновлены

Новое

  • Swift Testing теперь по умолчанию
  • Preview canvas работает без симулятора
  • Metal debugger поддерживает mesh shaders
  • Instruments добавлен шаблон Swift Concurrency

Исправлено

  • SourceKit-LSP не крашится при больших проектах
  • Simulator корректно отображает Dynamic Island
  • TestFlight теперь принимает билды с App Intents

Известные проблемы

  • CarPlay симулятор не запускается
  • XCTest может зависать при parallel testing
  • SwiftUI .animation(.default) ломает navigation transitions

Устарело

  • Interface Builder для watchOS storyboards
  • bitcode полностью удалён

Скачать

by zora_goron • 29 августа 2025 г. в 00:44 • 462 points

ОригиналHN

#apple#ios#macos#metal#swift#swiftui#tvos#visionos#watchos#xcode

Комментарии (362)

  • Apple добавил в Xcode бета-версию интеграции с Claude (Sonnet 4) и GPT-5, но модели не поставляются в комплекте: нужен оплаченный аккаунт у Anthropic/OpenAI и передача кода на внешние серверы.
  • Пользователей беспокоят приватность, утечки исходников и отсутствие офлайн-режима; многие считают, что Apple «Sherlock’нула» сторонние плагины.
  • Критика Xcode усилилась: баги, медлительность и плохой UX остаются нерешёнными, а встроенный ИИ не компенсирует недостатки.
  • Наблюдается ирония: Microsoft, первой внедрившей Copilot, теперь теряет эксклюзивность, поскольку Apple, Google и JetBrains внедряют собственные или альтернативные модели.