New Mac Studio with M5 Max and M5 Ultra 🔥 Горячее 💬 Длинная дискуссия
Apple анонсировала новый Mac Studio с процессорами M5 Max и M5 Ultra, позиционируя его как мощный настольный компьютер для ИИ-задач и экстремальных профессиональных рабочих процессов. M5 Max предлагает 18-ядерный CPU, до 40-ядерный GPU с нейроакселераторами в каждом ядре и до 128 ГБ унифицированной памяти, обеспечивая до 4,3× ускорение ИИ-производительности и до 1,8× рост графической мощности по сравнению с предыдущим поколением. M5 Ultra удваивает эти показатели: 36-ядерный CPU, до 80-ядерный GPU и впечатляющие 512 ГБ унифицированной памяти, что позволяет запускать огромные языковые модели полностью на устройстве. Оба варианта поддерживают пропускную способность памяти до 614 ГБ/с, Wi-Fi 7, Bluetooth 6 и Thunderbolt 5, который также позволяет объединять несколько Mac Studio в кластер для распределённого ИИ-вывода с до 3× ускорением по сравнению с одиночной системой.
Mac Studio позируется как полноценная платформа для разработки ИИ благодаря новым фреймворкам Core AI и MLX, оптимизированным под Apple Silicon, которые совместно с Xcode и macOS 27 обеспечивают полный цикл работы: от экспериментов и обучения моделей до их локального развёртывания. Поддержка Apple Intelligence и Siri AI дополняет экосистему, делая систему привлекательной для разработчиков, исследователей, данных учётов и креативных профессионалов. Устройство доступно для предзаказа с 25 августа 2026 года, а начало продаж — 22 сентября. Thunderbolt 5 также расширяет возможности подключения внешних накопителей, PCIe-шасси и хабов для самых интенсивных нагрузок.
Комментарии (493)
Обсуждение дополняет анонс Apple, подчеркивая, что M5 Ultra — это мощный, но чрезвычайно дорогой инструмент для локального ИИ, который подходит лишь узкому кругу профессионалов, а не массовому рынку, и его цена не оправдана для большинства пользователей, особенно при наличии более доступных облачных альтернатив.
-
Совет: Пользователь @joshstrange предлагает заменить закрепленный MBP на Mac Studio с Neo для редких удаленных задач, так как это экономит деньги и упрощает инфраструктуру.
-
Спор: @kristianp оспаривает утверждение Apple о возможности использования Mac Studio как сервера LLM для офиса, утверждая, что скорость токенов слишком низка для бизнес-применений, и лучше купить несколько GPU NVIDIA.
-
Совет: @alberth указывает, что 512 ГБ оперативной памяти для M5 Ultra появится только в октябре, а базовая версия M6 ограничена 32 ГБ, что подтверждает ограничения в текущей конфигурации.
-
Совет: @tristor отмечает, что 512 ГБ — это лишь порог «достаточно», а для надежного запуска моделей >1T параметров с 4-битным квантованием требуется 1 ТБ памяти, что Apple не предлагает.
-
Совет: @gizajob и @nythroaway048 отмечают отсутствие 1 ТБ опции как стратегическое ограничение Apple, несмотря на спрос со стороны финансово обеспеченных пользователей и исследователей.
-
Совет: @vadansky спрашивает, можно ли ожидать производительности Opus на M5 Max с 256 ГБ, что указывает на нехватку прямых сравнений производительности моделей LLM на этих чипах.
-
Совет: @swader999 подчеркивает, что облачные решения стоят дешевле ежемесячной аренды Mac Studio, что делает локальный ИИ на этом устройстве экономически нецелесообразным для многих.
-
Совет: @mythz считает, что цена 164 ГБ оперативной памяти в $4000 — это «апокалипсис памяти», и предлагает перейти на M6 Mac Mini как временное решение, пока цены не упадут.
-
Совет: @nico_h утверждает, что текущие цены на память неустойчивы и неоправданы для корпоративных клиентов, так как стоимость токена ниже реальной стоимости его генерации.
-
Совет: @ChildOfChaos советует ждать два года, чтобы цены снизились или появилась более доступная альтернатива, так как текущие цены слишком высоки.
-
Совет: @prometheus1992 предупреждает, что новые Mac Studio и Mac Mini будут в дефиците как минимум шесть месяцев после 22 сентября, что влияет на доступность.
-
Совет: @gigatexal шутливо сравнивает стоимость M5 Ultra с BMW 3 серии, подчеркивая, что устройство — это роскошь, а не необходимость для большинства.
-
Совет: @jdeaton отмечает, что Mac Studio не поддерживает Linux, что исключает его для разработчиков, зависящих от Linux-экосистемы.
-
Совет: @OneWhereWhy выражает опасения по поводу тепловыделения PCIe Gen 6 SSD в настольных ПК, так как ранее такие диски использовались только в корпоративных системах с лучшим охлаждением.
-
Совет: @drnick1 предлагает, чтобы Apple вернулась к традиционным ATX-башням с расширяемыми слотами, чтобы улучшить апгрейд, охлаждение и гибкость, а не делать компактные, неремонтопригодные устройства.
Muse Glimmer: 30B-parameter model optimized for always-on local agent workflows 🔥 Горячее 💬 Длинная дискуссия
Muse Glimmer — 30‑модель с открытыми весами, предназначенная для работы агентов непосредственно на вашем устройстве. Она умеет планировать расписание, писать сообщения, организовывать файлы и учиться вашему стилю работы, используя длительные контексты, точный вызов инструментов и многомодальное понимание. Благодаря эффективному дистилляционному рецепту и оптимизациям (квантование, DFlash‑спекулятивное декодирование) модель укладывается в память обычного ноутбука или ПК с одной видеокартой и генерирует ответы в реальном времени.
Ключевые возможности: — полноценное выполнение задач (DeepSearch QA, MCP‑Atlas, 𝛕‑Bench, SWE‑Bench); — надёжный вызов функций в длительных цепочках; — цепочки рассуждений длиной в несколько шагов; — восстановление после ошибок инструментов. На MacBook M4‑Max, M5‑Max и RTX 5090 скорость декодирования ускоряется в 1,5–3,1 раза благодаря DFlash. Веса модели уже доступны на Hugging Face, а в ближайшее время появятся интеграции с llama.cpp, MLX, ExecuTorch и партнёрами (Ollama, LM Studio и др.), что позволит быстро запустить собственного локального агента.
Комментарии (526)
Тред дополняет статью практическим опытом использования Muse Glimmer, сравнениями с другими моделями (например, Qwen3.6 27B), техническими деталями и потенциальными применениями. Пользователи отмечают хорошую работу модели, но требуют 32–64 ГБ ОЗУ. Рекомендуют оптимизации — квантование и DFlash-спекуляция — для улучшения производительности на слабых устройствах. Модель применима для планирования, написания сообщений, организации файлов и адаптации к стилю пользователя. Указываются ограничения: высокие требования к памяти и возможные проблемы с производительностью на устройствах с ограниченными ресурсами.
Bonsai 27B: A 27B-Class model that runs on a phone 🔥 Горячее 💬 Длинная дискуссия
Сегодня анонсирован Bonsai 27B — модель на 27 млрд параметров, основанная на Qwen3.6 27B, впервые способная полностью работать на смартфоне. Существует две версии: трёночная (ternary) с весами {−1,0,+1} и 1‑битовая, использующие групповой масштабирование FP16. Трёночная модель занимает 5,9 ГБ, 1‑битовая — 3,9 ГБ и помещается в память iPhone 17 Pro, при этом сохраняет весь набор функций: мультишаговое рассуждение, вызов инструментов, агентные циклы и мультимодальный vision‑токен. Оба варианта поддерживают 262 K‑токенный контекст, спекулятивное декодирование и полностью работают в низкой точности без перехода в более высокие форматы.
По оценкам на 15‑балльном наборе тестов, включая математику, программирование, вызовы инструментов и визуальные задачи, трёночная версия удерживает 95 % точности полной модели, а 1‑битовая — 90 %. Показатель «интеллектуальной плотности» достигает 0,53 единиц на гигабайт, в 10 раз превышая полноразрядный аналог и в 2,7 раза лучше лучших традиционных низко‑битовых схем. 1‑битовый вариант почти не отстаёт от полной версии в задачах рассуждения и кодирования, а его память в 2,5 раза меньше, чем у самых агрессивных обычных низко‑битовых построек. Весь набор весов доступен по лицензии Apache 2.0, поддерживается MLX на Apple‑устройствах и CUDA на NVIDIA‑GPU, а бесплатный API‑превью уже открыт для разработчиков.
Комментарии (215)
- Bonsai 27B с квантованием до 1–1.58 бит показывает впечатляющую производительность на CPU и мобильных устройствах, конкурируя с более крупными моделями.
- Пользователи отмечают значительное падение в задачах вызова инструментов и странности в ответах (например, неверные макронутриенты), что ставит под сомнение практическую надёжность.
- Инфраструктура для инференса на CPU (llama.cpp, bitnet.cpp) пока не оптимизирована для тернарных моделей, что снижает скорость по сравнению с Q4-квантованными аналогами.
- Мнения разделились: одни видят в этом сдвиг парадигмы к локальным ИИ, другие считают результаты переоценёнными или искусственными, особенно из-за сильного квантования.
- Открытые модели доступны на Hugging Face, но многие инструменты (LM Studio, Ollama) пока не поддерживают их, требуя обновлений или кастомных сборок.
A bug that taught me more about PyTorch than years of using it 🔥 Горячее
Плато обучения в модели PyTorch оказалось не ошибкой гиперпараметров, а багом в бэкенде фреймворка. Автор провёл детективное расследование, которое научило его больше о PyTorch, чем годы использования. Проблема заключалась в ядре MPS для Apple Silicon, где операции addcmul_ и addcdiv_ при работе с ненепрерывными тензорами молча записывали результаты во временный буфер вместо самого тензора.
Из-за инициализации весов энкодера как транспонированных декодера они получали ненепрерывную память, которая наследовалась состояниями оптимизатора Adam. Это приводило к тому, что exp_avg_sq.addcmul_() не обновлялся, оставаясь нулевым, что полностью останавливало обновление параметров. Исправить проблему можно, сделав веса непрерывными при инициализации, обновив PyTorch до версии ≥2.4 или перейдя на macOS 15+.
Комментарии (78)
- Найдена ошибка в градиентах для Apple MPS в PyTorch, вызванная неправильной обработкой не-непрерывных тензоров.
- Сообщество обсуждает, что подобные ошибки встречаются и в других библиотеках и бэкендах, и что их трудно отследить.
- Участники обсуждают, что Apple не поддерживает PyTorch и вместо этого развивает собственный фреймворк MLX, что ведет к фрагментации экосистемы.
- Обсуждается, что отсутствие должной поддержки PyTorch на macOS приводит к тому, что исследователи сталкиваются с такими ошибками, которые могут быть неочевидны и влиять на результаты экспериментов.
What's the strongest AI model you can train on a laptop in five minutes? 🔥 Горячее 💬 Длинная дискуссия
Сильнейшая модель за 5 минут на ноутбуке
Победитель: 1.8-млн-параметровный GPT-подобный трансформер, обученный на ~20 млн токенов TinyStories и показавший 9.6 перплексии. Пример:
Once upon a time, there was a little boy named Tim…
Ограничение времени
5 минут — это ~300 млн токен-шагов. Большие модели не успевают, мелкие (10 k) быстро выходят на плато. Оптимум — 1-2 млн параметров.
Скорость
На M1 Pro (MPS) достигал 3000 ток/с.
torch.compile,float16, MLX — без выгоды.- Градиентное накопление тормозит.
- Главное: минимальный размер модели и MPS.
Датасет
Simple Wikipedia давала факты без смысла («Paris, France is a city in North Carolina»).
TinyStories (рассказы уровня 4-летнего) — простые паттерны, мало имён, быстрая сходимость.
Комментарии (181)
- Обсуждение вращается вокруг тренировки маленьких языковых моделей на ноутбуке: почему это важно для науки и практики.
- Участники сравнивают ограничения по времени, энергии (джоулям) и железу; предлагают «AI-олимпиаду» за лучший результат на данный бюджет.
- Приводятся конкретные приёмы: Muon-оптимизатор, улучшенная инициализация, «cramming» за день на лэптопе, идея специализированных моделей «под задачу».
- Задаются вопросы о данных, переобучении, диффузных архитектурах и о том, когда марковская цепь окажется достаточной.
- В целом тон оптимистичен: даже на обычном ноутбуке можно быстро экспериментировать и учиться, не дожидаясь супер-кластеров.