GLM-5.3 is now open-weight 🔥 Горячее 💬 Длинная дискуссия
GLM-5.3 — это открытая модель с теми же весами, что и GLM-5.2, но с существенным улучшением благодаря пост-обучению. Она демонстрирует 50% рост в внутреннем тесте Z.ai Code Bench по сравнению с GLM-5.2 и достигает SOTA среди открытых моделей на публичных бенчмарках, включая Terminal Bench 3.0 (28.3 vs 4.6 у GLM-5.2) и Agents' Last Exam (28.5 vs 23.8). Особенно выделяется её способность к долгосрочному планированию и сложному коду.
В области кибербезопасности GLM-5.3 показывает неожиданно быстрый рост способностей: на CyberGym она лидирует с 84.5% (против 77.2 у GLM-5.2), а на этапах эксплуатации уязвимостей более чем удваивает результаты предшественницы — например, на ExploitGym (2h/6h) достигает 105/130 против 29/39 у GLM-5.2, а на ExploitBench — 54.4% против 24.4%. Модель поддерживает гибкое управление объёмом рассуждений через параметр reasoning_effort (low/high/max, по умолчанию max) и требует явного указания clear_thinking=true в шаблоне чата для корректной работы. Развёртывание возможно через SGLang, vLLM, Transformers и другие фреймворки, включая поддержку Ascend NPU.
Комментарии (228)
GLM-5.3 и его Flash-версия показали значительный рост производительности благодаря пост-обучению, а не увеличению размера, и конкурируют с проприетарными моделями при более низкой стоимости и возможности локального запуска. GLM-5.3 прибавил 50% в Z.ai Code Bench относительно GLM-5.2 и достиг SOTA среди открытых моделей на Terminal Bench 3.0 и Agents' Last Exam. GLM-5.3-Flash отвечает быстрее DeepSeek-V4-Flash (108 с против 154 с) при сопоставимой цене за задачу, что делает его предпочтительным для латенси-чувствительных сценариев. Улучшения достигнуты на той же базе весов, что и GLM-5.2, — за счёт качества тренировочных сред и валидаторов. GLM-5.3-Flash также демонстрирует лучшее соотношение токенов к точности, снижая избыточное «переразмышление» по сравнению с Qwen3.8 и GLM-5.2. В Q3-квантовании он уже превосходит многие модели 100B–200B по глубине мышления и внутренним тестам, а в задачах кодирования считается лучшим выбором, обходя DS4Flash и Stealth Ox-Alpha. Локальный запуск GLM-5.3 возможен на 512 ГБ RAM (Mac M5 Ultra или сервер с Epyc) и окупается: модели на старом железе показывают заметный рост, например с AA-счёта 24 до 57. Отмечается спор: часть пользователей считает вложения в дорогое локальное железо неоправданными из-за быстрого удешевления облачных API, другие — что локальная инфраструктура становится выгоднее со временем. Также обсуждается, что GLM-5.3 слаб в прозаических ответах и трудно настраивается на естественный стиль, но превосходит другие модели в рутинных задачах и кодировании. Практические советы: для длительной обработки выгоднее сервер с двойными Xeon и 512 ГБ RAM — он дешевле Mac M5 Ultra, хотя медленнее, и может работать в гараже из-за шума. GLM-5.3-Flash лучше использовать как исполнителя, а Kimi или другие модели — как планировщик. Для специализированных задач (например, поиск сделок) GLM-5.3 подходит как база для fine-tuning или LoRA-адаптации. Протестировать Flash-версию можно на OpenRouter через DeepInfra. Ограничения: GLM-5.3-Flash не поддерживает изображения, что не критично для текстовых и кодовых задач. Несмотря на более высокую цену по сравнению с GLM-5.2, переход на Flash-версию считается оправданным из-за значительного превосходства.
Qwen 3.8 27B 🔥 Горячее 💬 Длинная дискуссия
Qwen3.8-27B — новая модель из семейства Qwen с 27 млрд параметров, оптимизированная под FP8-квантование с блоком 128, сохраняющая почти полную точность оригинала. Она сочетает мощь в кодировании, научных задачах и агентных сценариях с поддержкой видеопонимания и гибким контролем рассуждений через параметры reasoning_effort и preserve_thinking. Модель нативно обрабатывает изображения и видео до часа длиной, а контекст поддерживается до 1 млн токенов — в развернутой версии на Qwen Cloud.
Технически, архитектура включает 64 слоя с гейтед DeltaNet и Gated Attention, а также MTP для многотокенного предсказания. В бенчмарках она превосходит предшественников: 73% на Terminal Bench 2.1 (против 63,4% у Qwen3.6) и 61,7% на SWE-bench Pro. Для длинных контекстов рекомендуется настраивать rope_parameters с фактором 2.0 при 524K токенов, а для видео — увеличить longest_edge до 469M для высокой частоты кадров. Модель совместима с vLLM, SGLang и другими фреймворками, а готовая облачная версия с инструментами и 1M контекстом выйдет вскоре.
Комментарии (722)
Qwen 3.8 27B демонстрирует качество, сопоставимое с Opus 4.6, в кодировании и генерации SVG (подтверждено @CMay, @simonw, @swalsh на Mac M5, RTX 3090/4090), но страдает от низкой эффективности: высокое потребление VRAM, медленная генерация и склонность к «переосмыслению» — тратит в 10 раз больше токенов, чем Gemma 4, часто зацикливаясь в режиме xhigh reasoning. @RandyOrion и @c7b утверждают, что качество напрямую зависит от усилий размышления, тогда как @Casteil и @dofm считают это избыточным. Для контроля поведения рекомендуют явно задавать `--chat-template-kwargs '{"preserve_thinking":true,"reasoning_effort":"medium"}'` или использовать шаблоны Jinja от @froggeric. Для ускорения инференса: на RTX 5090 — ninfer (~138 tok/s), на RTX 4090 — оптимизированный llama.cpp с MTP и flash-attn (@hypfer). VRAM-потребление неэффективно: 32K контекста — 2.5 ГБ, 128K не загружается даже при Q4_0 (в отличие от Gemma 4/Muse Glimmer). Квантованные версии от Unsloth (Q8kxl) зацикливаются — стабильнее версии от bartowski в llama.cpp. В немецком языке прогресс минимальный, с регрессиями, уступает Gemini Flash Lite (@scirob). Для бюджетного запуска — Intel B70 с 32 ГБ VRAM за $1500 (@Almondsetat). Модель корректно генерирует JS-приложения и минимизирует ошибки при портировании на Rust/Tauri (@dexterlagan). 1-битное квантование позволяет запустить на 16 ГБ Mac Mini, но требует перезапуска сессии при смене режимов plan/act (@jedbrooke).
Qwen3.8-2.4T 🔥 Горячее
Qwen3.8 — новый флагман открытой модели, построенный на архитектуре Qwen3.5 с 2,4 трлн параметров, из которых 95 млрд активно используется. Ключевые новшества: улучшенное кодирование, поддержка агентов с длительным планированием, гибкое управление «мышлением» через параметр reasoning_effort и сохранение контекста рассуждений между сообщениями. В отличие от закрытых аналогов, модель доступна в открытом доступе и может быть развернута через vLLM, SGLang или TokenSpeed, а также использована через официальный API Qwen Cloud.
Особое внимание уделено надёжности завершения многократных задач: модель лучше справляется с агентными сценариями, где требуется последовательное взаимодействие с окружением, и демонстрирует стабильные результаты на бенчмарках вроде SWE‑bench Pro (67,7 %) и PaperBench (93 %). Для оптимального использования рекомендуется sampling‑настройка temperature=1.0, top_p=0.95, top_k=20 и выделение до 262 144 токенов на рассуждения и 131 072 — на финальный ответ. Эти параметры позволяют моделировать сложные цепочки выводов без потери качества.
Комментарии (148)
Qwen3.8 — модель с 2,4 трлн параметров (95 млрд активных), поддерживает reasoning_effort для регулирования глубины рассуждений и сохраняет контекст рассуждений между сообщениями. Полная версия занимает 5 ТБ, quant-версия — 397 ГБ. Ограничения: нет поддержки зрения в открытой версии, контекст до 250K (можно попытаться расширить через сторонние решения). Для локального запуска требуются мощные ресурсы (например, RTX 5090 + 64 ГБ ОЗУ), но даже этого может не хватить. Сравнивается с Kimi K3, Opus 4.8 и Fable 5: некоторые считают, что у Qwen3.8 нет значительных преимуществ из-за ограничений и размера. Используется для OCR, кодирования и других задач — пользователи делятся результатами экспериментов.
Running GPT-OSS-120B at 500 tokens per second on Nvidia GPUs 💬 Длинная дискуссия
-
В день выхода открытой модели вроде gpt-oss-120b мы сразу ускоряем её для клиентов, как партнёры запуска OpenAI. К концу дня запуска стали лидерами на NVIDIA по латентности и пропускной способности по данным OpenRouter.
-
Быстрая оптимизация обеспечена гибким стеком инференса и экспертизой команды; за время написания поста прибавили ещё ~100 ток/с при 100% аптайме.
-
Работы включали:
- Тесты и бенчмарки в TensorRT-LLM, vLLM и SGLang.
- Совместимость с архитектурами Hopper и Blackwell.
- Интеграцию с нашим стеком (в т. ч. NVIDIA Dynamo).
- Оптимизации: маршрутизация с учётом KV-кэша, спекулятивная генерация с Eagle.
Шаг 1: Первый инференс
- Запускаем базовый инференс в любом доступном фреймворке и на нужных GPU/серверных уровнях.
- Параллелим работу: одни пробуют vLLM и SGLang, другие — TensorRT-LLM; быстрее всего взлетел TensorRT-LLM.
- Важно обслуживать модель и на Hopper (H100), и на Blackwell (B200) для широкой доступности и максимальной скорости.
- Гибкость рантайма позволяет быстро переключать инструменты и обновлять матрицу поддержки.
Шаг 2: Исправление багов совместимости
- Новые архитектуры приводят к тонким несовместимостям; GPT OSS добавил, например, Harmony — новый формат ответов.
- Итеративно чиним и валидируем на скорость и корректность; по возможности контрибутим обратно в open source.
- Благодаря сообществу есть несколько отличных путей запуска GPT OSS, проблемы быстро выявляются и чинятся.
Шаг 3: Оптимизация конфигурации
- Хотя GPT OSS 120B можно запустить на одном H100, оптимально масштабировать на 4–8 GPU для лучшей латентности/throughput.
- Рассмотрены два подхода параллелизма для MoE: тензорный и экспертный. Тензорный даёт меньшую задержку, экспертный — выше системную пропускную способность. Мы выбрали тензорный, так как приоритет — латентность.
- Приняли MoE Backend в TensorRT-LLM (поддерживается на Blackwell, не на Hopper), который добавляет более быстрые CUDA-ядра и превосходит предыдущие решения.
Комментарии (151)
- Обсуждение крутится вокруг запуска и производительности GPT-OSS (20B/120B) на разном железе: от MacBook M-серии и RTX 4090/3050 до датацентровых H100/Blackwell и даже CPU.
- Многие отмечают, что скорость хороша при малых контекстах; при >10k токенов начинается существенная деградация скорости и рост задержек, особенно без MCP/веб-доступа.
- TensorRT-LLM часто даёт лучшую латентность/пропускную способность, но сложен в настройке; альтернативы вроде vLLM/SGLang проще, Llama/Оllama позволяют быстро поднять 20B локально и даже распределить по старым GPU.
- Идут споры о “доступности” H100: купить дорого, но аренда широко доступна и выгоднее для нерегулярных нагрузок; при этом Blackwell с FP4 обещает ещё больший буст, в экосистеме Rust добавляют FP8/FP4.
- Пользователи спрашивают про требования к VRAM, практичную локальную агентную разработку на потребительских GPU, и оптимальные настройки на Mac (например, iogpu.wired_limit_mb).
- Обсуждают техники ускорения (спекулятивное декодирование — вызывающее вопросы пользы), причины падения токен/с при длинных диалогах, и различие prefill vs decode по узким местам.
- Наряду с похвалами скорости есть критика: сложность стеков, неточности/галлюцинации ответов, «извиняльный» контент, и вопрос — зачем OpenAI выпускает OSS-модели и как это соотносится с доступностью железа.