Qwen 3.8 27B available on Cerebras at 1500 tokens/s 🔥 Горячее 💬 Длинная дискуссия
Cerebras публикует открытые модели в своих публичных эндпоинтах, доступных на бесплатном пробном и pay-as-you-go тарифах с ограничениями по скорости и цене. Сейчас доступны две модели: GPT OSS 120B с 120 млрд параметров, контекстом 65k/131k токенов (бесплатно/платно) и скоростью ~3000 токенов/с, а также Qwen 3.8 27B с 27 млрд параметров, контекстом 64k/128k токенов и скоростью ~1500 токенов/с. Все модели на публичных эндпоинтах являются оригинальными, непруненными версиями — Cerebras не изменяет архитектуру моделей без предупреждения и не предлагает пруненные варианты в shared API. Для хранения используется селективное weight-only квантование (16/8/4 бит), при этом критичные слои хранятся в полной точности с онлайн-деквантизацией, чтобы вычисления выполнялись в высокой точности. Активации, внимание и KV-кэш остаются полной точности и не квантуются. Пруненные модели, такие как те, что получены через REAP-технику, доступны только для исследований на Hugging Face в коллекции Cerebras REAP и не служат производственными эндпоинтами. Cerebras подчеркивает прозрачность: любые будущие сжатые версии будут выделены как отдельные эндпоинты с явным命名ованием, чтобы пользователи могли осознанно выбирать между оригинальными и модифицированными моделями. Это позволяет сохранить доверие и контроль над тем, какая версия модели используется в продакшене.
Комментарии (191)
Cerebras не подходит для агентных задач: несмотря на высокую скорость генерации (до 1500 токенов/с), отсутствует кэширование промптов, что делает его дороже OpenRouter при повторных запросах, даже при более низкой цене за выходные токены ($1.5/M против $2.55/M). Лимиты в минуту (например, 450k TPM для Qwen 3.8 27B исчерпываются за 90 секунд) и учёт кэшированных токенов в лимите приводят к неожиданным расходам. Ограничение контекста в 128k токенов делает модель непригодной для анализа больших кодовых баз (например, Guice library требует 250k). Локальная инференция на RTX 5090/6000 (200–600 токенов/с) экономичнее и стабильнее для агентов, но некоторые пользователи сталкиваются с зацикливанием и потерей контекста у Qwen 3.8 27B. Cerebras удалил Gemma-4 31B с платного тарифа, несмотря на его лучшее понимание намерений, что указывает на фокус только на генерацию кода. Частые ошибки инструментальных вызовов увеличивают затраты, особенно по сравнению с DeepSeek-V4-Flash. Доступ к платформе затруднён: проблемы с регистрацией (redirect loop, блокировка email), отсутствие поддержки вне Discord, ошибки вида «model not found» вместо реальных причин (например, billing restrictions), и невозможность добавить оплату — аккаунты попадают в «limbo». Cerebras не предоставляет доступ к своим моделям через OpenRouter, несмотря на наличие других моделей там, что снижает прозрачность. Для индивидуальных разработчиков без командной поддержки платформа непригодна из-за ограничений на TPM и блокировки доступа к биллингу. В итоге, высокая скорость не компенсирует нехватку кэширования, лимиты и высокую стоимость — Cerebras эффективен только для разовых запросов.
Qwen 3.8 27B is excellent, but it defaults to overthinking things 🔥 Горячее 💬 Длинная дискуссия
Qwen 3.8 27B — Alibaba‑разработанная 27‑параметровая LLM с поддержкой визуального ввода, работает под лицензией Apache 2 и умеет генерировать сложные SVG‑рисунки, но по умолчанию включает «xhigh»‑уровень рассуждений, который превращает простые запросы в часы‑долгие раздумья. На ноутбуке с 128 ГБ RAM и на сервере NVIDIA DGX Spark я использовал 17 ГБ‑квантованную версию в LM Studio, увеличив контекст до 262 144 токенов; при включённом рассуждении модель потратила 21 минуту на создание SVG‑картинки пеликана, а без него — лишь 2 минуту, получив менее детализированный результат.
Запомните:
- 27 Б‑модель помещается в 17 ГБ файла и способна к полноценному генеративному рисованию и коду.
- Параметр
reasoning_effort(xhigh/medium/low) сильно влияет на скорость; отключив «xhigh», время генерации падает почти в 10 раз. - При работе через
llama.cppс MTP‑режимом (draft‑mtp) ускорение достигает ~72 % по сравнению с базовым GGUF‑режимом.
Эти факты показывают, что даже крупные открытые модели теперь доступны для локального использования без дорогостоящего дата‑центра, однако их производительность ограничена пропускной способностью памяти.
Комментарии (292)
Избыточное рассуждение — системная проблема современных LLM, не уникальная для Qwen 3.8: аналогичное поведение у Opus 5, Claude и других моделей. Оно вызвано RLHF и дистилляцией, где перерассуждение выгодно для бенчмарков, но вредит интерактивному использованию: замедляет ответ в 7–9 раз, увеличивает токен-расход и снижает эффективность. Qwen 3.8 27B работает на потребительском железе (M4/M5 Max, 48–128 ГБ RAM), превосходит по качеству 3.6 и сопоставима с Opus 4.6 и Codex 5.3, но из-за медленной работы и неэффективности по токенам непрактична без настройки. Для локального использования рекомендуется квантованные версии Q4, а не 16-битные веса. Уровень рассуждений можно контролировать: через шаблоны GGUF (например, Froggeric), параметры llama.cpp (--thinking-budget, --thinking-message) или принудительные хаки (например, fork @shifto), отключая 'xhigh' и используя 'none' или 'low'. Это снижает задержку, но может слегка ухудшить качество. Для разработчиков — динамическое управление уровнем рассуждений по запросу. Скорость на CPU — до 8 минут на задачу, на GPU — до 11 часов на сложные; при частом использовании облачные API (например, Luna) экономически выгоднее. Модель способна находить баги в фреймворках (например, Next.js), но только после десятков часов рассуждений — непригодна как быстрый отладчик. MTP-слой позволяет предсказывать 6–8 токенов с высокой точностью, что частично компенсирует избыточность в генерации кода и SVG. Избыточное рассуждение делает модели неэффективными для продакшена, где важны скорость и лаконичность, а не идеальный бенчмарк.
Models Are Getting Dumber on Purpose
Модели сознательно «обнуляют» знания ради эффективности: активные параметры падают с сотен миллиардов до 13–40 млрд, но при этом их способность к рассуждению растёт. Например, GLM-5.2 с 40 млрд активных параметров на токен достигает 99,2 % на AIME 2026, а Qwen3.5 9B — 91,3 % при 17 млрд активных. При этом на простых фактических вопросах (SimpleQA) лучший результат — лишь 53 % у Gemini 2.5 Pro, а маленькие модели показывают 80–82 % галлюцинаций. Это происходит потому, что знания занимают «тяжёлый» объём весов (≈2 бита на факт), тогда как алгоритмы рассуждения сжаты до скромного набора процедур, которые легко передаются в компактные модели через синтетические данные и RL‑fine‑tuning.
Таким образом, современные системы хранят лишь «широту» знаний — общую картину мира, достаточную для выбора правильного источника, — а детали (версии API, даты релизов, редкие формулы) вынесены в внешние базы. Это делает их устойчивыми к устареванию фактов, но требует runtime‑подключения к актуальному контенту. В результате ошибки в знаниях становятся обычными данными, исправляемыми без переобучения, а «галлюцинации» превращаются в проверяемые ссылки, что радикально снижает риск уверенного, но неверного ответа. В будущем модель будет почти полностью полагаться на внешние источники, а её веса будут служить лишь гибким «интерпретатором» запросов.
Комментарии (104)
Тред обсуждает перспективы и ограничения моделей, намеренно «обнуляющих» знания для эффективности, и возможность использования плаггабельных моделей для решения конкретных задач. @kennywinker предлагает плаггабельные модели знаний, не требующие знания всех языков программирования. @gopalv и @stanac поддерживают идею систем из нескольких специализированных моделей как более эффективной альтернативы одной универсальной, причём @stanac отмечает, что плаггабельные модели требуют базовых для работы. @jimmaswell возражает: модели с большим объёмом параметров и разнообразным знанием работают лучше, даже если это неочевидно, и структура задачи может скрываться в неожиданных источниках, например, в древних китайских стихах. @lowsong опровергает утверждение автора, что перемещение информации из весов в контекст устраняет галлюцинации — это не гарантирует точности выводов.
Qwen 3.8 27B 🔥 Горячее 💬 Длинная дискуссия
Qwen3.8-27B — новая модель из семейства Qwen с 27 млрд параметров, оптимизированная под FP8-квантование с блоком 128, сохраняющая почти полную точность оригинала. Она сочетает мощь в кодировании, научных задачах и агентных сценариях с поддержкой видеопонимания и гибким контролем рассуждений через параметры reasoning_effort и preserve_thinking. Модель нативно обрабатывает изображения и видео до часа длиной, а контекст поддерживается до 1 млн токенов — в развернутой версии на Qwen Cloud.
Технически, архитектура включает 64 слоя с гейтед DeltaNet и Gated Attention, а также MTP для многотокенного предсказания. В бенчмарках она превосходит предшественников: 73% на Terminal Bench 2.1 (против 63,4% у Qwen3.6) и 61,7% на SWE-bench Pro. Для длинных контекстов рекомендуется настраивать rope_parameters с фактором 2.0 при 524K токенов, а для видео — увеличить longest_edge до 469M для высокой частоты кадров. Модель совместима с vLLM, SGLang и другими фреймворками, а готовая облачная версия с инструментами и 1M контекстом выйдет вскоре.
Комментарии (722)
Qwen 3.8 27B демонстрирует качество, сопоставимое с Opus 4.6, в кодировании и генерации SVG (подтверждено @CMay, @simonw, @swalsh на Mac M5, RTX 3090/4090), но страдает от низкой эффективности: высокое потребление VRAM, медленная генерация и склонность к «переосмыслению» — тратит в 10 раз больше токенов, чем Gemma 4, часто зацикливаясь в режиме xhigh reasoning. @RandyOrion и @c7b утверждают, что качество напрямую зависит от усилий размышления, тогда как @Casteil и @dofm считают это избыточным. Для контроля поведения рекомендуют явно задавать `--chat-template-kwargs '{"preserve_thinking":true,"reasoning_effort":"medium"}'` или использовать шаблоны Jinja от @froggeric. Для ускорения инференса: на RTX 5090 — ninfer (~138 tok/s), на RTX 4090 — оптимизированный llama.cpp с MTP и flash-attn (@hypfer). VRAM-потребление неэффективно: 32K контекста — 2.5 ГБ, 128K не загружается даже при Q4_0 (в отличие от Gemma 4/Muse Glimmer). Квантованные версии от Unsloth (Q8kxl) зацикливаются — стабильнее версии от bartowski в llama.cpp. В немецком языке прогресс минимальный, с регрессиями, уступает Gemini Flash Lite (@scirob). Для бюджетного запуска — Intel B70 с 32 ГБ VRAM за $1500 (@Almondsetat). Модель корректно генерирует JS-приложения и минимизирует ошибки при портировании на Rust/Tauri (@dexterlagan). 1-битное квантование позволяет запустить на 16 ГБ Mac Mini, но требует перезапуска сессии при смене режимов plan/act (@jedbrooke).
Qwen3.8-2.4T 🔥 Горячее
Qwen3.8 — новый флагман открытой модели, построенный на архитектуре Qwen3.5 с 2,4 трлн параметров, из которых 95 млрд активно используется. Ключевые новшества: улучшенное кодирование, поддержка агентов с длительным планированием, гибкое управление «мышлением» через параметр reasoning_effort и сохранение контекста рассуждений между сообщениями. В отличие от закрытых аналогов, модель доступна в открытом доступе и может быть развернута через vLLM, SGLang или TokenSpeed, а также использована через официальный API Qwen Cloud.
Особое внимание уделено надёжности завершения многократных задач: модель лучше справляется с агентными сценариями, где требуется последовательное взаимодействие с окружением, и демонстрирует стабильные результаты на бенчмарках вроде SWE‑bench Pro (67,7 %) и PaperBench (93 %). Для оптимального использования рекомендуется sampling‑настройка temperature=1.0, top_p=0.95, top_k=20 и выделение до 262 144 токенов на рассуждения и 131 072 — на финальный ответ. Эти параметры позволяют моделировать сложные цепочки выводов без потери качества.
Комментарии (148)
Qwen3.8 — модель с 2,4 трлн параметров (95 млрд активных), поддерживает reasoning_effort для регулирования глубины рассуждений и сохраняет контекст рассуждений между сообщениями. Полная версия занимает 5 ТБ, quant-версия — 397 ГБ. Ограничения: нет поддержки зрения в открытой версии, контекст до 250K (можно попытаться расширить через сторонние решения). Для локального запуска требуются мощные ресурсы (например, RTX 5090 + 64 ГБ ОЗУ), но даже этого может не хватить. Сравнивается с Kimi K3, Opus 4.8 и Fable 5: некоторые считают, что у Qwen3.8 нет значительных преимуществ из-за ограничений и размера. Используется для OCR, кодирования и других задач — пользователи делятся результатами экспериментов.
A walk through of the DeltaNet family of linear attention variants 🔥 Горячее
В статье показано, как простые предположения о скрытом состоянии приводят к формуле линейного внимания, известной как Kimi Delta Attention (KDA), которая вытекает из семейства DeltaNet и используется в моделях Qwen и Kimi. Ключевой приём — заменить softmax на умножение на деградирующие матрицы и добавить корректирующий вектор ошибки, что позволяет обновлять состояние рекуррентно и хранить лишь текущий стейт. При этом запросы масштабируются по (d_k^{-1/2}), а ключи нормализованы, чтобы их внутреннее произведение оставалось в пределах одного скаляра. Такой подход превращает квадратичную зависимость от длины последовательности в линейную, а также делает возможным кэширование ключей и значений без роста памяти.
В результате получаем O(1) память и возможность обрабатывать запросы за константное время, а также β‑параметр, задающий экспоненциальный спад, который делает внимание устойчивым к очень длинным контекстам. Реализация KDA в Triton использует кусочные схемы: внутри чанка вычисляются диагональные взаимодействия, а между ними решается триангулярная система, что позволяет параллелить расчёты на GPU. Такой подход лежит в основе эффективного прямого прохода, используемого в последних версиях Qwen и Kimi, и демонстрирует, как простая идея о скрытом состоянии может породить мощный линейный механизм внимания.
Комментарии (106)
Тред обсуждает сложность и интуитивность математической нотации в статье, а также доступность понимания машинного обучения и линейного внимания. Многие находят нотацию запутанной, но некоторые — полезной и ясной. Пользователи делятся трудностями в освоении темы, предлагают ресурсы и примеры, выражают благодарность за обмен опытом. Споры идут о степени сложности разработки линейного внимания и Kimi Delta Attention: одни считают их несложными, другие — требующими глубоких знаний. Некоторые сомневаются в их новизне, называя их комбинацией существующих идей. @dr_kretyn рекомендует bra-ket нотацию как более интуитивную, особенно для физиков.
Qwen-Image-3.0: Rich Content, Authentic Details, Deep Knowledge 🔥 Горячее 💬 Длинная дискуссия
Qwen‑Image‑3.0 представляет третье поколение базовой модели генерации изображений, где ключевое слово — «Real» (实). Модель сочетает три возможности: богатый контент — поддержка до 4,5 к токенов ввода, позволяющая создавать сложные раскладки газет, сценариев и экзаменационных листов; аутентичные детали — точное воспроизведение мелкого текста размером 10 пкс и микроскопических деталей вроде пор и волос; глубокие знания — нативная работа с 12 языками и имитация веб‑страниц, игр и стримов, опирающаяся на обширные знания мира. Например, за один запрос модель нарисовала 3×3‑ячейковый набор сложных инфографик, а описание всех ячеек заняло 3,7 к токенов, но изображение получилось целостным.
Цель проекта — перевести генерацию картинок от «приятного» к «полезному», сделав её продуктивным инструментом в реальных задачах. Благодаря поддержке длинных инструкций, точности мелких деталей и широким знаниям, Qwen‑Image‑3.0 уже применяется для создания газет‑PDF, стрит‑драмы‑сторибордов и сложных интерфейсов, а также в дизайне, контент‑создании, образовании и электронной торговле. Как подчёркивают разработчики, модель «не просто красиво выглядит, а реально работает», открывая путь к массовому использованию в профессиональных потоках.
Комментарии (191)
Обсуждение ставит под сомнение заявленную точность модели и критикует отсутствие открытых весов, бенчмарков и прозрачности. В примерах с корейским текстом находят системные ошибки — смешение символов, искажённые слова и глаголы, — опровергающие обещанную точность генерации текста; тесты на chat.qwen.ai выявляют анатомические артефакты (третья нога, светящиеся глаза), а простой график роста ВВП Польши выходит мусорным. Жёлтый оттенок, идентичный GPT-Image-1, наводит на мысль об обучении на его выходах, бракованное арабское заглавное изображение подрывает доверие к демонстрациям, а механизм связывания текста с картинками без миллионов аннотированных пар остаётся неясным. Сообщество разочаровано отсутствием сроков публикации весов и «пластиковой» эстетикой одинаковых идеализированных лиц, из-за чего заявления об «аутентичности» выглядят парадоксально. Из практики отмечают, что в OCR по-прежнему лидирует Gemini и платные решения всё ещё нужны, спрашивают, требуются ли модели установленные шрифты, и рассуждают, как реалистичные продукт-фото изменят поведение потребителей.
China’s open-weights AI strategy is winning 🔥 Горячее 💬 Длинная дискуссия
Китайская открытая стратегия искусственного интеллекта выигрывает, а закрытая модель американского рынка обречена на провал. Открытые веса моделей почти всегда доминируют в инфраструктурном принятии, потому что их можно размещать где угодно, модифицировать и использовать без ограничений. В отличие от закрытых сервисов, они не требуют привязки к конкретному поставщику и позволяют быстро переключаться между API. Экспортные ограничения США блокируют централизованные глобальные сервисы, но дают Китаю возможность превратить вычислительный недостаток в конкурентное преимущество распространения.
Эти модели уже конкурируют с лучшими от OpenAI и Anthropic, а по оценкам a16z, около 80 % новых стартапов используют китайские открытые решения. Мостовые компании, такие как Moonshot и Qwen, заявляют, что их модели способны держаться на уровне лидеров, но по цене в несколько раз ниже. При этом американские корпорации вынуждены преследовать краткосрочную прибыль, а не экосистемные выгоды, тогда как открытый подход обеспечивает более устойчивый рост. Для сохранения публичных ценностей требуется переориентировать политику и поддержать инициативы вроде публичного AI.
Комментарии (664)
Обсуждение оспаривает тезис о победе открытых весов: высокие счета за инференс на арендованных GPU, отсутствие устойчивой бизнес-модели и предпочтение корпоративных клиентов к закрытым решениям с гарантиями безопасности и нулевым хранением данных. Утверждение о «80% стартапов на китайских моделях» опровергают: по опросам основа — Claude и Codex. Приводят контрдоводы: Llama не принесла успеха Meta; открытость весов не равна открытости данных и архитектуры; некоторые китайские модели вроде Kimi K3 дороже GPT-5.6 Terra; запуск чужой модели у провайдера не снимает риска бэкдоров; нет подтверждений госсубсидий на десятки миллиардов. Отмечают вендор-локин будущих моделей с бесконечным контекстом и маловероятность домашнего запуска из-за требований к железу. Открытость называют стратегией выхода на рынок, а не госдирективой; перспективнее эффективность и аппаратная независимость, а победа открытых моделей возможна лишь при удешевлении оборудования — и не скоро.
Qwen 3.6 27B is the sweet spot for local development 🔥 Горячее 💬 Длинная дискуссия
Qwen 3.6 27B стал «точкой слияния» для локального развития: это первый локальный модель, который ощутимо приближается к всеобщей интеллектуальности, при этом обходит более крупные варианты в практических задачах. Автор отмечает, что 27‑битовая версия «ударяет сзади» — её называют «перепрыгивает выше веса», а в Hacker News её часто называют лучшим компромиссом между мощью и ресурсоёмкостью.
Тестовые сценарии подтверждают возможности: от «пингвинов на велосипеде» до восьмистрочного стихотворения о Зоуке и квантовой физике, от мгновенного создания hexagonal‑minesweeper в OpenCode до генерации полноценной landing‑page для онлайн‑магазина свечей. Запуск локальный прост: через llama.cpp берут 8‑битную квантованную модель (Q8_0), контекст расширяют до 64 k токенов, а flash‑attention и draft‑mtp ускоряют вывод. При работе модель нагревается до такой степени, что её можно отследить тепловизором. Ключевые цифры — 27 B против 35 B, 8‑битное сжатие экономит ~50 % памяти, а контекст до 64 k токенов открывает широкие возможности для локального кодинга и генерации контента.
Комментарии (758)
- Обсуждается, что 128 ГБ MacBook Pro стоит около $6700 и оправдан лишь для приватности, а не для локального запуска крупных моделей.
- Большинство участников считают, что запуск Qwen 3.6 35B и аналогичных моделей на ноутбуке с 128 ГБ ОЗУ неэффективен и невыгодно по цене.
- Существуют более дешевые варианты: облачные сервисы (OpenRouter, Frontier Labs) и видеокарты типа Intel Arc Pro или AMD AI HX 370, которые дают лучшее соотношение цена/производительность.
- Есть мнения, что для «реальной работы» (агентов, сложных задач) нужны более мощные решения, а локальные модели на Mac‑системах часто медленнее, чем ожидалось.
AI World Clocks 🔥 Горячее 💬 Длинная дискуссия
Каждую минуту на сайте AI World Clocks отображаются новые часы, сгенерированные девятью разными AI-моделями. Каждая модель получает 2000 токенов для создания уникального дизайна аналоговых часов с анимированной секундной стрелкой, адаптивным дизайном и белым фоном. Проект представляет собой постоянную демонстрацию творческих возможностей ИИ в создании простых, но визуально разнообразных объектов.
Идея проекта принадлежит Брайану Муру, который вдохновился работой Мэтью Рейфилда. Каждые 60 секунд пользователь видит совершенно новый набор часов, демонстрирующий, как разные ИИ-модели интерпретируют одну и ту же задачу по-разному. Это интересный пример творческого применения генеративного ИИ для создания повседневных объектов, где функциональность сочетается с уникальным визуальным стилем.
Комментарии (352)
- Kimi K2 демонстрирует наибольшую точность и стабильность при генерации циферблатов, включая корректное отображение секундной стрелки.
- Qwen 2.2 и 2.5 выделяются креативными, но часто абсурдными решениями, напоминающими сюрреализм (например, искажённое расположение цифр).
- Большинство моделей испытывают трудности с базовыми задачами: правильным размещением цифр, отображением 13 часов или точным временем.
- Отсутствие визуальной обратной связи у ИИ приводит к непредсказуемым результатам и "когнитивной перегрузке" при решении логических задач.
- Проект сравнивают с тестом на деменцию ("нарисуй часы") и рассматривают как новый "тест Тьюринга" для оценки качества LLM.
Tongyi DeepResearch – open-source 30B MoE Model that rivals OpenAI DeepResearch 🔥 Горячее
Tongyi DeepResearch — первый полностью открытый веб-агент, демонстрирующий производительность на уровне DeepAI OpenAI. Модель достигает передовых результатов: 32.9 на тесте академического рассуждения Humanity's Last Exam, 43.4 на BrowseComp и 46.7 на BrowseComp-ZH в сложных задачах поиска информации, а также 75 на пользовательском бенчмарке xbench-DeepSearch, превосходя все существующие проприетарные и открытые агенты глубоких исследований. Авторы делятся полной методологией создания таких агентов, включая инновационное решение для синтеза данных на всем конвейере обучения.
В основе обучения лежит Agentic Continual Pre-training (CPT) с использованием системы AgentFounder для масштабного синтеза данных. Разработчики создают цикл данных, перегруппируя различные источники в привязанную к сущностям открытую мировую память знаний. Для сложных вопросов с высокой неопределенностью они синтезируют веб-данные через высокосвязанный граф знаний с помощью случайных обходов. Модель демонстрирует мощные возможности в режиме ReAct без инженерии промптов, а продвинутый Heavy Mode раскрывает верхний предел ее потенциала сложного рассуждения и планирования.
Комментарии (133)
- Обсуждение в основном вращается вокруг трёх тем: «Deep Research» как продукт vs. обычный поиск, практичность мелких моделей, и то, что большие модели всё ещё уступают специализированным инструментам в конкретных задачах.
- Участники обмениваются опытом, что мелкие модели (Qwen 3 4B и т.п.) уже способны обеспечить приемлемое качество при минимальных затратах, особенно если квантовать и/или запустить их на Apple Silicon.
- Обсуждается, что влияние этих моделей на рынок: будут ли они заменять крупные модели в нишевых задачах или же будут использованы как основа для дальнейшей настройки.
- Также поднимается вопрос о том, что, возможно, в будущем мы увидим взрыв специализированных моделей, обученных под конкретные задачи, и что это может быть следующим шагом после исчерпания выгод от предобучения.
Alibaba Cloud says it cut Nvidia AI GPU use by 82% with new pooling system 🔥 Горячее 💬 Длинная дискуссия
Alibaba Cloud представила систему объединения вычислительных ресурсов Aegaeon, которая, по их утверждению, позволяет сократить использование графических процессоров Nvidia на 82%. Новая технология способна обслуживать десятки больших языковых моделей, требуя лишь доли GPU, необходимых ранее.
Во время бета-тестирования на платформе Alibaba Cloud Marketplace в течение более трех месяцев количество необходимых Nvidia H20 GPU для работы с моделями до 72 миллиардов параметров сократилось с 1,192 до 213. Исследователи обнаружили, что 17,7% GPU выделялись для обслуживания всего 1,35% запросов, что свидетельствует о значительной неэффективности в работе с одновременными AI-нагрузками.
Работа была представлена на 31-й Симпозиуме по принципам операционных систем (SOSP) в Сеуле. Один из соавторов исследования - главный технолог Alibaba Cloud Чжоу Цзжэньрен. Aegaeon позиционируется как первая работа, раскрывающая чрезмерные затраты на обслуживание одновременных рабочих нагрузок LLM на рынке.
Комментарии (286)
- Эффективность использования GPU в облаке Alibaba — 17,7 % GPU обрабатывает всего 1,35 % запросов, и вместо 1192 GPU теперь используется 213, что на 82 % меньше.
- US-ограничения на экспорт чипов в Китай — вынуждают китайские компании к инновациям, что может привести к созданию более эффективных решений, которые в будущем могут быть использованы в других странах.
- Сравнение моделей — DeepSeek и Qwen от Alibaba Cloud являются наиболее популярными моделями для инференса, в то время как большинство других моделей используются очень редко, что приводит к неэффективному использованию ресурсов.
- Проблема с лицензиями и открытым исходным кодом — Китайские компании, такие как DeepSeek, начинают отказываться от открытого кода, что может повлиять на развитие AI-сообщества.
- Стоимость и доступность GPU — NVIDIA стоит дороже, чем в Китае, но в то же время, китайские компании могут разрабатывать более дешевые и эффективные решения, что может привести к снижению цен на GPU в будущем.
Ollama Web Search 🔥 Горячее 💬 Длинная дискуссия
Ollama представила новый API для веб-поиска, который позволяет моделям получать актуальную информацию из интернета, снижая риск галлюцинаций и повышая точность ответов. Бесплатный тариф доступен для индивидуального использования, а повышенные лимиты — через Ollama Cloud. API интегрирован с Python и JavaScript библиотеками, что упрощает создание инструментов для длительных исследовательских задач, включая работу с моделями вроде OpenAI gpt-oss.
Примеры кода демонстрируют использование через cURL, Python и JavaScript, возвращая структурированные результаты поиска с заголовками, URL и содержанием. Также показано, как построить поискового агента с помощью модели Qwen 3 от Alibaba, используя инструменты web_search и web_fetch для автоматизации запросов и обработки данных. Это расширяет возможности моделей, позволяя им активно взаимодействовать с веб-источниками в реальном времени.
Комментарии (158)
- Вопросы о поисковом провайдере и лицензии на результаты поиска, включая возможность их хранения и перепубликации.
- Сомнения в бизнес-модели Ollama, её переходе от локального хостинга к облачным услугам и планам монетизации.
- Обсуждение технических альтернатив для локального поиска и индексации, а также интеграции с Ollama.
- Критика запуска функции веб-поиска без четкой документации по тарифам, лимитам и политике конфиденциальности.
- Предложения и опыт использования сторонних инструментов для поиска (SearXNG, Tavily, SERP API) и локальных решений.
Qwen3-VL 🔥 Горячее
Qwen — это серия больших языковых моделей, разработанных Alibaba Group. Модели Qwen, включая версии для генерации текста, кода и мультимодальных задач, позиционируются как открытые и конкурентоспособные альтернативы другим известным ИИ, таким как GPT от OpenAI. Они поддерживают длинный контекст, мультиязычность и специализированные применения, например, для программирования или анализа данных.
Qwen2, следующее поколение, демонстрирует улучшенную производительность, эффективность и расширенные возможности, включая работу с аудио и изображениями. Модели доступны в различных размерах, от компактных версий для устройств с ограниченными ресурсами до мощных вариантов для сложных задач, что делает их гибким инструментом для разработчиков и исследователей.
Комментарии (131)
- Пользователи высоко оценили производительность модели Qwen3-VL при обработке сложных изображений (например, низкокачественных счетов), отмечая её превосходство над другими решениями.
- Обсуждаются технические и экономические аспекты запуска больших моделей (235B параметров) локально, включая требования к оборудованию и стоимость вычислений.
- Модель позиционируется как конкурентоспособная с закрытыми SOTA-решениями (GPT-4, Omni) при значительном снижении стоимости использования.
- Критикуются отдельные недостатки, характерные и для других мультимодальных моделей: ошибки в анализе edge-кейсов (например, подсчет конечностей у животных).
- Отмечается активность и щедрость команды Qwen в публикации моделей с открытыми весами и их вклад в развитие open-source сообщества.