Qwen3.8-2.4T
Qwen3.8 — новый флагман открытой модели, построенный на архитектуре Qwen3.5 с 2,4 трлн параметров, из которых 95 млрд активно используется. Ключевые новшества: улучшенное кодирование, поддержка агентов с длительным планированием, гибкое управление «мышлением» через параметр reasoning_effort и сохранение контекста рассуждений между сообщениями. В отличие от закрытых аналогов, модель доступна в открытом доступе и может быть развернута через vLLM, SGLang или TokenSpeed, а также использована через официальный API Qwen Cloud.
Особое внимание уделено надёжности завершения многократных задач: модель лучше справляется с агентными сценариями, где требуется последовательное взаимодействие с окружением, и демонстрирует стабильные результаты на бенчмарках вроде SWE‑bench Pro (67,7 %) и PaperBench (93 %). Для оптимального использования рекомендуется sampling‑настройка temperature=1.0, top_p=0.95, top_k=20 и выделение до 262 144 токенов на рассуждения и 131 072 — на финальный ответ. Эти параметры позволяют моделировать сложные цепочки выводов без потери качества.