DeepSeek peak/off-peak pricing update
DeepSeek-V4-Pro официально запущен с улучшениями для агентных задач: теперь доступны три уровня усилий рассуждения — от минимальных для простых запросов до максимальных для сложных сценариев. Модель интегрирована с OpenAI-совместимым API, включая одну кнопку для настройки с Codex, что упрощает внедрение в существующие рабочие процессы. Доступна как в веб-интерфейсе через «Expert Mode», так и через API — с теми же именами моделей, что и раньше.
Цены на API обновлены: введены тарифы в часы пик и вне пика — скидка до 50% в непиковые часы, что позволяет оптимизировать затраты на нагрузку. Новые тарифы вступают в силу 16:00 UTC 16 августа 2026 года. Бенчмарки показывают значительный рост производительности по сравнению с предыдущими версиями, особенно в задачах, требующих глубокого анализа.
Комментарии (101)
Цены на DeepSeek-V4-Pro выросли в 2–6 раз, зависят от времени суток (ниже ночью) и могут превышать стоимость альтернатив, таких как Baseten или Luna. Пользователи расходятся во мнениях: одни считают цены завышенными, другие — оправданными. Рекомендуется использовать альтернативные решения или откладывать запросы на более дешёвые часы.
DeepSeek-V4-Flash Update 🔥 Горячее 💬 Длинная дискуссия
DeepSeek‑V4‑Flash теперь доступен в публичном бета‑режиме: достаточно указать модель deepseek‑v4‑flash, а метод вызова API не меняется. По новым публичным бенчмаркам она превосходит V4‑Pro‑Preview: Terminal Bench 2.1 – 82.7, NL2Repo – 54.2, Cybergym – 76.7, DeepSWE – 54.4, Toolathlon – 70.3, Agent Last Exam – 25.2, Automation Bench (Публичный) – 25.1, DSBench‑FullStack – 68.7, DSBench‑Hard – 59.6. Тесты на публичных наборах проводились в минимальном режиме DeepSeek Harness с topp=0.95 и temperature=1.0. Модель поддерживает формат Responses API и адаптирована под Codex; архитектура и размер такие же, как у Flash‑Preview, только дообученная. DeepSeek‑V4‑Pro выйдет скоро, а текущий релиз касается только Flash.
Ранее компания объявила о выпуске DeepSeek‑V4‑Pro и Flash через OpenAI‑ и Anthropic‑совместимые интерфейсы, после чего старые имена deepseek‑chat и deepseek‑reasoner будут удалены 24 июля 2026 года. Модели V3.2‑Exp и V3.2‑Speciale показывают рост: HumanEval – 84.76 %, MATH – 71.02 %, BBH – 83.40 %, а в Arena‑Hard их победа над GPT‑4‑0314 выросла до 68.3 %. В публичных тестах использовался минимальный режим DeepSeek Harness с topp=0.95 и temperature=1.0, а внутренние наборы DSBench‑FullStack и DSBench‑Hard включают сложные задачи полного стека. Кроме того, в V3.2‑Exp точность JSON‑вывода достигла 97 % благодаря регулярным выражениям, а роль‑плейинг стал более гибким, позволяя модели принимать любые персонажи.
Комментарии (255)
DeepSeek-V4-Flash демонстрирует высокую производительность, низкую стоимость и быструю работу, особенно в кодировании, реализации и оптимизации. Пользователи сравнивают её с GPT 5.6 Luna, Kimi K3 и GLM 5.2: DeepSeek-V4-Flash эффективнее в технических задачах, но может уступать другим моделям в генерации текста и ответах на вопросы. Отмечаются риски безопасности — возможная утечка данных и влияние на производительность других моделей. Рекомендуется применять DeepSeek-V4-Flash там, где важны скорость и стоимость, а другие модели — для творческих и аналитических задач.
GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2 🔥 Горячее 💬 Длинная дискуссия
Большие модели больше не гарантируют лучшего понимания — их «ум» часто Plateau‑ит, а точность падает из‑за чрезмерного доверия к собственным ответам. Недавние сравнения показывают, что открытая GLM‑5.2 (≈753 млрд параметров) почти догоняет закрытые GPT‑5.5 и Claude 5, но её галлюцинации составляют лишь 28 %, тогда как у GPT‑5.5 — 86 %. При этом DeepSeek V4 Pro (1,6 Трл параметров) выдаёт 94 % ошибок на бенчмарке «Omniscience», а Opus 4.8 — 36 %. Технические тесты подтверждают: даже при большом объёме вычислительных ресурсов модель может уверенно предложить неверное решение, не признавая своей неуверенности.
Эта ситуация формирует трилемму современных ИИ:raw‑capability, калибровка неопределённости и вычислительная эффективность. Увеличивать размер и «рассудочный бюджет» бессмысленно, если модель начинает продавать вымысел за правду. Поэтому будущее — в выборе моделей, способных честно сообщать «не знаю», а не в гонке за всё более массивными, но менее надёжными системами.
Комментарии (293)
- Оценка галлюцинаций усложняется тем, что она зависит от того, когда модель не знает ответа и от распределения задач в тесте.
- Увеличение размеров моделей часто не повышает точность и может ухудшать способность «отказываться» от неправильных ответов.
- Некоторые крупные модели (DeepSeek V4 Pro, GLM‑5.2) показывают разный уровень галлюцинаций, при этом небольшие модели иногда справляются лучше.
- Необходимо развивать более точную классификацию ошибок ИИ, а не ограничиваться общим термином «галлюцинация».