Hacker News Digest

Тег: #deepseek-v4-pro

Постов: 3

DeepSeek peak/off-peak pricing update (api-docs.deepseek.com)

DeepSeek-V4-Pro официально запущен с улучшениями для агентных задач: теперь доступны три уровня усилий рассуждения — от минимальных для простых запросов до максимальных для сложных сценариев. Модель интегрирована с OpenAI-совместимым API, включая одну кнопку для настройки с Codex, что упрощает внедрение в существующие рабочие процессы. Доступна как в веб-интерфейсе через «Expert Mode», так и через API — с теми же именами моделей, что и раньше.

Цены на API обновлены: введены тарифы в часы пик и вне пика — скидка до 50% в непиковые часы, что позволяет оптимизировать затраты на нагрузку. Новые тарифы вступают в силу 16:00 UTC 16 августа 2026 года. Бенчмарки показывают значительный рост производительности по сравнению с предыдущими версиями, особенно в задачах, требующих глубокого анализа.

by fagnerbrack • 14 августа 2026 г. в 09:55 • 181 points

ОригиналHN

#api#codex#deepseek#deepseek-v4-pro#expert-mode#off-peak#openai-compatible#peak#pricing#web-interface

Комментарии (101)

Цены на DeepSeek-V4-Pro выросли в 2–6 раз, зависят от времени суток (ниже ночью) и могут превышать стоимость альтернатив, таких как Baseten или Luna. Пользователи расходятся во мнениях: одни считают цены завышенными, другие — оправданными. Рекомендуется использовать альтернативные решения или откладывать запросы на более дешёвые часы.

DeepSeek-V4-Flash Update (api-docs.deepseek.com) 🔥 Горячее 💬 Длинная дискуссия

DeepSeek‑V4‑Flash теперь доступен в публичном бета‑режиме: достаточно указать модель deepseek‑v4‑flash, а метод вызова API не меняется. По новым публичным бенчмаркам она превосходит V4‑Pro‑Preview: Terminal Bench 2.1 – 82.7, NL2Repo – 54.2, Cybergym – 76.7, DeepSWE – 54.4, Toolathlon – 70.3, Agent Last Exam – 25.2, Automation Bench (Публичный) – 25.1, DSBench‑FullStack – 68.7, DSBench‑Hard – 59.6. Тесты на публичных наборах проводились в минимальном режиме DeepSeek Harness с topp=0.95 и temperature=1.0. Модель поддерживает формат Responses API и адаптирована под Codex; архитектура и размер такие же, как у Flash‑Preview, только дообученная. DeepSeek‑V4‑Pro выйдет скоро, а текущий релиз касается только Flash.

Ранее компания объявила о выпуске DeepSeek‑V4‑Pro и Flash через OpenAI‑ и Anthropic‑совместимые интерфейсы, после чего старые имена deepseek‑chat и deepseek‑reasoner будут удалены 24 июля 2026 года. Модели V3.2‑Exp и V3.2‑Speciale показывают рост: HumanEval – 84.76 %, MATH – 71.02 %, BBH – 83.40 %, а в Arena‑Hard их победа над GPT‑4‑0314 выросла до 68.3 %. В публичных тестах использовался минимальный режим DeepSeek Harness с topp=0.95 и temperature=1.0, а внутренние наборы DSBench‑FullStack и DSBench‑Hard включают сложные задачи полного стека. Кроме того, в V3.2‑Exp точность JSON‑вывода достигла 97 % благодаря регулярным выражениям, а роль‑плейинг стал более гибким, позволяя модели принимать любые персонажи.

by dnhkng • 31 июля 2026 г. в 06:08 • 523 points

ОригиналHN

#anthropic#api#deepseek#deepseek-v4-flash#deepseek-v4-pro#json#openai

Комментарии (255)

DeepSeek-V4-Flash демонстрирует высокую производительность, низкую стоимость и быструю работу, особенно в кодировании, реализации и оптимизации. Пользователи сравнивают её с GPT 5.6 Luna, Kimi K3 и GLM 5.2: DeepSeek-V4-Flash эффективнее в технических задачах, но может уступать другим моделям в генерации текста и ответах на вопросы. Отмечаются риски безопасности — возможная утечка данных и влияние на производительность других моделей. Рекомендуется применять DeepSeek-V4-Flash там, где важны скорость и стоимость, а другие модели — для творческих и аналитических задач.

GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2 (arrowtsx.dev) 🔥 Горячее 💬 Длинная дискуссия

Большие модели больше не гарантируют лучшего понимания — их «ум» часто Plateau‑ит, а точность падает из‑за чрезмерного доверия к собственным ответам. Недавние сравнения показывают, что открытая GLM‑5.2 (≈753 млрд параметров) почти догоняет закрытые GPT‑5.5 и Claude 5, но её галлюцинации составляют лишь 28 %, тогда как у GPT‑5.5 — 86 %. При этом DeepSeek V4 Pro (1,6 Трл параметров) выдаёт 94 % ошибок на бенчмарке «Omniscience», а Opus 4.8 — 36 %. Технические тесты подтверждают: даже при большом объёме вычислительных ресурсов модель может уверенно предложить неверное решение, не признавая своей неуверенности.

Эта ситуация формирует трилемму современных ИИ:raw‑capability, калибровка неопределённости и вычислительная эффективность. Увеличивать размер и «рассудочный бюджет» бессмысленно, если модель начинает продавать вымысел за правду. Поэтому будущее — в выборе моделей, способных честно сообщать «не знаю», а не в гонке за всё более массивными, но менее надёжными системами.

by oshrimpton • 19 июня 2026 г. в 16:11 • 585 points

ОригиналHN

#claude-5#deepseek-v4-pro#glm-5.2#gpt-5.5#large-language-models#llm#mit#open-source#opus-4.8

Комментарии (293)

  • Оценка галлюцинаций усложняется тем, что она зависит от того, когда модель не знает ответа и от распределения задач в тесте.
  • Увеличение размеров моделей часто не повышает точность и может ухудшать способность «отказываться» от неправильных ответов.
  • Некоторые крупные модели (DeepSeek V4 Pro, GLM‑5.2) показывают разный уровень галлюцинаций, при этом небольшие модели иногда справляются лучше.
  • Необходимо развивать более точную классификацию ошибок ИИ, а не ограничиваться общим термином «галлюцинация».