Just the rumour of a bug is enough to find an exploit these days 🔥 Горячее
Слух о баге в OCaml-библиотеке cohttp привёл к тому, что атаки начались ещё до публикации исправления. Автор обнаружил в логах своего веб-сервера попытки эксплуатации уязвимости path traversal всего через несколько минут после открытия публичного pull request с патчем. Используя собственный ИИ-агент (DeepSeek V4 Pro), он смог воспроизвести эксплойт локально за минуту, основываясь лишь на общем описании проблемы — что демонстрирует, насколько быстро современные агентные системы могут находить уязвимости по косвенным намёкам.
Традиционный процесс закрытого исправления и embargo перестал работать: агенты, получив лишь общее направление (например, описание CVE), способны самостоятельно исследовать код и создавать эксплойты. Исследования показывают, что GPT-4-агент эксплуатирует 87% уязвимостей по их описанию, а среднее время до эксплуатации теперь отрицательное — атаки начинаются до выхода патча. Это требует пересмотра практик безопасности в open source: нужны быстрые механизмы триажи, верификации и доверия, а также защитные системы, способные противостоять автоматизированным атакам в реальном времени.
Комментарии (107)
Тред подтверждает: волна фейковых и низкокачественных security-репортов стала повседневностью для open source, а LLM сократили цикл от слуха до эксплойта и массового сканирования до минут. Главный враг — не техника, а отсутствие воли фиксить баги и медленный релиз патчей против рисков supply-chain автообновлений. По опыту @nickcw (rclone): за 10 лет — ~20 репортов, за последний месяц — >40, ~75% содержат зерно проблемы, конфигурации для воспроизведения становятся экзотичнее. @thedonncha наблюдает волнообразное накопление: после исчерпания одного проекта атаки переключаются на следующий, качество падает, нагрузка — нет. @bri3d и @happyopossum: использование PoC из обрывков кода — не ново, но LLM демократизировали его, сжав цикл (чтение коммита → RE → сборка → сканирование) с дней/недель до минут/часов. @loeg и @avsm: memory-safe языки (включая OCaml) не спасают — LLM находят логические баги и corner-кейсы в C-биндингах, как в Mirage-crypto. @loeg утверждает, что такие языки снижают число эксплуатируемых багов, но @avsm и @aseipp настаивают: ключевая проблема — масштабируемость и скорость атак: от слуха до эксплойта теперь часы, и это легко масштабируется деньгами и compute. @stephbook и @talon8635: реальный bottleneck — rollout/deployment. Обновление стека за 10 минут — редкость, CI верифицирует бизнес-логику дольше, автообновления сами становятся вектором supply-chain атаки. Выбор между известной уязвимостью и слепым доверием к апдейтам — ловушка. @Saghm и @xbar обсуждают, может ли LLM «найти» эксплойт по ложному слуху; @petesergeant приводит пример sgnt.ai/p/terrible-mistake: агент генерирует критичный баг по ложной подсказке — false positives становятся индуктивным инструментом. Советы: @nickcw — держать security-фиксы в отдельных ветках, мёржить только в релиз-день, мириться с конфликтами. @rndhouse — построил инструмент для детекции «тихих» багфиксов через GPT-5.5-класс модели; обфускация изменений для обхода — ненадёжна, c-lightning временно раздавал закрытый бинарь. @ChrisMarshallNY и @skybrian: мейнтейнеры могут уйти в приватные репозитории ради сокращения окна эксплуатации — хотя публичность ранее игнорировалась с тезисом «LoL MaRkEtInG». @godelski и @dingdongditchme: менеджмент давит на скорость и отказывается чинить баги, которые Claude уже верифицировал в open PR; без воли — качество ПО не растёт, LLM только ускоряют и хорошее, и плохое. @janpeuker: когда средние и высокие баги станут дёшевы для фикса, lowkey-хакинг и privacy-аудиты станут prohibitively expensive для обычных граждан — баланс сил сместится. Остальные не оспаривают напрямую, но тон треда — про удешевление эксплойтов, а не защиты.
Z.ai confirms Ox Alpha is a new GLM-series model and will release its weights 🔥 Горячее
Страница Bloomberg отображает сообщение о блокировке доступа из-за подозрения в автоматизированном трафике. Система определила необычную активность с компьютерной сети пользователя и потребовала подтверждения, что он не является роботом, предложив отметить соответствующее поле. Для разблокировки рекомендуется убедиться, что браузер поддерживает JavaScript и файлы cookie, а также не блокирует их загрузку. В случае продолжения проблем пользователю предлагается обратиться в службу поддержки, указав предоставленный идентификатор блокировки: 1a698e1b-a20f-11f1-b541-d9cf7d45d6f4. Страница также содержит ссылки на условия использования, политику cookie и форму обратной связи, а также призыв оформить подписку на Bloomberg.com для доступа к глобальным финансовым новостям. Никакой информации о статье про китайскую ИИ-модель Ox Alpha или её сравнении с DeepSeek в данном фрагменте отсутствует — доступ к контенту заблокирован защитной системой.
Комментарии (144)
Ox Alpha демонстрирует уровень кодирования между Sonnet и Opus, делает мало ошибок, но не считается «очень умной». Часто страдает от «doom loop» — проблемы, присущей модели и используемым harness-ам, включая исторически уязвимые модели GLM. Бенчмарки противоречивы: в одних тестах отстаёт от GPT-5.4 Nano, в других превосходит Fable, что ставит под сомнение реальную производительность. Инференция медленная, часты тайм-ауты; быстрый сервис повысил бы привлекательность. Модель пишет чистый код и удерживает контекст, но теряется в сложных bash-скриптах с пайплайнами. Размер модели не опубликован; предполагается, что если он не превышает GLM 5.3, модель «потрясающая», иначе — сравнима с DeepSeek Pro или Kimi K3. Открытый релиз весов воспринимается как конкурентный шаг против DeepSeek и полезен для экосистемы AI. Текущий интерес обусловлен бесплатностью — при введении платы использование может резко упасть. Отсутствуют надёжные отчёты о возможностях модели. Некоторые harness-ы (OpenRouter, OpenCode) скрывают направление трафика, вызывая опасения.
DeepSeek-v4-flash-vision-exp 🔥 Горячее
Главная идея — модель deepseek-v4-flash-vision-exp умеет принимать изображения вместе с текстом и выполнять с ними те же операции, что и с обычными запросами. Поддерживаются три способа подачи изображения: встраивание через base64‑data‑URL, публичный URL и ссылка на файл, загруженный через Files API. Каждый способ имеет свои ограничения: общий размер запроса ≤ 48 MiB, отдельный файл ≤ 32 MiB (для inline‑изображений) и ≤ 64 MiB при использовании Files API; внешняя ссылка должна быть ≤ 8192 символов и загрузиться за ≤ 60 секунд.
Факт, который стоит запомнить: изображение можно передать как image_url в составе массива content, где каждый элемент — либо текст, либо блок‑изображения с полем type: "image_url" (или file_id). Важно указывать правильный media_type (jpeg, png, gif, webp) и, при необходимости, параметр detail (low, high, original, auto). Эти детали позволяют гибко интегрировать визуальные данные в чат‑запросы без лишних сложностей.
Комментарии (128)
DeepSeek-v4-flash-vision-exp демонстрирует лучшее соотношение стоимости и производительности в агентных задачах — например, 59.3% на DeepSWE при использовании лишь 1/18 ресурсов Gemini 5.6-Sol Medium — но имеет значительные ограничения в визуальном распознавании. Модель ошибочно интерпретирует время на часах (5:10:45 вместо 08:09:25), что может быть связано с системной проблемой в обработке визуальных подсказок; однако некоторые пользователи отмечают, что изображение часов нестандартно, и даже люди могут ошибаться, ставя под сомнение релевантность такого теста. Ограничение в 800×800 пикселей не позволяет корректно анализировать полные страницы A4/Letter, что ограничивает применение в OCR-задачах. Модель не поддерживает изображения как результат инструментального вызова, что мешает визуальной верификации в агентных сценариях. Режим рассуждения увеличивает галлюцинации и снижает точность — его рекомендуется отключать при работе с изображениями. В детальной визуальной классификации (например, архитектурных объектов) модель уступает Bytedance Seed 2.1 Turbo. Для повышения точности пользователи применяют гибридные решения: DeepSeek для текста и Kimi K2.6 на Cloudflare для изображений. При попытках модели «выдумывать» доступ к изображениям используют обходные пути — например, явное назначение ей навыка внешней vision-модели. Ранее DeepSeek уже имел отдельную vision-модель для чата, поэтому выпуск v4-flash-vision-exp — логичное развитие, а не неожиданный поворот. Для тестирования без API-ключа можно использовать playground на OpenRouter с небольшим балансом ($5). Текущая версия — предварительный релиз; ожидается дообучение и улучшение в ближайшие недели.
DeepSeek peak/off-peak pricing update
DeepSeek-V4-Pro официально запущен с улучшениями для агентных задач: теперь доступны три уровня усилий рассуждения — от минимальных для простых запросов до максимальных для сложных сценариев. Модель интегрирована с OpenAI-совместимым API, включая одну кнопку для настройки с Codex, что упрощает внедрение в существующие рабочие процессы. Доступна как в веб-интерфейсе через «Expert Mode», так и через API — с теми же именами моделей, что и раньше.
Цены на API обновлены: введены тарифы в часы пик и вне пика — скидка до 50% в непиковые часы, что позволяет оптимизировать затраты на нагрузку. Новые тарифы вступают в силу 16:00 UTC 16 августа 2026 года. Бенчмарки показывают значительный рост производительности по сравнению с предыдущими версиями, особенно в задачах, требующих глубокого анализа.
Комментарии (101)
Цены на DeepSeek-V4-Pro выросли в 2–6 раз, зависят от времени суток (ниже ночью) и могут превышать стоимость альтернатив, таких как Baseten или Luna. Пользователи расходятся во мнениях: одни считают цены завышенными, другие — оправданными. Рекомендуется использовать альтернативные решения или откладывать запросы на более дешёвые часы.
DeepSeek V4 Pro 0813 🔥 Горячее 💬 Длинная дискуссия
Главная идея — DeepSeek V4 Pro 0813 — это первый стабильный релиз модели DeepSeek V4 Pro, построенный по архитектуре Mixture-of-Experts (MoE), которая позволяет эффективно распределять вычисления между специализированными подсистемами. Это делает её мощной, но при этом относительно экономичной в использовании ресурсов.
Ключевые цифры: вход стоит $0.435 за 1М токенов, но реальная средняя цена — всего $0.035, а выход — $0.87 (реально $0.8697), при этом кэширование снижает затраты до 92.7% от списка. Скорость генерации — 59 токенов/сек (P50), а средняя задержка — 1.3 секунды. Важный факт: 91.76% кэш-хитрейт говорит о высокой эффективности повторного использования контекста. Архитектура MoE даёт преимущество в сложных задачах, но требует точного балансирования нагрузки между экспертами.
Комментарии (424)
По опыту эксплуатации, DeepSeek V4 Flash 0731 показал значительный рост возможностей при небольшом размере и цене, что вызвало разочарование по поводу выпуска V4 Pro 0813. Некоторые пользователи отмечают, что V4 Pro 0813 уступает Flash по производительности, несмотря на более низкую стоимость; другие — что он достигает равных или лучших результатов, чем предыдущие модели, при сниженной цене. Тесты на одной задаче показали, что V4 Pro 0813 уступает Grok 4.6, но дешевле. В то же время один пользователь успешно применил V4 Pro 0813 для оптимизации трафик-симулятора и распределённого физического движка, получив улучшения без новых проблем. Рекомендуются альтернативы: Kimi-K3, GLM-5.2, Minimax — как модели, эффективные при минимальной стоимости.
DeepSeek V4 Flash on a Single AMD MI300X 🔥 Горячее
Главная идея — первый рабочий запуск DeepSeek‑V4‑Flash‑0731 на одной видеокарте AMD MI300X без дополнительной квантовки или оффлоу. Модель полностью помещается в 156,7 GiB HBM3, а благодаря 192 GiB памяти и 5,3 TB/s пропускной способности достигается пропускная способность до ≈ 8 K токенов/сек при предзаполнении и 168,6 токенов/сек в медиане однопоточного декодирования. При 8‑х одновременных потоках суммарный вывод достигает 542 токенов/сек, а пиковый 64‑потоковый баст‑запрос укладывается в 830 токенов/сек без OOM и ошибок движка. Контекст поддерживается до 256 K токенов (архитектура теоретически позволяет 1 M).
Ключевые факты, которые стоит запомнить:
- 156,7 GiB весов — полностью в HBM, без offload‑квантовки;
- ≈ 8 K tok/s предзаполнение (6 988–7 019 tok/s в продакшн‑профиле);
- 542 tok/s суммарный вывод при 8‑х потоках, 830 tok/s при 64‑потоковом басте;
- Исправления касаются FP8‑формата MI300X, MoE‑маршрутизации, CPU‑KV синхронизации и специфичных ядер ROCm.
Эти детали позволяют использовать MI300X как дешевый (в 2–3 раза) альтернативный вариант к NVIDIA‑решениям для тяжёлых LLM‑задач.
Комментарии (87)
DeepSeek V4 Flash можно запускать на AMD MI300X, но с ограничением контекстного окна с 1M до 256k — по опыту @monster_truck, это не снижает качество. @Tepix считает MI300X неподходящей как OAM-модуль, но @WhitneyLand отмечает, что модель работает, хоть и с ограничениями. MI350P — альтернатива с 144GB памяти, но меньшей, чем у MI300X. @fergusfinn советует использовать MI300X с высоким HBM и делится опытом работы с 2xMI300X. Производительность MI300X всё ещё ниже, чем у H800 (15k токенов/сек).
DeepSeek V4 Flash 0731 Intelligence, Performance and Price Analysis 🔥 Горячее 💬 Длинная дискуссия
DeepSeek V4 Flash 0731 демонстрирует высокую эффективность в рамках Artificial Analysis Intelligence Index, где его показатель AA‑Omniscience Index показывает значимые результаты, измеряя надёжность знаний и уровень галлюцинаций; индекс варьируется от –100 до 100, при этом 0 означает равное количество правильных и неправильных ответов, а отрицательные значения указывают на преобладание ошибок. При расчёте стоимости учитываются вводные, кэш‑хиты, рассуждения и генерируемые токены, цена за кэш‑хиты обычно значительно ниже обычной, что позволяет оценить среднюю цену за задачу в долларах. Кроме того, модель использует ограниченное количество выходных токенов на задачу, что снижает расход ресурсов.
Показатель Artificial Analysis Intelligence Index v4.1 включает девять оценок: GDPval‑AA v2, τ³‑Banking, Terminal‑Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA‑Omniscience и AA‑LCR, а модели с типом рассуждения отмечаются светящейся лампочкой. Весовые коэффициенты задач учитывают стоимость входных и выходных токенов, кэш‑записей и кэш‑хранилища, а размер контекстного окна определяет возможность работы с большими объёмами данных в системах генерации с подкреплением, что делает модель привлекательной для коммерческих сценариев.
Комментарии (253)
DeepSeek V4 Flash 0731 демонстрирует высокую производительность и эффективность, особенно в кодировании и решении сложных задач, при этом стоит дешевле GPT-5.4 и Anthropic. Однако сохраняются проблемы с галлюцинациями и забыванием, характерные для предыдущих версий. Модель требует точных спецификаций и может давать ошибочные ответы. Отсутствует multimodal-поддержка. Рекомендуется для задач, где важна стоимость и скорость, но с осторожностью — из-за рисков неточностей.
DeepSeek-V4-Flash Update 🔥 Горячее 💬 Длинная дискуссия
DeepSeek‑V4‑Flash теперь доступен в публичном бета‑режиме: достаточно указать модель deepseek‑v4‑flash, а метод вызова API не меняется. По новым публичным бенчмаркам она превосходит V4‑Pro‑Preview: Terminal Bench 2.1 – 82.7, NL2Repo – 54.2, Cybergym – 76.7, DeepSWE – 54.4, Toolathlon – 70.3, Agent Last Exam – 25.2, Automation Bench (Публичный) – 25.1, DSBench‑FullStack – 68.7, DSBench‑Hard – 59.6. Тесты на публичных наборах проводились в минимальном режиме DeepSeek Harness с topp=0.95 и temperature=1.0. Модель поддерживает формат Responses API и адаптирована под Codex; архитектура и размер такие же, как у Flash‑Preview, только дообученная. DeepSeek‑V4‑Pro выйдет скоро, а текущий релиз касается только Flash.
Ранее компания объявила о выпуске DeepSeek‑V4‑Pro и Flash через OpenAI‑ и Anthropic‑совместимые интерфейсы, после чего старые имена deepseek‑chat и deepseek‑reasoner будут удалены 24 июля 2026 года. Модели V3.2‑Exp и V3.2‑Speciale показывают рост: HumanEval – 84.76 %, MATH – 71.02 %, BBH – 83.40 %, а в Arena‑Hard их победа над GPT‑4‑0314 выросла до 68.3 %. В публичных тестах использовался минимальный режим DeepSeek Harness с topp=0.95 и temperature=1.0, а внутренние наборы DSBench‑FullStack и DSBench‑Hard включают сложные задачи полного стека. Кроме того, в V3.2‑Exp точность JSON‑вывода достигла 97 % благодаря регулярным выражениям, а роль‑плейинг стал более гибким, позволяя модели принимать любые персонажи.
Комментарии (255)
DeepSeek-V4-Flash демонстрирует высокую производительность, низкую стоимость и быструю работу, особенно в кодировании, реализации и оптимизации. Пользователи сравнивают её с GPT 5.6 Luna, Kimi K3 и GLM 5.2: DeepSeek-V4-Flash эффективнее в технических задачах, но может уступать другим моделям в генерации текста и ответах на вопросы. Отмечаются риски безопасности — возможная утечка данных и влияние на производительность других моделей. Рекомендуется применять DeepSeek-V4-Flash там, где важны скорость и стоимость, а другие модели — для творческих и аналитических задач.
GLM 5.2 and the coming AI margin collapse 🔥 Горячее 💬 Длинная дискуссия
Экономика искусственного интеллекта меняется: обучение модели — это разовый, дорогой капитальный расход, а реальная прибыль генерируется при инференсе, где есть реальные переменные затраты. Рынок переоценил DeepSeek R1, считая, что дешёвое обучение в $6 м делает крупные вложения в инфраструктуру излишними, что привело к резкому падению акций Nvidia. На деле же компании вроде Anthropic и OpenAI берут за токен инференса $25, при этом их валовая маржа достигает 90 % по сравнению с стоимостью вычислительных ресурсов. Такая модель позволяет амортизировать крупные затраты на обучение через огромный объём запросов, превращая их в устойчивую прибыль.
Недавно я тестировал GLM 5.2 от Z.ai — первый открытый конкурент, сравнимый по качеству с Opus и GPT‑5.5. Он почти неотличим по результатам, но работает медленнее, не поддерживает зрение и имеет слабую веб‑поисковую функцию, что критично для агентных сценариев. При этом платформа предоставляет совместимые OpenAI и Anthropic‑API, позволяя мгновенно заменить модель в Claude Code или Codex, меняя лишь базовый URL и ключ. Переключение стоит почти ничего, в отличие от привязки к проприетарным сервисам, и открывает путь к дешевым, открытым альтернативам, что может подорвать экономику закрытых лидеров.
Комментарии (468)
- Цены на API‑вызовы падают, но у гипермасштабов остаются высокие маржи, а конкуренция со стороны китайских провайдеров ставит под сомнение долгосрочную прибыльность.
- Открытые модели (GLM 5.2, DeepSeek и др.) дешевле в инференсе, однако их качество и надёжность пока уступают закрытым фронтирным системам, что ограничивает их массовое принятие.
- Основные барьеры – инфраструктурные ограничения и необходимость интеграции с удобными харанерами/ MCP, без которых открытые модели остаются менее удобными для профессионального использования.
- Экономика токенов показывает, что рост спроса (мультизадачность, веб‑поиск, агентные сценарии) будет давить на поставки вычислительных ресурсов, что может привести к росту цен в долгосрочной перспективе.
Alibaba Cloud says it cut Nvidia AI GPU use by 82% with new pooling system 🔥 Горячее 💬 Длинная дискуссия
Alibaba Cloud представила систему объединения вычислительных ресурсов Aegaeon, которая, по их утверждению, позволяет сократить использование графических процессоров Nvidia на 82%. Новая технология способна обслуживать десятки больших языковых моделей, требуя лишь доли GPU, необходимых ранее.
Во время бета-тестирования на платформе Alibaba Cloud Marketplace в течение более трех месяцев количество необходимых Nvidia H20 GPU для работы с моделями до 72 миллиардов параметров сократилось с 1,192 до 213. Исследователи обнаружили, что 17,7% GPU выделялись для обслуживания всего 1,35% запросов, что свидетельствует о значительной неэффективности в работе с одновременными AI-нагрузками.
Работа была представлена на 31-й Симпозиуме по принципам операционных систем (SOSP) в Сеуле. Один из соавторов исследования - главный технолог Alibaba Cloud Чжоу Цзжэньрен. Aegaeon позиционируется как первая работа, раскрывающая чрезмерные затраты на обслуживание одновременных рабочих нагрузок LLM на рынке.
Комментарии (286)
- Эффективность использования GPU в облаке Alibaba — 17,7 % GPU обрабатывает всего 1,35 % запросов, и вместо 1192 GPU теперь используется 213, что на 82 % меньше.
- US-ограничения на экспорт чипов в Китай — вынуждают китайские компании к инновациям, что может привести к созданию более эффективных решений, которые в будущем могут быть использованы в других странах.
- Сравнение моделей — DeepSeek и Qwen от Alibaba Cloud являются наиболее популярными моделями для инференса, в то время как большинство других моделей используются очень редко, что приводит к неэффективному использованию ресурсов.
- Проблема с лицензиями и открытым исходным кодом — Китайские компании, такие как DeepSeek, начинают отказываться от открытого кода, что может повлиять на развитие AI-сообщества.
- Стоимость и доступность GPU — NVIDIA стоит дороже, чем в Китае, но в то же время, китайские компании могут разрабатывать более дешевые и эффективные решения, что может привести к снижению цен на GPU в будущем.
DeepSeek OCR 🔥 Горячее 💬 Длинная дискуссия
Предоставленный текст содержит только навигационное меню и элементы интерфейса GitHub, но не содержит самого содержимого статьи о DeepSeek-OCR. Без основного текста статьи невозможно создать точный пересказ её содержания.
Для создания качественного саммари мне нужен сам текст статьи, описание проекта DeepSeek-OCR, его особенности, технические детали или результаты, которые он демонстрирует. Пожалуйста, предоставьте основное содержимое репозитория или статьи, и я подготовлю ёмкий пересказ в соответствии с вашими требованиями.
Комментарии (226)
- DeepSeek-OCR представляет собой исследование границ визуального сжатия текста, достигая почти безпотерянного восстановления текста при 97% точности, что делает его полезным для создания обучающих данных для LLM.
- Модель демонстрирует высокую точность на OmniAI бенчмарке, но при этом остается неясным, как она справляется с более сложными задачами, такими как распознование сложных таблиц и многостраничных документов.
- Несмотря на то, что DeepSeek-OCR является open-source и MIT лицензированным, отсутствие коммерческого продукта подчеркивает пробел в экосистеме OCR, что может быть связано с тем, что модель не была обучена на полностью лицензионых данных.
- Сообщество отмечает, что несмотря на то, что модель может быть использована для создания обучающих данных для LLM, она не может быть использована в продакшене, потому что она не была обучена на лицензионных данных.
- Некоторые участники обсуждения отмечают, что модель может быть использована для извлечения текста из старых журналов и книг, но при этом остается неясным, насколько она справляется с распознованием сложных многостраничных документов и таблиц.
AI tools are making the world look weird 💬 Длинная дискуссия
Исследования в области поведенческих наук часто страдают от системной ошибки: они опираются на данные, собранные в западных, образованных, индустриальных, богатых и демократических обществах (WEIRD), а затем применяют выводы ко всему человечеству. Это приводит к искажённым результатам, поскольку такие популяции составляют лишь малую часть мирового населения и могут демонстрировать нетипичные психологические и социальные паттерны.
Например, многие классические теории о принятии решений или морали основаны на экспериментах с студентами американских университетов, чьи реакции часто не совпадают с поведением людей из других культур. Это ограничивает применимость исследований в глобальном масштабе и подрывает их ценность для бизнеса или политики, ориентированных на разнообразные аудитории.
Осознание этой проблемы — первый шаг к более инклюзивной и точной науке.
Комментарии (169)
- Обсуждается культурная предвзятость ИИ (особенно ChatGPT), который демонстрирует сильное смещение в сторону западных, особенно американских, ценностей из-за преобладания англоязычных данных в обучении.
- Участники отмечают, что исходные данные для обучения ИИ (например, с Reddit) перекошены в сторону взглядов западной, образованной, индустриализированной, богатой и демократической (WEIRD) аудитории, что ограничивает способность ИИ отражать глобальное разнообразие.
- Поднимается вопрос, могут ли ИИ, обученные на других языках или данных (например, DeepSeek, Mistral), или использование специальных промптов снизить этот эффект и лучше отражать другие культуры.
- Критикуется методология исследования, лежащего в основе статьи, за отсутствие деталей и возможную нерепрезентативность, а также обоснованность некоторых антропологических claims в рекомендованной книге.
- Обсуждается, является ли проблема inherent ограничением архитектуры ИИ или же её можно смягчить за счёт более разнообразных данных и специализированного обучения для разных культурных контекстов.
DeepSeek-v3.1 🔥 Горячее 💬 Длинная дискуссия
DeepSeek-V3.1 — первый шаг к эпохе агентов
- Гибридный режим: одна модель, два режима — Think (рассуждения) и Non-Think (быстрый ответ).
- Скорость: Think-режим отвечает быстрее, чем DeepSeek-R1-0528.
- Агентские навыки: улучшены работа с инструментами и многошаговые задачи.
Попробовать: chat.deepseek.com
API
deepseek-chat→ Non-Think,deepseek-reasoner→ Think, контекст 128К.- Поддержка формата Anthropic API и строгого Function Calling (бета).
Инструменты и агенты
- Рост результатов на SWE / Terminal-Bench.
- Эффективнее многошаговые поисковые задачи.
Модель
- База V3.1: дообучена на 840 B токенов для длинного контекста.
- Обновлён токенайзер и шаблон чата.
- Веса открыты: V3.1-Base, V3.1.
Цены
- Новые тарифы с 5 сентября 2025, 16:00 UTC. До этого действуют старые.
Комментарии (253)
- Выпущены GGUF-файлы DeepSeek-V3.1 для локального запуска: ≥250 ГБ RAM+VRAM или медленный off-load на SSD.
- На бенчмарках модель уступает GPT-5/Claude 4/GLM-4.5, но конкурентоспособна среди открытых весов.
- Пользователи жалуются на навязчивое «Of course.» в ответах, повышенные галлюцинации и устаревшие форматы tool-use.
- Цена API: $0,56 вход / $1,68 выход за 1 M токенов — дёшево, но без прежней ночной скидки.
- Китайские СМИ: V3.1 обучена на FP8 для будущих отечественных AI-чипов, что может ударить по позициям NVIDIA.