Hacker News Digest

Обновлено: 09 сентября 2026 г. в 06:43

Постов: 2130 • Страница 32/213

Gemini 3.7 Flash (blog.google) 🔥 Горячее 💬 Длинная дискуссия

Гемини 3.7 Flash — новое поколение «рабочей лошадки» от Google, созданное для сложного программирования и агентных сценариев. За три недели после релиза 3.6 Flash компания представила модель с существенно улучшенным пониманием кода, точностью генерации и способностью работать с длинными цепочками задач. На тестах FrontierCode 1.1 точность выросла с 34,4 % до 43,6 %, а в DeepSWE v1.1 — с 49,0 % до 65,3 %. В веб‑разработке 3.7 Flash генерирует полноценные приложения и UI‑компоненты из меньшего числа промптов, а на Arena.ai WebDev Arena набрал Elo 1588 против 1538 у предшественника.

Особенно заметны рост точности в обработке тяжёлых документов: на бенчмарке GDP.pdf показатель вырос с 22 % до 34 %, а в AutomationBench — с 17 % до 30,4 %. Стоимость остаётся вдвое ниже, чем у 3.6 Flash (0,75 $/млн входных и 3,75 $/млн выходных токенов), а новая версия лучше адаптируется к подводным камням, уточняет намерения пользователя и требует меньше ручного контроля. Теперь разработчики могут использовать её в Google AI Studio, Android Studio и через Gemini Enterprise, а обычные пользователи — в Spark внутри приложения Gemini.

by thisisauserid • 13 августа 2026 г. в 17:23 • 906 points

ОригиналHN

#android-studio#gemini#gemini-3.7-flash#gemini-enterprise#google#google-ai-studio#language-model#llm#spark

Комментарии (453)

Gemini 3.7 Flash лидирует по скорости и низкой задержке, что критично для интерактивных сценариев (например, Google AI Mode), но страдает от сложного парсинга «мыслей», академичного стиля ответов и неконкурентоспособной долгосрочной цены — после 2026 года тариф удваивается, при этом модель к тому времени устареет. Пользователи отмечают: - Модель лучше подходит для агентных задач и быстрых итераций, но слаба в сложном кодинге и рефакторинге — уступает GPT-5.6 Luna, DeepSeek и Opus. - Вывод требует значительной очистки от внутренних монологов, усложняя интеграцию. - Стиль ответов стал менее интуитивным, вероятно, из-за RLVR-тренировок. - Галлюцинации и ложные утверждения сохраняются в серии Flash (3.1–3.7), снижая доверие по сравнению с Claude или Sol. - Генерация SVG сломана в Firefox и Chrome из-за невалидных фильтров — проблема кросс-браузерной совместимости. - В image-to-html уступает Opus 5, но сопоставима с Grok 4.6. - Интеграция в Android-ассистента ухудшила UX: модель галлюцинирует инструкции и отказывается выполнять простые команды. - Google Cloud: запутанная номенклатура (Gemini, Anti-gravity, Vertex) и сложная регистрация CLI-инструментов отталкивают разработчиков. - Для специфических задач (анализ рынков на Rust) Stepfun AI Step-3.5-Flash дешевле и эффективнее. - AA-метрика выросла за счёт увеличения токенов вывода, а не качества — экономика использования изменилась. - Качество ответов («vibes») остаётся важнее бенчмарков: пользователи предпочитают Claude за стиль, несмотря на цифры. Споры о целесообразности: одни считают 3.7 Flash избыточным на фоне более дешёвых и быстрых альтернатив, другие — востребованным для быстрых задач, где превосходит Sonnet 5 и Opus.

Mistral OCR 4.1 (docs.mistral.ai) 🔥 Горячее

Версия OCR 4.1 от Mistral AI — это обновлённый сервис для обработки документов, предлагающий точное выделение блоков текста с привязкой к абзацам, структурные метки и оценку уверенности на каждом уровне. Сервис теперь работает быстрее и дешевле: обработка 1000 страниц стоит всего 3,50 евро, а аннотированные страницы — 4,38 евро, что делает его доступным для массового использования.

Новые возможности включают извлечение bounding box'ов на уровне абзацев, поддержку нескольких языков и улучшенную обработку сложных макетов. В разделе «Why Mistral» подчёркивается, что платформа сочетает высокую точность с гибкой ценовой моделью, а также интеграцию с другими моделями, такими как GLM-5.2 и Shieldstral. Для тестирования доступен playground с примером обработки документа, где можно сравнить результаты с предыдущими версиями.

by spelk • 13 августа 2026 г. в 17:05 • 353 points

ОригиналHN

#glm-5.2#mistral-ai#ocr#shieldstral

Комментарии (141)

Тред обсуждает практический опыт использования Mistral OCR 4.1, сравнивая его с OpenAI и Baidu Unlimited OCR. Пользователи расходятся во мнениях: @ComputerPerson считает, что Mistral не превосходит OpenAI, а @kmitz утверждает, что он лучше распознаёт рукописные email-адреса. Цену Mistral OCR 4.1 считают высокой — @rtaylorgarlock и @petcat сравнивают её с более дешёвым Baidu. @piterrro делится опытом: собственный OCR-пайплайн на арендованных GPU обрабатывает 1000 страниц за $0,05–0,1, с полными bounding box и скоростью 0,8 с/страницу. @aliljet и @x3ro подчёркивают, что точность важнее цены, и Mistral может быть слишком дорогим. @waldrews выражает опасения по поводу цензуры чувствительных документов, а @kolinko предлагает использовать несколько сервисов и сравнивать результаты для повышения точности.

Spaghettifying DRAM (github.com) 🔥 Горячее 💬 Длинная дискуссия

Платформенный процессор, система управления режимом SMM, C6‑DRAM и микрокод процессора можно «разблокировать», перепрограммируя переводы физических адресов DRAM.
skitter-creek-bath-salts вмешивается в нижние уровни иерархии памяти, переписывая регистры контроллера DRAM, чтобы любой виртуальный адрес *p мог указывать в произвольное место физической памяти. При разрушении адресных преобразований исчезают и защита, построенная на них: SEV, SGX, TDX, TrustZone, pKVM, CoVE, SMRAM и даже скрытые регионы PSP и ME становятся доступными.

Эксперимент проведён на процессорах AMD Family 16h, где документация раскрывает регистры переводов, позволяющие менять маппинг без блокировки. Техника универсальна: схожие схемы переплетения, перемешивания и переключения используют все современные контроллеры памяти — от x86 до ARM и RISC‑V. Таким образом, «разблокировка» DRAM открывает путь к новым атакам и исследованиям, показывая, что даже самые защищённые области DRAM можно обойти, если знать, как «перепутать» их адресацию.

by matt_d • 13 августа 2026 г. в 14:17 • 626 points

ОригиналHN

#amd#arm#dram#risc-v#sev#sgx#smm#tdx#trustzone#x86

Комментарии (162)

Тред обсуждает потенциальные последствия и ограничения эксплуатации подобных атак. Эксперты расходятся во мнениях: одни считают, что атаки могут обходить традиционные механизмы безопасности, другие — что современные системы уже их предотвращают. По опыту @zahlman, атаки возможны лишь при наличии root-доступа. @creshal утверждает, что они позволяют получить доступ к ранее недоступным областям системы. Эксперты советуют ограничивать доступ к таким возможностям только владельцам систем и действовать с осторожностью, учитывая риски для безопасности.

Deutsche Bank becomes first foreign yuan clearing bank in Europe (tradersunion.com) 🔥 Горячее 💬 Длинная дискуссия

Deutsche Bank стала первым за пределами Азии банком, получившим статус централизованного валютного посредника по юаню — это значит, что он теперь участвует в распределении платежей в китайской валюте между банками Европы. Главное преимущество такого статуса — доступ к системе CHIPS, которая обрабатывает около 90% международных валютных переводов.

Цифры говорят сами за себя: в Европе лишь 3% платежей в юанях проходят через локальные системы, тогда как в Азии этот показатель достигает 90%. Это открывает Deutsche Bank уникальную возможность стать мостом между азиатскими и европейскими рынками. Эксперты отмечают, что рост спроса на юань в глобальной экономике делает такой шаг стратегически важным — особенно учитывая, что Китай активно продвигает свою валюту как альтернативу доллару.

by Markoff • 13 августа 2026 г. в 12:09 • 263 points

ОригиналHN

#china#chips#deutsche-bank

Комментарии (290)

Рост Китая и его финансовая экспансия ставят под вопрос статус доллара США как резервной валюты: одни считают замену возможной, другие — маловероятной, сомневаясь в устойчивости китайской экономики и юаня в условиях глобального кризиса. Некоторые рекомендуют изучать китайский язык как подготовку к возможным изменениям в международной финансовой системе.

ChatGPT Desktop (Codex Desktop) for Linux (openai.com) 🔥 Горячее 💬 Длинная дискуссия

Кодекс — мощный агент, теперь доступный внутри ChatGPT. Он умеет создавать функции, рефакторить код, мигрировать репозитории и даже управлять CI/CD, полностью автоматизируя задачи от простых pull‑request’ов до сложных архитектурных изменений.

Ключевой факт: команды уже используют его для одновременной работы над несколькими ветками проекта, экономя недели разработки. Кроме того, Codex умеет «учиться» под стиль вашей команды — через настройки Skills — и выполнять фоновые задачи, такие как мониторинг инцидентов или автоматическое тестирование, чтобы инженеры могли сосредоточиться на инновациях.

by allanrbo • 13 августа 2026 г. в 04:53 • 293 points

ОригиналHN

#codex#linux#llm#openai

Комментарии (196)

Пользователи отмечают, что ChatGPT Desktop для Linux имеет большой размер, высокое потребление памяти и медленную работу, что проблематично для устройств с ограниченными ресурсами. Многие считают, что оно не предлагает существенных преимуществ перед браузерной или CLI-версией, а может представлять риск безопасности — в частности, потенциальный неограниченный доступ к файлам пользователя. Рекомендуется использовать приложение в изолированной среде или виртуальной машине. Обсуждаются также проблемы совместимости с мобильными устройствами.

Delta (zed.dev) 🔥 Горячее 💬 Длинная дискуссия

Delta — это многоигровое окружение для совместной разработки кода с агентами, где реплицируются и код, и разговоры в реальном времени. В отличие от традиционных комментариев в коммитах, здесь можно комментировать любую строку кода или диалог, даже если она написана годами назад, и видеть изменения сразу в контексте.

Агенты работают в рамках той же цепочки обсуждений, что и разработчики, поэтому при проблеме можно запросить объяснение или исправление без реконструкции намерений из diff. DeltaDB синхронизирует репозиторий и диалог, позволяя командам работать в облаке или локально, не теряя контекста.

by khy • 12 августа 2026 г. в 18:19 • 556 points

ОригиналHN

#collaborative-coding#delta#deltadb#real-time-collaboration#zed

Комментарии (198)

Пользователи обсуждают полезность Delta и Zed: одни видят в Delta потенциал для наставничества и передачи задач, другие считают его решением проблем, которых нет. Предлагаются альтернативы — использование существующих инструментов совместной работы или отдельные документы для фиксации решений. Многие выражают разочарование слабым базовым опытом редактирования в Zed и опасениями по поводу vendor lock-in с Delta.

DeepSeek V4 Pro 0813 (openrouter.ai) 🔥 Горячее 💬 Длинная дискуссия

Главная идея — DeepSeek V4 Pro 0813 — это первый стабильный релиз модели DeepSeek V4 Pro, построенный по архитектуре Mixture-of-Experts (MoE), которая позволяет эффективно распределять вычисления между специализированными подсистемами. Это делает её мощной, но при этом относительно экономичной в использовании ресурсов.

Ключевые цифры: вход стоит $0.435 за 1М токенов, но реальная средняя цена — всего $0.035, а выход — $0.87 (реально $0.8697), при этом кэширование снижает затраты до 92.7% от списка. Скорость генерации — 59 токенов/сек (P50), а средняя задержка — 1.3 секунды. Важный факт: 91.76% кэш-хитрейт говорит о высокой эффективности повторного использования контекста. Архитектура MoE даёт преимущество в сложных задачах, но требует точного балансирования нагрузки между экспертами.

by explosion-s • 12 августа 2026 г. в 16:04 • 986 points

ОригиналHN

#deepseek#mixture-of-experts#openrouter#v4-pro

Комментарии (424)

По опыту эксплуатации, DeepSeek V4 Flash 0731 показал значительный рост возможностей при небольшом размере и цене, что вызвало разочарование по поводу выпуска V4 Pro 0813. Некоторые пользователи отмечают, что V4 Pro 0813 уступает Flash по производительности, несмотря на более низкую стоимость; другие — что он достигает равных или лучших результатов, чем предыдущие модели, при сниженной цене. Тесты на одной задаче показали, что V4 Pro 0813 уступает Grok 4.6, но дешевле. В то же время один пользователь успешно применил V4 Pro 0813 для оптимизации трафик-симулятора и распределённого физического движка, получив улучшения без новых проблем. Рекомендуются альтернативы: Kimi-K3, GLM-5.2, Minimax — как модели, эффективные при минимальной стоимости.

Grok 4.6 (x.ai) 🔥 Горячее 💬 Длинная дискуссия

Grok 4.6 — новая версия ИИ-ассистента от x.ai — сосредоточена на выполнении сложных, многошаговых задач: от анализа кода и исследований до превращения абстрактных идей в рабочие приложения. Модель достигла уровня GPT-5.6 Sol на индексе Artificial Analysis Intelligence, показав лидирующие результаты на пяти ключевых бенчмарках, включая DeepSWE 1.1 и CursorBench 3.2. Особое внимание уделено агентным сценариям — Grok 4.6 способен удерживать контекст на протяжении длительных сессий, работая с репозиториями кода, документацией и инструментами проектирования.

Обучение прошло в два этапа: сначала использовалась продвинутая подборка синтетических данных по инженерии и STEM, затем — уточнение на основе отфильтрованных траекторий, сгенерированных Grok 4.5. Модель прошла RL-обучение на задачах в областях от оптимизации ядра до веб-разработки. Доступна уже сегодня в Cursor и Grok Build, причём в первую неделю пользователи получают вдвое больше лимита использования. Это делает её одним из первых ИИ, способных самостоятельно доводить идеи до рабочего продукта без постоянного вмешательства.

by iLuddite • 12 августа 2026 г. в 15:32 • 314 points

ОригиналHN

#cursor#grok#x.ai

Комментарии (321)

Grok 4.6 показывает хорошие результаты в сравнении с GPT-5.6 Sol и Fable, особенно в анализе кода и исследованиях — быстро и точно. Интерфейс считается более приятным. Однако есть скептицизм: сомнения в достоверности бенчмарков, ограничения модели, риски использования и репутационные опасения, связанные с её разработчиком, ассоциируемым с Илоном Маском. Рекомендуется применять для целевых задач, но с учётом ограничений.

Qwen3.8-2.4T (huggingface.co) 🔥 Горячее

Qwen3.8 — новый флагман открытой модели, построенный на архитектуре Qwen3.5 с 2,4 трлн параметров, из которых 95 млрд активно используется. Ключевые новшества: улучшенное кодирование, поддержка агентов с длительным планированием, гибкое управление «мышлением» через параметр reasoning_effort и сохранение контекста рассуждений между сообщениями. В отличие от закрытых аналогов, модель доступна в открытом доступе и может быть развернута через vLLM, SGLang или TokenSpeed, а также использована через официальный API Qwen Cloud.

Особое внимание уделено надёжности завершения многократных задач: модель лучше справляется с агентными сценариями, где требуется последовательное взаимодействие с окружением, и демонстрирует стабильные результаты на бенчмарках вроде SWE‑bench Pro (67,7 %) и PaperBench (93 %). Для оптимального использования рекомендуется sampling‑настройка temperature=1.0, top_p=0.95, top_k=20 и выделение до 262 144 токенов на рассуждения и 131 072 — на финальный ответ. Эти параметры позволяют моделировать сложные цепочки выводов без потери качества.

by Philpax • 12 августа 2026 г. в 15:01 • 629 points

ОригиналHN

#huggingface#qwen#qwen-cloud#qwen3.8#sglang#tokenspeed#vllm

Комментарии (148)

Qwen3.8 — модель с 2,4 трлн параметров (95 млрд активных), поддерживает reasoning_effort для регулирования глубины рассуждений и сохраняет контекст рассуждений между сообщениями. Полная версия занимает 5 ТБ, quant-версия — 397 ГБ. Ограничения: нет поддержки зрения в открытой версии, контекст до 250K (можно попытаться расширить через сторонние решения). Для локального запуска требуются мощные ресурсы (например, RTX 5090 + 64 ГБ ОЗУ), но даже этого может не хватить. Сравнивается с Kimi K3, Opus 4.8 и Fable 5: некоторые считают, что у Qwen3.8 нет значительных преимуществ из-за ограничений и размера. Используется для OCR, кодирования и других задач — пользователи делятся результатами экспериментов.

License plate reader searches should require a warrant (andrewpwheeler.com)

ALPR‑камеры уже собирают данные о каждом проезде, но их поиск без судебного разрешения остаётся юридически спорным.
В деле Schmidt v. City of Norfolk суд признал, что «сегодня» массовый поиск исторических записей не нарушает конституцию, однако подчёркнул, что «не сегодня» — значит, что в будущем это неизбежно. По мнению автора, когда камеры станут настолько плотными, что смогут воссоздать «полный маршрут» человека, требование ордера станет обязательным.

Ключевой факт: как в Carpenter v. United States, где суд признал, что подробные данные о перемещениях требуют ордера, так же и исторические запросы к базе ALPR‑данных должны подпадать под ту же защиту. Автор предлагает, чтобы штаты заранее ввели закон о необходимости ордера для любых «исторических» поисков видеоматериалов, независимо от того, кто их собрал — муниципальную систему или частного оператора. Это лишь небольшая нагрузка на детективную работу, но сохранит фундаментальные личные свободы.

by apwheele • 12 августа 2026 г. в 14:43 • 214 points

ОригиналHN

#alpr#license-plate-reader

Комментарии (122)

В обсуждении статьи о ALPR-камерах поднимается вопрос о необходимости судебного разрешения для поиска данных, а также критикуется массовый сбор и отсутствие защиты прав граждан. Некоторые считают, что доступ к данным должен быть ограничен судебным ордером, другие — что данные должны быть открытыми или защищены техническими ограничениями. Пользователь @mc32 предлагает ввести журналы с аудитом и ответственностью, как в HIPAA. Пользователь @bko утверждает, что требование судебного разрешения нереалистично, так как полиция уже имеет доступ к множеству данных. Пользователь @iamleppert предлагает либо полную открытость данных, либо обязательное судебное разрешение для их использования. Большинство согласны: текущая система требует изменений.