Hacker News Digest

Тег: #cost

Постов: 4

Small Models Have Arrived (calv.info) 🔥 Горячее 💬 Длинная дискуссия

Новые маленькие модели, такие как gpt-5.6-luna, удивительно быстрые и эффективные — до 100 токенов в секунду — при стоимости в десятки центов за сложные задачи, включая анализ тысяч писем. Это кардинально меняет экономику AI: раньше для персонализированного новостного сайта с использованием дорогих моделей требовалось $1 за запрос, что делало потребительский продукт невыгодным; теперь стоимость падает до $0.10, открывая путь к масштабируемым сервисам.

В бизнесе большинство задач — не прорывные, а рутинные: переписка, координация, уведомления. Даже опытные основатели, вроде Петера из Segment, тратят 95% времени на такие «токен-спьютерные» дела. Маленькие, дешёвые и быстрые модели идеально подходят именно для них — заменяя людей, выполняющих повторяющуюся работу. Хотя фронтальные модели останутся нужны для научных прорывов, спрос на «хорошие, но недорогие» модели только растёт. Остаётся решить технические вопросы — безопасность, роли, интеграции — но направление ясно: будущее за эффективностью, а не за мощностью.

by tosh • 27 августа 2026 г. в 15:56 • 706 points

ОригиналHN

#cost#gpt-5.6-luna#llm#segment#token

Комментарии (308)

Тред подтверждает тезис о 'good enough' малых моделях, но с оговорками: скрытая стоимость reasoning-токенов, реальные цифры из прода, возражения по качеству на коде и спор о ценообразовании проприетарных vs open-source. Спрос на дешёвые/быстрые модели всегда был — блокировал supply, а не спрос. Локальный запуск малых моделей побеждает cloud по latency, приватности и DX и станет следующей волной. Inference становится commodity-вычислением, дифференциация моделей сгладится; продукты будут выигрывать пониманием задач пользователя, а не выбором модели. Специализированные маленькие модели давно используются в проде из-за цены, скорости и меньших галлюцинаций. Спор о качестве: часть участников считает Luna достаточной для 90% задач и vibe-кодинга за центы; другие возражают — Sol/Opus ловят баги, которые Luna пропускает; описан случай галлюцинации с фиктивным коммитом, когда дешёвая модель вызывала раздражение. Спор о цене: одни считают, что closed-source победит по цене за счёт scale и оптимизации стека, оставив open-source нишу приватности/кастомизации; другие продвигают self-hosted на edge как более дешёвую и лёгкую альтернативу. Спор о скорости: TPS раздут из-за thinking-токенов, нужен показатель с учётом reasoning-эффективности. Советы из опыта: $10 кредита OpenAI (~126 запросов) сожгли $0.61 — API inference дёшев даже для прототипов. Reasoning-модели могут тратить ~2800 thinking-токенов на вызов — это в 3 раза дороже non-reasoning, за ними нужно следить. Luna достаточна для ~90% правок кода; Sol/Fable нужны для сложных задач при готовности строить guardrails. Опыт с 7B локальной моделью и guided generation с test-driven циклом ещё до эпохи thinking-моделей давал аналогичное поведение. Открытый вопрос — как перестроить workflow под малые модели при текущем использовании Opus со spec-driven подходом. Для embedded-демо ищут модели ~100 MiB (SmolLM 2 в Q4 — пограничный вариант) — ниша миниатюрных моделей не заполнена. Тренд: self-hosted модели, дообученные на собственных reasoning traces (QLoRA), inference как 'библиотека на бэкенде'. Практический кейс: Luna сделал возможным vibe-кодинг маленьких приложений за ~$5 и эксплуатацию за центы в день.

GPT 5.6 Sol is the best "vision" model OpenAI ever released (blog.roboflow.com) 🔥 Горячее

GPT‑5.6 Sol стал лучшей визуальной моделью, которую OpenAI представила до сих пор. В тестах на нашем предстоящем VLM‑бенчмарке, охватывающем детекцию, подсчёт, OCR и извлечение данных, Sol показал резкий рост: mAP@50 вырос с 13,8 у GPT‑5.5 до 46,2, а Terra и Luna набрали 44,7 и 43,3 соответственно. Это превратило объектное распознавание из слабого места в практичную возможность, особенно заметную в сложных сценах с множеством похожих предметов — например, таблеток, яиц или монет.

Пара ярких фактов: Sol обрабатывает документные макеты, выделяя заголовки, таблицы, подписи и подписи, а также умеет работать с плотными сценами, хотя иногда генерирует коробки в случайных местах, не совпадающих с реальными объектами. Стоимость и скорость тоже важны: Sol стоит около 2,5 ¢ за изображение и тратит ~10 секунд, Terra — ~6 секунд и ~1 ¢, а Luna — чуть более 5 секунд и < 0,5 ¢. При этом Gemini 3.5 Flash дешевле (0,8 ¢) и лидирует по точности при массовом использовании, делая его более выгодным для больших потоков данных.

by plurby • 17 августа 2026 г. в 12:09 • 276 points

ОригиналHN

#cost#gemini-3.5-flash#gpt-5.6#llm#object-detection#ocr#openai#speed#vision#vlm-benchmark

Комментарии (143)

GPT-5.6 Sol демонстрирует прогресс в визуальных задачах, но его практическая применимость ограничена высокой стоимостью, низкой скоростью (в 25–50 раз медленнее специализированных моделей) и ненадёжностью в production-сценариях. Gemini 3.5 Flash превосходит его по всем метрикам, кроме OCR, при трёхкратно меньшей цене, делая его предпочтительным для детекции и подсчёта. Локальные альтернативы — Qwen3.8 и MiniCPM-V-4.6 (0.8B) — показывают сопоставимую или лучшую производительность, особенно при требованиях к скорости, экономичности и работе на потребительском оборудовании. Подсчёт объектов, например таблеток, решается эффективнее классическими CV-методами (OpenCV), что ставит под сомнение ценность Sol в таких задачах. Sol ошибочно интерпретирует геометрию изображений (например, поворот монет на 90°) и галлюцинирует содержимое чёрных изображений, что указывает на фундаментальные проблемы понимания реальности. Он не распознаёт надёжно редкие или выцветшие кириллические надписи, несмотря на высокую точность в других OCR-задачах. Для распознавания нотной записи Sol показал неожиданно высокую точность, возможно, благодаря способности к сложному пространственному анализу. Для анализа изображений и кода лучше подходят модели OpenAI (Terra, Luna). Для обработки старых документов рекомендуется предварительная обработка изображений через Python. В задачах с низкой задержкой (например, робототехника в аптеках) Sol неприменим. Использование нескольких специализированных моделей (Fable, Gemini, Sol) по задачам эффективнее, чем полагаться на одну. Визуальные бенчмарки не учитывают глубину восприятия — отсутствие бинокулярных данных делает сравнение неполным, особенно для автономного вождения.

A third world engineer responds to “RISC-V: They should have known better” (rvembedded.com) 🔥 Горячее 💬 Длинная дискуссия

Главная мысль: RISC‑V захватывает рынок дешёвых микроконтроллеров не благодаря изысканной схеме команд, а потому, что открытый набор инструкций позволяет выпускать чипы по 10 ¢, а открытый инструментарий делает их доступными даже в отдалённых регионах.

Ключевые детали: компрессированные store‑offsets и отдельный Zicsr‑модуль действительно вызывают неудобства, но они лишь часть более широкой проблемы — отсутствие массового доступа к недорогим разработчикам. Для большинства стран «третьего мира» цена и логистика важнее эстетики ISA; один‑долларовый чип с бесплатной доставкой меняет правила игры, позволяя студентам и малым компаниям создавать собственные устройства.

Запомните: RISC‑V меняет Embedded‑пространство не за счёт «красивого» кода, а благодаря своей открытости, доступности и способности дать каждому шанс «зажечь» свой собственный транзисторный эксперимент.

by Narishma • 16 августа 2026 г. в 17:01 • 556 points

ОригиналHN

#chip#cost#embedded#logistics#low-cost#microcontroller#open-source#risc-v#third-world#toolchain

Комментарии (282)

Тред дополняет статью опытом эксплуатации и оспаривает утверждения о стоимости и доступности RISC-V. Автор @ndiddy отмечает, что оригинальная статья говорит о невозможности RISC-V конкурировать с ARM64, а ответ — о его пригодности для дешёвых микроконтроллеров — это разные темы. @kelnos сомневается, как RISC-V может быть дешевле в регионах с высокой стоимостью доставки, ведь она не зависит от типа чипа. @vlovich123 подтверждает: разница в 10 центов против доллара незначительна при доминирующей стоимости доставки. @HawtAds опровергает: в Нигерии и Бангладеш доставка не так дорога, как утверждается. @strenholme предполагает, что в будущем RISC-V может достигнуть или превзойти производительность ARM и x86_64, исходя из исторических тенденций.

Show HN: Why write code if the LLM can just do the thing? (web app experiment) (github.com) 🔥 Горячее 💬 Длинная дискуссия

Предоставленный контент — это навигационное меню GitHub для репозитория "samrolken/nokode", без описания самого проекта. На странице отсутствует информация о функционале, целях или особенностях nokode.

В интерфейсе присутствуют стандартные элементы GitHub: поиск, разделы для Enterprise, Pricing, Open Source, Resources и Solutions. Нет ни README, ни кода, ни обсуждений — только базовая структура страницы репозитория.

Для получения информации о проекте потребуется доступ к содержимому репозитория или его документации.

by samrolken • 01 ноября 2025 г. в 17:45 • 389 points

ОригиналHN

#code-generation#cost#experiment#github#llm#performance#scalability#security

Комментарии (279)

  • Обсуждение показало, что «генерация кода на лету» вызывает споры: кто-то считает это будущим, другие указывают на проблемы с безопасностью, стоимостью и предсказуемостью.
  • Участники обсуждали, что вместо генерации кода, можно кешировать уже созданные компоненты и переиспользовать их, что может решить проблему с производительностью.
  • Некоторые комментаторы подчеркнули, что даже если LLM сгенерирует код, его все равно придется тестировать и поддерживать, и это может быть небезопасно.
  • Также обсуждались вопросы стоимости и устойчивости такого подхода, особенно если учесть, что модели становятся дороже.
  • В целом, участники согласились, что идея интересная как эксперимент, но пока не ясно, как она может масштабироваться или стать нормой практикой безопасной.