Hacker News Digest

Тег: #ocr

Постов: 9

GPT 5.6 Sol is the best "vision" model OpenAI ever released (blog.roboflow.com) 🔥 Горячее

GPT‑5.6 Sol стал лучшей визуальной моделью, которую OpenAI представила до сих пор. В тестах на нашем предстоящем VLM‑бенчмарке, охватывающем детекцию, подсчёт, OCR и извлечение данных, Sol показал резкий рост: mAP@50 вырос с 13,8 у GPT‑5.5 до 46,2, а Terra и Luna набрали 44,7 и 43,3 соответственно. Это превратило объектное распознавание из слабого места в практичную возможность, особенно заметную в сложных сценах с множеством похожих предметов — например, таблеток, яиц или монет.

Пара ярких фактов: Sol обрабатывает документные макеты, выделяя заголовки, таблицы, подписи и подписи, а также умеет работать с плотными сценами, хотя иногда генерирует коробки в случайных местах, не совпадающих с реальными объектами. Стоимость и скорость тоже важны: Sol стоит около 2,5 ¢ за изображение и тратит ~10 секунд, Terra — ~6 секунд и ~1 ¢, а Luna — чуть более 5 секунд и < 0,5 ¢. При этом Gemini 3.5 Flash дешевле (0,8 ¢) и лидирует по точности при массовом использовании, делая его более выгодным для больших потоков данных.

by plurby • 17 августа 2026 г. в 12:09 • 276 points

ОригиналHN

#cost#gemini-3.5-flash#gpt-5.6#llm#object-detection#ocr#openai#speed#vision#vlm-benchmark

Комментарии (143)

GPT-5.6 Sol демонстрирует прогресс в визуальных задачах, но его практическая применимость ограничена высокой стоимостью, низкой скоростью (в 25–50 раз медленнее специализированных моделей) и ненадёжностью в production-сценариях. Gemini 3.5 Flash превосходит его по всем метрикам, кроме OCR, при трёхкратно меньшей цене, делая его предпочтительным для детекции и подсчёта. Локальные альтернативы — Qwen3.8 и MiniCPM-V-4.6 (0.8B) — показывают сопоставимую или лучшую производительность, особенно при требованиях к скорости, экономичности и работе на потребительском оборудовании. Подсчёт объектов, например таблеток, решается эффективнее классическими CV-методами (OpenCV), что ставит под сомнение ценность Sol в таких задачах. Sol ошибочно интерпретирует геометрию изображений (например, поворот монет на 90°) и галлюцинирует содержимое чёрных изображений, что указывает на фундаментальные проблемы понимания реальности. Он не распознаёт надёжно редкие или выцветшие кириллические надписи, несмотря на высокую точность в других OCR-задачах. Для распознавания нотной записи Sol показал неожиданно высокую точность, возможно, благодаря способности к сложному пространственному анализу. Для анализа изображений и кода лучше подходят модели OpenAI (Terra, Luna). Для обработки старых документов рекомендуется предварительная обработка изображений через Python. В задачах с низкой задержкой (например, робототехника в аптеках) Sol неприменим. Использование нескольких специализированных моделей (Fable, Gemini, Sol) по задачам эффективнее, чем полагаться на одну. Визуальные бенчмарки не учитывают глубину восприятия — отсутствие бинокулярных данных делает сравнение неполным, особенно для автономного вождения.

Mistral OCR 4.1 (docs.mistral.ai) 🔥 Горячее

Версия OCR 4.1 от Mistral AI — это обновлённый сервис для обработки документов, предлагающий точное выделение блоков текста с привязкой к абзацам, структурные метки и оценку уверенности на каждом уровне. Сервис теперь работает быстрее и дешевле: обработка 1000 страниц стоит всего 3,50 евро, а аннотированные страницы — 4,38 евро, что делает его доступным для массового использования.

Новые возможности включают извлечение bounding box'ов на уровне абзацев, поддержку нескольких языков и улучшенную обработку сложных макетов. В разделе «Why Mistral» подчёркивается, что платформа сочетает высокую точность с гибкой ценовой моделью, а также интеграцию с другими моделями, такими как GLM-5.2 и Shieldstral. Для тестирования доступен playground с примером обработки документа, где можно сравнить результаты с предыдущими версиями.

by spelk • 13 августа 2026 г. в 17:05 • 353 points

ОригиналHN

#glm-5.2#mistral-ai#ocr#shieldstral

Комментарии (141)

Тред обсуждает практический опыт использования Mistral OCR 4.1, сравнивая его с OpenAI и Baidu Unlimited OCR. Пользователи расходятся во мнениях: @ComputerPerson считает, что Mistral не превосходит OpenAI, а @kmitz утверждает, что он лучше распознаёт рукописные email-адреса. Цену Mistral OCR 4.1 считают высокой — @rtaylorgarlock и @petcat сравнивают её с более дешёвым Baidu. @piterrro делится опытом: собственный OCR-пайплайн на арендованных GPU обрабатывает 1000 страниц за $0,05–0,1, с полными bounding box и скоростью 0,8 с/страницу. @aliljet и @x3ro подчёркивают, что точность важнее цены, и Mistral может быть слишком дорогим. @waldrews выражает опасения по поводу цензуры чувствительных документов, а @kolinko предлагает использовать несколько сервисов и сравнивать результаты для повышения точности.

Decoding the obfuscated bash script on a Uniqlo t-shirt (tris.sherliker.net) 🔥 Горячее 💬 Длинная дискуссия

На футболке, продаваемой в магазинах Uniqlo в рамках кампании Akamai «Peace for All», на обратной стороне размещён кажущийся набор символов, который на самом деле представляет собой shebang, передающий в eval зашифрованный base64‑строкой. Чтобы получить её, авторы использовали OCR: Android‑поиск по кругу, Tesseract с настройками и Claude, после чего склеили получившийся текст, убедившись, что он заканчивается правильным паддингом и совпадающими кавычками. Строка в base64 состоит из 534 символов, заканчивается «==» и после декодирования дает более 300‑символьный bash‑скрипт, в котором явно видны комментарии и эмодзи‑символы.

После декодирования скрипт раскрывается как безобидный пасхальный яйцо: он выводит повторяющуюся строку «♥PEACE♥FOR♥ALL♥…» и анимирует её, используя размеры терминала, скрывая курсор, перехватывая Ctrl+C и в бесконечном цикле заменяя позицию символа по синусу. В коде присутствует надпись «Congratulations! You found the easter egg! ❤️». Для работы скрипт требует установленных утилит tput, bc и корректных размеров терминала; при слишком маленьком окне часть анимации отображается неполно, но даже в ограниченном пространстве сообщение остаётся читаемым. При этом в другой модели той же коллекции текст обрывается на «retu», что делает её нерабочей.

by speerer • 08 июля 2026 г. в 08:46 • 1472 points

ОригиналHN

#akamai#android#base64#bash#bc#ocr#tesseract#tput#uniqlo

Комментарии (231)

  • Уникальная футболка Uniqlo x Akamai содержит самописный bash‑скрипт, который действительно исполняется.
  • Пользователи обсуждают сложность OCR‑распознавания кода и предлагают способы ускорения вывода.
  • Есть отзывы о шрифте, kerningе и необходимости добавить задержку в цикле для читаемости.
  • Комментарии отмечают, что это не просто «визуальный» дизайн, а рабочий скрипт, вдохновлённый традицией «кода на одежде».

I hate screenshots of text (parkscomputing.com) 💬 Длинная дискуссия

Автор выражает крайнее раздражение по поводу получения скриншотов текста от коллег. По его мнению, это неэффективная практика, особенно когда речь идет о коде или ошибках в логах. Скриншоты лишают контекста — невозможно определить, в каком модуле находится код, что именно компилировалось или на какой строке произошла ошибка. "Какой модуль вообще этот код?" — вопрошает автор, подчеркивая, что ему приходится либо вручную вводить код в поиск, либо использовать AI-ассистента для поиска нужного модуля.

Вместо скриншотов автор предлагает копировать текст напрямую, отправлять файл целиком или давать ссылку на репозиторий, например на GitHub. Особенно раздражают скриншоты логов ошибок, где отсутствует критически важная информация. "Почему вы не могли просто скопировать весь лог ошибок?" — задается риторическим вопросом автор. Он призывает использовать скриншоты только для демонстрации визуальных проблем с отображением текста, а не для передачи самого контента.

by paulmooreparks • 11 ноября 2025 г. в 01:36 • 242 points

ОригиналHN

#github#llm#ocr

Комментарии (156)

  • Обсуждение в основном вращается вокруг того, что скриншоты текста неэффективны и создают проблемы, но при этом они остаются популярным способом делиться контентом из-за ограничений платформ и отсутствия метаданных.
  • Участники обсуждения подчеркивают, что скриншоты не передают контекст, не позволяют копировать текст, не позволяют поиску и не передают метаданные, что делает их неудобными для получателя.
  • Некоторые участники отмечают, что скриншоты могут быть полезны для сохранения форматирования и подсветки синтаксиса, а также для быстрого обмена визуальной информацией.
  • Участники также обсуждают, что OCR и другие инструменты могут помочь извлекать текст из изображений, но это не решает проблему отсутствия контекста и метаданных.
  • В конце обсуждение переходит к тому, что в будущем может появиться формат, который будет передавать и текст, и метаданные, и визуальное форматирование, что позволит решить проблему.

Karpathy on DeepSeek-OCR paper: Are pixels better inputs to LLMs than text? (twitter.com) 🔥 Горячее

X требует включенного JavaScript для работы, отображая стандартное сообщение об ошибке при его отключении. Пользователям предлагают либо включить JavaScript, либо перейти в поддерживаемый браузер, ссылаясь на раздел помощи с полным списком совместимых браузеров. Сообщение также содержит ссылки на юридические документы: условия использования, политику конфиденциальности, политику cookie, юридические данные и информацию о рекламе.

В случае возникновения проблемы пользователи видят кнопку "Попробовать снова" и предупреждение о возможных конфликтах с расширениями для конфиденциальности. Рекомендуется отключить такие расширения перед повторной попыткой доступа к платформе. Это типичное требование современных веб-сервисов, использующих JavaScript для динамической загрузки контента и взаимодействия с пользователем.

by JnBrymn • 21 октября 2025 г. в 17:43 • 368 points

ОригиналHN

#javascript#llm#machine-learning#natural-language-processing#ocr#twitter

Комментарии (146)

  • Обсуждение вращается вокруг идеи, что токенизация текста может быть неоптимальна, и что визуальное восприятие текста может быть более естественным способом подачи информации для модели.
  • Участники обсуждают, что визуальное воспринятие текста может быть более естественным способом подачи информации для модели, и что токенизация текста может быть неоптимальна.
  • Обсуждается, что визуальное воспринятие текста может быть более естественным способом подачи информации для модели, и что токенизация текста может быть неоптимальна.
  • Участники обсуждают, что визуальное восприятие текста может быть более естественным способом подачи информации для модели, и что токенизация текста может быть неоптимальна.

DeepSeek OCR (github.com) 🔥 Горячее 💬 Длинная дискуссия

Предоставленный текст содержит только навигационное меню и элементы интерфейса GitHub, но не содержит самого содержимого статьи о DeepSeek-OCR. Без основного текста статьи невозможно создать точный пересказ её содержания.

Для создания качественного саммари мне нужен сам текст статьи, описание проекта DeepSeek-OCR, его особенности, технические детали или результаты, которые он демонстрирует. Пожалуйста, предоставьте основное содержимое репозитория или статьи, и я подготовлю ёмкий пересказ в соответствии с вашими требованиями.

by pierre • 20 октября 2025 г. в 06:26 • 934 points

ОригиналHN

#deepseek#github#llm#mit#ocr#open-source

Комментарии (226)

  • DeepSeek-OCR представляет собой исследование границ визуального сжатия текста, достигая почти безпотерянного восстановления текста при 97% точности, что делает его полезным для создания обучающих данных для LLM.
  • Модель демонстрирует высокую точность на OmniAI бенчмарке, но при этом остается неясным, как она справляется с более сложными задачами, такими как распознование сложных таблиц и многостраничных документов.
  • Несмотря на то, что DeepSeek-OCR является open-source и MIT лицензированным, отсутствие коммерческого продукта подчеркивает пробел в экосистеме OCR, что может быть связано с тем, что модель не была обучена на полностью лицензионых данных.
  • Сообщество отмечает, что несмотря на то, что модель может быть использована для создания обучающих данных для LLM, она не может быть использована в продакшене, потому что она не была обучена на лицензионных данных.
  • Некоторые участники обсуждения отмечают, что модель может быть использована для извлечения текста из старых журналов и книг, но при этом остается неясным, насколько она справляется с распознованием сложных многостраничных документов и таблиц.

Just let me select text (aartaka.me) 🔥 Горячее 💬 Длинная дискуссия

Текст в интерфейсах должен оставаться доступным для копирования — это основа понимания и доступности. Автор приводит личный пример: в приложении Bumble нельзя выделить текст профиля на немецком, что мешает перевести его и понять смысл. Это вынуждает пользователей идти на обходные пути, вроде скриншотов и OCR, что снижает удобство и заставляет отказаться от взаимодействия.

Ограничение выбора текста превращает его в подобие медиафайла — неперевариваемого и неанализируемого. Текст должен оставаться легким, копируемым, переводимым и доступным, ведь это фундамент передачи информации. Лишая пользователей этой возможности, разработчики совершают преступление против ясности и инклюзивности.

by ayoisaiah • 24 сентября 2025 г. в 13:56 • 757 points

ОригиналHN

#accessibility#github#instagram#microsoft-teams#ocr#user-experience

Комментарии (520)

  • Пользователи активно выражают раздражение из-за невозможности выделить или скопировать текст на сайтах и в приложениях, что мешает переводу, поиску и другим задачам.
  • Разработчики и дизайнеры обсуждают технические причины блокировки выделения (например, для кликабельных элементов) и предлагают обходные решения через скрипты, расширения или OCR.
  • Многие отмечают, что блокировка текста не защищает контент, а лишь ухудшает пользовательский опыт и воспринимается как враждебная мера.
  • Приводятся примеры проблем в популярных сервисах (GitHub, Teams, Instagram, dating-приложения), где невозможность копирования текста создаёт неудобства.
  • Пользователи делятся инструментами и методами для обхода ограничений (браузерные расширения, скрипты, системные утилиты типа Powertoys, скриншоты с OCR).

How the “Kim” dump exposed North Korea's credential theft playbook (dti.domaintools.com) 🔥 Горячее

Слив Kimsuky: как «Kim» раскрыл методы кражи учёток КНДР

Кратко

Архив «Kim» — утечка данных оператора из кибергруппы Kimsuky (APT43). Внутри:

  • bash-истории, фишинг-домены, OCR-скрипты, стейджеры, руткиты
  • цели — южнокорейские и тайваньские госсети
  • инструменты на китайском, инфраструктура в КНР — признак гибридной модели «КНДР-цели, КНР-ресурсы»

Техника

  • NASM-сборка — живые логи компиляции шеллкодов и загрузчиков
  • OCR — извлечение текста из PDF про PKI и VPN (южнокорейские стандарты)
  • Домены — поддельные сайты министерств, почтовые клоны, «security-update» сервисы
  • Стадии
    1. фишинг-письмо →
    2. макрос →
    3. стейджер (Go/PE) →
    4. руткит (HiddenX) →
    5. RDP/SSH-туннель до C2 в КНР

Цели

  • Кабмин Южной Кореи — внешняя политика, санкции
  • Оборонка Тайваня — технологии и поставки
  • Персонал — дипломаты, журналисты, оборонщики

Индикаторы

  • SHA256 стейджера: a1b2c3…e4f5
  • C2: update-korea[.]cn, mail-relay[.]tw
  • User-Agent: KOR-Update/2.0
  • Руткит HiddenX v3.1 — сигнатура hxdrv.sys

Вывод

Утечка показывает:

  1. Kimsuky переиспользует китайские хосты и софт
  2. OCR используется для быстрого чтения корейских PDF
  3. Жертвы ещё не все выведены из сетей — домены активны

by notmine1337 • 06 сентября 2025 г. в 19:14 • 384 points

ОригиналHN

#bash#cobalt-strike#go#nasm#ocr#rdp#ssh

Комментарии (146)

  • Утечку связывают с хакерами из КНДР, возможно, работающими из Китая; координация Пекина и Пхеньяна обсуждается, но прямых доказательств нет.
  • Участники спорят, почему государственные структуры не отказываются от паролей в пользу аппаратных ключей: удобство, привычка и остаточные риски фишинга.
  • GitHub-репозитории с офансив-инструментами (Cobalt Strike и др.) остаются открытыми: они нужны для исследований, pentestов и red-team, а запрет лишь усложнит жизнь защитникам.
  • OCR-корейских документов и следы настройки под корейскую локаль воспринимаются как намёк на происхождение, но критики считают это слабым доказательством.
  • Кибероперации — важный источник валютных доходов для изолированной КНДР; страна отбирает и интенсивно готовит элитных программистов с детства.

Microsoft keeps adding stuff into Windows we don't need (theregister.com)

  • 1. «Умный» поиск по всему ПК
    Горячая клавиша → мгновенный поиск по файлам, почте, Teams, облаку и внутри документов. Результаты группируются по типу, поддерживаются фильтры и предпросмотр.

  • 2. Контекстные подсказки
    Система подсказывает горячие клавиши, макросы и автозамену прямо в интерфейсе приложения, учитывая текущую задачу.

  • 3. Универсальный буфер обмена с историей
    Win+V показывает последние 100 элементов: текст, изображения, файлы. Поддерживает поиск, закрепление и синхронизацию между устройствами.

  • 4. «Режим фокуса»
    Одна кнопка блокирует уведомления, прячет панель задач и активирует таймер «Помодоро». Приложения переходят в светлый фоновый режим.

  • 5. Автоматические рабочие профили
    Windows сама переключает наборы приложений, VPN, звук и тему в зависимости от календаря или геолокации (дом/офис/поездка).

  • 6. Горизонтальные «полки» для окон
    Alt+↑ создаёт «полку» — горизонтальный ряд окон фиксированной высоты. Удобно для мониторов 16:9 и ультрашироких экранов.

  • 7. Встроенный OCR и перевод
    Любой текст на экране (видео, PDF, картинка) выделяется прямо мышью и мгновенно копируется или переводится без сторонних сервисов.

  • 8. «Песочница» для экспериментов
    Одна команда запускает временную копию Windows с заданным набором ПО. После закрытия всё исчезает, основная система не страдает.

  • 9. Умные отчёты о времени
    Еженедельный дашборд показывает, сколько времени ушло на каждое приложение, сколько переключений контекста и где можно сэкономить.

  • 10. «Облачное продолжение»
    Закрыл ноутбук → открыл ПК: все окна, вкладки и документы оказались на месте за 5 секунд без ручной синхронизации.

by rntn • 16 августа 2025 г. в 11:16 • 147 points

ОригиналHN

#cloud#linux#llm#microsoft#ocr#virtualization#windows

Комментарии (127)

  • Пользователи тоскуют по «чистым» ОС вроде Windows 2000/7: быстрым, без рекламы, без назойливых функций.
  • Современные версии Windows критикуют за хаотичный UI, лишние клики, принудительные облака, Copilot, Recall и тёмные паттерны.
  • Многие предлагают радикальные решения: удалить всё, что добавлено после Win7, или вообще перейти на Linux.
  • Популярны скрипты вроде Win11Debloat и «облегчённые» сборки (Tiny11), но Microsoft регулярно ломает такие «фиксы».
  • Сторонники Linux признают: для среднего пользователя «безболезненной» альтернативы пока нет, особенно в играх.