Hacker News Digest

Тег: #video-generation

Постов: 4

Gemini Omni 1.1 Flash (blog.google) 🔥 Горячее 💬 Длинная дискуссия

Gemini Omni 1.1 Flash — это обновлённая версия генеративной модели от Google DeepMind, ориентированная на профессиональное создание видео через API. Она добавляет студийный уровень контроля: теперь можно плавно расширять сцены на основе до 10 секунд предыдущего контекста (раньше — только последняя секунда), что обеспечивает лучшую визуальную согласованность и позволяет создавать истории длиной до 40 секунд шагами по 10 секунд. Также реализована генерация видео между заданными первым и последним кадрами — идеально для сложных переходов, орбит камеры или зацикленных клипов без скачков.

Для ускорения прототипирования доступен режим 360p: генерация происходит до 60% быстрее и в три раза дешевле, чем в стандартном 720p, что удобно для раскадровок и быстрой итерации. По готовности можно апскейлить результат до 4K с сохранением деталей. Модель уже интегрирована в Google AI Studio, Gemini Enterprise Agent Platform и доступна подписчикам Google AI Plus, Pro и Ultra в Google Flow и Gemini app. Официальная документация, кукбук и гайды по промптингу помогают разработчикам внедрять эти возможности в свои инструменты и рабочие процессы.

by saretup • 27 августа 2026 г. в 17:06 • 280 points

ОригиналHN

#360p#4k#api#deepmind#gemini#gemini-enterprise-agent-platform#gemini-omni-1.1-flash#google#google-ai-studio#video-generation

Комментарии (208)

Тред почти не обсуждает техническую сторону Omni 1.1 Flash; вместо этого доминируют индустриальные и культурные последствия генеративного видео. Прозвучали конкретные сигналы удара по смежным профессиям (актёры озвучки, фотографы, иллюстраторы), скепсис по поводу практической пользы и контроля, а также единичные пользовательские наблюдения о поведении модели.

  • Участники массово фиксируют исчезновение «небрендовых» креативных работ: @earthnail называет произвольную озвучку «мёртвой», @anonzzzies описывает по опыту из своего города, что меню/афиши/баннеры ресторанов и событий теперь генерирует OpenAI, а его знакомый фотограф перешёл на свадьбы, потому что коммерческие съёмки «plummeting» с конца прошлого года.

  • Несколько комментаторов (@thangalin, @apwheele, @NooneAtAll3, @cube00, @DataDive, @bluerooibos) сходятся на том, что видеогенерация пока слаба для реальных задач: модели «дрейфуют» и не держат 30+ секунд, синхронизация с заранее записанным аудио не работает, а нетворческие превью в 360p при повторном запуске дают другой результат из-за недетерминированности.

  • Пользователи (@037, @vardump, @ygouzerh, @GaggiX, @fg137) сообщают, что демо-страница Google плохо работает в Firefox и в целом неудобна на десктопе: бесконтрольный инстант-скролл назад к видео после ручного скролла, много тяжёлых видео; @037 в шутку предлагает гугловцам «P.S. Make sure the page works in Firefox too».

  • Совет: @cube00 советует использовать низкое разрешение 360p только как драфт: при одинаковом промпте на 720p результат отличается из-за недетерминированности, поэтому превью — это лишь проверка идеи, а не воспроизводимый рендер.

  • Совет: @andsoitis указывает, что тема влияния на актёров всё-таки обсуждалась, и даёт поисковый запрос на Algolia HN для тех, кому нужен контекст прошлых дискуссий и профсоюзные кейсы (упоминается контракт SAG-AFTRA против нелицензированных AI-перформансов).

  • @petcat и @lambda отмечают, что экранные и голосовые актёры защищены профсоюзами (SAG-AFTRA), которые целенаправленно бастовали и выторговывали пункты про AI, в отличие от разработчиков, не имеющих коллективного рычага.

  • Спор: @porridgeraisin и @deadlast2 считают автоматизацию креативных профессий логичным продолжением истории труда (как когда-то исчезли чертёжники), а @space_fountain и @DataDive возражают: инструменты «отлично делают слоп», но почти бесполезны для художественного видения и лишают визуальный контент обещания реальности, делая его «массивом пикселей, расставленных алгоритмом на 2D-экране».

  • Часть комментаторов (@bluerooibos, @chermi, @SpyCoder77, @CmonGoogle) выражает усталость и недоверие к маркетингу: пользователи «онемели» к апдейтам, @chermi саркастически вспоминает «3.5prowithinamonth», а @CmonGoogle формулирует три ложные предпосылки, на которых держится нарратив фрагментации AI-брендов Google.

  • Совет: @thangalin демонстрирует свой работающий self-hosted пайплайн для аудиокниг — контейнеризованное веб-приложение, озвучивающее его sci-fi роман локально с несколькими нарраторами и персонажами (скриншоты keenlore), показывая практический пример замены актёров озвучки.

  • @petegleeson ловит явный failure модели в маркетинговом видео: цитата хвалит «accuracy» Omni Flash, а в кадре аргентинский футболист в майке «RESSC», что показывает, как минимум для текста на форме, заявленная точность не выдерживает проверки.

  • @simonw ставит релиз в стратегический контекст: OpenAI фактически бросил Sora, а Google продолжает инвестировать в генерацию видео, возможно, потому что это путь к «world models», тогда как новой версии Gemini Pro давно нет — это подтверждает @guilhermeasper фразой «Google does anything except launch a new version of Gemini Pro».

  • Совет: @shreya1999 формулирует сдвиг рынка: «сырое» качество генерации уже стало baseline-ом, конкуренция теперь идёт за контролируемость, а @overflowy предупреждает, что откажется от любого бизнеса, использующего сгенерированные видео в продакшене.

  • Спор: @dominotw спорит с нарративом массовой автоматизации: AI хорошо работает только там, где есть компиляторы, тесты, CI и «куча данных» (например, hiring через Mercor), во всём остальном он «sucks», что противоречит видению @deadlast2 о скором поглощении всех индустрий.

I love LLMs, I hate hype (geohot.github.io)

Я восхищён новыми большими языковыми моделями, автопилотами, видеогенерацией и агентами‑помощниками, которые уже позволяют ставить установить tmux с настройками geohot и делают возможным «Год настольного Linux». Я использую локальную GLM‑5.2, вижу, как кодовые агенты ускоряют разработку, а всё это – продолжение компьютерной революции, в которой я давно участвую. Я считаю, что эти инструменты уже меняют привычный рабочий процесс, позволяя сосредоточиться на более креативных задачах, а не на рутине. При этом я отмечаю, что такие возможности делают меня ещё более оптимистичным относительно будущего искусственного интеллекта.

Но я раздражен тем, как часто вокруг AI распространяется пессимистичный хайп о «конце света» и «потерянном классе», а также навязанные нарративы о доминировании в «свете» только в Сан‑Франциско. Как писал Линус Торвальдс, агенты делают программирование в 10 раз продуктивнее, а компиляторы — в 1000 раз, и я вижу реальный прирост, хотя с риском когнитивного переутомления. Открытый код и массовое внедрение AI не могут быть полностью подконтрольны крупным лабораториям, потому что их ценность будет распределяться шире, а не захвачена ими. Поэтому я поддерживаю идею, что «единство ближе», а не «конец света».

by therepanic • 12 июля 2026 г. в 18:31 • 216 points

ОригиналHN

#autopilot#github#glm-5.2#jekyll#linux#llm#tmux#video-generation

Комментарии (117)

  • Frontier‑лаборатории создают значительную ценность, но, по мнению участников, не успевают её захватить, продавая её по высоким подпискам.
  • Продуктивность от LLM растёт, однако модели остаются «рваными», требуют тщательного проектирования и не всегда оправдывают ожидания.
  • Стоимость доступа к топовым моделям (до $200 / мес) и возможные будущие повышения вызывают тревогу о субсиях и доступности.
  • Открытый код и форки становятся важными инструментами, но рискуют превратиться в «поддержку в пустоте», если не поддерживать традиции совместного развития.

Sora Update #1 (blog.samaltman.com)

OpenAI активно собирает отзывы о Sora и готовится внести изменения. Правообладатели получат более детальный контроль над генерацией персонажей — смогут указывать, как их можно использовать, включая полный запрет. Многие из них видят потенциал в «интерактивной фанфикшн» и ожидают роста вовлечённости.

Также компания ищет способ монетизации генерации видео, поскольку пользователи создают контента больше ожидаемого. Часть доходов планируется делиться с правообладателями, чьи персонажи используются. OpenAI предупреждает, что возможны ошибки в процессе, но обещает быстро реагировать на фидбэк и постоянно совершенствовать систему.

by davidbarker • 04 октября 2025 г. в 00:39 • 108 points

ОригиналHN

#content-moderation#generative-ai#intellectual-property#openai#user-feedback#video-generation

Комментарии (131)

  • OpenAI столкнулась с юридическими угрозами от правообладателей (включая Ghibli и Nintendo) из-за генерации контента с использованием их IP, что привело к введению строгих ограничений на создание видео.
  • Компания осознала необходимость монетизации генерации видео из-за высоких вычислительных затрат и планирует внедрить плату за использование, а также рассмотреть возможность распределения доходов с правообладателями.
  • Пользователи выражают разочарование из-за резкого ужесточения ограничений, которые теперь блокируют создание контента по мотивам даже не самых известных игр и франшиз.
  • В сообществе распространено мнение, что изначальное разрешение генерации защищённого контента было осознанным PR-ходом для роста популярности, а не ошибкой.
  • Подход OpenAI к решению проблемы воспринимается многими как лицемерный, неискренний и технически сложный для реализации на практике.

Genie 3: A new frontier for world models (deepmind.google) 🔥 Горячее 💬 Длинная дискуссия

Genie 3 — возможности:

Ниже — записи реальных взаимодействий с Genie 3.

Моделирование физических свойств мира

Передает природные явления (вода, свет) и сложные взаимодействия среды.

  • Промпт: Вид от первого лица — робот с шинами едет по вулканическому полю, избегая лавовых луж. Виден дым и потоки лавы, синее небо, вокруг лишь черные скалы.
  • Промпт: Вождение гидроцикла во время фестиваля огней.
  • Промпт: Прогулка по набережной во Флориде во время шторма: ветер гнет пальмы, волны хлещут через перила, сильный дождь, плащ-дождевик, впереди мост.
  • Промпт: Быстрая съемка за медузой в темных глубинах между каньонами с мидиями и крабами; вдали гидротермальные источники с ярко-синим дымом.
  • Промпт: Пилот вертолета маневрирует над прибрежным утесом с водопадом.

Симуляция природного мира

Генерирует экосистемы: поведение животных и детальную растительность.

  • Промпт: Забег вдоль ледникового озера, лесные тропы, брод через горные ручьи среди заснеженных вершин и сосен, богатая фауна.
  • Промпт: Реальная трекинг-съемка: заплыв через темные океанские каньоны среди огромной стаи медуз, биолюминесценция.
  • Промпт: Фотореалистичный дзен-сад на рассвете: белый песок с узорами, пруд с лилиями, камни с мхом, каменный фонарь и кэрн, забор из бамбука.
  • Промпт: Густая листва с каплями воды и пятнистым светом; влажный, спокойный воздух, мягко размытый фон.

Моделирование анимации и вымысла

Создает фантастические сцены и выразительных персонажей.

  • Промпт: Яркий 3D-стиль: пушистое существо с ушами, как у овчарки, мчится по радужному мосту среди парящих островов и светящейся флоры; свет теплый и радостный.
  • Промпт: Ящерица в стиле оригами.
  • Промпт: Широкий план: зачарованный лес в сумерках; игрок управляет крупной светлячком, пролетающим сквозь крону с пестрой листвой.

by bradleyg223 • 05 августа 2025 г. в 14:08 • 1462 points

ОригиналHN

#computer-graphics#deepmind#google#machine-learning#real-time-rendering#vae#video-generation#world-models

Комментарии (481)

  • Обсуждение посвящено Genie 3 от Google DeepMind: впечатляющая реалтайм-генерация интерактивных миров (720p) с устойчивостью во времени, но крайне мало технических деталей и доступа для публики.
  • Технические спекуляции: возможен видео-генеративный подход с 4x временным даунскейлом в VAE и управляющими сигналами (направление/угол обзора), заметны артефакты (скачки текстур, проблемы с текстом, редкие люди в сценах).
  • Часть сообщества критикует отсутствие статьи/отчета и закрытость веса модели; другие отмечают, что прогресс согласуется с намёками Demis и является эмерджентным эффектом масштабирования.
  • Споры о подходе: «мир-модель как видео» vs классический графический конвейер (меши/анимации/рендер), вопрос о пригодности для игр, VR/XR и робототехники; звучит запрос на VR-вывод и интеграцию со звуком.
  • Реакции варьируются от восторга и ощущения «холодека»/диссоциации до обеспокоенности влиянием на творчество и смыслы; некоторые видят в этом шаг к embodied AI и бесконечному синтетическому датасету.
  • Практические ожидания: ускорение прототипирования в геймдеве, обучение навыкам через ИИ-NPC и терапию; скептики считают демо «бережным» и сомневаются в масштабируемой пользе без перехода к 3D-структурам.
  • Вопросы остаются: архитектура, вычислительные затраты, форматы объектов/интеграция, сроки публичного доступа и реальная применимость за пределами демонстраций.