# Сопутствующие статьи по теме Генерация видео

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Генерация видео", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Выходит видео-версия Nano Banana: встроена мировая база знаний Gemini, оригинальная банановая генерация изображений занимает всего 4 секунды

Выпущены две новые мультимодальные модели от Google: Gemini Omni Flash и Nano Banana 2 Lite. Gemini Omni Flash, доступная через API, сочетает возможности Gemini по работе с текстом, изображениями и видео, позволяя генерировать и редактировать видео с использованием знаний о мире. Модель поддерживает диалоговое редактирование видео, работу с несколькими типами входных данных и синхронизацию текста с действием. Стоимость генерации — около 0,10 доллара за секунду видео. Nano Banana 2 Lite — это оптимизированная для скорости модель генерации изображений. Она создаёт изображение с разрешением 1K примерно за 4 секунды и стоит около 0,034 доллара за изображение, что делает её вдвое дешевле и в пять раз быстрее Nano Banana 2, сохраняя при этом качество рендеринга текста. Ключевая инновация — возможность совместного использования моделей в едином рабочем процессе. Пользователи могут быстро генерировать изображения с помощью Nano Banana 2 Lite, а затем немедленно использовать их в качестве основы для создания видео в Gemini Omni Flash. Google представил три демо-приложения, иллюстрирующих этот подход: «Anywhere» для создания туристических видео из фото, «Space Lift» для визуализации дизайна интерьера и «Omni product studio» для автоматической генерации рекламного контента для электронной коммерции. Эти разработки демонстрируют стратегию Google по внедрению мультимодального ИИ в практические, коммерчески жизнеспособные приложения, охватывающие такие области, как маркетинг, дизайн и развлечения, используя преимущества экосистемы Android для монетизации.

marsbit07/01 01:55

Выходит видео-версия Nano Banana: встроена мировая база знаний Gemini, оригинальная банановая генерация изображений занимает всего 4 секунды

marsbit07/01 01:55

Команда Ли Фэйфэй проясняет понятие "мировой модели": Sora — всего лишь рендерер

Команда Ли Фэйфэй и World Labs представили классификацию «моделей мира» в ИИ, разделив их на три функциональные проекции: рендереры, симуляторы и планировщики. В статье утверждается, что термин «модель мира» стал размытым и используется для описания различных систем, от генераторов видео (таких как Sora от OpenAI) до систем предсказания в автопилоте Tesla, хотя они решают принципиально разные задачи. Sora классифицируется как «рендерер» — он создает правдоподобные пиксельные изображения, но не способен моделировать физические взаимодействия на основе действий (например, предсказать, что произойдет, если толкнуть чашку). Настоящая «модель мира» в рамках классической теории (частично наблюдаемые марковские процессы принятия решений, POMDP) должна уметь выполнять полный цикл: генерировать наблюдения (рендеринг), предсказывать следующее состояние на основе действий (симуляция) и планировать действия для достижения цели (планирование). Четкое разграничение этих категорий имеет практическую ценность для инвесторов, разработчиков и исследователей, предотвращая заблуждения о возможностях технологий и помогая в выборе правильных инструментов для таких задач, как робототехника или цифровые двойники.

marsbit06/04 03:18

Команда Ли Фэйфэй проясняет понятие "мировой модели": Sora — всего лишь рендерер

marsbit06/04 03:18

В области генерации видео с помощью ИИ «значительное превосходство» стало реальностью

В области генерации видео с использованием искусственного интеллекта китайские компании, такие как ByteDance (Seedance 2.0) и Kuaishou (Kling 3.0), демонстрируют лидирующие позиции по сравнению с американскими аналогами, такими как OpenAI Sora. Ключевыми факторами этого отрыва являются преимущества в данных и практическом применении. Китайские компании имеют доступ к огромным объёмам высококачественных видеоданных с поведенческими метками от таких платформ, как Douyin и Kuaishou. Эти данные, отражающие реальные предпочтения пользователей, служат отличной основой для тренировки моделей. Кроме того, интеграция ИИ-инструментов в экосистемы (например, Seedance в видеоредактор CapCut) создаёт цикл обратной связи, постоянно улучшающий модели. Практическое применение также сильнее в Китае. Основные сценарии включают: создание рекламных видео для электронной коммерции, что значительно снижает затраты для продавцов; генерацию рекламных роликов; и производство коротких сериалов (short-form dramas), которые можно монетизировать. Американские инструменты в основном остаются на стадии экспериментов. Однако китайский ИИ сталкивается с проблемами. Это значительный разрыв в вычислительных мощностях (по оценкам, в 8 раз меньше, чем у США), проблемы с авторскими правами на тренировочные данные (как в случае с исками голливудских студий), растущие коммерческие расходы на генерацию видео и отставание в развитии базовых языковых моделей, которые лежат в основе видео-ИИ. Таким образом, хотя Китай достиг реального лидерства в специализированной области генерации видео, этот успех не является абсолютным и существует на фоне структурных вызовов в более фундаментальных аспектах ИИ.

marsbit05/21 04:37

В области генерации видео с помощью ИИ «значительное превосходство» стало реальностью

marsbit05/21 04:37

Gemini 3.5 пришел! Этой ночью Google собственноручно победил Google

На Google I/O 2026 были представлены революционные достижения в области искусственного интеллекта. Главной новостью стал Gemini Omni — первая по-настоящему «универсальная» модель, способная создавать видео из любых комбинаций входных данных (текст, изображение, аудио, видео) с глубоким пониманием физического мира и возможностью последующего редактирования через чат. Параллельно был анонсирован Gemini 3.5 Flash, который по производительности и скорости превзошел предыдущий флагман 3.1 Pro и конкурентов. Он стал основой для Antigravity 2.0 — платформы для разработки агентов, продемонстрировавшей создание операционной системы силами 93 ИИ-агентов за 12 часов. Также представлен Gemini Spark — персональный ИИ-агент, работающий круглосуточно в облаке. Он интегрирован с сервисами Google (Gmail, Docs, Sheets) и может автономно выполнять сложные задачи, такие как планирование мероприятий или составление отчетов. Эти релизы в комплексе знаменуют новый этап, когда ИИ получает способность к полному пониманию, самостоятельному принятию решений и выполнению действий, приближая эру искусственного суперинтеллекта (ASI).

链捕手05/20 06:59

Gemini 3.5 пришел! Этой ночью Google собственноручно победил Google

链捕手05/20 06:59

Таинственная модель HappyHorse взлетела в рейтинге, принеся свежее дыхание в гонку генерации?

Загадочная модель HappyHorse-1.0 неожиданно возглавила рейтинг AI Video Arena платформы Artificial Analysis, обойдя таких гигантов, как Seedance 2.0 и другие коммерческие решения. Рейтинг основан на слепых пользовательских тестах (Elo), что делает его более объективным. Анализ языка интерфейса (китайский и кантонский выше английского) и названия, отсылающего к году Лошади, указал на китайское происхождение команды. Технический анализ показал, что HappyHorse, вероятно, является оптимизированной версией недавно открытой модели daVinci-MagiHuman (разработана совместно Shanghai Insitute of Intelligence и Sand.ai). Её архитектура — 15-миллиардный трансформер, объединяющий текст, видео и аудио в единый поток. Быстрый успех объясняется фокусом на генерации портретов и говорящих голов, которые доминируют в тестовых выборках. Однако модель требует мощного железа (H100), ограничена короткими клипами и сценами с одним персонажем. Несмотря на это, её успех сигнализирует о важном сдвиге: открытые модели впервые достигли качества, сопоставимого с коммерческими в слепых тестах. Это может ускорить развитие сообщества и предложить альтернативу для создателей, ценящих контроль и кастомизацию.

marsbit04/08 07:59

Таинственная модель HappyHorse взлетела в рейтинге, принеся свежее дыхание в гонку генерации?

marsbit04/08 07:59

Американские СМИ раскрыли внутреннюю историю закрытия Sora: ежедневные убытки в миллионы, число пользователей сократилось вдвое, конкуренты переманивают сотрудников

В мае OpenAI неожиданно закрыла генератор видеоинструмент Sora, несмотря на амбициозные планы и недавнюю сделку с Disney. Проект, который позиционировался как следующее большое потребительское приложение после ChatGPT, стал финансовым бременем: ежедневные убытки составляли около $1 млн, а количество пользователей упало с пика в 1 млн до менее 500 тыс. Решение было принято в связи с необходимостью перенаправить вычислительные ресурсы (дефицитные AI-чипы) на более приоритетные задачи — разработку новой модели кодового инструмента и корпоративных продуктов в преддверии IPO. Ключевые сотрудники проекта, включая Тима Брукса и Билла Пиблса, оказались в центре борьбы за таланты с Meta. Сделка с Disney на $1 млрд и использование её персонажей не состоялись. OpenAI теперь фокусируется на «супер-приложении» с AI-агентами для автоматизации задач.

marsbit03/30 07:30

Американские СМИ раскрыли внутреннюю историю закрытия Sora: ежедневные убытки в миллионы, число пользователей сократилось вдвое, конкуренты переманивают сотрудников

marsbit03/30 07:30

活动图片