Текст: Буквенный ИИ
По сообщениям, видео-генеративная модель Bytedance Seedance 2.1 будет выпущена в ближайшее время, ожидается, что качество генерации улучшится на 20% по сравнению с версией 2.0. Bytedance заявил Буквенному ИИ, что эта информация является ложной.
Хотя Seedance 2.1 может быть выпущена не в ближайшее время, настоящий рост популярности Seedance 2.0 за рубежом является фактом.
Причина в том, что в выходные статья под заголовком "Китайские компании ИИ вырываются вперед в гонке по генерации видео, опережая американских конкурентов" широко распространилась за рубежом.
Статья, используя в качестве ключевых аргументов Seedance 2.0 и Kuaishou Kling 3.0, пришла к неожиданному выводу: "Китай в области генерации видео ИИ не только опережает США, но и это преимущество будет сохраняться вечно".

Это утверждение звучит несколько нелогично и больше похоже на восхваление китайского ИИ. В конце концов, за последние годы в индустрии ИИ всегда было так: сначала в Силиконовой долине выпускали какой-либо продукт, а затем появлялся аналогичный продукт в Китае, что мы все видели.
Но, прочитав точку зрения зарубежных СМИ, я обнаружил, что мои мысли были действительно слишком односторонними. В области генерации видео ИИ в Китае действительно есть опережение по сравнению с США.
В статье специально были взяты интервью у нескольких американских предпринимателей в области ИИ, а также у кинематографистов, использующих технологии генерации видео ИИ. Результат был таков, что все согласились: китайские инструменты ИИ для видео уже полностью превзошли своих американских коллег.
Что еще более важно, это опережение является не просто этапным техническим преимуществом, а всесторонним опережением — превосходством в каждом звене, от данных до внедрения.
Более того, это опережение является таким, что его "невозможно догнать". Другими словами, это лидирующее положение будет сохраняться постоянно.
Значительное превосходство стало реальностью?
Почему китайский ИИ всегда будет опережать американский ИИ?
Один из аргументов статьи заключается в том, что в области генерации видео ИИ разрыв на уровне алгоритмов быстро сокращается.
В настоящее время технологии различных компаний в плане архитектуры уже "в целом схожи". Трансформеры, диффузионные модели, механизмы пространственно-временного внимания — эти основные технологические маршруты стали относительно прозрачными.
Поэтому ключевой вопрос заключается в том, у кого данные для обучения более высокого качества и большего объема.
И это именно та область, где Bytedance и Kuaishou наиболее сильны. Douyin и Kuaishou сами по себе являются одними из крупнейших в мире машин по производству видео.
Что еще более важно, эти данные содержат полную маркировку пользовательского поведения.
Какие видео лайкнули, добавили в избранное, поделились, у каких высокий процент досмотра — все эти данные видны в бэкэнде.
И эта маркировка не требует ручной разметки, она генерируется естественным образом на основе реальных действий пользователей. Такие качественные данные с маркировкой не всегда можно купить на рынке даже за деньги.
Для сравнения, у OpenAI и Anthropic нет накопленных видеоданных.
При выпуске Sora OpenAI в основном полагался на публичные видеоданные, собранные из интернета, а также на частично лицензированные кинематографические материалы.
Проблема в том, что публичные видео в интернете часто неоднородны по качеству, содержат много повторяющегося контента, контента низкого качества и даже вторично обработанного контента с водяными знаками и рекламой.
Поэтому в процессе обучения часто возникает ситуация, когда результат не соответствует затраченным усилиям.
На глобальной платформе оценки Artificial Analysis инструменты из Китая — Seedance 2.0 от Bytedance, Kling 3.0 от Kuaishou и HappyHorse от Alibaba — заняли первые места в рейтингах генерации видео по тексту и по изображению.
Этот рейтинг формируется голосами реальных пользователей, что означает, что все считают контент, генерируемый этими тремя ИИ для видео, более привлекательным.
Хотя у Google есть и YouTube как источник данных, и модель генерации видео Veo 3.
Но проблема Google заключается в слишком большом количестве ограничений, а видео на YouTube, как правило, длятся более 5 минут. Однако современные GPU еще не могут вместить такие длинные и высококачественные видео в качестве обучающих данных, что может привести к сбоям в процессе обучения модели.
Это привело к тому, что рыночный отклик на Veo 3 не был очень хорошим, он уступает китайским моделям генерации видео ИИ, таким как Seedance 2.0 и Kling 3.0.
Основатель Director AI Бен Чианг заявил: "Мы пробовали большинство американских моделей, но они недостаточно хорошо справляются с генерацией видео". Поэтому в настоящее время он в основном использует китайские инструменты, такие как Kling, Seedance 2.0 и Conch, для творчества.
Независимый создатель фильмов с использованием ИИ Джордж Вон сказал: "Seedance 2.0 — это инструмент, меняющий правила игры. Он может обрабатывать агрессивные углы и скорость съемки, не теряя деталей лица персонажей или контраста света и тени. Большинство моделей ИИ начинают дрожать или смещаться при быстром движении."
И это преимущество в данных также позволяет продукту проводить «самоусиление».
Bytedance уже интегрировал Seedance 2.0 в творческие инструменты, такие как Jianying, поэтому компания ежедневно получает более 50 миллионов отзывов о сгенерированных видео.
Таким образом, Bytedance может знать, что «это видео удовлетворило пользователя, а это — нет».
С каждым таким отзывом направление развития следующего поколения продуктов Seedance становится более четким.
Такая непрерывная, масштабная и основанная на реальных сценариях цикличная обратная связь также не сравнима с лабораторной средой, как у OpenAI и Anthropic.
Даже при вложении большего количества ресурсов в краткосрочной перспективе сложно создать подобный цикл обратной связи на основе данных.
Технологии можно догнать, алгоритмы можно скопировать, но накопление экосистемы и данных требует времени, пользовательской базы и полноценного замкнутого цикла продукта.
Сценарии внедрения
Развитие ИИ для видео компанией должно иметь «цель».
Преимущество в данных — это только начало. То, что превращает технологию в конкурентоспособность, — это нахождение прибыльных сценариев применения. Имея сценарии внедрения, компании получают мотивацию развивать генерацию видео ИИ.
В этом измерении Bytedance и Kuaishou также превосходят американский ИИ.
Первым крупномасштабным сценарием внедрения являются коммерческие видео.
Раньше стоимость создания профессионального видео для одного товара достигала нескольких тысяч юаней. Включая фотографа, осветителя, аренду площадки, расходы на моделей, постпродакшн и т.д.
Для большинства малых и средних продавцов на обычном магазине Taobao может быть несколько сотен товаров, и их полная съемка обойдется как минимум в сотни тысяч юаней.
Технология генерации видео ИИ изменила эту ситуацию.
Генеральный директор компании по инфраструктуре видео Firework Винсент Ян заявил: «Один ритейлер попросил нас создать 100 000 видео для страниц его товаров. Без ИИ это было бы совершенно нереально с точки зрения затрат. Теперь каждый продукт может иметь свое собственное видео, и даже можно создавать несколько версий, адаптированных для разных клиентов».
Данные показывают, что коэффициент конверсии товарных страниц с видео на 30–80% выше, чем у страниц только с изображениями и текстом, а Douyin и Kuaishou сами по себе являются одними из крупнейших платформ для коммерческих трансляций и продаж через короткие видео в Китае.
Сгенерировав видео с помощью ИИ, можно сразу же пойти направо и запустить его в рекламу.
Модель HappyHorse от Alibaba также четко определила коммерческие видео в качестве ключевого сценария внедрения. Она поддерживает массовую генерацию коротких видео для демонстрации товаров и видеороликов с виртуальными ведущими. Продавец может загрузить изображения товаров и простое текстовое описание, и система автоматически создаст несколько версий видео для продаж, каждая из которых будет ориентирована на разные целевые аудитории, использовать разные формулировки и способы демонстрации.
Второй сценарий — реклама.
Традиционный производственный цикл для телевизионной коммерческой рекламы слишком длинный.
Для 30-секундного брендового ролика от креативного планирования до съемок и производства часто требуются недели.
Имея модели генерации видео, можно за несколько минут создать десятки различных версий рекламных креативов.
Третий сценарий — короткие сериалы.
Короткие сериалы на основе ИИ пережили взрывной рост в 2026 году. Данные показывают, что количество коротких сериалов на ИИ, находящихся в эфире в марте 2026 года, увеличилось на 138% по сравнению с январем, что значительно превышает скорость производства традиционного кино- и видеоконтента.
С помощью генерации видео ИИ небольшая команда или даже индивидуальный создатель могут создать короткий сериал за несколько дней.
И это еще не все: платформа коротких сериалов Hongguo от Bytedance также интегрировала функцию «поиск аналогов по изображению».
Эту функцию легко понять: при просмотре короткого сериала, если вас заинтересовал наряд персонажа, мебель в сцене, припаркованная у входа машина, вы можете просто нажать на поиск по изображению, и система порекомендует аналогичные товары, которые можно сразу купить.
Это равносильно превращению короткого сериала в коммерческий сценарий, который может приносить конверсии.
В отличие от этого, на американском рынке, несмотря на наличие таких контентных платформ, как Netflix и YouTube, нет никакого внедрения и конверсии.
Американские инструменты для видео ИИ в большей степени остаются на этапе творческих экспериментов, и единственным коммерческим сценарием внедрения является подписка на членство.
Кроме того, с точки зрения функциональности продукта, китайские модели генерации видео также более подходят для коммерческого внедрения.
Seedance 2.0 может помещать несколько исходных фотографий, видео и звук в одно видео ИИ, а Sora этого не может, она может генерировать видео, только указав модели одно изображение и текст.
Это происходит не потому, что технология Sora недостаточно хороша, а потому, что ей не хватает полноценной коммерческой экосистемы для реализации этих технологических возможностей.
Пропасть в вычислительных мощностях
Но у китайского видео-ИИ тоже есть непреодолимое препятствие — вычислительные мощности.
Ведущие американские компании в области ИИ рассматривают вычислительные мощности как золото, скупая все доступные мощности на рынке.
Недавно заключенные Anthropic соглашения на вычислительные мощности в общей сложности превышают 10 гигаватт.
Эта цифра включает аренду всех вычислительных мощностей дата-центра SpaceX Colossus 1, охватывающих 220 000 GPU от Nvidia; соглашение на 5 ГВт с Amazon; а также соглашения на 3,5 ГВт с Google и Broadcom.
То же самое и с OpenAI.
Благодаря глубокому сотрудничеству с Microsoft OpenAI получила доступ к сотням тысяч высокопроизводительных GPU, а Microsoft также специально построила несколько гипермасштабируемых дата-центров для OpenAI.
Для сравнения, хотя китайские компании добились значительного прогресса в оптимизации эффективности алгоритмов, по абсолютному масштабу вычислительных мощностей все еще существует разрыв.
По данным зарубежных СМИ, разрыв между Китаем и США в области вычислительных мощностей для ИИ в 2023 году составлял примерно 3 раза, а к началу 2026 года увеличился примерно до 8 раз.
Помимо вычислительных мощностей, у китайского ИИ есть и другие проблемы.
Первая — это авторские права.
Возьмем, к примеру, Seedance 2.0. Примерно через месяц после выпуска Disney, Warner Bros., Paramount, Skydance, Netflix и еще 6 голливудских гигантов совместно направили Bytedance письмо о прекращении нарушений, заявив, что Seedance 2.0 в фазе обучения в массовом порядке без разрешения использовала защищенные авторским правом кинематографические материалы.
После этого Bytedance срочно приостановил запланированный на середину марта глобальный запуск Seedance 2.0.
Если вы используете Seedance 2.0 с февраля до настоящего времени, вы заметите, что IP-персонажей, которых раньше можно было генерировать, теперь использовать нельзя, вместо этого можно использовать только образы «прохожих».
Вторая — коммерческий порог повышается.
Американские модели генерации видео, такие как Sora, часто отказывают в генерации из-за условий использования, тогда как китайские инструменты более либеральны и дешевле.
Но это также принесло китайским компаниям в области ИИ «счастливую головную боль».
С февраля спрос на использование Seedance 2.0 резко вырос, и некоторые пользователи уже столкнулись с ограничениями по объему и увеличением времени ожидания в очереди.
По данным зарубежных СМИ, Bytedance применил более жесткий коммерческий подход к некоторым американским корпоративным клиентам, требуя предоплаты около 2 миллионов долларов в обмен на доступ к модели и объем использования.
То же самое и с Kuaishou: они в настоящее время выделяют бизнес Kling, и в будущем, возможно, будут продвигать его к отдельному IPO.
Это означает, что Kling является независимым бизнесом с более сильной историей роста, чем основная компания Kuaishou.
Чем масштабнее история роста, тем яснее должен быть финансовый расчет.
Однако стоимость видео ИИ выше. Потребление вычислительных мощностей для генерации пользователем нескольких секунд видео намного выше, чем для генерации текста.
Чем выше качество и длительность генерируемого видео, тем выше стоимость обработки (инференса).
Многие модели генерации видео так работают: сначала они дешевые или даже бесплатные, но как только пользователи хлынут, быстро начинают ограничения, очереди и рост цен.
Не то чтобы компании не хотели увеличивать объемы, просто и у самих запасы не безграничны.
Поэтому следующее, с чем столкнется китайское видео-ИИ, — это не только «может ли оно создать хорошую модель», но и «может ли оно превратить хорошую модель в хороший бизнес».
Если цена слишком низкая, чем быстрее растет число пользователей, тем больше убытки; если цена слишком высокая и нет пользователей, то игра не стоит свеч.
Третья — технологический разрыв между моделями.
В конечном счете, способность генерировать видео основана на языковых моделях.
Какой бы продвинутой ни была модель генерации видео, ей все равно нужны базовые возможности понимания языка, чтобы понимать подсказки пользователя. Затем ей нужны возможности логического вывода (reasoning), чтобы понимать логические связи сцен и персонажей и поддерживать связность генерируемого контента.
По оценкам зарубежных СМИ, ChatGPT 5.5 от OpenAI и Mythos от Anthropic опережают китайские компании в области ИИ на 9 месяцев до 1 года.
Этот разрыв проявляется в нескольких аспектах, таких как способность к логическому выводу, понимание контекста, многораундовый диалог, обработка сложных задач и т.д.
Хотя Китай опережает американский ИИ в таких нишевых областях, как генерация видео ИИ, в универсальных больших моделях все еще ощущается довольно заметный разрыв.
В целом, лидерство Китая в области генерации видео ИИ является реальным, но и не гарантирует полной безопасности. Разрыв в вычислительных мощностях и базовых моделях всегда остается мечом, занесенным над головой. Но, по крайней мере, сейчас нам больше не нужно смотреть на спину Силиконовой долины снизу вверх.








