
Juillet n'est pas encore terminé, mais le domaine de la génération vidéo par IA est déjà en plein essor.
Du 3 au 23 juillet, en seulement 20 jours, 5 entreprises ont successivement annoncé des levées de fonds importantes. Keling AI a levé 3 milliards de dollars, Shengshu Keji a levé 500 millions de dollars, Aishi Keji a clôturé un tour C+ de plusieurs centaines de millions de dollars, Zhixiang Weilai un tour C de 1,5 milliard de yuans, et même une nouvelle société créée il y a moins d'un an, FlovaAI, a levé 80 millions de dollars en tour d'ange.
Les financements des 4 premières entreprises atteignant le statut de licorne s'élèvent ensemble à plus de 26,2 milliards de yuans. Autrement dit, les capitaux injectés en juillet 2026 dépassent la somme totale des deux années précédentes (2024-2025) pour l'ensemble du secteur.
Pourquoi ont-elles toutes levé des fonds en juillet ? Que s'est-il passé ? Il ne s'agit probablement pas d'une simple coïncidence.
Keling AI : Un investissement historique simultané des BAT, un ARR quadruplé en un an
Le 3 juillet, Keling AI a annoncé une limite de financement de série A de 3 milliards de dollars, menée par CPE Yuanfeng et Guofang Innovation, avec la participation de 34 institutions – les noms de Tencent, Alibaba Cloud et Baidu apparaissent rarement ensemble dans la liste des investisseurs. Lighthouse Capital agit en tant que conseiller financier.
La limite de financement de 3 milliards de dollars en série A correspond à une valorisation post-investissement d'environ 18 milliards de dollars ; la partie déjà signée s'élève à environ 19 milliards de yuans.
Pourquoi les capitaux osent-ils parier sur ce chiffre ? Les résultats du premier trimestre 2026 de Kuaishou ont donné confiance au marché.
Le rapport financier Q1 2026 de Kuaishou a révélé que Keling AI a généré plus de 650 millions de yuans de revenus au trimestre, avec une croissance annuelle de plus de 300%. Son taux de revenu annuel courant (ARR) est passé de 100 millions de dollars en mars 2025 à près de 500 millions de dollars en mars 2026, quadruplant en un an.
Ce chiffre est sans équivalent dans le secteur de la vidéo IA – à part Seedance de ByteDance, aucune autre entreprise chinoise n'atteint ce niveau.
Les revenus de Keling sont tirés par deux moteurs : les appels API des clients entreprises et les abonnements payants des particuliers. En juin 2026, Keling AI compte plus de 100 millions d'utilisateurs dans le monde et près de 50 000 clients entreprises. Par exemple, Keling a participé à la production des effets spéciaux et des scènes virtuelles du feuilleton historique chinois à succès "Les Années de la Paix" et a soutenu la génération de centaines de plans de haute qualité pour la série hollywoodienne "La Dynastie de David".
Côté produit, en février de cette année, Keling a lancé sa série de modèles 3.0, permettant la génération de vidéos jusqu'à 15 secondes, le contrôle des séquences, la cohérence du sujet et la synchronisation audio-visuelle.
Deux détails sont à noter. Premièrement, la valorisation a été ajustée à la baisse par rapport aux rumeurs de 20 milliards de dollars en mai, avec une tarification plus pragmatique accélérant la transaction. Deuxièmement, l'annonce incluait une clause conditionnelle – si Beijing Keling ne parvient pas à réaliser son introduction en bourse avant octobre 2031, les investisseurs ont le droit d'exiger un rachat au principal plus des intérêts simples annuels de 8%.
Scission, financement, incitations aux actions, clause de rachat – cette série de mesures pointe clairement vers un objectif : Keling prépare son indépendance en vue d'une introduction en bourse.
Shengshu Keji : 500 millions de dollars avant l'IPO, du modèle vidéo vers le "modèle monde"
Le 6 juillet, Shengshu Keji a annoncé un tour de financement B+ de 500 millions de dollars.
Mais si on regarde la chronologie, cette entreprise a levé 3 tours en 5 mois : un tour A+ de plus de 600 millions de yuans en février (mené par Zhongguancun Science City, Xinglian Capital), un tour B de 2 milliards de yuans en avril (mené par Alibaba Cloud), plus ce tour de 500 millions de dollars en juillet, totalisant plus de 5 milliards de yuans.
3 tours en 5 mois, ce rythme indique une chose : les capitaux se bousculent pour monter à bord. Pourquoi cette précipitation ?
Fin mars de cette année, Shengshu Keji avait déjà achevé sa transformation en société par actions – une étape standard avant une introduction en bourse. Des sources du marché indiquent qu'elle pourrait lancer son processus d'IPO à Hong Kong dès le premier semestre. Ainsi, les capitaux se précipitent pour monter à bord à la veille de l'IPO.
Le produit phare de Shengshu Keji est Vidu , lancé mondialement en juillet 2024, et qui en trois ans est déjà itéré vers la version Vidu S1 – un modèle d'interaction en temps réel, supportant le contrôle par la voix et la génération de durée illimitée (1 minute - 2 heures).
Sur l'ensemble de l'année 2025, Shengshu Keji a réalisé une croissance décuplée en utilisateurs et revenus, générant cumulativement plus de 400 millions de vidéos ; son portefeuille clients B2B est particulièrement solide : dans la publicité et le e-commerce, on trouve JD.com, Alibaba 1688, Amazon, Meituan, Focus Media, BlueFocus, L'Oréal, Anta ; dans le cinéma et l'animation, Tencent Animation, China Literature, CCTV Animation, iQiyi, Mango TV ; dans le jeu vidéo, Lilith Games, 37 Interactive Entertainment.
Shengshu Keji ne se contente pas de la génération vidéo, et s'étend cette année vers l'intelligence incarnée.
En avril 2026, Shengshu Keji a officiellement lancé son modèle d'action monde universel Motubrain, utilisant l'approche technologique World Action Model (WAM), intégrant la perception, la prédiction et l'action dans un modèle unifié, permettant aux robots de posséder des capacités de "prévision par un cerveau" et "multifonction par un cerveau", tandis que la version commerciale MotuBrain entre en phase de validation industrielle.
Fondée il y a seulement 3 ans par des anciens de l'Université Tsinghua, cette entreprise évolue rapidement d'une "société de modèles vidéo" vers une "plateforme de modèle monde universel". Les 500 millions de dollars serviront principalement à la R&D du "modèle monde universel".
C'est précisément cette histoire qui intéresse les investisseurs.
Aishi Keji : Une licorne en trois ans, 150 millions d'utilisateurs mondiaux
Le 14 juillet, Aishi Keji a clôturé un tour C+ mené par Alibaba. Ajouté au tour C de 300 millions de dollars finalisé en mars (mené par CDH Investments, avec la participation de près de 20 investisseurs dont China Ruyi, 37 Interactive Entertainment), le financement total du tour C atteint 2,98 milliards de yuans, pour une valorisation post-investissement dépassant 2 milliards de dollars.
Alibaba avait déjà mené un tour B de 60 millions de dollars en septembre 2025, et renforce sa position avec ce tour C+. Ant Group avait également mené un tour A2 de plus de 100 millions de yuans dès avril 2024.
L'investissement continu de l'écosystème Alibaba dans Aishi montre qu'il considère cette dernière comme un point stratégique dans le secteur de la vidéo IA.
En mars 2026, Aishi Keji compte plus de 150 millions d'utilisateurs dans le monde, avec 15 millions d'utilisateurs actifs mensuels, et un taux de revenu annuel courant (ARR) atteignant 40 millions de dollars.
Il est intéressant de noter que le cofondateur Xie Xuzhang révèle que le coût d'entraînement d'un modèle de niveau équivalent chez Aishi n'est qu'environ 10% de celui de ses concurrents. Cet avantage de coût repose sur la sélection de données de haute qualité, la réduction des itérations d'entraînement inefficaces, et l'utilisation d'une architecture Diffusion Transformer optimisée, améliorant l'utilisation des ressources, réduisant les coûts unitaires d'entraînement et permettant la réutilisation de l'expérience d'ingénierie.
En janvier de cette année, Aishi a lancé PixVerse R1, se présentant comme le premier modèle monde universel en temps réel supportant le 1080P. Contrairement à la génération vidéo traditionnelle "pré-enregistrée", R1 permet une "génération dynamique en temps réel" – l'utilisateur peut saisir de nouvelles instructions pendant la lecture de la vidéo, et l'image peut réaliser une transition naturelle et fluide de la lumière, de l'ombre et des plans en environ 0,5 seconde.

La stratégie d'Aishi diffère des autres acteurs : là où les autres cherchent à améliorer la qualité de génération, Aishi se concentre sur les capacités d'interaction. Une semaine seulement après le lancement de R1, China Ruyi a annoncé un partenariat stratégique avec Aishi et un investissement de 14,2 millions de dollars.
L'utilisation des fonds du dernier tour C+ est clairement définie : pour le modèle de base de génération vidéo, le modèle monde en temps réel et la croissance mondiale.
Zhixiang Weilai : Une nouvelle licorne, la stratégie alternative "modèle + agent + matériel"
Zhixiang Weilai est la "nouvelle licorne" de cette liste – après un tour C de 1,5 milliard de yuans, sa valorisation post-investissement dépasse 1 milliard de dollars. Son fondateur, Mei Tao, est membre étranger de l'Académie canadienne du génie et ancien vice-président de JD.com.
Cette entreprise a finalisé trois tours de financement en trois mois, totalisant plus de 2,1 milliards de yuans.
Le 23 juillet, Zhixiang Weilai a annoncé un tour C de 1,5 milliard de yuans, mené par le Fonds de sécurité sociale, le Fonds de revitalisation industrielle du Sichuan et ICBC Investment, avec la participation du Fonds de nouvelles perspectives de Shanghai Film, Huace Film & TV et d'autres capitaux industriels du cinéma, ainsi que 18 institutions – une combinaison de capitaux nationaux à long terme, de capitaux publics locaux et de capitaux industriels, assez rare dans le secteur de la vidéo IA.
Zhixiang a lancé dès mai 2024 le premier modèle de génération vidéo en architecture DiT accessible au public, et a présenté lors du WAIC 2026 qui vient de se terminer son agent de création multimodale vivago R1, axé sur la génération et l'édition de vidéos de durée illimitée.
Ses produits couvrent actuellement plus de 100 pays, servant plus de 50 millions d'utilisateurs et 40 000 clients entreprises. Ses revenus annuels 2025 dépassaient 100 millions de yuans, et son chiffre d'affaires du premier trimestre 2026 a déjà dépassé celui de l'année précédente. Mei Tao a déclaré lors de la China International Supply Chain Expo 2026 que, en raison des coûts élevés de pré-entraînement des grands modèles, l'entreprise prévoit d'atteindre l'équilibre mensuel bénéfice-pertes en 2029.
Mei Tao est aussi direct : "Nous ne rivalisons pas avec ByteDance sur les capacités fondamentales, nous nous concentrons sur le marketing commercial et la collaboration cinématographique professionnelle."
La stratégie de Zhixiang est claire : éviter le champ de bataille frontal avec les géants, et approfondir les scénarios verticaux. Elle a d'abord établi une base d'utilisateurs avec un modèle d'image, avant d'évoluer vers la vidéo et les modèles monde.
FlovaAI : 80 millions de dollars en tour d'ange, le troisième départ de Guo Lie
Le fondateur de FlovaAI, Guo Lie, est un nom incontournable dans l'histoire de l'internet mobile chinois. En 2013, Guo Lie crée FaceQ, puis FaceU, son équipe étant acquise par ByteDance en 2018 pour 300 millions de dollars. Par la suite, il a participé chez ByteDance à l'incubation de BeautyCam, XiuTu , et Jianying – oui, Jianying (CapCut) est en partie son œuvre.
En 2025, Guo Lie repart à zéro, fonde Shenzhen Yuzhou Technology, et lance Flova.ai en octobre. Sequoia Capital China, IDG et Sky9 Capital ont investi cumulativement plus de 80 millions de dollars.
Oser donner 80 millions de dollars en tour d'ange, les investisseurs ne parient pas sur le produit, mais sur la personne de Guo Lie. Chaque outil grand public qu'il a créé par le passé est devenu un succès phénoménal.

Flova est une plateforme Agent de création vidéo native IA. L'utilisateur exprime ses besoins créatifs via le dialogue, et l'Agent exécute l'intégralité du processus, de la création du scénario et la conception des personnages au design des séquences, la génération d'images/vidéos/audio, jusqu'à l'assemblage de la timeline de montage.
Contrairement à l'interface canvas dominante sur le marché, Flova a conçu un panneau de travail en "storyboard". L'Agent reçoit les instructions dans la boîte de dialogue, le processus de travail s'affiche sur le storyboard de gauche, l'utilisateur voit directement le résultat dans la zone de prévisualisation centrale et peut intervenir à tout moment en double-cliquant pour modifier.
Plusieurs utilisateurs précoces rapportent que la plus grande caractéristique de Flova est sa "mémoire" – après la création d'une dizaine d'épisodes, il peut encore se souvenir d'une séquence spécifique du premier épisode. Cette capacité de mémoire contextuelle longue est très remarquable parmi les produits similaires.
À ce stade, Flova adopte une stratégie de marge zéro. Guo Lie déclare : "Pendant la phase de développement, nous viserons une marge zéro." L'équipe ne cherche pas à générer des revenus à court terme, mais se concentre sur le ratio de consommation effective : quelle part de la consommation de Token est perçue comme utile par l'utilisateur, et quelle part est du gaspillage dû à des imperfections du produit.
Pourquoi cette concentration en juillet ? Les raisons possibles
Revenons maintenant à la question centrale : Pourquoi ces 5 entreprises ont-elles levé des fonds de manière concentrée en juillet ? En rassemblant toutes les informations, je découvre que quatre raisons créent une résonance.
Premièrement, l'"effet d'aspiration" de ByteDance Seedance pousse tout le monde à accélérer.
Depuis son lancement en février, Seedance 2.0 de ByteDance génère plus de 1 milliard de yuans de revenus mensuels, avec un taux de pénétration d'environ 95% dans l'industrie des mini-séries, et représente plus de 80% des parts de marché en termes de consommation quotidienne de Token.
Volcano Engine a revu à la hausse son objectif de revenus MaaS pour 2026, de 1,5 milliard de yuans l'année dernière à 15 milliards de yuans – une croissance décuplée, reposant presque entièrement sur le seul modèle Seedance. De plus, Seedance 2.1 sera bientôt lancé, avec une amélioration attendue de 20%, et une version bas de gamme au prix comprimé à 0,5 yuans la seconde.
Lorsque ByteDance utilise la double stratégie "capacité du modèle en avance écrasante + guerre des prix" pour dominer le marché, les autres acteurs, s'ils ne lèvent pas rapidement des fonds, n'accumulent pas de puissance de calcul et n'accélèrent pas leurs itérations, risquent de perdre leur place à la table.
Tous cherchent un levier pour résister à ByteDance sur le long terme. Mais les approches diffèrent totalement : Keling suit une voie de plateforme tout modal, Shengshu une voie technologique, Aishi une voie différenciée d'interaction en temps réel, Zhixiang une voie d'approfondissement des scénarios verticaux, FlovaAI une voie de flux de travail Agent.
Les capitaux ne parient pas sur la même histoire, mais sur différentes voies technologiques et modèles économiques.
Deuxièmement, la commercialisation est démontrée, les capitaux voient une voie de sortie.
L'année dernière, on débattait encore si "la vidéo IA pouvait générer de l'argent", cette année les données sont là : l'ARR de Keling approche 500 millions de dollars, les revenus de Shengshu ont décuplé en 2025, l'ARR d'Aishi atteint 40 millions de dollars, Seedance génère plus de 1 milliard de yuans par mois.
Publicité, e-commerce, mini-séries, jeux, cinéma – les scénarios de paiement pour la vidéo IA sont validés un par un. Cet état de "flux de trésorerie visible" est le déclencheur direct de l'entrée massive des capitaux.
Troisièmement, le secteur évolue de la "génération vidéo" vers le "modèle monde", la narration évolue.
Au premier semestre de cette année, la concurrence entre les modèles de base s'est concentrée, les capitaux du marché primaire ont commencé à chercher la prochaine direction, la génération multimodale et les modèles monde sont devenus la sortie consensuelle.
Notez une tendance : aucune des 4 entreprises ayant levé des fonds colossaux ne se présente comme faisant seulement de la "génération vidéo". Keling parle de flux de travail de création tout-en-un multimodal, Shengshu parle de "modèle monde universel" et d'intelligence incarnée, Aishi parle de "modèle monde en temps réel" et de divertissement interactif, Zhixiang parle de "modèle monde multimodal natif" et de raisonnement causal.
La génération vidéo n'est que l'entrée, le véritable objectif final est le modèle monde – un système IA capable de comprendre, raisonner et construire le monde physique. Les investisseurs ne regardent pas le marché actuel de la génération vidéo, mais qui émergera dans trois ans dans le domaine des modèles monde.
Quatrièmement, la fenêtre d'IPO à Hong Kong est ouverte, les capitaux se bousculent pour un "billet".
Depuis l'introduction en bourse de Zhipu et MiniMax à Hong Kong en janvier, leurs cours ont fortement augmenté. Au premier trimestre, le montant levé via les IPO à Hong Kong a dépassé les 100 milliards de HKD en 79 jours, un record historique, avec plus de 350 entreprises en file d'attente.
Shengshu a achevé sa transformation, les rumeurs d'IPO persistent ; la scission et les clauses de rachat de Keling sont essentiellement des préludes à une introduction en bourse. Les financements concentrés sur le marché primaire préparent en grande partie l'entrée sur le marché secondaire.
Enfin, je dirais qu'après ce mois de juillet, le secteur de la vidéo IA entre dans la phase finale, le paysage va se clarifier : les entreprises leaders, avec des capitaux importants, se précipitent vers l'IPO, les entreprises de taille moyenne sont re-évaluées par la narration du modèle monde, et de nouveaux acteurs comme Flova tentent de contourner la course aux armements des modèles grâce aux Agents, pour s'emparer d'une part du gâteau au niveau applicatif.
Mais derrière l'animation se pose la question de l'argent qui arrive vite mais qui brûle encore plus vite. La génération vidéo est la catégorie d'IA la plus gourmande en puissance de calcul. Plus de 26 milliards de yuans semblent impressionnants, mais répartis sur les factures annuelles de calcul de chaque entreprise, cela n'est pas forcément confortable.
Cet article provient du compte officiel WeChat "IT桔子" (ID : itjuzi521), auteur : Wu Meimei





