# Génération vidéo Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Génération vidéo", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

La version vidéo de Nano Banana est arrivée : intégrant les connaissances mondiales de Gemini, la génération d'images de la banane d'origine ne prend que 4 secondes

Google dévoile deux nouveaux modèles multimodaux Gemini : Omni Flash pour la vidéo et Nano Banana 2 Lite pour l'image, offrant rapidité et coût réduit. Gemini Omni Flash, désormais accessible via API, combine les capacités de raisonnement multimodales de Gemini avec la génération et l'édition vidéo. Il permet de créer ou modifier des vidéos de 10 secondes à partir de texte, d'images ou de vidéos de référence, en utilisant des connaissances du monde réel pour assurer la cohérence. Son coût est de 0,10$ par seconde de vidéo générée. Google note toutefois des limitations actuelles, comme la durée maximale et des contraintes sur la cohérence des personnages. Parallèlement, Nano Banana 2 Lite est un modèle de génération d'images optimisé pour la vitesse et l'efficacité économique. Il génère une image en 1K en seulement 4 secondes pour environ 0,034$, soit cinq fois plus rapide et deux fois moins cher que son prédécesseur Nano Banana 2, tout en conservant une bonne qualité de rendu, notamment pour le texte. Le véritable potentiel réside dans l'utilisation combinée des deux modèles : Nano Banana 2 Lite peut générer rapidement des images, qui sont ensuite utilisées comme base par Omni Flash pour créer des vidéos. Google illustre cette synergie avec trois démonstrations : "Anywhere" pour insérer une personne dans des paysages dynamiques, "Space Lift" pour visualiser des concepts de décoration d'intérieur, et "Omni Product Studio" pour créer automatiquement des visuels et vidéos marketing pour le commerce électronique. Ces lancements soulignent la stratégie de Google de se concentrer sur les applications pratiques du multimodale pour des secteurs comme le e-commerce, la publicité ou l'aménagement, malgré la concurrence féroce dans d'autres domaines comme le codage.

marsbit07/01 01:57

La version vidéo de Nano Banana est arrivée : intégrant les connaissances mondiales de Gemini, la génération d'images de la banane d'origine ne prend que 4 secondes

marsbit07/01 01:57

Dans le domaine de la génération de vidéos par IA, « Bien en avance » devient réalité

L'intelligence artificielle chinoise en génération vidéo est désormais considérée comme « bien en avance » sur ses concurrents américains, selon un article largement relayé. Des modèles comme Seedance 2.0 de ByteDance, Kling 3.0 de Kuaishou et HappyHorse d'Alibaba dominent les classements d'évaluation internationaux, devançant des outils comme Sora d'OpenAI ou Veo 3 de Google. Cette avance s'explique par plusieurs atouts structurels. Premièrement, les entreprises chinoises disposent d'un réservoir de données vidéo de très haute qualité, issues de leurs propres plateformes (TikTok/Douyin, Kuaishou). Ces données, enrichies par les comportements naturels des utilisateurs (partages, achats, taux de visionnage), sont un avantage compétitif majeur et difficile à reproduire. Deuxièmement, la technologie a trouvé des débouchés commerciaux clairs et rentables en Chine : création de vidéos pour le e-commerce, publicités, et surtout, production de mini-séries générant du revenu via des placements de produits. Ce cycle vertueux « produit-données-ventes » est absent du marché américain. Cependant, des défis persistent. L'écart en matière de puissance de calcul (hardware) entre les États-Unis et la Chine se creuse, et les modèles de langage généraux américains (comme GPT-5.5) conservent une avance de près d'un an. De plus, les entreprises chinoises font face à des pressions sur les droits d'auteur, des coûts de calcul élevés qui remettent en cause la viabilité économique de l'accès libre, et doivent gérer une forte demande. En conclusion, si la Chine a pris une réelle avance dans ce domaine spécifique, elle doit continuer à innover pour transformer cet avantage technique en succès commercial durable.

marsbit05/21 04:41

Dans le domaine de la génération de vidéos par IA, « Bien en avance » devient réalité

marsbit05/21 04:41

Gemini 3.5 est là ! Ce soir, Google se supplante lui-même

Lors du Google I/O 2026, Sundar Pichai et Demis Hassabis ont dévoilé une série d'avancées majeures en matière d'IA. Le modèle phare Gemini Omni a été présenté comme un système « omni » capable de générer et d'éditer des vidéos de haute qualité à partir de n'importe quelle combinaison de textes, images, audio ou vidéos, avec une compréhension cohérente de la physique et du monde. Parallèlement, Gemini 3.5 Flash a été annoncé, surpassant son prédécesseur 3.1 Pro dans la plupart des tests et offrant une vitesse jusqu'à quatre fois supérieure à celle des principaux concurrents. Il est optimisé pour le codage et les tâches d'agent. La plateforme de développement d'agents Antigravity a été mise à jour en version 2.0, devenant une application de bureau indépendante. Une démonstration a montré 93 agents créant un système d'exploitation fonctionnel en 12 heures. De plus, Gemini Spark, un agent personnel IA fonctionnant 24h/24 et 7j/7 dans le cloud, a été introduit. Il peut automatiser des workflows complexes en interagissant avec les outils Google comme Gmail, Docs et Sheets, et prendre en charge les commandes vocales. Ces annonces marquent une intégration poussée des capacités de compréhension et de génération multimodales avec des agents autonomes et persistants, représentant selon l'article un pas significatif vers une intelligence artificielle plus générale et autonome.

链捕手05/20 07:06

Gemini 3.5 est là ! Ce soir, Google se supplante lui-même

链捕手05/20 07:06

Le modèle mystérieux HappyHorse débarque et domine le classement, la course à la génération vidéo accueille-t-elle un "poisson-chat" ?

Un modèle de génération de vidéo nommé HappyHorse-1.0 a discrètement atteint la première place du classement AI Video Arena d'Artificial Analysis, dépassant des modèles établis comme Seedance 2.0. Ce classement, basé sur des tests en aveugle par des utilisateurs réels (système Elo), est considéré comme reflétant fidèlement la perception humaine. Les indices pointent vers une origine chinoise (ordre des langues sur le site, référence à l'année du cheval). Après analyse technique, la communauté identifie HappyHorse comme une version optimisée du modèle open source daVinci-MagiHuman, développé conjointement par le laboratoire GAIR de SII (Shanghai) et Sand.ai (Pékin). Ce modèle utilise un transformateur monoflux de 15 milliards de paramètres pour un traitement conjoint du texte, de la vidéo et de l'audio. Sa montée fulgurante s'expliquerait par un réglage spécifique pour le benchmark, qui favorise les scènes avec un personnage (60% des tests), son domaine de force. Cependant, des tests pratiques notent des limites : besoin de puces H100, difficultés avec les scènes complexes或多personnages, et durée de génération courte (~10 sec). Symboliquement, cet événement marque un tournant : un modèle open source rivalise pour la première fois en qualité perçue avec des solutions propriétaires. Cela pourrait, à terme, menacer leur avantage concurrentiel dans des niches comme les portraits ou les présentateurs virtuels, en offrant une alternative personnalisable, moins chère et plus flexible. La course n'est pas terminée, mais la piste s'élargit pour l'open source.

marsbit04/08 08:02

Le modèle mystérieux HappyHorse débarque et domine le classement, la course à la génération vidéo accueille-t-elle un "poisson-chat" ?

marsbit04/08 08:02

活动图片