# Génération Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Génération", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

La Bataille de la Génération Vidéo par IA en Juillet : Des Capitaux Dépassant 200 Milliards de Yuans Entrent en Masse, Qui Sera en Finale ?

En juillet 2026, le secteur de la génération de vidéo par IA connaît un afflux massif de capitaux, avec plus de 200 milliards de yuans investis en seulement 20 jours. Cinq entreprises ont annoncé des levées de fonds majeures : Kling AI (30 milliards USD), Shengshu Technology (5 milliards USD), Aishi Tech (centaines de millions USD), Zhixiang Future (1,5 milliard RMB) et FlovaAI (80 millions USD en amorçage). Cette frénésie s'explique par plusieurs facteurs. L'avance technologique et commerciale écrasante de Seedance (ByteDance) pousse les concurrents à accélérer. La viabilité commerciale est désormais avérée, avec des revenus annuels récurrents (ARR) importants pour les leaders. Le récit d'investissement évolue de la simple génération vidéo vers des "modèles mondiaux" (world models) plus ambitieux. Enfin, une fenêtre favorable pour les introductions en bourse à Hong Kong incite les investisseurs à prendre position avant des listings potentiels. Les stratégies divergent : Kling vise une plateforme tout-en-un, Shengshu mise sur les modèles mondiaux et l'intelligence incarnée, Aish Tech se spécialise dans l'interaction en temps réel, Zhixiang Future cible des scénarios verticaux, et FlovaAI mise sur des agents de création pour contourner la course aux modèles. Avec ces financements, le secteur entre dans une phase décisive où les leaders se préparent pour le marché public, tandis que la pression sur les coûts de calcul reste intense.

marsbitIl y a 2 jours 07:46

La Bataille de la Génération Vidéo par IA en Juillet : Des Capitaux Dépassant 200 Milliards de Yuans Entrent en Masse, Qui Sera en Finale ?

marsbitIl y a 2 jours 07:46

Claude Opus 5 fuité, voici les premiers tests des internautes

Anthropic aurait accidentellement laissé fuir des aperçus de son prochain modèle d'IA, Claude Opus 5, et les premiers tests des internautes affluent. Les démonstrations partagées sur les réseaux sociaux, notamment par @chetaslua, mettent en avant des capacités graphiques impressionnantes. Elles incluent la génération de scènes 3D détaillées (comme un trébuchet attaquant un château avec des paramètres physiques affichés), des interfaces interactives aux reflets réalistes et des rendus complexes dans des styles variés, du réaliste au pixel art (comme une réplique de Minecraft). Certains utilisateurs estiment que la qualité et la densité des détails surpasseraient même celles de Fable 5, le modèle de génération vidéo actuel d'Anthropic. Les premières traces de cette fuite sont apparues vers le 9 juillet, avec un modèle mystérieux nommé "Honeycomb EAP" brièvement visible dans l'éditeur de code Cursor. Par la suite, des références à "Claude Opus 5" ont été repérées dans Google Vertex AI et dans des messages d'erreur de Cursor, confirmant son développement avancé. Une capture d'écran suggère même qu'Opus 5 serait utilisé en secours lorsque les garde-fous de Fable 5 sont déclenchés. Si les performances visuelles semblent prometteuses, la question du coût reste en suspens. Bien qu'Opus 5 soit facturé moitié moins cher que Fable 5 par million de tokens, certains testeurs rapportent une consommation de tokens beaucoup plus élevée, ce qui pourrait finalement annuler l'avantage tarifaire. La communauté attend désormais une version officielle et des benchmarks complets pour confirmer si Opus 5 peut vraiment remplacer Fable 5.

marsbit07/24 07:57

Claude Opus 5 fuité, voici les premiers tests des internautes

marsbit07/24 07:57

1600 lignes de code ont créé un Manhattan sous-marin, Fable 5 a stupéfié Karpathy

Le modèle Fable 5, nouvellement réactivé, a créé une onde de choc en générant 63 mondes 3D interactifs et complexes, souvent du premier coup. Andrey Karpathy, récemment arrivé chez Anthropic, a qualifié les résultats d'"incroyables" et d'un exemple de "fablemaxxing" – une avancée qualitative majeure. Parmi les créations les plus frappantes figure une "Manhattan sous-marine" détaillée, construite avec seulement 1600 lignes de code. Les autres mondes incluent des villes historiques (Londres, Istanbul), des simulations physiques, des tableaux célèbres (comme *La Nuit étoilée* de Van Gogh) rendus navigables en 3D, et des paysages naturels saisissants où un ours attrape un saumon. L'auteur, Peter Gostev d'Arena.ai, souligne que la prouesse ne réside pas dans la beauté d'une scène isolée, mais dans la capacité du modèle à coordonner une multitude d'éléments de manière cohérente. Alors que les modèles précédents échouaient souvent dans les dernières étapes, Fable 5 produit des résultats complets à partir de spécifications détaillées, démontrant une compréhension et un pouvoir explicatif inédits. Cependant, Gostev note quelques limites : les éléments de jeu manquent de profondeur et le modèle semble parfois retenir son plein potentiel, nécessitant des incitations pour se dépasser. Karpathy s'interroge sur la façon dont le modèle, formé sur des données internet, a acquis et traduit une compréhension aussi nuancée du monde physique en éléments 3D animés. Cette capacité ouvre la porte à des possibilités immenses avec les futures itérations. L'exploration de ce que l'IA peut vraiment créer et comprendre ne fait que commencer.

marsbit07/06 09:52

1600 lignes de code ont créé un Manhattan sous-marin, Fable 5 a stupéfié Karpathy

marsbit07/06 09:52

Le premier modèle de génération à grande échelle utilisant la physique comme primitive de calcul, Un-0, est arrivé. Réduira-t-il la consommation énergétique de l'IA de 1000 fois ?

Unconventional AI, fondée par l'ancien responsable IA de Databricks Naveen Rao, a dévoilé Un-0, un modèle génératif d'images innovant utilisant un système physique de "coupled oscillators" (oscillateurs couplés) comme primitif de calcul. L'objectif est de réinventer le calcul pour l'IA en exploitant la dynamique naturelle des systèmes physiques, afin de réduire potentiellement la consommation énergétique de l'inférence IA d'un facteur 1000 par rapport aux systèmes numériques traditionnels basés sur GPU. Le modèle Un-0 fonctionne en entraînant un vaste réseau d'oscillateurs couplés (modélisés par l'équation de Kuramoto) dont les forces de couplage et les fréquences naturelles sont les paramètres appris. Pour générer une image, le système est initialisé aléatoirement, guidé par un label de classe, puis laissé à évoluer selon sa dynamique physique. Un état latent est prélevé à un instant T et converti en pixels par un petit décodeur. Sur ImageNet 64x64, Un-0 atteint un FID de 6.74 avec 322 millions de paramètres, une performance comparable à celle des premiers modèles génératifs traditionnels comme BigGAN, bien qu'en deçà des modèles de pointe actuels. Entraîné avec une nouvelle fonction de perte "Drifting Loss", il démontre la faisabilité d'utiliser un système dynamique physique pour une tâche IA à grande échelle. Ce modèle représente une première étape vers une nouvelle génération de matériel de calcul "non conventionnel" où la physique effectue le calcul, fusionnant calcul et mémoire et tolérant le bruit, ce qui pourrait mener à des gains d'efficacité énergétique révolutionnaires.

marsbit06/26 10:59

Le premier modèle de génération à grande échelle utilisant la physique comme primitive de calcul, Un-0, est arrivé. Réduira-t-il la consommation énergétique de l'IA de 1000 fois ?

marsbit06/26 10:59

Nouveau travail de l'équipe de Kaiming He : En supprimant le VAE et les données privées, la génération d'images à partir de texte devient encore plus performante

Le domaine de la génération d'images à partir de texte est un marché très compétitif, où les approches dominantes reposent souvent sur des architectures complexes comprenant des encodeurs VAE, d'énormes volumes de données privées et des étapes d'alignement coûteuses. Cependant, l'équipe de Kaiming He propose **MiniT2I**, un modèle de génération texte-image délibérément minimaliste qui remet en question ce paradigme. MiniT2I s'entraîne directement sur les pixels, éliminant le besoin d'un encodeur VAE, ce qui réduit les coûts de calcul et évite les erreurs de reconstruction. Son architecture **MM-JiT**, basée sur un Transformer, supprime les mécanismes d'injection conditionnelle complexes (comme AdaLN) et les fonctions de perte auxiliaires. À la place, elle utilise des adaptateurs texte légers et exploite le bruit de l'image lui-même pour représenter l'information temporelle. Le modèle est entraîné uniquement sur des données publiques en deux phases : un pré-entraînement sur CC12M recaptioned par LLaVA, suivi d'un fine-tuning sur environ 120 000 paires image-texte de haute qualité. Avec seulement 258 millions de paramètres, la version B/16 de MiniT2I surpasse des modèles pixel-space plusieurs fois plus grands sur des benchmarks comme GenEval (0.87) et DPG-Bench (84.2). L'approche démontre qu'il est possible d'obtenir des performances compétitives avec une architecture simplifiée, des données ouvertes et des ressources de calcul académiques, suggérant un possible changement de paradigme dans le domaine. Les limitations actuelles incluent des artefacts aux frontières des patchs, des effets secondaires du CFG à fort coefficient, et des difficultés avec le rendu de texte et des résolutions très élevées.

marsbit06/22 10:21

Nouveau travail de l'équipe de Kaiming He : En supprimant le VAE et les données privées, la génération d'images à partir de texte devient encore plus performante

marsbit06/22 10:21

Celui qui a créé Kling est retourné chez Alibaba et a créé un nouveau champion inattendu

L'ancien cadre d'Alibaba, Zhang Di, est revenu chez le géant chinois en novembre 2025 après avoir dirigé le développement du modèle IA Kling chez Kuaishou. En seulement cinq mois, il a lancé HappyHorse-1.0, un modèle open source de génération vidéo qui a rapidement dominé les classements d'Artificial Analysis en avril 2026, surpassant des concurrents comme ByteDance et Kuaishou dans les catégories texte-vidéo et image-vidéo. HappyHorse utilise une architecture transformer multimodal de 15 milliards de paramètres, permettant une synchronisation labiale précise dans plusieurs langues. Optimisé pour la vitesse et le coût, il génère des vidéos en 38 secondes sur une seule GPU H100. Son positionnement au sein de Taotian Group (commerce électronique d'Alibaba) indique une orientation claire vers des applications commerciales concrètes. L'objectif principal est de révolutionner la création de contenu pour les marchands : génération de vidéos de produits, scénarios de vente, et publicités personnalisées à grande échelle. En s'intégrant à l'écosystème transactionnel d'Alibaba, HappyHorse pourrait aider les vendeurs à améliorer leurs taux de conversion en créant des vidéos hyper-contextuelles, tout en évitant les écueils des modèles purement divertissants qui peinent à être rentables (comme Sora d'OpenAI) ou qui rencontrent des problèmes de droits d'auteur (comme Seedance de ByteDance).

marsbit04/13 05:17

Celui qui a créé Kling est retourné chez Alibaba et a créé un nouveau champion inattendu

marsbit04/13 05:17

Réclamer le « Cheval Heureux », Alibaba déploie sa « formation de combat » en IA

Alibaba a officiellement reconnu être derrière le modèle de génération vidéo HappyHorse (Cheval Heureux), qui a pris la tête du classement du platform Artificial Analysis avec un score Elo de 1357. Développé par la division innovation ATH (Alibaba Token Hub), le modèle se distingue par sa capacité à produire des vidéos haute définition synchronisées avec des effets sonores, réduisant considérablement les coûts et le temps de production. Cette annonce s’inscrit dans une série d’avancées récentes d’Alibaba dans l’IA, notamment les lancements successifs des modèles Qwen3.5-Omni, Wan2.7-Image et Qwen3.6-Plus. Qwen3.6-Plus a notamment battu des records d’utilisation avec 1 400 milliards de tokens traités en une journée. Sur le plan organisationnel, Alibaba a restructuré ses équipes IA avec la création du comité technique dirigé par le CEO Wu Yongming et la division ATH, visant à harmoniser la recherche, les infrastructures et les applications commerciales. L’entreprise investit massivement, avec 380 milliards de RMB prévus sur trois ans pour le cloud et l’IA, et a déjà produit 470 000 puces GPU maison via sa filiale Pingtouge. Si ces moves impressionnent par leur ampleur et leur rapidité, Alibaba doit encore prouver sa capacité à maintenir cette dynamique face à une concurrence intense et à intégrer efficacement ces innovations dans son écosystème commercial.

marsbit04/11 04:14

Réclamer le « Cheval Heureux », Alibaba déploie sa « formation de combat » en IA

marsbit04/11 04:14

活动图片