# Multimodal Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Multimodal", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

Gemini 3.5 est là ! Ce soir, Google se supplante lui-même

Lors du Google I/O 2026, Sundar Pichai et Demis Hassabis ont dévoilé une série d'avancées majeures en matière d'IA. Le modèle phare Gemini Omni a été présenté comme un système « omni » capable de générer et d'éditer des vidéos de haute qualité à partir de n'importe quelle combinaison de textes, images, audio ou vidéos, avec une compréhension cohérente de la physique et du monde. Parallèlement, Gemini 3.5 Flash a été annoncé, surpassant son prédécesseur 3.1 Pro dans la plupart des tests et offrant une vitesse jusqu'à quatre fois supérieure à celle des principaux concurrents. Il est optimisé pour le codage et les tâches d'agent. La plateforme de développement d'agents Antigravity a été mise à jour en version 2.0, devenant une application de bureau indépendante. Une démonstration a montré 93 agents créant un système d'exploitation fonctionnel en 12 heures. De plus, Gemini Spark, un agent personnel IA fonctionnant 24h/24 et 7j/7 dans le cloud, a été introduit. Il peut automatiser des workflows complexes en interagissant avec les outils Google comme Gmail, Docs et Sheets, et prendre en charge les commandes vocales. Ces annonces marquent une intégration poussée des capacités de compréhension et de génération multimodales avec des agents autonomes et persistants, représentant selon l'article un pas significatif vers une intelligence artificielle plus générale et autonome.

链捕手05/20 07:06

Gemini 3.5 est là ! Ce soir, Google se supplante lui-même

链捕手05/20 07:06

Celui qui a créé Kling est retourné chez Alibaba et a créé un nouveau champion inattendu

L'ancien cadre d'Alibaba, Zhang Di, est revenu chez le géant chinois en novembre 2025 après avoir dirigé le développement du modèle IA Kling chez Kuaishou. En seulement cinq mois, il a lancé HappyHorse-1.0, un modèle open source de génération vidéo qui a rapidement dominé les classements d'Artificial Analysis en avril 2026, surpassant des concurrents comme ByteDance et Kuaishou dans les catégories texte-vidéo et image-vidéo. HappyHorse utilise une architecture transformer multimodal de 15 milliards de paramètres, permettant une synchronisation labiale précise dans plusieurs langues. Optimisé pour la vitesse et le coût, il génère des vidéos en 38 secondes sur une seule GPU H100. Son positionnement au sein de Taotian Group (commerce électronique d'Alibaba) indique une orientation claire vers des applications commerciales concrètes. L'objectif principal est de révolutionner la création de contenu pour les marchands : génération de vidéos de produits, scénarios de vente, et publicités personnalisées à grande échelle. En s'intégrant à l'écosystème transactionnel d'Alibaba, HappyHorse pourrait aider les vendeurs à améliorer leurs taux de conversion en créant des vidéos hyper-contextuelles, tout en évitant les écueils des modèles purement divertissants qui peinent à être rentables (comme Sora d'OpenAI) ou qui rencontrent des problèmes de droits d'auteur (comme Seedance de ByteDance).

marsbit04/13 05:17

Celui qui a créé Kling est retourné chez Alibaba et a créé un nouveau champion inattendu

marsbit04/13 05:17

Réclamer le « Cheval Heureux », Alibaba déploie sa « formation de combat » en IA

Alibaba a officiellement reconnu être derrière le modèle de génération vidéo HappyHorse (Cheval Heureux), qui a pris la tête du classement du platform Artificial Analysis avec un score Elo de 1357. Développé par la division innovation ATH (Alibaba Token Hub), le modèle se distingue par sa capacité à produire des vidéos haute définition synchronisées avec des effets sonores, réduisant considérablement les coûts et le temps de production. Cette annonce s’inscrit dans une série d’avancées récentes d’Alibaba dans l’IA, notamment les lancements successifs des modèles Qwen3.5-Omni, Wan2.7-Image et Qwen3.6-Plus. Qwen3.6-Plus a notamment battu des records d’utilisation avec 1 400 milliards de tokens traités en une journée. Sur le plan organisationnel, Alibaba a restructuré ses équipes IA avec la création du comité technique dirigé par le CEO Wu Yongming et la division ATH, visant à harmoniser la recherche, les infrastructures et les applications commerciales. L’entreprise investit massivement, avec 380 milliards de RMB prévus sur trois ans pour le cloud et l’IA, et a déjà produit 470 000 puces GPU maison via sa filiale Pingtouge. Si ces moves impressionnent par leur ampleur et leur rapidité, Alibaba doit encore prouver sa capacité à maintenir cette dynamique face à une concurrence intense et à intégrer efficacement ces innovations dans son écosystème commercial.

marsbit04/11 04:14

Réclamer le « Cheval Heureux », Alibaba déploie sa « formation de combat » en IA

marsbit04/11 04:14

Du « jeton lexical » au « jeton symbolique » : La bataille sous-jacente de la cognition en IA derrière le nom chinois de Token

Résumé : Le Comité national chinois pour l'examen des termes scientifiques a récemment recommandé de traduire "Token" par "词元" (cíyuán, unité lexicale), suscitant un débat sur la pertinence de cette dénomination. L'article souligne que bien que cette traduction soit jugée intuitive et facile à diffuser, elle présente des incohérences structurelles à long terme. Le terme "Token", initialement utilisé en traitement du langage naturel, est désormais une unité discrète fondamentale dans les modèles multimodaux (texte, image, audio). Le choix de "词元" ancre sémantiquement le concept dans le domaine linguistique, ce qui peut induire des malentendus cognitifs et entraver la communication interdisciplinaire. De plus, il entre en conflit avec le terme "lemma" (lemme), déjà traduit par "词元" en linguistique. L’alternative "符元" (fúyuán, unité symbolique) est proposée comme plus adaptée : elle reflète la nature computationnelle du token comme unité symbolique discrète, indépendante de toute modalité spécifique. Cette option assure une meilleure cohérence conceptuelle, une stabilité à long terme et une réversibilité précise en anglais ("symbolic unit"), facilitant les échanges académiques internationaux. En conclusion, la terminologie doit s'aligner sur la nature structurelle des concepts plutôt que sur des analogies historiques ou des facilités explicatives temporaires.

marsbit04/10 10:51

Du « jeton lexical » au « jeton symbolique » : La bataille sous-jacente de la cognition en IA derrière le nom chinois de Token

marsbit04/10 10:51

Le premier grand modèle de Wang Tao permet enfin à Meta de revenir à la table des négociations

L'article annonce le lancement par Meta de Muse Spark, son premier modèle d'intelligence artificielle majeur développé sous la direction d'Alexandr Wang (汪滔), recruté il y a dix mois pour diriger le Meta Superintelligence Labs (MSL). Conçu pour être "petit et rapide", ce modèle multimodal natif intègre dès sa conception une compréhension visuelle et textuelle, avec une fonction de "chaîne de raisonnement visuel" et un mode "Contemplation" faisant appel à plusieurs sous-agents pour un raisonnement parallèle. Il obtient un score de 52 sur l'Artificial Analysis Intelligence Index, le classant 4ème mondial. Ses points forts sont le raisonnement scientifique (89,5% sur GPQA Diamond), la compréhension visuelle et des graphiques (86,4 sur CharXiv), et surtout le raisonnement médical (42,8% sur HealthBench Hard), grâce à un entraînement avec plus de 1000 médecins. Il est moins performant en génie logiciel (77,4% sur SWE-Bench). Déployé sur les produits Meta (WhatsApp, Instagram, etc.) et bientôt disponible via une API, Spark marque le retour de Meta dans la course à l'IA. La stratégie de prioriser un modèle plus petit et rapide plutôt qu'un "modèle écrasant" a été bien accueillie par le marché, faisant monter l'action de 6,5%. Ce modèle, probablement le projet interne "Avocado" maintes fois reporté, est présenté comme une première étape avant des modèles plus larges. Meta pourrait adopter une stratégie mixte, à la fois open source et propriétaire à l'avenir.

marsbit04/09 11:03

Le premier grand modèle de Wang Tao permet enfin à Meta de revenir à la table des négociations

marsbit04/09 11:03

Le modèle mystérieux HappyHorse débarque et domine le classement, la course à la génération vidéo accueille-t-elle un "poisson-chat" ?

Un modèle de génération de vidéo nommé HappyHorse-1.0 a discrètement atteint la première place du classement AI Video Arena d'Artificial Analysis, dépassant des modèles établis comme Seedance 2.0. Ce classement, basé sur des tests en aveugle par des utilisateurs réels (système Elo), est considéré comme reflétant fidèlement la perception humaine. Les indices pointent vers une origine chinoise (ordre des langues sur le site, référence à l'année du cheval). Après analyse technique, la communauté identifie HappyHorse comme une version optimisée du modèle open source daVinci-MagiHuman, développé conjointement par le laboratoire GAIR de SII (Shanghai) et Sand.ai (Pékin). Ce modèle utilise un transformateur monoflux de 15 milliards de paramètres pour un traitement conjoint du texte, de la vidéo et de l'audio. Sa montée fulgurante s'expliquerait par un réglage spécifique pour le benchmark, qui favorise les scènes avec un personnage (60% des tests), son domaine de force. Cependant, des tests pratiques notent des limites : besoin de puces H100, difficultés avec les scènes complexes或多personnages, et durée de génération courte (~10 sec). Symboliquement, cet événement marque un tournant : un modèle open source rivalise pour la première fois en qualité perçue avec des solutions propriétaires. Cela pourrait, à terme, menacer leur avantage concurrentiel dans des niches comme les portraits ou les présentateurs virtuels, en offrant une alternative personnalisable, moins chère et plus flexible. La course n'est pas terminée, mais la piste s'élargit pour l'open source.

marsbit04/08 08:02

Le modèle mystérieux HappyHorse débarque et domine le classement, la course à la génération vidéo accueille-t-elle un "poisson-chat" ?

marsbit04/08 08:02

活动图片