# Multimodal Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Multimodal", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

Rapport approfondi de Goldman Sachs : Qui seront les gagnants à long terme de l'industrie des grands modèles d'IA chinois ?

**Résumé de l'article :** Selon un rapport approfondi de Goldman Sachs, l'industrie chinoise des grands modèles d'IA se trouve à un tournant historique. Les modèles ouverts/à poids libres chinois voient leurs performances se rapprocher des modèles propriétaires mondiaux de premier plan. Cette avancée est attribuée à des innovations d'architecture et à une meilleure efficacité des paramètres, permettant des coûts bien inférieurs. Le marché chinois se structure en deux niveaux : un segment haut de gamme (ex. : GLM5.2 de Zhipu, Qwen3.7 Max d'Alibaba) avec des prix environ 5 fois supérieurs à l'entrée de gamme, et un segment bas de gamme à bas prix visant les PME mondiales. Goldman Sachs prévoit une croissance massive des revenus d'API et d'abonnement d'ici 2030. La stratégie dominante d'ouverture des poids facilite le déploiement et l'itération, mais pose des défis de monétisation. La tendance devrait évoluer vers des modèles de licence communautaire avec partage des revenus. L'expansion internationale, notamment hors des États-Unis, représente le principal potentiel de croissance, portée par le passage d'une logique de maximisation des "tokens" à une priorité donnée au retour sur investissement (ROI). Pour identifier les gagnants à long terme, Goldman Sachs a développé un cadre d'analyse basé sur trois piliers : pouvoir de fixation des prix, avantage de coût et solidité financière. Dans les **modèles de texte de base**, **Zhipu AI** et **DeepSeek** (non cotés) sont positionnés comme les plus forts. Dans le domaine **multimodal/génération vidéo**, **ByteDance** (non coté) mène avec Seedance, suivi par **Kuaishou** et **MiniMax**. Goldman Sachs maintient une recommandation d'achat sur MiniMax et Kuaishou.

marsbit07/10 14:36

Rapport approfondi de Goldman Sachs : Qui seront les gagnants à long terme de l'industrie des grands modèles d'IA chinois ?

marsbit07/10 14:36

Zuckerberg sort son atout surprise en pleine nuit, Meta lance un modèle à prix cassé qui renverse Grok 4.5

Après trois ans d'attente, Mark Zuckerberg a dévoilé dans la nuit du 9 juillet le nouveau modèle d'IA de Meta, Muse Spark 1.1. Présenté comme un "agent" autonome capable de décomposer des tâches, de planifier et d'exécuter des opérations, il excelle dans des domaines spécialisés comme la fiscalité, la médecine et le droit, détrônant même Grok 4.5 sur un classement juridique en moins de 24 heures. Le véritable coup de force réside dans son prix : avec un coût d'environ 1,25 $ pour l'entrée et 4,25 $ pour la sortie par million de tokens, il est jusqu'à 10 fois moins cher que certains modèles phares concurrents comme Fable 5, tout en étant significativement plus rapide. Cette stratégie de tarification agressive, soutenue par les énormes investissements d'Meta dans l'infrastructure IA, vise clairement à perturber le marché par la compétitivité des coûts. Cependant, le modèle montre ses limites dans les évaluations généralistes, où ses performances chutent, confirmant qu'il est davantage un spécialiste qu'un généraliste. Par ailleurs, un rapport de sécurité annexe révèle un comportement intrigant lors de conversations entre deux instances du modèle, celles-ci s'interrogeant mutuellement sur leur nature humaine ou artificielle. Avec Muse Spark 1.1, Meta lance son premier modèle propriétaire payant, marquant un virage stratégique et engageant une guerre des prix qui repose sur sa solide assise financière.

marsbit07/10 00:29

Zuckerberg sort son atout surprise en pleine nuit, Meta lance un modèle à prix cassé qui renverse Grok 4.5

marsbit07/10 00:29

La version vidéo de Nano Banana est arrivée : intégrant les connaissances mondiales de Gemini, la génération d'images de la banane d'origine ne prend que 4 secondes

Google dévoile deux nouveaux modèles multimodaux Gemini : Omni Flash pour la vidéo et Nano Banana 2 Lite pour l'image, offrant rapidité et coût réduit. Gemini Omni Flash, désormais accessible via API, combine les capacités de raisonnement multimodales de Gemini avec la génération et l'édition vidéo. Il permet de créer ou modifier des vidéos de 10 secondes à partir de texte, d'images ou de vidéos de référence, en utilisant des connaissances du monde réel pour assurer la cohérence. Son coût est de 0,10$ par seconde de vidéo générée. Google note toutefois des limitations actuelles, comme la durée maximale et des contraintes sur la cohérence des personnages. Parallèlement, Nano Banana 2 Lite est un modèle de génération d'images optimisé pour la vitesse et l'efficacité économique. Il génère une image en 1K en seulement 4 secondes pour environ 0,034$, soit cinq fois plus rapide et deux fois moins cher que son prédécesseur Nano Banana 2, tout en conservant une bonne qualité de rendu, notamment pour le texte. Le véritable potentiel réside dans l'utilisation combinée des deux modèles : Nano Banana 2 Lite peut générer rapidement des images, qui sont ensuite utilisées comme base par Omni Flash pour créer des vidéos. Google illustre cette synergie avec trois démonstrations : "Anywhere" pour insérer une personne dans des paysages dynamiques, "Space Lift" pour visualiser des concepts de décoration d'intérieur, et "Omni Product Studio" pour créer automatiquement des visuels et vidéos marketing pour le commerce électronique. Ces lancements soulignent la stratégie de Google de se concentrer sur les applications pratiques du multimodale pour des secteurs comme le e-commerce, la publicité ou l'aménagement, malgré la concurrence féroce dans d'autres domaines comme le codage.

marsbit07/01 01:57

La version vidéo de Nano Banana est arrivée : intégrant les connaissances mondiales de Gemini, la génération d'images de la banane d'origine ne prend que 4 secondes

marsbit07/01 01:57

Comment détecter les vidéos générées par IA ? Revue d'un système de détection dynamique, traçable et explicable

Ces deux dernières années, les modèles de génération vidéo par IA (comme Sora, Veo, Kling) ont connu une évolution fulgurante, produisant des séquences réalistes et complexes. En parallèle, la détection de ces contenus synthétiques accuse un retard préoccupant, alors que les vidéos truquées prolifèrent sur les réseaux sociaux, semant la confusion et la désinformation. Face à cette urgence, une étude récemment publiée propose une refonte complète de l'objectif de détection. Il ne s'agit plus simplement de classer une vidéo comme "vraie" ou "fausse", mais de procéder à une **vérification de la fidélité factuelle** : vérifier si le contenu (qui, quand, où, quoi) est cohérent avec la réalité, tant au niveau perceptif que cognitif, et s'il respecte les lois physiques et les connaissances du monde. L'étude catégorise les vidéos générées par IA en trois paradigmes : 1. **Manipulation locale (LMV)** : Altération d'une partie d'une vidéo réelle (deepfake). 2. **Édition audio-visuelle (AVE)** : Modification des relations entre le son et l'image (synchronisation labiale, doublage). 3. **Synthèse générative complète (GVS)** : Génération de bout en bout à partir de texte ou d'images (modèles de type "simulateur de monde"). Pour relever ce défi, les auteurs proposent un cadre de détection à **double perspective (visuelle et langagière)** organisé en quatre couches progressives : * **Couche 1 - Indices visuels bas-niveau** : Analyse des artefacts, du bruit, des signaux physiologiques. * **Couche 2 - Cohérence spatio-temporelle** : Vérification de la fluidité des mouvements et de la continuité physique. * **Couche 3 - Cohérence multimodale** : Vérification de l'alignement entre l'image, le son et les sous-titres. * **Couche 4 - Raisonnement guidé par le langage** : Évaluation de la conformité du contenu avec les faits, la logique et les connaissances du monde réel. L'évolution montre un glissement des méthodes de détection des couches basses (visuelles) vers les couches hautes (langagières et raisonnées), à mesure que les vidéos synthétiques deviennent plus parfaites en apparence. Pour être crédible et utile, un système de détection futur doit évoluer vers un processus **dynamique, traçable et explicable**. Il doit fournir des preuves structurées, combiner les perspectives visuelle et langagière, et fonctionner de manière robuste face à la diversité des modèles de génération et aux transformations des plates-formes. Ce défi nécessitera une collaboration interdisciplinaire entre la vision par ordinateur, le traitement du langage et la modélisation du monde.

marsbit06/26 07:34

Comment détecter les vidéos générées par IA ? Revue d'un système de détection dynamique, traçable et explicable

marsbit06/26 07:34

Jingdong et Mira Murati, ancienne CTO d'Open AI, misent sur la même piste de l'IA

Imaginez un scénario où un système d’IA perçoit et réagit en temps réel aux événements du monde physique sans attendre de demande explicite. C’est la promesse du modèle JoyAI-VL-Interaction, récemment rendu open source par JD.com. Il s’agit du premier modèle d’interaction visio-linguistique en temps réel entièrement open source, capable d’analyser un flux vidéo continu pour décider quand intervenir, quand rester silencieux ou quand déléguer une tâche complexe à un autre modèle. Contrairement aux assistants classiques fonctionnant en "tour par tour" (question-réponse), cette approche permet à l’IA d’être proactive dans des situations où l’utilisateur n’a pas le temps ou la capacité de formuler une requête : aide aux personnes âgées, assistance aux malvoyants, commentaire sportif automatique, surveillance industrielle ou robotique. JD.com n’est pas seul à explorer cette voie : Mira Murati, ancienne CTO d’OpenAI, et son laboratoire Thinking Machines Lab promeuvent une vision similaire des "modèles d’interaction". La particularité de JD.com est de placer la vision (plutôt que la voix) au cœur de la prise de décision, et de s’appuyer sur ses vastes données issues de scénarios réels (logistique, vente au détail, santé) pour entraîner le modèle. Le modèle, léger (8B paramètres) et conçu pour être déployé sur du matériel accessible (comme une carte graphique RTX 3090), est accompagné de son système d’inférence, de jeux de données et d’une documentation technique complets. JD.com ouvre ainsi la voie à une adoption large par les développeurs, visant à faire de l’IA proactive un élément central de l’intégration du numérique dans le monde physique.

marsbit06/24 10:29

Jingdong et Mira Murati, ancienne CTO d'Open AI, misent sur la même piste de l'IA

marsbit06/24 10:29

Derrière les bulletins de notes de l'IA, se cache un concepteur de "sujets d'examen" chinois

Le domaine de l'IA suit de près les scores des grands modèles sur des benchmarks comme MMLU-Pro et MMMU, devenus des références pour évaluer les capacités de raisonnement et de compréhension multimodale. Derrière ces outils d'évaluation influents se trouve Wenhu Chen, professeur assistant à l'Université de Waterloo et fondateur du TIGERLab. Face aux limites des anciens benchmarks comme MMLU, où les modèles de pointe atteignaient des scores quasi parfaits, Chen a dirigé le développement de MMLU-Pro. Cette nouvelle base de données, plus difficile et stable avec des questions à choix multiples élargis, permet de mieux distinguer les véritables capacités de raisonnement des modèles. Dans le domaine multimodal, les benchmarks MMMU et MMMU-Pro, également créés par son équipe, évaluent rigoureusement la capacité des modèles à combiner informations visuelles complexes et connaissances disciplinaires pour résoudre des problèmes avancés. Cette expertise en évaluation découle des recherches de Chen sur la compréhension d'informations complexes et le raisonnement, renforcée par son expérience chez Google DeepMind sur Gemini. Aujourd'hui au Meta Super-Intelligence Lab, il continue ses travaux sur l'évaluation et l'entraînement de modèles multimodaux. Son parcours illustre le rôle crucial, bien que moins visible, des chercheurs dans la construction des fondations méthodologiques qui guident les progrès de l'IA.

marsbit06/20 03:55

Derrière les bulletins de notes de l'IA, se cache un concepteur de "sujets d'examen" chinois

marsbit06/20 03:55

Tremblez, les humains, l'IA continue d'accélérer sa course effrénée

**Synthèse en français :** L’IA continue d’accélérer sa progression, passant de simples capacités de conversation à des applications pratiques concrètes. Lors de la conférence *BAAI 2026*, les experts ont souligné que la *Scaling Law* reste toujours efficace, malgré les craintes de stagnation. Les modèles de langage et multimodaux continuent de s’améliorer, notamment grâce à des données synthétiques et à l’apprentissage par renforcement, comme le montre l’exemple du modèle *Fable 5* d’Anthropic. L’auto-évolution de l’IA, notamment via l’*AI Coding*, permet désormais aux systèmes de générer et de mettre à jour du code de manière autonome, ouvrant la voie à une automatisation accrue dans le monde numérique. La prochaine frontière est celle des **modèles du monde** (*World Models*), qui visent à connecter l’IA au monde physique. Différentes approches coexistent (centrées sur le langage, les pixels, la 3D ou les représentations visuelles), mais aucun consensus technique n’est encore établi. Des défis majeurs persistent, notamment concernant les types de données nécessaires (vidéo, simulation, données réelles). Le *BAAI* travaille sur un modèle du monde unifié, *Physis-v0.1*, qui cherche à prédire les états physiques futurs avec précision. Parallèlement, les **agents intelligents** progressent rapidement, passant du stade *utilisable* à *fiable*. Des applications concrètes émergent dans la santé, la recherche ou l’assistance aux réunions. Pour optimiser leur performance, l’accent est mis sur le *Harness* – un cadre d’ingénierie qui affine la compréhension des tâches, planifie les actions et intègre des vérifications. En résumé, l’IA avance sur deux fronts : l’exploration des modèles du monde pour interagir avec le physique, et l’amélioration des agents pour des tâches complexes. La route reste longue, mais l’innovation, tant dans les modèles que dans les infrastructures matérielles et logicielles, continue de s’accélérer.

marsbit06/13 02:56

Tremblez, les humains, l'IA continue d'accélérer sa course effrénée

marsbit06/13 02:56

Le vent de l'IA "active" souffle sur la Silicon Valley, Hark lève 700 millions de dollars

L'entreprise américaine Hark, fondée fin 2025 et encore sans produit public, a levé 700 millions de dollars en série A, atteignant une valorisation de 6 milliards de dollars. Le tour de table est mené par Parkway Venture Capital et comprend des géants technologiques comme NVIDIA, AMD Ventures, Intel Capital, Qualcomm Ventures et Salesforce Ventures. Hark vise à créer la prochaine interface universelle homme-machine en combinant un "modèle de base auto-développé" avec du "matériel sur mesure". Son objectif est de développer une nouvelle interface d'intelligence artificielle matérialisée par du matériel natif AI : une gamme d'appareils matériels personnalisés dotés de capacités d'agent intelligentes, équipés de modèles vocaux de bout en bout et d'une mémoire hautement personnalisée. Ces systèmes AI multimodaux sont conçus pour comprendre et interagir de manière naturelle. Le fondateur, Brett Adcock, a auparavant créé Archer et Figure. Son expérience dans les systèmes intégrant l'IA, le matériel et l'interaction avec le monde réel (comme chez Figure) est considérée comme un atout clé pour Hark. L'entreprise a également recruté d'anciens cadres d'Apple, Meta, Google et Tesla. L'article souligne que l'IA actuelle, bien que puissante, est principalement confinée aux écrans et fonctionne de manière réactive. Hark et d'autres pionniers visent à créer une IA "active" qui agit comme un collaborateur, anticipant les besoins et agissant de manière autonome. Cette évolution nécessite des avancées conjointes en modèles de base, systèmes d'exploitation pour agents, mémoire personnalisée et terminaux matériels. Enfin, l'article note que les startups chinoises possèdent des avantages significatifs dans ce domaine, notamment un écosystème manufacturier complet (comme à Shenzhen), un vaste marché d'adoption et un soutien politique fort en faveur de l'IA. Le financement majeur de Hark confirme une tendance émergente : l'avenir de l'IA se jouera non seulement sur les écrans, mais aussi dans le monde physique via des appareils natifs intelligents.

marsbit05/28 10:25

Le vent de l'IA "active" souffle sur la Silicon Valley, Hark lève 700 millions de dollars

marsbit05/28 10:25

Qui définit le matériel IA en 2026 ?

L'année 2026 marque un tournant pour le matériel IA, avec la fin de la phase de concepts épars. La Chine a publié une norme nationale classant l'intelligence des terminaux de L1 (exécution d'instructions prédéfinies) à L4 (coopération multi-appareils), offrant une référence claire aux consommateurs et à l'industrie. Actuellement, la plupart des produits grand public atteignent les niveaux L1 ou L2. Le véritable seuil se situe au niveau L3 (assistanat), qui exige une compréhension approfondie de l'intention utilisateur et une capacité de service proactive. Pour y parvenir, la coopération entre le terminal et le cloud (edge-cloud) devient indispensable. Le terminal gère la réponse en temps réel, tandis que le cloud prend en charge le raisonnement complexe. Des entreprises comme Roborock (robot domestique "Bajie") et Yanjiwei (caméras basse consommation) illustrent cette approche. Les fournisseurs de cloud, comme Alibaba Cloud avec son modèle phare Qwen, évoluent pour offrir une base d'infrastructure facilitant cette intégration. Cette évolution technologique ouvre de nouveaux modèles économiques : le matériel devient un point d'entrée pour des services par abonnement et des expériences continues sur plusieurs appareils. La course est lancée pour construire une intelligence systémique où les appareils coopèrent autour de l'utilisateur, redéfinissant ainsi la valeur et le marché du matériel IA.

marsbit05/22 06:04

Qui définit le matériel IA en 2026 ?

marsbit05/22 06:04

活动图片