Le modèle mystérieux HappyHorse débarque et domine le classement, la course à la génération vidéo accueille-t-elle un "poisson-chat" ?

marsbitPublié le 2026-04-08Dernière mise à jour le 2026-04-08

Résumé

Un modèle de génération de vidéo nommé HappyHorse-1.0 a discrètement atteint la première place du classement AI Video Arena d'Artificial Analysis, dépassant des modèles établis comme Seedance 2.0. Ce classement, basé sur des tests en aveugle par des utilisateurs réels (système Elo), est considéré comme reflétant fidèlement la perception humaine. Les indices pointent vers une origine chinoise (ordre des langues sur le site, référence à l'année du cheval). Après analyse technique, la communauté identifie HappyHorse comme une version optimisée du modèle open source daVinci-MagiHuman, développé conjointement par le laboratoire GAIR de SII (Shanghai) et Sand.ai (Pékin). Ce modèle utilise un transformateur monoflux de 15 milliards de paramètres pour un traitement conjoint du texte, de la vidéo et de l'audio. Sa montée fulgurante s'expliquerait par un réglage spécifique pour le benchmark, qui favorise les scènes avec un personnage (60% des tests), son domaine de force. Cependant, des tests pratiques notent des limites : besoin de puces H100, difficultés avec les scènes complexes或多personnages, et durée de génération courte (~10 sec). Symboliquement, cet événement marque un tournant : un modèle open source rivalise pour la première fois en qualité perçue avec des solutions propriétaires. Cela pourrait, à terme, menacer leur avantage concurrentiel dans des niches comme les portraits ou les présentateurs virtuels, en offrant une alternative personnalisable, moins chère et plus flexib...

Aucune conférence de presse, aucun blog technique, aucun soutien d'entreprise – un modèle de génération de texte en vidéo nommé HappyHorse-1.0 a discrètement atteint la première place du classement AI Video Arena de la plateforme d'évaluation IA authoritative Artificial Analysis, dépassant avec un score Elo plus élevé Seedance 2.0 et laissant derrière lui des acteurs majeurs comme Kling et Tian Gong, déclenchant instantanément une "course au décryptage" dans les cercles technologiques.

Le classement d'Artificial Analysis n'est pas une évaluation de paramètres techniques, mais un résumé des résultats de tests en aveugle par des utilisateurs réels sous forme de score Elo, reflétant la perception réelle après visionnage. Cela rend ce classement plus difficile à remettre en question qu'un simple benchmark, et fait de "qui est derrière cela" une question impossible à ignorer.

Le "Cheval Heureux" atteint discrètement le sommet, déclenchant un jeu de devinettes dans le milieu technologique

Les spéculations sur X sont arrivées rapidement. La première chose remarquée fut l'ordre des langues sur le site officiel : le mandarin et le cantonais précèdent l'anglais. Pour un produit destiné aux utilisateurs mondiaux, cet ordre est quelque peu inhabituel – si une équipe américaine était aux commandes, l'anglais serait presque invariablement en première position. Une équipe originaire de Chine est pratiquement confirmée.

Le nom lui-même est aussi un indice. 2026 est l'année du Cheval selon le calendrier lunaire, le nom "HappyHorse" cache un clin d'œil peu subtil à l'année du Cheval, une tactique similaire avait été employée plus tôt dans l'année par "Pony Alpha". La liste des suspects s'est donc allongée rapidement : les fondateurs de Tencent et d'Alibaba portent le nom de famille Ma (cheval), ils y figurent naturellement ; certains ont parié sur Xiaomi, estimant que Lei Jun est traditionnellement discret et aime dévoiler ses cartes soudainement ; d'autres ont trouvé que le style ressemblait plus à DeepSeek, car DS avait précédemment lancé discrètement un modèle visuel, puis l'avait retiré tout aussi discrètement. Les spéculations étaient nombreuses et animées, mais aucune n'avait de preuve tangible.

Ce qui a véritablement identifié la cible, c'est une comparaison point par point au niveau technique. L'utilisateur X Vigo Zhao a comparé les données de benchmark publiques de HappyHorse-1.0 avec celles de modèles connus un par un, et a trouvé une correspondance très forte : daVinci-MagiHuman, le modèle open source "Da Vinci Magic Human" mis en ligne sur Github en mars.

Qualité visuelle 4.80, alignement texte 4.18, cohérence physique 4.52, taux d'erreur de mots dans la parole 14.60% – les données correspondent point par point. La structure du site officiel est aussi presque identique : la description de l'architecture, le tableau des performances, le style de présentation des vidéos de démonstration, tout semble provenir du même modèle. Les deux partagent la même architecture Transformer à flux unique, la même génération conjointe audio-vidéo, et la même liste de langues prises en charge. Un tel degré de coïncidence est difficile à expliquer par le hasard.

La conclusion la plus largement acceptée dans les cercles techniques est que HappyHorse est une version itérative optimisée par Sand.ai, l'un des co-développeurs de daVinci-MagiHuman, basée sur le modèle open source, dans le but principal de vérifier les limites des performances du modèle sous les préférences réelles des utilisateurs et de préparer le terrain pour sa commercialisation future.

daVinci-MagiHuman a été officiellement open source le 23 mars 2026, fruit de la collaboration de deux jeunes équipes. L'une provient du laboratoire de recherche sur l'intelligence artificielle générative (GAIR) du Shanghai Institute of Intelligence (SII), dirigé par le chercheur Liu Pengfei ; l'autre est Sand.ai (Sand Technology) basée à Pékin, dont le fondateur Cao Yue a également un background académique, et dont l'orientation de l'entreprise est les modèles de monde auto-régressifs.

Le modèle utilise un Transformer à flux unique pur à attention de 15 milliards de paramètres, fourrant les tokens de texte, vidéo et audio dans une même séquence pour une modélisation conjointe – l'open source n'avait jamais réalisé auparavant un pré-entraînement conjoint audio-vidéo véritablement from scratch, la plupart se contentant de coller des bases mono-modales.

Comment un modèle vidéo open source a-t-il réalisé une remontée éclair en deux semaines ?

Une fois l'identité clarifiée, une autre question devient plus difficile à répondre : daVinci-MagiHuman n'est open source que depuis fin mars, comment HappyHorse-1.0 a-t-il pu obtenir un score Elo plus élevé que Seedance 2.0 en seulement deux semaines ?

D'après les informations divulguées sur le site officiel, HappyHorse n'a pas modifié l'architecture sous-jacente de manière significative. L'hypothèse la plus raisonnable est qu'il a effectué des ajustements ciblés sur la stratégie de génération par défaut pour le scénario d'évaluation.

Le système Elo est essentiellement une accumulation des préférences des utilisateurs. Améliorer légèrement les éléments sensibles à la perception comme la stabilité des expressions faciales, l'alignement audio-vidéo, ou l'esthétique visuelle, permet d'être plus facilement choisi dans les tests en aveugle. La limite supérieure des capacités du modèle n'a pas changé, mais les "performances en évaluation" peuvent être polies.

En fait, dans les échantillons de test en aveugle d'Artificial Analysis, la génération de portraits et les contenus de type narration" représentaient plus de 60%, et daVinci-MagiHuman s'est concentré sur la performance de portraits dès la phase d'entraînement, lui conférant un avantage naturel dans ce type de scénario, ce qui est la raison principale de son taux de victoire en aveugle ; si l'échantillon de test en aveugle est principalement composé de gros plans sur des personnages, les modèles spécialisés dans les portraits bénéficieront systématiquement d'un avantage, sans rapport direct avec leurs performances réelles dans des scénarios complexes impliquant plusieurs personnages, des mouvements de caméra complexes ou des narrations temporelles longues.

Le résultat est qu'un écart notable est apparu entre les chiffres du classement et l'expérience de test, divisant les commentateurs sur X en deux camps. Les sceptiques, après tests, estiment que HappyHorse-1.0 présente encore un écart visible avec Seedance 2.0 en termes de détails des personnages et de cohérence dynamique, et remettent en question la représentativité du score Elo lui-même.

Les partisans, quant à eux, placent de grands espoirs dans le potentiel de HappyHorse, espérant qu'il pourra résoudre le point sensible de l'industrie qu'est la "cohérence de la qualité d'image dans les séquences multi-plans", car c'est un problème que les modèles vidéo grand public actuels n'ont pas bien résolu. Si daVinci-MagiHuman parvient réellement à faire une percée ici, cela pourrait être bien plus important qu'une place dans un classement.

Les limites du modèle lui-même ne doivent pas non plus être masquées par les chiffres. Le blogueur Xiaohongshu @JACK's AI World a déployé et testé daVinci-MagiHuman dès sa sortie. Il a constaté qu'il nécessitait un H100 pour fonctionner, les cartes graphiques grand public sont基本 exclues, et bien que la communauté travaille sur des solutions de quantification, le déploiement local pour les utilisateurs individuels restera difficile à court terme.

En termes de scénarios, il excelle actuellement principalement pour les personnages uniques ; dès que plusieurs personnages apparaissent ou que la scène devient complexe, la qualité chute – ce n'est pas un problème réglable par paramétrage, c'est directement lié à son orientation de conception axée sur les portraits. La durée de génération est généralement d'environ 10 secondes, au-delà cela devient désordonné, et une sortie haute définition nécessite encore des plugins de super-résolution.

La conclusion de @JACK's AI World est : la facilité d'utilisation globale de daVinci-MagiHuman est inférieure à celle de LTX 2.3, il faudra attendre que la communauté améliore la quantification avant qu'il ne soit adapté à un usage quotidien.

La course à la génération vidéo attend-elle un véritable "poisson-chat" ?

Bien sûr, une première place dans un classement ne signifie pas grand-chose. Ensuite, HappyHorse devra subir des tests plus complets sur la stabilité, la vitesse d'accès en concurrence élevée, la cohérence inter-scénarios, la précision du contrôle des personnages, ainsi que la capacité de généralisation au-delà de l'ensemble d'évaluation. Ce sont là les indicateurs clés qui déterminent si un modèle peut véritablement entrer dans le flux de travail des créateurs.

Mais si l'on élargit le champ de vision à la structure industrielle globale, le signal envoyé par cet événement est déjà suffisamment clair.

Les modèles vidéo open source en eux-mêmes ne sont pas nouveaux. Mais un écart visible au niveau de l'effet a toujours persisté entre l'open source et le闭源 (closed source) – dans les scénarios nécessitant une livraison au client, la qualité de génération des modèles open source n'a pas réussi à franchir durablement le seuil de "utilisable" à "livrable". Le pouvoir de fixation des prix des produits闭源 comme Kling ou Seedance est, dans une large mesure, construit sur cet écart.

Cette fois, la signification réside dans le fait qu'un produit basé sur un modèle open source a, pour la première fois, rivalisé de front avec les principaux concurrents闭源 actuels sur un classement de test en aveugle basé sur la perception réelle des utilisateurs. Quelles que soient les composantes d'optimisation pour le scénario d'évaluation, pour les fabricants闭源 qui dépendent de cet écart pour construire leur pouvoir de fixation des prix, c'est au moins un signal qui mérite d'être pris au sérieux.

Pour les développeurs, la signification de ce point d'inflexion est plus concrète. Dans les scénarios verticaux comme les portraits, les humains numériques, les streamers virtuels, etc., une fois que la qualité de génération de la base open source atteint le seuil "livrable", la structure des coûts du déploiement autonome subira un changement substantiel – non seulement une compression des coûts d'appel d'API, mais surtout l'intégration complète des données, du modèle et de la chaîne d'inférence sous son propre contrôle, obtenant une flexibilité en termes de profondeur de personnalisation et de conformité à la vie privée que les solutions闭源 peinent à offrir.

HappyHorse-1.0 n'ébranlera pas à court terme la position de marché de Seedance 2.0 ou de Kling, mais une fois la cognition établie que les modèles open source peuvent rivaliser avec les闭源, les optimisations de quantification, les微调 (fine-tuning) verticaux et l'accélération de l'inférence seront poursuivies par la communauté à un rythme d'itération dépassant de loin celui des produits闭源.

En cette année du Cheval, ce qui mérite vraiment d'être suivi, ce n'est peut-être pas quel cheval court le plus vite, mais la piste elle-même qui s'élargit.

Cet article provient du compte WeChat officiel "AI价值官" (AI Value Officer), auteur : Xing Ye, éditeur : Mei Qi

Questions liées

QQu'est-ce que HappyHorse-1.0 et pourquoi a-t-il suscité l'attention dans le domaine de l'IA ?

AHappyHorse-1.0 est un modèle de génération de vidéos à partir de texte qui a discrètement atteint la première place du classement AI Video Arena d'Artificial Analysis, dépassant des modèles établis comme Seedance 2.0. Son succès est dû à son score Elo élevé, basé sur des tests à l'aveugle par des utilisateurs réels, ce qui a déclenché une compétition d'investigation dans la communauté technologique.

QQuelles preuves suggèrent que HappyHorse-1.0 est lié au modèle open source daVinci-MagiHuman ?

ALes données de référence publiques de HappyHorse-1.0 correspondent étroitement à celles de daVinci-MagiHuman, un modèle open source sorti en mars 2026. Les similitudes incluent des scores identiques en qualité visuelle, alignement texte-vidéo, cohérence physique et taux d'erreur vocale, ainsi qu'une architecture technique et une liste de langues prises en charge presque identiques.

QQui sont les équipes derrière le développement de daVinci-MagiHuman et HappyHorse-1.0 ?

AdaVinci-MagiHuman est le fruit d'une collaboration entre le laboratoire de recherche sur l'IA générative (GAIR) de la Shanghai Innovation Institute (SII), dirigé par le chercheur Liu Pengfei, et Sand.ai (San Dai Tech), une startup de Pékin fondée par Cao Yue, spécialisée dans les modèles mondiaux auto-régressifs.

QPourquoi HappyHorse-1.0 a-t-il performé aussi rapidement dans les tests en aveugle malgré son récent lancement ?

AHappyHorse-1.0 a obtenu un score Elo élevé en raison de son optimisation pour les scènes de test, en particulier les contenus mettant en scène des personnages humains et des narrations, qui représentent plus de 60% des échantillons de test. Sa conception initiale axée sur la génération de personnages lui a donné un avantage naturel dans ces scénarios.

QQuel impact HappyHorse-1.0 pourrait-il avoir sur l'industrie de la génération vidéo par IA ?

AHappyHorse-1.0 symbolise un tournant où un modèle open source rivalise avec des solutions propriétaires dans des tests basés sur la perception utilisateur. Cela pourrait réduire les coûts de déploiement, offrir plus de flexibilité en matière de personnalisation et de confidentialité, et accélérer l'innovation communautaire, élargissant ainsi les possibilités pour les développeurs et les créateurs.

Lectures associées

L'action de Circle s'effondre de 76 %, un stablecoin lié au dollar hongkongais sera lancé d'ici deux semaines

Le cours de l'action de Circle (CRCL) a chuté d'environ 76% depuis son pic de juin de l'année dernière, atteignant environ 62 dollars le 19 juillet. Cette baisse reflète une réévaluation par le marché face à l'intensification de la concurrence et aux pressions sur les marges, malgré la confiance affichée par la direction dans la stratégie à long terme. Le président de Circle, Heath Tarbert, met en avant les atouts de l'entreprise, notamment l'USDC et ses 730 milliards de dollars de circulation. Cependant, de nouveaux défis émergent : l'alliance entre le nouveau stablecoin Open USD et la plateforme Visa Stablecoin Platform menace de fragmenter le marché. Parallèlement, Circle poursuit son expansion dans les paiements réels, comme en témoigne son partenariat avec JCB au Japon. Le paysage réglementaire ajoute à la complexité. Tether (USDT) dispose d'une période d'adaptation d'environ deux ans pour se conformer au GENIUS Act américain, ce qui pourrait nécessiter un important réajustement de ses réserves. À Hong Kong, le secteur entre dans une phase de concrétisation, avec Standard Chartered et l'entreprise Anchorage prêtes à lancer un stablecoin lié au dollar de Hong Kong (HKDAP) après avoir obtenu une licence. La chute du cours de Circle symbolise la transition du secteur des stablecoins d'une dynamique de "vainqueur unique" à un paysage concurrentiel multipolaire. La valeur attribuée par le marché aux avantages d'échelle est en cours de révision, et la capacité d'exécution des acteurs sera déterminante dans les deux prochaines années.

marsbitIl y a 11 mins

L'action de Circle s'effondre de 76 %, un stablecoin lié au dollar hongkongais sera lancé d'ici deux semaines

marsbitIl y a 11 mins

Sous le siège du capital, la décentralisation est la seule défense des chaînes publiques

L'auteur, Omid Malekan, professeur adjoint à la Columbia Business School, défend farouchement la décentralisation comme la caractéristique essentielle et non négociable des blockchains publiques. Il s'oppose à ceux qui privilégient la scalabilité, le business développement ou le financement abondant, estimant que ces priorités conduisent inévitablement à la corruption par le capital. Son raisonnement, qu'il qualifie de réaliste et machiavélique, repose sur la nature intrinsèquement opportuniste des entreprises et des institutions. Celles-ci chercheront toujours à s'approprier ou à neutraliser toute technologie menaçant leur position dominante. Le principal risque pour une blockchain n'est donc pas une attaque externe (comme une attaque à 51%), mais une prise de contrôle interne par des intérêts capitalistes. L'auteur illustre ce propos par l'exemple des blockchains de consortium ou "permissionnées". Ces systèmes, présentés comme des solutions pragmatiques, sont en réalité des outils pour préserver les oligopoles existants (comme Visa et Mastercard) en verrouillant l'accès à la concurrence. Pour lui, ces solutions hybrides et centralisées sont inefficaces et peu sûres à long terme. Il conclut que, malgré ses défauts et sa complexité, une blockchain comme Ethereum, avec son haut degré de décentralisation, reste la meilleure défense contre cette capture institutionnelle. C'est l'infrastructure la plus résistante pour construire un système financier véritablement ouvert et neutre, où les actifs finiront par affluer naturellement vers la sécurité la plus forte.

Foresight NewsIl y a 19 mins

Sous le siège du capital, la décentralisation est la seule défense des chaînes publiques

Foresight NewsIl y a 19 mins

Qui décide des règles du Bitcoin ? Le BIP-110 déclenche un conflit de gouvernance

L’article aborde la controverse soulevée par la proposition BIP-110, qui vise à réduire temporairement la capacité d’enregistrement de données non financières sur la blockchain Bitcoin via un soft fork. La proposition, initiée par Dathon Ohm, prévoit d’imposer de nouvelles limites au niveau du consensus, notamment sur la taille des scripts et l’utilisation d’OP_RETURN. Elle est activable par un signal minier à 55% sur une période déterminée. Les partisans soutiennent que les inscriptions et les runes surchargent les nœuds et détournent Bitcoin de sa mission monétaire, notant que les politiques de relais par défaut (comme l’ajustement dans Bitcoin Core v30) sont devenues inefficaces face aux canaux privés vers les mineurs. Les opposants, dont Michael Saylor et Adam Back, critiquent fermement l’approche. Saylor y voit un précédent de gouvernance dangereux, avec un seuil d’activation trop bas (55% contre 95% pour BIP-9) et des risques de division de la chaîne. Adam Back défend le principe d’un réseau sans permission, où la lenteur du consensus technique agit comme un système immunitaire contre les modifications non éprouvées. Techniquement, des experts comme Martin Habovštiak montrent que le stockage arbitraire de données pourrait contourner ces restrictions, tandis qu’un client alternatif comme DOG Mode pourrait les neutraliser au niveau du relais. Le débat révèle des tensions plus profondes sur la gouvernance de Bitcoin : les mineurs (divisés, avec des positions variées chez Ocean, Foundry et F2Pool), les opérateurs de nœuds (comme Bitcoin Knots) qui défendent leur souveraineté, les mainteneurs du code, et désormais des acteurs économiques majeurs comme MicroStrategy, dont les réserves de BTC influencent le récit. Un bug potentiel (BlockSlop) lié à l’activation tardive de BIP-110 a également été révélé, ajoutant un risque technique. En définitive, BIP-110 sert de test de pression pour la gouvernance bitcoin, opposant une vision interventionniste visant à préserver la fonction monétaire du réseau à une vision neutraliste défendant son ouverture et son processus de consensus prudent. La question centrale reste : qui a le pouvoir de décider ce qu’est Bitcoin ?

marsbitIl y a 32 mins

Qui décide des règles du Bitcoin ? Le BIP-110 déclenche un conflit de gouvernance

marsbitIl y a 32 mins

Qui décide des règles du Bitcoin ? Le BIP-110 déclenche une divergence de gouvernance

Le débat autour du BIP-110 (Réduction de données par softfork temporaire) a remis en lumière les profondes divergences de gouvernance au sein de la communauté Bitcoin. Cette proposition vise à limiter par consensus les données non financières, comme les inscriptions et les runes, en imposant des restrictions sur la taille des scripts et OP_RETURN. Ses partisans, incluant certains nœuds et mineurs comme Ocean, arguent que ces données parasitaires alourdissent la charge des nœuds et détournent l'objectif monétaire de Bitcoin, et que les politiques de relayage par défaut (comme l'ajustement dans Bitcoin Core v30) sont inefficaces. Les opposants, menés par des figures comme Michael Saylor et Adam Back, contestent vigoureusement l'approche. Ils estiment que modifier les règles de consensus pour interdire des transactions valides est antidémocratique, contraire au principe de neutralité du protocole et crée un précédent dangereux en matière de gouvernance. Back souligne que le processus de consensus technique lent et méticuleux est précisément ce qui protège Bitcoin. Saylor, représentant d'un grand détenteur institutionnel, met en garde contre les risques de division de la chaîne et d'instabilité du marché. La discussion révèle également les limites techniques du BIP-110 : des méthodes alternatives pour encoder des données persistent, et un logiciel client comme "DOG Mode" pourrait contourner les restrictions. De plus, un problème potentiel de consensus ("BlockSlop") a été révélé, exposant les risques techniques d'une telle mise à niveau. Au-delà de la question des données, le conflit pose une question fondamentale : qui décide de ce qu'est Bitcoin ? Les mineurs (avec des divisions internes, comme le montre le vote pondéré de Foundry), les opérateurs de nœuds, les développeurs principaux ou les grands détenteurs de capitaux ? Le BIP-110, qu'il soit activé ou non, sert de test de pression pour le système de gouvernance décentralisé et sans autorité unique de Bitcoin.

链捕手Il y a 44 mins

Qui décide des règles du Bitcoin ? Le BIP-110 déclenche une divergence de gouvernance

链捕手Il y a 44 mins

Trading

Spot
活动图片