# Référence Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Référence", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

Premier ensemble de données d'entraînement Doc2Repo de longue portée, les agents de code vont au-delà de la correction de bugs pour commencer à créer des dépôts

L'équipe du Gaoling Institute of Artificial Intelligence de l'Université Renmin de Chine a récemment publié DeNovoSWE, le premier grand ensemble de données d'entraînement pour des tâches de génération de code à long terme au niveau du dépôt. Contrairement aux benchmarks précédents centrés sur la correction de bogues (comme SWE-bench), DeNovoSWE se concentre sur la tâche complexe de génération d'un dépôt logiciel complet et exécutable à partir de zéro, en se basant uniquement sur une documentation détaillée. La méthode utilise une approche "Diviser pour régner" et un mécanisme "Critique & Réparation" automatisé par agents multiples pour construire 4 818 instances de tâches de haute qualité. Elle décompose un dépôt cible en "capacités" fondamentales, génère une documentation structurée alignée sur les évaluations (tests), et assure l'absence de fuite d'informations depuis le code source original. Les expériences montrent que l'entraînement avec DeNovoSWE améliore considérablement les performances des agents de code. Par exemple, le modèle Qwen3-30B-A3B-Instruct a vu son taux de réussite passer de 5.8% à 47.2% sur le benchmark BeyondSWE-Doc2Repo. Cela démontre que des données spécifiquement conçues pour les tâches longues et complexes de génération de dépôts sont essentielles pour faire évoluer les agents de code du rôle de mainteneur à celui d'architecte logiciel capable de planifier et d'implémenter des projets complets.

marsbit06/25 08:55

Premier ensemble de données d'entraînement Doc2Repo de longue portée, les agents de code vont au-delà de la correction de bugs pour commencer à créer des dépôts

marsbit06/25 08:55

Le Phénomène Inattendu Japonais de l'IA : Comment un Petit Modèle de 7B Défie Fable et Mythos ?

En juin 2026, Sakana AI, basée à Tokyo, a présenté Fugu, un modèle d'IA qui défie les attentes. Malgré sa taille modeste de seulement 7 milliards de paramètres, son système "Fugu Ultra" obtient des scores élevés (73,7 sur SWE-Bench Pro et 82,1 sur TerminalBench 2.1), surpassant des géants comme GPT-5.5 et Claude Opus 4.8. Son secret ? Fugu n'est pas un modèle monolithique, mais un "chef d'orchestre" (RL Conductor). Ce petit modèle utilise l'apprentissage par renforcement pour analyser une tâche utilisateur, puis la décompose et la route dynamiquement vers un pool d'agents spécialisés utilisant les meilleurs modèles externes (GPT, Gemini, Claude, etc.). Il valide et synthétise leurs réponses. Cette architecture d'orchestration multi-agents permet à Fugu d'exceller dans des tâches complexes et multi-étapes comme la revue de code approfondie, les tests de sécurité complets ou la stabilité dans les conversations longues, tout en économisant des tokens. Cette approche représente une voie d'innovation "asymétrique" pour le Japon, confronté à des contraintes de calcul et de données. Plutôt que de concurrencer frontalement les modèles géants, Sakana AI crée un système intelligent pour exploiter au mieux les capacités existantes. Cependant, cette force est aussi sa faiblesse : Fugu dépend fortement des API des grands modèles américains, ce qui pose des risques de stabilité, de coût et de latence. De plus, ses comparaisons avec des modèles de pointe sous restrictions à l'export (comme Fable 5) sont basées sur des rapports publics et non sur des tests directs, suscitant des débats. En résumé, Fugu est une innovation système brillante qui change la donne pour les workflows complexes, mais ses utilisateurs doivent être conscients de ses dépendances sous-jacentes.

marsbit06/22 11:23

Le Phénomène Inattendu Japonais de l'IA : Comment un Petit Modèle de 7B Défie Fable et Mythos ?

marsbit06/22 11:23

Derrière les bulletins de notes de l'IA, se cache un concepteur de "sujets d'examen" chinois

Le domaine de l'IA suit de près les scores des grands modèles sur des benchmarks comme MMLU-Pro et MMMU, devenus des références pour évaluer les capacités de raisonnement et de compréhension multimodale. Derrière ces outils d'évaluation influents se trouve Wenhu Chen, professeur assistant à l'Université de Waterloo et fondateur du TIGERLab. Face aux limites des anciens benchmarks comme MMLU, où les modèles de pointe atteignaient des scores quasi parfaits, Chen a dirigé le développement de MMLU-Pro. Cette nouvelle base de données, plus difficile et stable avec des questions à choix multiples élargis, permet de mieux distinguer les véritables capacités de raisonnement des modèles. Dans le domaine multimodal, les benchmarks MMMU et MMMU-Pro, également créés par son équipe, évaluent rigoureusement la capacité des modèles à combiner informations visuelles complexes et connaissances disciplinaires pour résoudre des problèmes avancés. Cette expertise en évaluation découle des recherches de Chen sur la compréhension d'informations complexes et le raisonnement, renforcée par son expérience chez Google DeepMind sur Gemini. Aujourd'hui au Meta Super-Intelligence Lab, il continue ses travaux sur l'évaluation et l'entraînement de modèles multimodaux. Son parcours illustre le rôle crucial, bien que moins visible, des chercheurs dans la construction des fondations méthodologiques qui guident les progrès de l'IA.

marsbit06/20 03:55

Derrière les bulletins de notes de l'IA, se cache un concepteur de "sujets d'examen" chinois

marsbit06/20 03:55

Derrière le bulletin de notes de l'IA, se cache un « examinateur » chinois

À chaque publication d'un modèle d'IA de pointe, l'attention se porte sur des "bulletins de notes" bien connus comme MMLU-Pro, MMMU et MMMU-Pro. Ces benchmarks sont devenus les épreuves standard pour évaluer et comparer les capacités des grands modèles de langage et multimodaux. Derrière ces outils d'évaluation influents se trouve Chen Wenhu, professeur assistant à l'Université de Waterloo. Face à l'obsolescence d'anciens benchmarks comme le MMLU original, où les modèles atteignaient des scores quasi parfaits, Chen et son équipe ont créé MMLU-Pro. Cette nouvelle "feuille d'examen", plus difficile avec plus de choix et des questions nécessitant un raisonnement, permet de mieux différencier les performances des modèles. Dans le domaine multimodal, leur benchmark MMMU, et sa version améliorée MMMU-Pro, évaluent la capacité des modèles à comprendre et raisonner à partir d'informations complexes combinant texte, images, tableaux, etc., comme dans des problèmes universitaires. Chen, dont les recherches portent sur la compréhension d'informations complexes, a travaillé chez Google DeepMind sur Gemini avant de fonder le TIGERLab. Son équipe développe également des modèles (comme UniVideo pour la vidéo), une expérience qui l'aide à concevoir de meilleures évaluations. Il travaille désormais au sein du laboratoire Superintelligence de Meta sur les données et l'évaluation multimodales. Son parcours illustre le rôle crucial, bien que moins médiatisé, des chercheurs qui conçoivent les outils permettant de mesurer objectivement les progrès de l'IA.

marsbit06/19 09:22

Derrière le bulletin de notes de l'IA, se cache un « examinateur » chinois

marsbit06/19 09:22

Un petit modèle de 3B, avec des scores en programmation comparables à ceux d’Opus 4.5, suscite un vif débat, et il est chinois

Récemment, un petit modèle de langage de 3 milliards de paramètres, nommé VibeThinker-3B, a suscité un vif intérêt sur les réseaux sociaux. Développé par l'équipe de Weibo, ce modèle affiche des performances en programmation et en raisonnement vérifiable comparables à celles de grands modèles de pointe comme GPT-5, Claude Opus 4.5 ou Gemini 3 Pro, malgré sa taille réduite. Spécialement conçu pour les tâches de raisonnement où la réponse peut être objectivement vérifiée (mathématiques, programmation compétitive, raisonnement STEM), VibeThinker-3B obtient des scores remarquables sur plusieurs benchmarks : 94.3 à l'AIME26, 89.3 au HMMT25, 80.2 au LiveCodeBench v6, et un taux de réussite de 96.1% sur des problèmes récents de LeetCode. Sa construction repose sur Qwen2.5-Coder-3B, suivie d'un processus de post-entraînement avancé nommé "Spectrum-to-Signal". Ce processus combine un fine-tuning supervisé en deux étapes basé sur un curriculum, un apprentissage par renforcement appliqué à plusieurs domaines de raisonnement, une auto-distillation hors ligne, et enfin un apprentissage par renforcement sur instructions (Instruct RL) pour améliorer la contrôlabilité. Le rapport technique introduit également une stratégie d'évaluation à la volée, la "Claim-Level Reliability" (CLR), qui permet de booster davantage les performances sur les tests mathématiques. Les auteurs proposent l'"hypothèse de compression paramétrique sélective", suggérant que les capacités de raisonnement vérifiable sont hautement compressibles et dépendantes d'une utilisation intensive des paramètres, contrairement aux connaissances factuelles générales qui nécessitent une grande échelle. Cela indique un découplage partiel entre la faculté de raisonner et la connaissance du monde. L'objectif n'est pas de remplacer les grands modèles, mais d'explorer les limites des petits modèles sur des capacités spécifiques, démontrant qu'ils peuvent atteindre des performances de pointe dans des domaines où des signaux de vérification clairs existent. Le modèle est disponible en open source sur HuggingFace et arXiv.

marsbit06/18 00:27

Un petit modèle de 3B, avec des scores en programmation comparables à ceux d’Opus 4.5, suscite un vif débat, et il est chinois

marsbit06/18 00:27

Anthropic met en garde contre l’IA récursive, la nouvelle société de Tian Yuan Dong vient de franchir la « première étape »

Il y a quelques jours, Anthropic a publié un article intitulé "When AI Builds Itself", déclenchant des discussions sur l'« amélioration récursive de soi » – des systèmes d'IA conçus pour développer de manière autonome leurs versions successives. Simultanément, Recursive Superintelligence, une startup cofondée par Tianyuandong (ex-Meta FAIR), a émergé de son mode furtif et a présenté ses premiers résultats techniques : un système d'automatisation de la recherche en IA. Intitulé "First Steps Toward Automated AI Research", ce système vise à automatiser la boucle classique de la recherche (idée, code, expérience, analyse). Il a été évalué sur trois références, établissant de nouveaux records. Sur NanoChat Autoresearch, il a amélioré la perte de validation d'un petit modèle de langage. Sur NanoGPT Speedrun, il a réduit le temps d'entraînement nécessaire pour atteindre une perte cible (de 79,7 à 77,5 secondes). Enfin, sur SOL-ExecBench (optimisation de noyaux GPU), il a augmenté le score global de 0,699 à 0,754, se rapprochant de la limite théorique du matériel. Fondée fin 2025/début 2026, Recursive a levé 650 millions de dollars avec une valorisation de 4,65 milliards. Son objectif est d'accélérer les progrès de l'IA en permettant à l'IA d'améliorer récursivement ses propres capacités de recherche. Cette avancée illustre l'émergence d'un nouveau paradigme de recherche, tandis qu'Anthropic met en garde contre les risques potentiels de cette trajectoire et appelle à une coordination mondiale. Recursive reconnaît qu'il ne s'agit que d'un premier pas, les défis comme la prévention de la triche aux indicateurs restant majeurs pour une application à des problèmes scientifiques ouverts.

marsbit06/12 04:17

Anthropic met en garde contre l’IA récursive, la nouvelle société de Tian Yuan Dong vient de franchir la « première étape »

marsbit06/12 04:17

« Je n’ai plus besoin de meilleurs modèles » : les réactions contrastées face à l’IA sur un post Reddit viral

Anthropic a récemment lancé Claude Fable 5, son premier modèle de niveau Mythos accessible au public. Bien qu'il affiche des performances record sur le benchmark SWE-Bench Pro, dépassant largement ses prédécesseurs, la réaction des utilisateurs sur Reddit est mitigée. Un post populaire sur r/artificial, intitulé "Claude Fable m'a fait réaliser que je n'ai pas besoin d'un meilleur modèle", résume un sentiment répandu : la fatigue face aux nouvelles versions. De nombreux utilisateurs estiment que les modèles précédents comme Opus 4.8 sont déjà "suffisants" pour leurs besoins quotidiens, évoquant un rapport coût-bénéfice défavorable, le prix de Fable 5 étant presque le double. Le principal point de critique concerne les "garde-fous" de sécurité de Fable 5. Les utilisateurs se plaignent que le modèle refuse trop fréquemment des requêtes liées à la sécurité ou à la programmation, les renvoyant vers Opus, ce qui nuit à son utilité pratique, surtout pour les abonnés payants. Cependant, une minorité d'utilisateurs aux tâches complexes (simulations physiques, code à très long contexte) font l'éloge de Fable 5, décrivant une différence de capacité "nuit et jour" pour leurs projets exigeants. Le débat soulève une question plus large : un fossé se creuse-t-il entre les modèles de pointe accessibles au public et les versions encore plus puissantes réservées aux entreprises et gouvernements ? Alors que les benchmarks montrent une progression constante, la perception des utilisateurs suggère que pour la majorité, le "suffisamment bon" pourrait être déjà atteint, laissant les gains marginaux aux seuls cas d'usage extrêmes. L'avenir de Fable 5 dépendra des ajustements d'Anthropic sur la sécurité et de l'adoption par les utilisateurs spécialisés.

marsbit06/12 02:55

« Je n’ai plus besoin de meilleurs modèles » : les réactions contrastées face à l’IA sur un post Reddit viral

marsbit06/12 02:55

L'AGI n'est plus qu'à un pas de distance

En avril, Anthropic a dévoilé le modèle Mythos, capable d'identifier des milliers de vulnérabilités critiques, ce qui a secoué le secteur de la cybersécurité. Considéré trop dangereux pour être publié, il est resté confidentiel jusqu'à la mise en ligne récente de Fable 5, une version dotée de sécurités. La version non censurée, Mythos 5, n'est accessible qu'à environ 200 organismes strictement sélectionnés, comme la Maison Blanche. Les tests révèlent que Fable 5 surpasse largement ses concurrents (Claude Opus 4.8, GPT-5.5, Gemini 3.1 Pro) dans des benchmarks comme SWE-Bench Pro. Une démonstration avec Stripe a montré sa capacité à migrer 50 millions de lignes de code en un jour, démontrant une réelle « capacité d'agence à long terme ». Il ne s'agit plus d'un simple assistant réactif, mais d'un outil capable de planifier, d'exécuter et de corriger des tâches complexes de manière autonome. Selon les critères d'OpenAI, Fable 5 atteint le niveau 3 (Agent) et touche au niveau 4 (Innovateur). Le rythme des progrès laisse penser que le niveau 5 (Organisation, équivalent à l'AGI) pourrait être atteint d'ici 18 à 24 mois. Cette rapidité justifie les mesures de sécurité drastiques. Les rapports internes indiquent que Mythos 5 a atteint un niveau (CB-1) lui permettant théoriquement de guider la création d'armes biochimiques ou de générer des exploits pour des cyberattaques contre des infrastructures critiques. Pour le contenir, Anthropic a implémenté un mécanisme de « routage par rétrogradation silencieuse » (redirigeant les requêtes sensibles vers un modèle moins puissant) et une rétention obligatoire des données de 30 jours pour surveiller les abus. Anthropic facture Fable 5 à un prix élevé (10$/M de tokens en entrée, 50$/M en sortie), le rendant prohibitif pour les particuliers. Cette stratégie vise délibérément le marché B2B, où les entreprises sont prêtes à payer pour un gain de productivité radical et, surtout, pour une défense contre les cybermenaces avancées que seul un modèle comme Mythos 5 peut contrer. Ceci marque la fin de l'ère « gratuite » de l'IA grand public et consacre une division où la technologie la plus avancée devient un bien stratégique réservé aux applications commerciales et gouvernementales, accélérant potentiellement l'avènement des « entreprises à une personne » tout en posant des défis majeurs pour le marché du travail.

marsbit06/11 05:15

L'AGI n'est plus qu'à un pas de distance

marsbit06/11 05:15

De Hunyuan à l'IA de WeChat, le rythme lent de Tencent arrive au point de livraison

Le 8 juin 2026, la plateforme de développement WeChat a annoncé le lancement en bêta d'une nouvelle fonctionnalité nommée provisoirement "WeChat AI". Cet assistant IA intégré à l'écosystème WeChat permettra aux utilisateurs d'accéder et d'opérer directement des mini-programmes par conversation en langage naturel. Deux modes d'intégration sont proposés : un mode automatique où WeChat analyse le code source du mini-programme, et un mode développement pour une intégration plus personnalisée. Cette initiative représente une étape clé pour Tencent, qui cherche à intégrer ses capacités IA dans son application super-populaire. Ce déploiement s'appuie sur le modèle de langue Hunyuan de Tencent, classé deuxième en Chine pour ses capacités de base mais premier pour ses capacités applicatives et Agent. Ce choix reflète une stratégie délibérée de privilégier la stabilité et l'utilité pratique plutôt que la course aux paramètres, adaptée aux besoins d'un assistant qui exécutera des tâches critiques (commandes, paiements). L'écosystème des mini-programmes, avec 40 000 développeurs et un milliard d'utilisateurs actifs quotidiens, constitue un avantage unique pour WeChat AI. Le mode automatique vise à faciliter l'adoption massive par les petits développeurs. Cependant, cette approche soulève des questions sensibles : protection du code source, exposition des marques et répartition des flux, car l'IA pourrait "court-circuiter" l'interface des commerçants. Avant WeChat AI, l'application autonome Yuanbao a servi de test pour l'IA de Tencent. Elle a atteint plus de 114 millions d'utilisateurs mensuels pendant les fêtes du printemps 2026, mais son utilisation quotidienne a ensuite chuté, révélant les limites d'une application indépendante pour la fidélisation. L'intégration native dans WeChat vise à retenir les utilisateurs via des scénarios d'utilisation concrets. Pekka Ma, PDG de Tencent, a évoqué la vision de "homardiser" chaque mini-programme, les transformant en agents intelligents exécutant des tâches. Il a aussi reconnu la nécessité de concilier l'efficacité centralisée de l'IA avec la protection du trafic décentralisé des commerçants. Avec Hunyuan (couche technique), Yuanbao (validation produit) et WeChat AI (intégration finale), la feuille de route de Tencent est cohérente. Cependant, son impact réel dépendra de sa capacité à rassurer les développeurs sur la sécurité, à équilibrer les intérêts de l'écosystème et à garantir la fiabilité des opérations pour les utilisateurs. L'intégration dans WeChat marque un tournant dans la stratégie IA de Tencent, mais sa réussite reste à démontrer.

marsbit06/08 10:29

De Hunyuan à l'IA de WeChat, le rythme lent de Tencent arrive au point de livraison

marsbit06/08 10:29

活动图片