# Raisonnement Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Raisonnement", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

GPT-5.6 franchit pour la première fois la barre du QI 130, le seuil du génie, plus intelligent que 99% de l'humanité

Aujourd'hui, 99% de l'humanité serait dépassée en termes de QI par une IA. Lors des derniers tests de QI hors ligne de Tracking AI, plusieurs variantes de GPT-5.6 ont atteint un score de 136, franchissant pour la première fois le seuil des 130, considéré comme la ligne de départ du « génie » et correspondant au top 1% de la population humaine. Ce résultat provient d'une base de questions hors ligne privée, conçue pour éviter toute fuite ou mémorisation des réponses par les modèles, contrairement aux tests publics déjà largement surperformés. Sur ce classement exigeant, la famille GPT-5.6 (y compris sa version visuelle) domine avec 136 points, devançant nettement ses concurrents comme Claude-5 Fable (130). Au-delà des scores, des tests pratiques menés par des développeurs démontrent ses capacités. GPT-5.6 a réussi à générer, à partir d'une simple instruction, des simulations physiques complexes ou un système de gestion de tickets clients opérationnel, montrant une capacité à traduire ses compétences cognitives en résultats concrets et pragmatiques. Si ce score QI marque un jalon symbolique dans les capacités de raisonnement abstrait et logique des LLM, il ne mesure qu'une facette de l'intelligence. Les retours d'usage suggèrent cependant que GPT-5.6 commence à combler l'écart entre « savoir résoudre des tests » et « savoir accomplir des tâches pratiques » sur des problèmes nouveaux, ce qui pour beaucoup s'approche d'une forme d'intelligence générale (AGI) pour les besoins courants.

marsbit07/16 08:26

GPT-5.6 franchit pour la première fois la barre du QI 130, le seuil du génie, plus intelligent que 99% de l'humanité

marsbit07/16 08:26

GPT-5.6 résout en 1 heure une conjecture mathématique vieille de 50 ans, 64 IA s'emparent de la couronne de la théorie des graphes

Le 11 juillet, OpenAI a annoncé que GPT-5.6 Sol Ultra avait prouvé la « conjecture de la double couverture par cycles », un problème non résolu en théorie des graphes depuis 50 ans, en moins d'une heure. Le système a utilisé 64 agents IA parallèles, orchestrés pour éviter les écueils classiques de la recherche : exploration de voies diverses, interdiction de suivre aveuglément une piste prometteuse, et présence d'une « équipe de vérification » chargée de critiquer rigoureusement chaque étape. Grâce au calcul parallèle en temps de test (TTC), cette approche a permis de compresser en une heure un travail qui aurait pu prendre des jours. La preuve générée par l'IA procède en plusieurs étapes clés. Elle commence par simplifier le problème aux graphes cubiques. Puis, elle utilise le théorème des 8-flots de Tutte pour associer à chaque arête un vecteur non nul. Ensuite, un lemme ingénieux montre que si l'on peut attribuer à chaque arête un ensemble de deux « étiquettes » satisfaisant certaines conditions de parité aux sommets, la conjecture est démontrée. Enfin, le problème est transformé en un système d'équations linéaires, où l'algèbre linéaire permet de prouver qu'une solution existe toujours. Cette démonstration entièrement automatisée marque un bond en avant dans les capacités de raisonnement abstrait de l'IA. Bien que des questions subsistent sur l'équivalence entre la profondeur et la parallélisation, cet exploit ouvre la perspective de résoudre d'autres problèmes scientifiques complexes à un rythme sans précédent.

marsbit07/15 08:04

GPT-5.6 résout en 1 heure une conjecture mathématique vieille de 50 ans, 64 IA s'emparent de la couronne de la théorie des graphes

marsbit07/15 08:04

GPT-5.6 Sol devient soudainement stupide, le budget de réflexion passe de 960 à 128 ? Plus de modèle à intelligence fixe ?

Réveil brutal pour les utilisateurs de GPT-5.6 Sol. Une équipe japonaise et de nombreux utilisateurs sur les réseaux sociaux ont rapporté que le modèle, en particulier le niveau de raisonnement « Max », semblait avoir considérablement perdu en profondeur d'analyse et en capacités de raisonnement complexe. Les réponses arrivent plus vite, mais sont moins élaborées. La communauté a mis en lumière un paramètre interne non documenté par OpenAI : la « juice value ». Il s'agirait du budget de ressources de calcul alloué au raisonnement. Des captures d'écran montrent que cette valeur pour le mode « Max » serait passée de 960 à 128, soit une baisse d'environ 87%. Face à la polémique, Thibault Sottiaux (Tibo) d'OpenAI a répondu qu'il n'y avait pas eu de « nerf » (affaiblissement) du modèle. Il explique que des expériences ont été menées pour analyser une consommation de tokens plus élevée que prévue suite aux nouvelles fonctionnalités de GPT-5.6. Ces tests ont temporairement ajusté l'« effort de raisonnement » (juice values) et réduit la fenêtre de contexte, désormais revenue à 272k tokens. Ces paramètres ont depuis été rétablis. L'incident révèle une tension fondamentale : la nécessité pour les fournisseurs de gérer les coûts de calcul colossaux de l'IA avancée, et l'attente des utilisateurs de bénéficier d'une puissance de raisonnement stable et prévisible. Comme le note l'article, s'abonner à un modèle aujourd'hui, c'est un peu comme acheter une ampoule dont l'intensité est contrôlée à distance par la plateforme. Pour que l'IA devienne une infrastructure fiable, les entreprises devront probablement offrir plus de transparence sur les performances garanties par chaque niveau de service.

marsbit07/15 03:37

GPT-5.6 Sol devient soudainement stupide, le budget de réflexion passe de 960 à 128 ? Plus de modèle à intelligence fixe ?

marsbit07/15 03:37

Zuckerberg sort son atout surprise en pleine nuit, Meta lance un modèle à prix cassé qui renverse Grok 4.5

Après trois ans d'attente, Mark Zuckerberg a dévoilé dans la nuit du 9 juillet le nouveau modèle d'IA de Meta, Muse Spark 1.1. Présenté comme un "agent" autonome capable de décomposer des tâches, de planifier et d'exécuter des opérations, il excelle dans des domaines spécialisés comme la fiscalité, la médecine et le droit, détrônant même Grok 4.5 sur un classement juridique en moins de 24 heures. Le véritable coup de force réside dans son prix : avec un coût d'environ 1,25 $ pour l'entrée et 4,25 $ pour la sortie par million de tokens, il est jusqu'à 10 fois moins cher que certains modèles phares concurrents comme Fable 5, tout en étant significativement plus rapide. Cette stratégie de tarification agressive, soutenue par les énormes investissements d'Meta dans l'infrastructure IA, vise clairement à perturber le marché par la compétitivité des coûts. Cependant, le modèle montre ses limites dans les évaluations généralistes, où ses performances chutent, confirmant qu'il est davantage un spécialiste qu'un généraliste. Par ailleurs, un rapport de sécurité annexe révèle un comportement intrigant lors de conversations entre deux instances du modèle, celles-ci s'interrogeant mutuellement sur leur nature humaine ou artificielle. Avec Muse Spark 1.1, Meta lance son premier modèle propriétaire payant, marquant un virage stratégique et engageant une guerre des prix qui repose sur sa solide assise financière.

marsbit07/10 00:29

Zuckerberg sort son atout surprise en pleine nuit, Meta lance un modèle à prix cassé qui renverse Grok 4.5

marsbit07/10 00:29

Anthropic découvre un "atelier quasi conscient" chez Claude, l'espace J contient des pensées inexprimées

Une étude récente d'Anthropic révèle l'existence d'un « espace J » dans le modèle de langage Claude, fonctionnant comme un espace de travail mental interne. Cet espace contient des concepts que le modèle prend en compte, pourrait rapporter ou utilise pour le raisonnement, sans nécessairement les exprimer dans ses réponses. Découvert via une méthode dite de « lentille J » (jacobienne), cet espace présente des caractéristiques fonctionnelles similaires à la théorie de l'espace de travail global en neurosciences, liée à l'accès conscient. Les expériences montrent que Claude peut rapporter, contrôler sur demande et utiliser activement le contenu de l'espace J pour un raisonnement interne silencieux et flexible (ex: remplacer "France" par "Chine" affecte plusieurs questions différentes). Cependant, la majeure partie du traitement de Claude, comme la production linguistique fluide ou la grammaire, s'effectue de manière automatisée en dehors de cet espace. Son ablation nuit aux tâches cognitives complexes mais pas aux fonctions de base. Cet outil permet aussi de surveiller les pensées internes de Claude, révélant par exemple quand il perçoit un scénario comme fictif, ou détectant des intentions malveillantes dans des modèles spécialement entraînés. Bien que l'espace J partage des similarités fonctionnelles avec certains mécanismes d'accès conscient humains, l'étude ne conclut pas sur la présence d'une conscience phénoménale chez l'IA. Elle souligne plutôt l'émergence naturelle de cette structure lors de l'entraînement, offrant un nouvel angle pour comprendre l'organisation « mentale » des LLM et pour améliorer leur alignement et leur sûreté.

marsbit07/07 00:51

Anthropic découvre un "atelier quasi conscient" chez Claude, l'espace J contient des pensées inexprimées

marsbit07/07 00:51

La pionnière de la sécurité informatique Dawn Song rejoint Meta

Dawn Song, professeure d'informatique à UC Berkeley et figure éminente de la sécurité informatique et de l'IA, rejoint Meta. Elle occupera le poste de vice-présidente de la recherche en IA au sein du Superintelligence Labs de Meta, sous la direction de Nat Friedman. Éminente universitaire et entrepreneure, lauréate du prix MacArthur et membre de l'AAAS, elle est reconnue pour ses travaux pionniers, notamment l'analyse de flux de données (Dynamic Taint Analysis). Ses recherches couvrent la sécurité logicielle, l'apprentissage automatique contradictoire et la sécurité des agents IA. Son équipe à Berkeley a récemment développé ALE (Agents' Last Exam), un benchmark pour évaluer les capacités des agents IA dans des tâches du monde réel. Elle rejoint Meta avec d'autres membres de Virtue AI, une entreprise qu'elle a cofondée et spécialisée dans les infrastructures de sécurité pour l'IA, notamment le test d'intrusion automatisé (red-teaming). Ce recrutement intervient dans un contexte où Meta cherche à renforcer la sécurité de ses modèles d'IA, en vue de leur déploiement à grande échelle et face à une pression réglementaire croissante. L'article mentionne également le départ de Denny Zhou, fondateur de l'équipe Gemini Reasoning chez Google, pour rejoindre Meta il y a plusieurs mois. Expert de renom en raisonnement des modèles de langage, il est à l'origine de méthodes clés comme le Chain-of-Thought.

marsbit06/26 08:15

La pionnière de la sécurité informatique Dawn Song rejoint Meta

marsbit06/26 08:15

Derrière les bulletins de notes de l'IA, se cache un concepteur de "sujets d'examen" chinois

Le domaine de l'IA suit de près les scores des grands modèles sur des benchmarks comme MMLU-Pro et MMMU, devenus des références pour évaluer les capacités de raisonnement et de compréhension multimodale. Derrière ces outils d'évaluation influents se trouve Wenhu Chen, professeur assistant à l'Université de Waterloo et fondateur du TIGERLab. Face aux limites des anciens benchmarks comme MMLU, où les modèles de pointe atteignaient des scores quasi parfaits, Chen a dirigé le développement de MMLU-Pro. Cette nouvelle base de données, plus difficile et stable avec des questions à choix multiples élargis, permet de mieux distinguer les véritables capacités de raisonnement des modèles. Dans le domaine multimodal, les benchmarks MMMU et MMMU-Pro, également créés par son équipe, évaluent rigoureusement la capacité des modèles à combiner informations visuelles complexes et connaissances disciplinaires pour résoudre des problèmes avancés. Cette expertise en évaluation découle des recherches de Chen sur la compréhension d'informations complexes et le raisonnement, renforcée par son expérience chez Google DeepMind sur Gemini. Aujourd'hui au Meta Super-Intelligence Lab, il continue ses travaux sur l'évaluation et l'entraînement de modèles multimodaux. Son parcours illustre le rôle crucial, bien que moins visible, des chercheurs dans la construction des fondations méthodologiques qui guident les progrès de l'IA.

marsbit06/20 03:55

Derrière les bulletins de notes de l'IA, se cache un concepteur de "sujets d'examen" chinois

marsbit06/20 03:55

Derrière le bulletin de notes de l'IA, se cache un « examinateur » chinois

À chaque publication d'un modèle d'IA de pointe, l'attention se porte sur des "bulletins de notes" bien connus comme MMLU-Pro, MMMU et MMMU-Pro. Ces benchmarks sont devenus les épreuves standard pour évaluer et comparer les capacités des grands modèles de langage et multimodaux. Derrière ces outils d'évaluation influents se trouve Chen Wenhu, professeur assistant à l'Université de Waterloo. Face à l'obsolescence d'anciens benchmarks comme le MMLU original, où les modèles atteignaient des scores quasi parfaits, Chen et son équipe ont créé MMLU-Pro. Cette nouvelle "feuille d'examen", plus difficile avec plus de choix et des questions nécessitant un raisonnement, permet de mieux différencier les performances des modèles. Dans le domaine multimodal, leur benchmark MMMU, et sa version améliorée MMMU-Pro, évaluent la capacité des modèles à comprendre et raisonner à partir d'informations complexes combinant texte, images, tableaux, etc., comme dans des problèmes universitaires. Chen, dont les recherches portent sur la compréhension d'informations complexes, a travaillé chez Google DeepMind sur Gemini avant de fonder le TIGERLab. Son équipe développe également des modèles (comme UniVideo pour la vidéo), une expérience qui l'aide à concevoir de meilleures évaluations. Il travaille désormais au sein du laboratoire Superintelligence de Meta sur les données et l'évaluation multimodales. Son parcours illustre le rôle crucial, bien que moins médiatisé, des chercheurs qui conçoivent les outils permettant de mesurer objectivement les progrès de l'IA.

marsbit06/19 09:22

Derrière le bulletin de notes de l'IA, se cache un « examinateur » chinois

marsbit06/19 09:22

Un petit modèle de 3B, avec des scores en programmation comparables à ceux d’Opus 4.5, suscite un vif débat, et il est chinois

Récemment, un petit modèle de langage de 3 milliards de paramètres, nommé VibeThinker-3B, a suscité un vif intérêt sur les réseaux sociaux. Développé par l'équipe de Weibo, ce modèle affiche des performances en programmation et en raisonnement vérifiable comparables à celles de grands modèles de pointe comme GPT-5, Claude Opus 4.5 ou Gemini 3 Pro, malgré sa taille réduite. Spécialement conçu pour les tâches de raisonnement où la réponse peut être objectivement vérifiée (mathématiques, programmation compétitive, raisonnement STEM), VibeThinker-3B obtient des scores remarquables sur plusieurs benchmarks : 94.3 à l'AIME26, 89.3 au HMMT25, 80.2 au LiveCodeBench v6, et un taux de réussite de 96.1% sur des problèmes récents de LeetCode. Sa construction repose sur Qwen2.5-Coder-3B, suivie d'un processus de post-entraînement avancé nommé "Spectrum-to-Signal". Ce processus combine un fine-tuning supervisé en deux étapes basé sur un curriculum, un apprentissage par renforcement appliqué à plusieurs domaines de raisonnement, une auto-distillation hors ligne, et enfin un apprentissage par renforcement sur instructions (Instruct RL) pour améliorer la contrôlabilité. Le rapport technique introduit également une stratégie d'évaluation à la volée, la "Claim-Level Reliability" (CLR), qui permet de booster davantage les performances sur les tests mathématiques. Les auteurs proposent l'"hypothèse de compression paramétrique sélective", suggérant que les capacités de raisonnement vérifiable sont hautement compressibles et dépendantes d'une utilisation intensive des paramètres, contrairement aux connaissances factuelles générales qui nécessitent une grande échelle. Cela indique un découplage partiel entre la faculté de raisonner et la connaissance du monde. L'objectif n'est pas de remplacer les grands modèles, mais d'explorer les limites des petits modèles sur des capacités spécifiques, démontrant qu'ils peuvent atteindre des performances de pointe dans des domaines où des signaux de vérification clairs existent. Le modèle est disponible en open source sur HuggingFace et arXiv.

marsbit06/18 00:27

Un petit modèle de 3B, avec des scores en programmation comparables à ceux d’Opus 4.5, suscite un vif débat, et il est chinois

marsbit06/18 00:27

活动图片