Présenté il y a 5 ans, un PPT qualifié de "non-sens" par un professeur du MIT a prédit la pensée centrale d'OpenAI o1 et o3

marsbitPublié le 2026-08-17Dernière mise à jour le 2026-08-17

Résumé

Il y a cinq ans, Giambattista Parascandolo, aujourd'hui chercheur clé d'OpenAI sur les modèles de raisonnement, a présenté lors d'un entretien au MIT une vision qualifiée de "non-sens" par le comité. Son exposé proposait trois axes pour améliorer les capacités de raisonnement des réseaux de neurones : le "raisonnement ouvert" (où le modèle consacre plus de temps de calcul pour affiner sa réponse), l'utilisation du langage comme support de raisonnement pour guider la planification, et la capacité d'un agent à manipuler ses propres états internes pour s'auto-améliorer. Ces idées préfiguraient les principes des modèles de raisonnement actuels comme OpenAI o1 et o3, ainsi que des concepts tels que le raisonnement en chaîne et les workflows d'agents. Après cet échec universitaire, Parascandolo a rejoint OpenAI, où il a contribué au développement de GPT-4, puis aux recherches fondamentales derrière o1 et o3, validant ainsi sa vision pionnière.

Le monde de l'IA ne manque pas de ragots.

Cette fois, le protagoniste est Giambattista Parascandolo, un chercheur important dans le domaine des modèles de raisonnement chez OpenAI.

En 2020, il s'est rendu au MIT pour un entretien pour un poste de professeur et a donné une présentation sur l'utilisation de GPT pour le raisonnement. Résultat, la plupart des membres du comité de sélection ont qualifié cette approche de « non-sens » (nonsense).

https://x.com/turingbook/status/2084003612687249836?s=20

Le type a carrément joué cartes sur table, en écrivant cette expérience sur sa page personnelle et en y ajoutant la description du rapport de l'époque ainsi que des liens vers les diapositives.

https://sites.google.com/view/giambattista-parascandolo/home

Que contenait ce rapport qualifié de « non-sens » ?

Le site web du MIT indique que le thème de cette présentation était de savoir comment les réseaux de neurones artificiels peuvent dépasser la distribution d'entraînement et acquérir des capacités de généralisation et de planification plus proches de celles de l'homme.

Parascandolo pense que les humains sont capables de réorganiser leurs connaissances existantes, d'identifier des invariants clés, de construire des modèles abstraits et d'effectuer une planification à long terme. Les réseaux de neurones artificiels ont encore une grande marge de progression dans ces domaines.

À la fin de sa présentation, il propose trois futures pistes de recherche : le raisonnement ouvert dans les réseaux de neurones, les degrés de liberté encore inexplorés dans les réseaux de neurones artificiels, et l'utilisation du langage comme support de raisonnement dans l'apprentissage par renforcement pour améliorer l'efficacité de l'échantillonnage.

Le concept clé parmi ceux-ci est celui de « raisonnement ouvert ».

Parascandolo le définit comme suit : le modèle peut consacrer plus de temps et de calculs pour corriger continuellement sa réponse. Plus le problème est difficile, plus le modèle devrait réfléchir à plusieurs reprises, et ces calculs supplémentaires doivent se traduire par de meilleurs résultats.

Cela ressemble déjà beaucoup à l'extension du calcul au moment du raisonnement d'aujourd'hui.

Le Transformer standard de l'époque avait une profondeur de réseau fixe, la quantité de calcul direct subie par chaque token était fondamentalement déterminée, mais la difficulté d'un problème n'avait pas de relation stable avec la longueur de l'entrée. Un problème pouvait être très long, mais sa réponse très simple. Un autre problème ne pouvait avoir qu'une phrase, mais nécessiter plusieurs tours de décomposition et de vérification.

Le RNN semblait plus adapté à ce type de tâche. Il pouvait fonctionner de manière répétée et, en théorie, obtenir un temps de réflexion de longueur arbitraire. Cependant, la courbe présentée par Parascandolo dans son PPT montrait que les RNN n'étaient généralement performants que dans le voisinage du nombre d'étapes de raisonnement vu lors de l'entraînement. Continuer à augmenter le nombre de cycles pouvait même entraîner une baisse de la précision.

Cela signifiait qu'augmenter la quantité de calculs n'était que la première étape ; le modèle devait également apprendre à utiliser ces calculs.

La planification multi-étapes la plus efficace à l'époque reposait largement sur la prédiction-contrôle de modèle et la recherche arborescente de Monte-Carlo. Le réseau neuronal était chargé de prédire l'environnement ou d'évaluer la valeur, tandis qu'un algorithme de recherche externe était chargé d'explorer les chemins futurs. Parascandolo souhaitait intégrer davantage les capacités de raisonnement à long terme dans les réseaux de neurones.

Sa deuxième idée était de faire du langage un support de raisonnement.

Parascandolo a pris l'exemple du jeu classique *Montezuma's Revenge*. Un agent d'apprentissage par renforcement formé à partir de zéro doit essayer un grand nombre de combinaisons d'états et d'actions. De nombreuses actions correctes ne sont pas complexes en elles-mêmes ; ce qui manque réellement à l'agent est un jugement sur « quelle action est plus raisonnable ».

GPT a déjà absorbé une grande quantité de connaissances sur le monde à partir de textes. Le langage peut aider le modèle à décrire l'environnement, à comprendre les objectifs, à décomposer les tâches et à générer des plans de haut niveau, tout en réduisant considérablement l'espace de recherche.

Aujourd'hui, cette approche évoque facilement les chaînes de pensée, la planification linguistique et les flux de travail des agents.

La troisième piste de recherche proposée par Parascandolo était que les systèmes d'IA pouvaient réinitialiser la tâche, revenir à n'importe quel état mémorisé, construire des scénarios contrefactuels, et même ajuster le temps, la gravité et les résultats d'observation dans le simulateur. Le système pouvait même directement lire, copier et modifier ses propres valeurs d'activation et les poids de son réseau neuronal.

Cela équivalait à intégrer le processus d'apprentissage lui-même dans l'espace d'action de l'agent. Il pouvait s'engager dans une pratique délibérée, générer des scénarios d'entraînement spéciaux, transférer des connaissances existantes, et réapprendre à partir des trajectoires d'échec.

Le PPT d'il y a cinq ans avait presque esquissé la voie des modèles de raisonnement actuels.

Nous avons également déterré un blog qu'il avait écrit en juin 2021, dont le titre était *« Rétropropagation, évolution et le malentendu des "deux chiens" »*.

Cet article réfutait principalement l'argument selon lequel « les réseaux de neurones ont besoin de masses de données, ils ne ressemblent donc pas au cerveau humain ».

Parascandolo pensait que le fait que les humains apprennent à reconnaître les chiens après en avoir vu seulement quelques-uns ne signifie pas qu'ils n'ont pas accumulé d'expérience auparavant. La longue évolution a imprégné l'expérience du monde de nos ancêtres dans la structure et les biais inductifs du cerveau humain.

Selon cette perspective, le pré-entraînement à grande échelle des réseaux de neurones peut être comparé à l'évolution biologique, tandis que le réglage fin du modèle et l'apprentissage en contexte sont plus proches de l'apprentissage au cours de la vie d'un individu. GPT-3 a lu beaucoup plus de texte que n'importe quel individu, mais son pré-entraînement a joué le rôle de compresser une expérience massive et de façonner une capacité d'apprentissage efficace. Par conséquent, on ne peut pas directement comparer toutes les données de pré-entraînement du modèle avec le petit nombre d'échantillons d'apprentissage d'un individu après sa naissance.

Cette compréhension signifie également que continuer à augmenter les données et la puissance de calcul pourrait encore apporter des améliorations significatives. Il comparait les rôles qu'ils jouent, sans considérer que le mécanisme de la descente de gradient et celui de l'évolution biologique étaient identiques.

Qui est ce type ?

Ce type est assez discret ; son dernier post sur X remonte à novembre 2024, date à laquelle il recrutait deux ingénieurs de recherche (RE) et ingénieurs logiciels (SWE) pour o1.

Selon sa page personnelle, les recherches de Parascandolo ont toujours tourné autour de la généralisation, de la planification et du raisonnement.

En 2017, il a commencé son doctorat à l'Institut Max Planck pour les systèmes intelligents et à l'ETH Zurich, sous la direction de Bernhard Schölkopf et Thomas Hofmann. Sa thèse portait sur la généralisation hors distribution (OOD) dans l'apprentissage profond.

Pendant son doctorat, il a effectué un stage à Google X à Mountain View et à DeepMind à Londres. Le premier portait sur la recherche en conception automatisée sur des simulateurs à très grande échelle, et le second sur la recherche de division pour conquérir l'arbre de recherche de Monte-Carlo.

Après avoir obtenu son doctorat en septembre 2021, il a rejoint directement OpenAI. Il a d'abord intégré l'équipe d'apprentissage par renforcement dirigée par John Schulman, puis s'est tourné vers l'équipe algorithmique où se trouvait Mark Chen, avant de rejoindre l'équipe 🍓 (fraise) dirigée par Jerry Tworek. L'équipe fraise était le nom de code interne du projet o1.

En 2023, il a participé au développement de GPT-4 et a constitué une nouvelle équipe pour poursuivre les recherches sur le raisonnement. Il a ensuite participé aux recherches fondamentales d'OpenAI o1 et o3, promouvant l'extension de la modélisation des récompenses, la construction d'environnements et des algorithmes de raisonnement généraux. Une partie de la description de ces algorithmes est encore masquée par des blocs noirs.

Lors de cet entretien au MIT en 2020, Parascandolo n'a pas obtenu le poste de professeur ; il est allé chez OpenAI.

Quatre ans plus tard, il a contribué à construire o1.

La vie est toujours pleine de surprises.

Liens de référence :

https://x.com/giambattista92

https://sites.google.com/view/giambattista-parascandolo/home

https://gibipara92.github.io/2021/06/09/backprop-evolution-two-dogs.html

https://docs.google.com/presentation/d/1edd2GkAP31wNygaev3DO8gE1t2lgsx1z8TeVpBKqlYA/edit?slide=id.gc772610149_0_179#slide=id.gc772610149_0_179

Cet article provient du compte officiel WeChat "Machine Heart" (ID : almosthuman2014), auteur : Yang Wen

Cryptos en tendance

Questions liées

QQui est Giambattista Parascandolo et quel a été son rôle dans le développement de l'IA chez OpenAI ?

AGiambattista Parascandolo est un chercheur clé chez OpenAI, spécialisé dans les modèles de raisonnement. Il a contribué au développement de GPT-4 et a joué un rôle central dans les projets o1 et o3, en travaillant sur des algorithmes de raisonnement général, la modélisation des récompenses et la construction d'environnements.

QQuel était le sujet principal de la présentation de Parascandolo au MIT en 2020, et pourquoi a-t-elle été initialement critiquée ?

ALa présentation portait sur l'utilisation des réseaux de neurones pour atteindre une généralisation et des capacités de planification plus proches de celles des humains, en particulier via le 'raisonnement ouvert'. Elle a été critiquée et qualifiée de 'non-sens' par la plupart des professeurs du comité de recrutement du MIT, qui doutaient de la faisabilité de cette approche à l'époque.

QQu'est-ce que le 'raisonnement ouvert' (open-ended reasoning) selon Parascandolo, et en quoi ressemble-t-il aux modèles de raisonnement actuels ?

AParascandolo définissait le 'raisonnement ouvert' comme la capacité d'un modèle à consacrer plus de temps et de calculs pour réviser continuellement sa réponse. Plus un problème est difficile, plus le modèle devrait 'réfléchir' longtemps, transformant ce calcul supplémentaire en de meilleurs résultats. Cela préfigure directement les techniques modernes d'extension du calcul au moment de l'inférence, comme dans les modèles de raisonnement actuels.

QComment Parascandolo envisageait-il l'utilisation du langage comme support de raisonnement, et quelles technologies actuelles cela évoque-t-il ?

AIl proposait d'utiliser le langage comme un support interne pour le raisonnement, aidant le modèle à décrire l'environnement, à comprendre les objectifs, à décomposer les tâches et à générer des plans de haut niveau. Cette idée annonce directement des techniques contemporaines comme le 'chain-of-thought' (enchaînement de pensées), la planification par le langage et les flux de travail des agents IA.

QQuelle analogie Parascandolo a-t-il utilisée dans son blog de 2021 pour expliquer l'apprentissage des réseaux de neurones par rapport à l'apprentissage humain ?

ADans son blog, Parascandolo a comparé le pré-entraînement à grande échelle des réseaux de neurones à l'évolution biologique, qui compresse l'expérience massive des ancêtres en structures cérébrales. Le réglage fin (fine-tuning) et l'apprentissage en contexte (in-context learning) seraient alors plus analogues à l'apprentissage individuel au cours d'une vie. Cela justifie, selon lui, l'utilisation de vastes ensembles de données pour le pré-entraînement.

Lectures associées

Wall Street Morning Report : Les bénéfices du S&P affichent la plus forte croissance en 30 ans, Nvidia devient le 6ème actionnaire de SpaceX

**Résumé de l'article :** Les marchés américains ont clôturé en baisse vendredi, bien que l'indice Russell 2000 ait atteint un niveau record. La vente au détail américaine de juillet, en baisse inattendue, a renforcé les anticipations d'une pause dans le cycle de resserrement de la Fed en septembre. L'attention se porte cette semaine sur la vente aux enchères d'obligations américaines à 20 ans, un test pour les marchés obligataires alors que les rendements des obligations à long terme atteignent des sommets. Le S&P 500 a affiché une croissance bénéficiaire de 31% au T2, la plus forte hors récession depuis 1992, soutenant une réévaluation plus saine. Cependant, la durabilité des dépenses en capital liées à l'IA est réexaminée face aux goulots d'étranglement et à la hausse des taux. Les performances des actions technologiques ont été mitigées. Les valeurs du stockage (comme SanDisk) et des communications optiques ont bondi, tandis que Broadcom a chuté, affecté par des préoccupations concernant ses garanties dans le financement de l'IA. NVIDIA a révélé détenir environ 21 milliards de dollars d'actions SpaceX. AMD a progressé après une émission record d'obligations. L'IA reste un moteur, mais son récit évolue, l'accent étant mis sur les résultats vérifiables et le financement, avec un transfert des risques hors bilan. La demande de centres de données stimule également les secteurs de l'énergie. **Points saillants des actions :** SanDisk (+7,4%), Applied Optoelectronics (+15,5%), AMD (+6,5%), Broadcom (-5,9%), Reddit (+12,6% avant son entrée dans le S&P 500). **À surveiller cette semaine :** Compte-rendu de la Fed (mercredi), données d'emploi américaines, LPR chinois, résultats d'Alibaba, sommets sur l'IA à Séoul et sur la robotique à Pékin, et données d'exportation coréennes sur les semi-conducteurs.

marsbitIl y a 18 mins

Wall Street Morning Report : Les bénéfices du S&P affichent la plus forte croissance en 30 ans, Nvidia devient le 6ème actionnaire de SpaceX

marsbitIl y a 18 mins

Le BTC se consolide en oscillation latérale, la reprise quotidienne du HYPE se confirme|Analyse spéciale

Le marché évolue dans une phase de consolidation clé. Pour le BTC, l'observation principale est de voir si le mouvement de correction journalier pourra se stabiliser au-dessus du support fort de 60 950 - 61 500 USD. Trois scénarios sont possibles : poursuite de la remontée, consolidation en range ou rupture baissière vers un double creux. L'analyse quantitative privilégie les deux premières options. Les niveaux de résistance clés se situent à 65 500, 67 300 et 69 500-71 000 USD. Pour le HYPE, un rebond journalier est établi depuis le creux de 51.11 USD. Le point d'attention est de vérifier si le prix peut franchir et se maintenir au-dessus de la zone de résistance 58 - 58.5 USD pour confirmer une phase d'impulsion haussière. Si ce niveau résiste, une phase de prolongation de la consolidation est à prévoir. Les stratégies proposées pour le BTC incluent des positions courtes tactiques près des résistances (67 300 USD et 69 500-71 000 USD) et des positions longues légères près du support (60 950 - 61 500 USD). Pour le HYPE, il est conseillé aux détenteurs de positions longues (prises vers 50-52 USD) de surveiller leur stop-loss, tandis que les investisseurs non positionnés pourraient envisager une entrée prudente en cas de breakout confirmé au-dessus de 58.5 USD. Une gestion stricte des risques est rappelée, avec des stops initiaux systématiques et un mécanisme de trailing stop pour protéger les plus-values. Toutes les analyses sont basées sur l'étude technique et ne constituent pas un conseil en investissement.

marsbitIl y a 23 mins

Le BTC se consolide en oscillation latérale, la reprise quotidienne du HYPE se confirme|Analyse spéciale

marsbitIl y a 23 mins

Le festin de la puissance de calcul de l'IA, devenu "le poison des taux d'intérêt élevés" pour les capitaux mondiaux ?

Ces dernières semaines, le coût réel de l'emprunt ajusté de l'inflation a atteint ses plus hauts niveaux depuis plus d'une décennie dans les principales économies mondiales. Cette hausse des rendements réels, indicateur clé du coût de financement, est notamment alimentée par une frénésie d'emprunts. D'un côté, les gouvernements maintiennent des déficits budgétaires élevés. De l'autre, les géants de la technologie comme Alphabet, Amazon et Meta ont émis près de 2200 milliards de dollars d'obligations cette année pour financer leurs infrastructures d'IA, soit le double du total de 2025. Cette concurrence massive pour le capital fait monter les rendements, comme le montre le taux de 5.22% sur une récente émission d'obligations américaines à 30 ans. Si une croissance économique solide et la fin des achats d'obligations par les banques centrales soutiennent également cette tendance, l'explosion de la dette liée à l'IA est un nouveau facteur décisif. À terme, cette hausse des coûts d'emprunt réels pourrait menacer les marchés boursiers en réduisant l'attrait relatif des actions et la valeur actuelle des flux de trésorerie futurs des entreprises. Bien que la résilience actuelle des bénéfices protège encore les marchés, une dépendance accrue au crédit pourrait amplifier l'impact. De plus, des coûts trop élevés pourraient freiner la consommation et l'investissement, pesant sur la croissance. Les analystes avertissent que ces facteurs structurels risquent de persister, laissant présager une poursuite de la pression sur les rendements.

marsbitIl y a 24 mins

Le festin de la puissance de calcul de l'IA, devenu "le poison des taux d'intérêt élevés" pour les capitaux mondiaux ?

marsbitIl y a 24 mins

Ni investi dans l'IA ni rachats d'actions, JD.com, si "avare", peut-il encore réussir ?

Le géant chinois du commerce électronique JD.com a publié des résultats du deuxième trimestre 2026 jugés "stables" mais "fades". Le chiffre d'affaires a reculé de 3% en glissement annuel, conformément aux attentes du marché et reflétant l'affaiblissement de la consommation domestique. Les principales tendances incluent : * Une baisse des revenus du segment principal "JD Retail" de 4,7%, avec un ralentissement particulièrement marqué des ventes d'articles de première nécessité et des revenus publicitaires. * Un ralentissement de la croissance des activités logistiques et nouvelles, après la fin de l'effet d'entraînement de la "guerre de la livraison de repas". * Une marge opérationnelle du segment Retail stable, montrant des signes de plafonnement après plusieurs trimestres de forte progression. * Des pertes des activités nouvelles (dont livraison de repas et international) restant élevées, autour de 9,9 milliards de yuans, car les investissements à l'étranger compensent la réduction des pertes sur la livraison de repas. * Une réduction des retours aux actionnaires, avec seulement 1 milliard USD de rachats d'actions sur le premier semestre, et une préférence pour les placements financiers. Les perspectives dépendront de la reprise de la consommation en ligne en Chine au second semestre et du niveau futur des investissements dans les nouvelles activités. Sans les dépenses massives en IA d'autres géants technologiques, JD conserve une certaine visibilité et pourrait être considéré comme une valeur défensive si le secteur se redresse. Cependant, l'absence de catalyseur fort et la réduction des rachats d'actions limitent l'attrait à court terme.

marsbitIl y a 31 mins

Ni investi dans l'IA ni rachats d'actions, JD.com, si "avare", peut-il encore réussir ?

marsbitIl y a 31 mins

Trading

Spot

Articles tendance

Comment acheter CORE

Bienvenue sur HTX.com ! Nous vous permettons d'acheter CORE (CORE) de manière simple et pratique. Suivez notre guide étape par étape pour commencer votre parcours crypto.Étape 1 : Création de votre compte HTXUtilisez votre adresse e-mail ou votre numéro de téléphone pour ouvrir un compte sur HTX gratuitement. L'inscription se fait en toute simplicité et débloque toutes les fonctionnalités.Créer mon compteÉtape 2 : Choix du mode de paiement (rubrique Acheter des cryptosCarte de crédit/débit : utilisez votre carte Visa ou Mastercard pour acheter instantanément CORE (CORE).Solde :utilisez les fonds du solde de votre compte HTX pour trader en toute simplicité.Prestataire tiers :pour accroître la commodité d'utilisation, nous avons ajouté des modes de paiement populaires tels que Google Pay et Apple Pay.P2P :tradez directement avec d'autres utilisateurs sur HTX.OTC (de gré à gré) : nous offrons des services personnalisés et des taux de change compétitifs aux traders.Étape 3 : stockage de vos CORE (CORE)Après avoir acheté vos CORE (CORE), stockez-les sur votre compte HTX. Vous pouvez également les envoyer ailleurs via un transfert sur la blockchain ou les utiliser pour trader d'autres cryptos.Étape 4 : tradez des CORE (CORE)Tradez facilement CORE (CORE) sur le marché Spot de HTX. Il vous suffit d'accéder à votre compte, de sélectionner la paire de trading, d'exécuter vos trades et de les suivre en temps réel. Nous offrons une expérience conviviale aux débutants comme aux traders chevronnés.

563 vues totalesPublié le 2024.12.13Mis à jour le 2026.06.02

Comment acheter CORE

Discussions

Bienvenue dans la Communauté HTX. Ici, vous pouvez vous tenir informé(e) des derniers développements de la plateforme et accéder à des analyses de marché professionnelles. Les opinions des utilisateurs sur le prix de CORE (CORE) sont présentées ci-dessous.

活动图片