Présenté il y a 5 ans, un PPT qualifié de "non-sens" par un professeur du MIT a prédit la pensée centrale d'OpenAI o1 et o3

marsbitXuất bản vào 2026-08-17Cập nhật gần nhất vào 2026-08-17

Tóm tắt

Il y a cinq ans, Giambattista Parascandolo, aujourd'hui chercheur clé d'OpenAI sur les modèles de raisonnement, a présenté lors d'un entretien au MIT une vision qualifiée de "non-sens" par le comité. Son exposé proposait trois axes pour améliorer les capacités de raisonnement des réseaux de neurones : le "raisonnement ouvert" (où le modèle consacre plus de temps de calcul pour affiner sa réponse), l'utilisation du langage comme support de raisonnement pour guider la planification, et la capacité d'un agent à manipuler ses propres états internes pour s'auto-améliorer. Ces idées préfiguraient les principes des modèles de raisonnement actuels comme OpenAI o1 et o3, ainsi que des concepts tels que le raisonnement en chaîne et les workflows d'agents. Après cet échec universitaire, Parascandolo a rejoint OpenAI, où il a contribué au développement de GPT-4, puis aux recherches fondamentales derrière o1 et o3, validant ainsi sa vision pionnière.

Le monde de l'IA ne manque pas de ragots.

Cette fois, le protagoniste est Giambattista Parascandolo, un chercheur important dans le domaine des modèles de raisonnement chez OpenAI.

En 2020, il s'est rendu au MIT pour un entretien pour un poste de professeur et a donné une présentation sur l'utilisation de GPT pour le raisonnement. Résultat, la plupart des membres du comité de sélection ont qualifié cette approche de « non-sens » (nonsense).

https://x.com/turingbook/status/2084003612687249836?s=20

Le type a carrément joué cartes sur table, en écrivant cette expérience sur sa page personnelle et en y ajoutant la description du rapport de l'époque ainsi que des liens vers les diapositives.

https://sites.google.com/view/giambattista-parascandolo/home

Que contenait ce rapport qualifié de « non-sens » ?

Le site web du MIT indique que le thème de cette présentation était de savoir comment les réseaux de neurones artificiels peuvent dépasser la distribution d'entraînement et acquérir des capacités de généralisation et de planification plus proches de celles de l'homme.

Parascandolo pense que les humains sont capables de réorganiser leurs connaissances existantes, d'identifier des invariants clés, de construire des modèles abstraits et d'effectuer une planification à long terme. Les réseaux de neurones artificiels ont encore une grande marge de progression dans ces domaines.

À la fin de sa présentation, il propose trois futures pistes de recherche : le raisonnement ouvert dans les réseaux de neurones, les degrés de liberté encore inexplorés dans les réseaux de neurones artificiels, et l'utilisation du langage comme support de raisonnement dans l'apprentissage par renforcement pour améliorer l'efficacité de l'échantillonnage.

Le concept clé parmi ceux-ci est celui de « raisonnement ouvert ».

Parascandolo le définit comme suit : le modèle peut consacrer plus de temps et de calculs pour corriger continuellement sa réponse. Plus le problème est difficile, plus le modèle devrait réfléchir à plusieurs reprises, et ces calculs supplémentaires doivent se traduire par de meilleurs résultats.

Cela ressemble déjà beaucoup à l'extension du calcul au moment du raisonnement d'aujourd'hui.

Le Transformer standard de l'époque avait une profondeur de réseau fixe, la quantité de calcul direct subie par chaque token était fondamentalement déterminée, mais la difficulté d'un problème n'avait pas de relation stable avec la longueur de l'entrée. Un problème pouvait être très long, mais sa réponse très simple. Un autre problème ne pouvait avoir qu'une phrase, mais nécessiter plusieurs tours de décomposition et de vérification.

Le RNN semblait plus adapté à ce type de tâche. Il pouvait fonctionner de manière répétée et, en théorie, obtenir un temps de réflexion de longueur arbitraire. Cependant, la courbe présentée par Parascandolo dans son PPT montrait que les RNN n'étaient généralement performants que dans le voisinage du nombre d'étapes de raisonnement vu lors de l'entraînement. Continuer à augmenter le nombre de cycles pouvait même entraîner une baisse de la précision.

Cela signifiait qu'augmenter la quantité de calculs n'était que la première étape ; le modèle devait également apprendre à utiliser ces calculs.

La planification multi-étapes la plus efficace à l'époque reposait largement sur la prédiction-contrôle de modèle et la recherche arborescente de Monte-Carlo. Le réseau neuronal était chargé de prédire l'environnement ou d'évaluer la valeur, tandis qu'un algorithme de recherche externe était chargé d'explorer les chemins futurs. Parascandolo souhaitait intégrer davantage les capacités de raisonnement à long terme dans les réseaux de neurones.

Sa deuxième idée était de faire du langage un support de raisonnement.

Parascandolo a pris l'exemple du jeu classique *Montezuma's Revenge*. Un agent d'apprentissage par renforcement formé à partir de zéro doit essayer un grand nombre de combinaisons d'états et d'actions. De nombreuses actions correctes ne sont pas complexes en elles-mêmes ; ce qui manque réellement à l'agent est un jugement sur « quelle action est plus raisonnable ».

GPT a déjà absorbé une grande quantité de connaissances sur le monde à partir de textes. Le langage peut aider le modèle à décrire l'environnement, à comprendre les objectifs, à décomposer les tâches et à générer des plans de haut niveau, tout en réduisant considérablement l'espace de recherche.

Aujourd'hui, cette approche évoque facilement les chaînes de pensée, la planification linguistique et les flux de travail des agents.

La troisième piste de recherche proposée par Parascandolo était que les systèmes d'IA pouvaient réinitialiser la tâche, revenir à n'importe quel état mémorisé, construire des scénarios contrefactuels, et même ajuster le temps, la gravité et les résultats d'observation dans le simulateur. Le système pouvait même directement lire, copier et modifier ses propres valeurs d'activation et les poids de son réseau neuronal.

Cela équivalait à intégrer le processus d'apprentissage lui-même dans l'espace d'action de l'agent. Il pouvait s'engager dans une pratique délibérée, générer des scénarios d'entraînement spéciaux, transférer des connaissances existantes, et réapprendre à partir des trajectoires d'échec.

Le PPT d'il y a cinq ans avait presque esquissé la voie des modèles de raisonnement actuels.

Nous avons également déterré un blog qu'il avait écrit en juin 2021, dont le titre était *« Rétropropagation, évolution et le malentendu des "deux chiens" »*.

Cet article réfutait principalement l'argument selon lequel « les réseaux de neurones ont besoin de masses de données, ils ne ressemblent donc pas au cerveau humain ».

Parascandolo pensait que le fait que les humains apprennent à reconnaître les chiens après en avoir vu seulement quelques-uns ne signifie pas qu'ils n'ont pas accumulé d'expérience auparavant. La longue évolution a imprégné l'expérience du monde de nos ancêtres dans la structure et les biais inductifs du cerveau humain.

Selon cette perspective, le pré-entraînement à grande échelle des réseaux de neurones peut être comparé à l'évolution biologique, tandis que le réglage fin du modèle et l'apprentissage en contexte sont plus proches de l'apprentissage au cours de la vie d'un individu. GPT-3 a lu beaucoup plus de texte que n'importe quel individu, mais son pré-entraînement a joué le rôle de compresser une expérience massive et de façonner une capacité d'apprentissage efficace. Par conséquent, on ne peut pas directement comparer toutes les données de pré-entraînement du modèle avec le petit nombre d'échantillons d'apprentissage d'un individu après sa naissance.

Cette compréhension signifie également que continuer à augmenter les données et la puissance de calcul pourrait encore apporter des améliorations significatives. Il comparait les rôles qu'ils jouent, sans considérer que le mécanisme de la descente de gradient et celui de l'évolution biologique étaient identiques.

Qui est ce type ?

Ce type est assez discret ; son dernier post sur X remonte à novembre 2024, date à laquelle il recrutait deux ingénieurs de recherche (RE) et ingénieurs logiciels (SWE) pour o1.

Selon sa page personnelle, les recherches de Parascandolo ont toujours tourné autour de la généralisation, de la planification et du raisonnement.

En 2017, il a commencé son doctorat à l'Institut Max Planck pour les systèmes intelligents et à l'ETH Zurich, sous la direction de Bernhard Schölkopf et Thomas Hofmann. Sa thèse portait sur la généralisation hors distribution (OOD) dans l'apprentissage profond.

Pendant son doctorat, il a effectué un stage à Google X à Mountain View et à DeepMind à Londres. Le premier portait sur la recherche en conception automatisée sur des simulateurs à très grande échelle, et le second sur la recherche de division pour conquérir l'arbre de recherche de Monte-Carlo.

Après avoir obtenu son doctorat en septembre 2021, il a rejoint directement OpenAI. Il a d'abord intégré l'équipe d'apprentissage par renforcement dirigée par John Schulman, puis s'est tourné vers l'équipe algorithmique où se trouvait Mark Chen, avant de rejoindre l'équipe 🍓 (fraise) dirigée par Jerry Tworek. L'équipe fraise était le nom de code interne du projet o1.

En 2023, il a participé au développement de GPT-4 et a constitué une nouvelle équipe pour poursuivre les recherches sur le raisonnement. Il a ensuite participé aux recherches fondamentales d'OpenAI o1 et o3, promouvant l'extension de la modélisation des récompenses, la construction d'environnements et des algorithmes de raisonnement généraux. Une partie de la description de ces algorithmes est encore masquée par des blocs noirs.

Lors de cet entretien au MIT en 2020, Parascandolo n'a pas obtenu le poste de professeur ; il est allé chez OpenAI.

Quatre ans plus tard, il a contribué à construire o1.

La vie est toujours pleine de surprises.

Liens de référence :

https://x.com/giambattista92

https://sites.google.com/view/giambattista-parascandolo/home

https://gibipara92.github.io/2021/06/09/backprop-evolution-two-dogs.html

https://docs.google.com/presentation/d/1edd2GkAP31wNygaev3DO8gE1t2lgsx1z8TeVpBKqlYA/edit?slide=id.gc772610149_0_179#slide=id.gc772610149_0_179

Cet article provient du compte officiel WeChat "Machine Heart" (ID : almosthuman2014), auteur : Yang Wen

Tiền kỹ thuật số thịnh hành

Câu hỏi Liên quan

QQui est Giambattista Parascandolo et quel a été son rôle dans le développement de l'IA chez OpenAI ?

AGiambattista Parascandolo est un chercheur clé chez OpenAI, spécialisé dans les modèles de raisonnement. Il a contribué au développement de GPT-4 et a joué un rôle central dans les projets o1 et o3, en travaillant sur des algorithmes de raisonnement général, la modélisation des récompenses et la construction d'environnements.

QQuel était le sujet principal de la présentation de Parascandolo au MIT en 2020, et pourquoi a-t-elle été initialement critiquée ?

ALa présentation portait sur l'utilisation des réseaux de neurones pour atteindre une généralisation et des capacités de planification plus proches de celles des humains, en particulier via le 'raisonnement ouvert'. Elle a été critiquée et qualifiée de 'non-sens' par la plupart des professeurs du comité de recrutement du MIT, qui doutaient de la faisabilité de cette approche à l'époque.

QQu'est-ce que le 'raisonnement ouvert' (open-ended reasoning) selon Parascandolo, et en quoi ressemble-t-il aux modèles de raisonnement actuels ?

AParascandolo définissait le 'raisonnement ouvert' comme la capacité d'un modèle à consacrer plus de temps et de calculs pour réviser continuellement sa réponse. Plus un problème est difficile, plus le modèle devrait 'réfléchir' longtemps, transformant ce calcul supplémentaire en de meilleurs résultats. Cela préfigure directement les techniques modernes d'extension du calcul au moment de l'inférence, comme dans les modèles de raisonnement actuels.

QComment Parascandolo envisageait-il l'utilisation du langage comme support de raisonnement, et quelles technologies actuelles cela évoque-t-il ?

AIl proposait d'utiliser le langage comme un support interne pour le raisonnement, aidant le modèle à décrire l'environnement, à comprendre les objectifs, à décomposer les tâches et à générer des plans de haut niveau. Cette idée annonce directement des techniques contemporaines comme le 'chain-of-thought' (enchaînement de pensées), la planification par le langage et les flux de travail des agents IA.

QQuelle analogie Parascandolo a-t-il utilisée dans son blog de 2021 pour expliquer l'apprentissage des réseaux de neurones par rapport à l'apprentissage humain ?

ADans son blog, Parascandolo a comparé le pré-entraînement à grande échelle des réseaux de neurones à l'évolution biologique, qui compresse l'expérience massive des ancêtres en structures cérébrales. Le réglage fin (fine-tuning) et l'apprentissage en contexte (in-context learning) seraient alors plus analogues à l'apprentissage individuel au cours d'une vie. Cela justifie, selon lui, l'utilisation de vastes ensembles de données pour le pré-entraînement.

Nội dung Liên quan

Elon Musk và Công ty X Tiến Thêm Bước Về Tiền Mã Hóa! Một Kỷ Nguyên Thanh Toán Mới Đang Ló Dạng! Đây Là Chi Tiết

Nền tảng truyền thông xã hội X của Elon Musk đang xem xét khả năng sử dụng stablecoin để trả thưởng cho những người sáng tạo nội dung. Theo nguồn tin, X đang đàm phán về việc sử dụng stablecoin, chủ yếu là USDC, cho các khoản thanh toán này. Kế hoạch hiện vẫn đang được thảo luận và chưa có quyết định cuối cùng hay thời điểm triển khai cụ thể. Nếu được thực hiện, nó có thể cho phép các nhà sáng tạo nội dung trên toàn cầu nhận tiền nhanh hơn dưới dạng kỹ thuật số. Các chuyên gia nhận định việc sử dụng stablecoin, đặc biệt trong thanh toán xuyên biên giới, có thể trở thành một giải pháp thay thế cho các hệ thống thanh toán truyền thống. Bài báo cũng đề cập rằng SpaceX, một công ty khác của Elon Musk, đã sử dụng stablecoin để thực hiện các khoản thanh toán xuyên biên giới cho dịch vụ Starlink ở một số quốc gia. Mặc dù chưa được phê duyệt, việc X cân nhắc sử dụng các đồng tiền kỹ thuật số như USDC được coi là một tín hiệu mới về khả năng mở rộng ứng dụng của stablecoin vào các giao dịch thanh toán kỹ thuật số hàng ngày.

cryptonews.ru2 giờ trước

Elon Musk và Công ty X Tiến Thêm Bước Về Tiền Mã Hóa! Một Kỷ Nguyên Thanh Toán Mới Đang Ló Dạng! Đây Là Chi Tiết

cryptonews.ru2 giờ trước

Nhà đầu tư tiền điện tử mất 1010 ETH do truy cập trang web Tornado Cash lỗi thời

Nhà đầu tư tiền điện tử mất 1.010 ETH do truy cập trang web Tornado Cash lỗi thời bị chiếm đoạt. Các nhà phân tích từ Wu Blockchain cho biết nạn nhân đã sử dụng dấu trang trình duyệt cũ để vào trang trộn tiền điện tử, lúc này tên miền đã bị kẻ xấu kiểm soát và triển khai giao diện giả mạo. Tin rằng mình đang tương tác với hợp đồng thông minh Tornado Cash thật, nạn nhân đã cấp quyền truy cập tài sản cho bọn lừa đảo, và số tiền bị rút sạch trong vòng 12 giờ. Số tiền bị đánh cắp, hiện nằm rải rác trên nhiều địa chỉ ví do tội phạm kiểm soát, được rút thành nhiều lần nhỏ. Nhóm Tornado Cash đã mất quyền kiểm soát tên miền cũ sau lệnh trừng phạt của OFAC Mỹ năm 2022, và kể từ đó, bọn tội phạm đã đăng ký lại và vận hành trang web lừa đảo. Trong 12 tháng qua, trang web giả này được cho là đã đánh cắp tổng cộng khoảng 4.000 ETH từ nhiều người dùng. Trong bối cảnh này, các chuyên gia bảo mật Bitdefender cũng cảnh báo về phần mềm độc hại Lumma Stealer đang được phát tán dưới vỏ bọc là bản phim lậu của bộ phim "Oppenheimer" đạo diễn bởi Christopher Nolan.

cryptonews.ru2 giờ trước

Nhà đầu tư tiền điện tử mất 1010 ETH do truy cập trang web Tornado Cash lỗi thời

cryptonews.ru2 giờ trước

Các chuyên gia phân tích: MiCA chưa gây ra đợt rút vốn toàn cầu đáng kể khỏi USDT

Các nhà phân tích cho biết Quy định về Thị trường Tài sản Crypto (MiCA) của châu Âu chưa gây ra hiện tượng rút tiền hàng loạt trên toàn cầu khỏi stablecoin USDT. Dữ liệu từ Artemis Analytics và một nghiên cứu độc lập của Đại học LUISS và Đại học Surrey chỉ ra rằng việc hạn chế USDT trên các sàn giao dịch được quản lý ở châu Âu chưa dẫn đến sự sụt giảm đáng kể về nguồn cung hoặc nhu cầu toàn cầu đối với USDT. Nghiên cứu xác nhận MiCA đã thay đổi cơ cấu giao dịch trên một số nền tảng cụ thể ở châu Âu, nơi thị phần của USDC đã tăng lên sau khi USDT bị hạn chế. Tuy nhiên, thị phần và khối lượng giao dịch tổng hợp của các stablecoin hàng đầu hầu như không thay đổi trên quy mô toàn cầu. USDT vẫn giữ vị trí dẫn đầu với vốn hóa thị trường khoảng 183 tỷ USD vào cuối tháng 7. Hoạt động với USDT tiếp tục mở rộng mạnh mẽ bên ngoài châu Âu, đặc biệt trên các mạng như BNB Chain và Tron, phản ánh xu hướng áp dụng số hóa đô la trên các thị trường mới nổi. Trong khi đó, tại châu Âu, việc Tether không đăng ký theo MiCA đã khiến nhiều dịch vụ phải hạn chế USDT. Dù vậy, dữ liệu không cho thấy sự dịch chuyển thanh khoản quy mô lớn hoặc thay đổi đột ngột trùng khớp với thời điểm MiCA có hiệu lực.

cryptonews.ru2 giờ trước

Các chuyên gia phân tích: MiCA chưa gây ra đợt rút vốn toàn cầu đáng kể khỏi USDT

cryptonews.ru2 giờ trước

Giao dịch

Giao ngay

Bài viết Nổi bật

Làm thế nào để Mua CORE

Chào mừng bạn đến với HTX.com! Chúng tôi đã làm cho mua CORE (CORE) trở nên đơn giản và thuận tiện. Làm theo hướng dẫn từng bước của chúng tôi để bắt đầu hành trình tiền kỹ thuật số của bạn.Bước 1: Tạo Tài khoản HTX của BạnSử dụng email hoặc số điện thoại của bạn để đăng ký tài khoản miễn phí trên HTX. Trải nghiệm hành trình đăng ký không rắc rối và mở khóa tất cả tính năng. Nhận Tài khoản của tôiBước 2: Truy cập Mua Crypto và Chọn Phương thức Thanh toán của BạnThẻ Tín dụng/Ghi nợ: Sử dụng Visa hoặc Mastercard của bạn để mua CORE (CORE) ngay lập tức.Số dư: Sử dụng tiền từ số dư tài khoản HTX của bạn để giao dịch liền mạch.Bên thứ ba: Chúng tôi đã thêm những phương thức thanh toán phổ biến như Google Pay và Apple Pay để nâng cao sự tiện lợi.P2P: Giao dịch trực tiếp với người dùng khác trên HTX.Thị trường mua bán phi tập trung (OTC): Chúng tôi cung cấp những dịch vụ được thiết kế riêng và tỷ giá hối đoái cạnh tranh cho nhà giao dịch.Bước 3: Lưu trữ CORE (CORE) của BạnSau khi mua CORE (CORE), lưu trữ trong tài khoản HTX của bạn. Ngoài ra, bạn có thể gửi đi nơi khác qua chuyển khoản blockchain hoặc sử dụng để giao dịch những tiền kỹ thuật số khác.Bước 4: Giao dịch CORE (CORE)Giao dịch CORE (CORE) dễ dàng trên thị trường giao ngay của HTX. Chỉ cần truy cập vào tài khoản của bạn, chọn cặp giao dịch, thực hiện giao dịch và theo dõi trong thời gian thực. Chúng tôi cung cấp trải nghiệm thân thiện với người dùng cho cả người mới bắt đầu và người giao dịch dày dạn kinh nghiệm.

Tổng lượt xem 630Xuất bản vào 2024.12.13Cập nhật vào 2026.06.02

Làm thế nào để Mua CORE

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của CORE (CORE) được trình bày dưới đây.

活动图片