Una presentación calificada de "absurda" por un profesor del MIT hace 5 años predijo la idea central de OpenAI o1 y o3

marsbitXuất bản vào 2026-08-17Cập nhật gần nhất vào 2026-08-17

Tóm tắt

Hace cinco años, Giambattista Parascandolo, ahora investigador clave de modelos de razonamiento en OpenAI, presentó una charla en el MIT proponiendo que las redes neuronales podrían lograr un "razonamiento abierto": la capacidad de dedicar más tiempo y cómputo para refinar respuestas, usar el lenguaje como vehículo de razonamiento y modificar internamente sus propios parámetros para aprender. Los profesores del comité lo calificaron de "disparate". Su presentación, sin embargo, esbozaba conceptos que hoy son centrales en modelos como OpenAI o1 y o3: la expansión de cómputo en el tiempo de inferencia, las cadenas de pensamiento (CoT), la planificación con lenguaje y los agentes que ajustan su conocimiento. Tras no obtener el puesto en el MIT, Parascandolo se unió a OpenAI en 2021. Contribuyó al desarrollo de GPT-4 y posteriormente fue parte fundamental del equipo "Strawberry" que creó los modelos de razonamiento o1 y o3, haciendo realidad las ideas que años antes fueron rechazadas.

El mundo de la IA no escasea de chismes.

Esta vez el protagonista es Giambattista Parascandolo, un investigador clave en modelos de razonamiento de OpenAI.

En 2020, fue a una entrevista para un puesto de profesor en el MIT, donde dio una charla sobre el uso de GPT para el razonamiento. El resultado fue que la mayoría de los profesores del comité calificaron esta dirección de "absurda" (nonsense).

https://x.com/turingbook/status/2084003612687249836?s=20

Este tipo respondió directamente y escribió esta experiencia en su página personal, adjuntando la descripción de la charla de ese año y el enlace a las diapositivas.

https://sites.google.com/view/giambattista-parascandolo/home

¿De qué hablaba esa charla calificada de "absurda"?

El sitio web del MIT muestra que el tema de esta charla era cómo hacer que las redes neuronales artificiales superen la distribución de entrenamiento y adquieran capacidades de generalización y planificación más cercanas a las humanas.

Parascandolo creía que los humanos pueden recombinar conocimientos existentes, identificar invariantes clave, construir modelos abstractos y realizar planificación a largo plazo. Las redes neuronales artificiales todavía tienen un gran margen de mejora en estos aspectos.

Al final de la charla, propuso tres direcciones de investigación futura: el razonamiento abierto en redes neuronales, los grados de libertad aún no explorados en las redes neuronales artificiales, y el uso del lenguaje como vehículo de razonamiento en el aprendizaje por refuerzo para mejorar la eficiencia de las muestras.

El concepto clave entre estos es el "razonamiento abierto".

Parascandolo lo definió como: el modelo puede invertir más tiempo y computación para corregir continuamente la respuesta. Cuanto más difícil sea el problema, más pasos debería pensar el modelo, y la computación adicional debería traducirse en mejores resultados.

Esto suena muy parecido a la expansión de cómputo en tiempo de razonamiento de hoy en día.

En ese entonces, el Transformer estándar tenía una profundidad de red fija, la cantidad de cómputo hacia adelante que experimentaba cada token era básicamente fija, pero la dificultad del problema no tenía una relación estable con la longitud de la entrada. Un problema podía ser muy largo, pero la respuesta ser muy simple. Otro problema de solo una oración podía necesitar múltiples rondas de descomposición y verificación.

Las RNN parecían más adecuadas para este tipo de tareas. Podían ejecutarse repetidamente, obteniendo teóricamente un tiempo de pensamiento de longitud arbitraria. Sin embargo, la curva mostrada por Parascandolo en la PPT indicaba que las RNN generalmente solo funcionaban mejor cerca del número de pasos de razonamiento vistos durante el entrenamiento, y al continuar aumentando las iteraciones, la precisión podía incluso disminuir.

Esto significaba que aumentar la cantidad de cómputo era solo el primer paso, el modelo también tenía que aprender a utilizar ese cómputo.

En ese momento, la planificación multi-paso más efectiva dependía en gran medida de la predicción y control del modelo y de la búsqueda en árbol de Monte Carlo. La red neuronal era responsable de predecir el entorno o evaluar el valor, y un algoritmo de búsqueda externo se encargaba de expandir las trayectorias futuras. Parascandolo esperaba integrar aún más la capacidad de razonamiento de largo alcance en la red neuronal.

Su segunda idea era hacer del lenguaje el vehículo del razonamiento.

Parascandolo utilizó el juego clásico "Montezuma's Revenge" como ejemplo. Un agente de aprendizaje por refuerzo entrenado desde cero necesita probar una gran cantidad de combinaciones de estados y acciones; muchas de las operaciones correctas en sí mismas no son complejas, lo que realmente le falta al agente es el juicio sobre "qué comportamiento es más razonable".

GPT ya ha absorbido una gran cantidad de conocimiento del mundo a partir del texto. El lenguaje puede ayudar al modelo a describir el entorno, comprender los objetivos, descomponer tareas y generar planes de alto nivel, y también puede reducir drásticamente el espacio de búsqueda.

Hoy en día, este enfoque fácilmente nos hace pensar en la cadena de pensamiento (CoT), la planificación basada en lenguaje y los flujos de trabajo de agentes.

La tercera dirección propuesta por Parascandolo era que los sistemas de IA podrían reiniciar tareas, volver a cualquier estado en la memoria, construir escenarios contrafactuales, y también ajustar el tiempo, la gravedad y los resultados de observación en el simulador. El sistema incluso podría leer, copiar y modificar directamente sus propios valores de activación y pesos de red neuronal.

Esto equivale a incorporar el proceso de aprendizaje mismo en el espacio de operación del Agente. Podría realizar práctica deliberada, generar escenarios de entrenamiento especiales, transferir conocimientos existentes y reaprender a partir de trayectorias fallidas.

En la PPT de hace cinco años, casi estaba escrita la hoja de ruta de los modelos de razonamiento de hoy.

También encontramos un blog que escribió en junio de 2021, titulado "Retropropagación, evolución y el error de los 'dos perros'".

Este blog refutaba principalmente la visión de que "las redes neuronales necesitan una enorme cantidad de datos, por lo tanto no se parecen al cerebro humano".

Parascandolo creía que el hecho de que los humanos puedan aprender a reconocer perros después de ver solo unos pocos no significa que no hayan acumulado experiencia previamente. La larga evolución ha sedimentado la experiencia de los ancestros en contacto con el mundo en la estructura y los sesgos inductivos del cerebro humano.

Según esta perspectiva, el pre-entrenamiento a gran escala de las redes neuronales se puede comparar con la evolución biológica, mientras que el ajuste fino (fine-tuning) y el aprendizaje en contexto (in-context learning) se asemejan más al aprendizaje individual a lo largo de la vida. GPT-3 ha leído mucho más texto que cualquier individuo, pero su pre-entrenamiento sirvió para comprimir una enorme cantidad de experiencia y dar forma a una capacidad de aprendizaje eficiente. Por lo tanto, no se puede comparar directamente la totalidad de los datos de pre-entrenamiento del modelo con la pequeña cantidad de muestras de aprendizaje de una persona después de nacer.

Esta comprensión también implica que continuar ampliando los datos y la potencia computacional aún podría traer mejoras significativas. Él comparaba el papel que ambos desempeñan, sin afirmar que el descenso de gradiente y la evolución biológica tuvieran mecanismos específicos idénticos.

¿Quién es este tipo?

Este tipo es bastante discreto, su última publicación en X data de noviembre de 2024, cuando estaba contratando a dos ingenieros de investigación (RE) e ingenieros de software (SWE) para o1.

Según muestra su página personal, la trayectoria de investigación de Parascandolo siempre ha girado en torno a la generalización, la planificación y el razonamiento.

En 2017, comenzó su doctorado en el Instituto Max Planck de Sistemas Inteligentes y la ETH de Zúrich, bajo la supervisión de Bernhard Schölkopf y Thomas Hofmann. Su tesis doctoral se centró en la generalización OOD en el aprendizaje profundo.

Durante su doctorado, realizó prácticas en Google X en Mountain View y en DeepMind en Londres. En el primero participó en investigación sobre diseño automatizado en simuladores a gran escala, y en el segundo en investigación sobre búsqueda en árbol de Monte Carlo por divide y vencerás.

Se doctoró en septiembre de 2021 y se unió directamente a OpenAI. Inicialmente entró en el equipo de aprendizaje por refuerzo liderado por John Schulman, luego pasó al equipo de algoritmos donde estaba Mark Chen, y posteriormente se unió al equipo 🍓 (fresa) liderado por Jerry Tworek. El equipo fresa era el nombre interno del proyecto o1.

En 2023, participó en el desarrollo de GPT-4 y formó un nuevo equipo para continuar investigando el razonamiento. Más tarde, participó en la investigación fundamental de OpenAI o1 y o3, impulsando la expansión del modelado de recompensas, la construcción de entornos y los algoritmos de razonamiento general. Parte de la descripción de estos algoritmos aún la mantiene oculta con bloques negros.

En esa entrevista de 2020, Parascandolo no consiguió el puesto de profesor en el MIT. Se fue a OpenAI.

Cuatro años después, ayudó a construir o1.

La vida siempre es fascinante.

Enlaces de referencia:

https://x.com/giambattista92

https://sites.google.com/view/giambattista-parascandolo/home

https://gibipara92.github.io/2021/06/09/backprop-evolution-two-dogs.html

https://docs.google.com/presentation/d/1edd2GkAP31wNygaev3DO8gE1t2lgsx1z8TeVpBKqlYA/edit?slide=id.gc772610149_0_179#slide=id.gc772610149_0_179

Este artículo proviene del WeChat público "机器之心" (ID:almosthuman2014), autor: Yang Wen

Tiền kỹ thuật số thịnh hành

Câu hỏi Liên quan

Q¿Quién es Giambattista Parascandolo y por qué es relevante en el artículo?

AGiambattista Parascandolo es un investigador clave en el equipo de modelos de razonamiento de OpenAI. Es relevante porque, en 2020, presentó una charla en el MIT sobre el uso de GPT para el razonamiento, que fue criticada como "sin sentido" por muchos profesores, pero sus ideas anticiparon los conceptos centrales detrás de los modelos de razonamiento de OpenAI, como o1 y o3.

Q¿Qué es el 'razonamiento abierto' según la presentación de Parascandolo y cómo se relaciona con los modelos actuales?

AParascandolo definió el 'razonamiento abierto' como la capacidad de un modelo para invertir más tiempo y cálculo computacional para refinar continuamente su respuesta. Cuanto más difícil sea el problema, más pasos de pensamiento debería dar el modelo, convirtiendo el cálculo adicional en mejores resultados. Esto se asemeja mucho a la extensión computacional en el momento del razonamiento (reasoning-time compute scaling) utilizada en modelos actuales como o1.

Q¿Por qué las RNN no eran ideales para el razonamiento de múltiples pasos según el artículo?

AAunque las RNN pueden ejecutarse repetidamente y teóricamente permitir un tiempo de razonamiento arbitrario, el artículo señala que su rendimiento óptimo generalmente se encontraba cerca del número de pasos de razonamiento vistos durante el entrenamiento. Aumentar más los ciclos a menudo conducía a una disminución en la precisión, lo que indica que solo aumentar el cálculo no es suficiente; el modelo debe aprender a utilizarlo eficazmente.

Q¿Cómo propuso Parascandolo utilizar el lenguaje como soporte para el razonamiento?

AParascandolo propuso utilizar el lenguaje como un vehículo para el razonamiento, especialmente en el aprendizaje por refuerzo. Sugirió que los modelos de lenguaje como GPT, que han absorbido un vasto conocimiento del mundo a través del texto, podrían ayudar a describir entornos, comprender objetivos, descomponer tareas y generar planes de alto nivel, reduciendo así significativamente el espacio de búsqueda necesario para que un agente tome decisiones.

Q¿Cuál fue la trayectoria profesional de Parascandolo después de su entrevista en el MIT?

ADespués de no obtener el puesto de profesor en el MIT en 2020, Parascandolo se unió a OpenAI en septiembre de 2021. Comenzó en el equipo de aprendizaje por refuerzo, luego pasó al equipo de algoritmos y finalmente se unió al equipo 'Strawberry' (fresa), que era el nombre en clave interno del proyecto o1. Contribuyó a la investigación fundamental de o1 y o3, trabajando en modelado de recompensas, construcción de entornos y escalado de algoritmos de razonamiento general.

Nội dung Liên quan

Elon Musk và Công ty X Tiến Thêm Bước Về Tiền Mã Hóa! Một Kỷ Nguyên Thanh Toán Mới Đang Ló Dạng! Đây Là Chi Tiết

Nền tảng truyền thông xã hội X của Elon Musk đang xem xét khả năng sử dụng stablecoin để trả thưởng cho những người sáng tạo nội dung. Theo nguồn tin, X đang đàm phán về việc sử dụng stablecoin, chủ yếu là USDC, cho các khoản thanh toán này. Kế hoạch hiện vẫn đang được thảo luận và chưa có quyết định cuối cùng hay thời điểm triển khai cụ thể. Nếu được thực hiện, nó có thể cho phép các nhà sáng tạo nội dung trên toàn cầu nhận tiền nhanh hơn dưới dạng kỹ thuật số. Các chuyên gia nhận định việc sử dụng stablecoin, đặc biệt trong thanh toán xuyên biên giới, có thể trở thành một giải pháp thay thế cho các hệ thống thanh toán truyền thống. Bài báo cũng đề cập rằng SpaceX, một công ty khác của Elon Musk, đã sử dụng stablecoin để thực hiện các khoản thanh toán xuyên biên giới cho dịch vụ Starlink ở một số quốc gia. Mặc dù chưa được phê duyệt, việc X cân nhắc sử dụng các đồng tiền kỹ thuật số như USDC được coi là một tín hiệu mới về khả năng mở rộng ứng dụng của stablecoin vào các giao dịch thanh toán kỹ thuật số hàng ngày.

cryptonews.ru2 giờ trước

Elon Musk và Công ty X Tiến Thêm Bước Về Tiền Mã Hóa! Một Kỷ Nguyên Thanh Toán Mới Đang Ló Dạng! Đây Là Chi Tiết

cryptonews.ru2 giờ trước

Nhà đầu tư tiền điện tử mất 1010 ETH do truy cập trang web Tornado Cash lỗi thời

Nhà đầu tư tiền điện tử mất 1.010 ETH do truy cập trang web Tornado Cash lỗi thời bị chiếm đoạt. Các nhà phân tích từ Wu Blockchain cho biết nạn nhân đã sử dụng dấu trang trình duyệt cũ để vào trang trộn tiền điện tử, lúc này tên miền đã bị kẻ xấu kiểm soát và triển khai giao diện giả mạo. Tin rằng mình đang tương tác với hợp đồng thông minh Tornado Cash thật, nạn nhân đã cấp quyền truy cập tài sản cho bọn lừa đảo, và số tiền bị rút sạch trong vòng 12 giờ. Số tiền bị đánh cắp, hiện nằm rải rác trên nhiều địa chỉ ví do tội phạm kiểm soát, được rút thành nhiều lần nhỏ. Nhóm Tornado Cash đã mất quyền kiểm soát tên miền cũ sau lệnh trừng phạt của OFAC Mỹ năm 2022, và kể từ đó, bọn tội phạm đã đăng ký lại và vận hành trang web lừa đảo. Trong 12 tháng qua, trang web giả này được cho là đã đánh cắp tổng cộng khoảng 4.000 ETH từ nhiều người dùng. Trong bối cảnh này, các chuyên gia bảo mật Bitdefender cũng cảnh báo về phần mềm độc hại Lumma Stealer đang được phát tán dưới vỏ bọc là bản phim lậu của bộ phim "Oppenheimer" đạo diễn bởi Christopher Nolan.

cryptonews.ru2 giờ trước

Nhà đầu tư tiền điện tử mất 1010 ETH do truy cập trang web Tornado Cash lỗi thời

cryptonews.ru2 giờ trước

Các chuyên gia phân tích: MiCA chưa gây ra đợt rút vốn toàn cầu đáng kể khỏi USDT

Các nhà phân tích cho biết Quy định về Thị trường Tài sản Crypto (MiCA) của châu Âu chưa gây ra hiện tượng rút tiền hàng loạt trên toàn cầu khỏi stablecoin USDT. Dữ liệu từ Artemis Analytics và một nghiên cứu độc lập của Đại học LUISS và Đại học Surrey chỉ ra rằng việc hạn chế USDT trên các sàn giao dịch được quản lý ở châu Âu chưa dẫn đến sự sụt giảm đáng kể về nguồn cung hoặc nhu cầu toàn cầu đối với USDT. Nghiên cứu xác nhận MiCA đã thay đổi cơ cấu giao dịch trên một số nền tảng cụ thể ở châu Âu, nơi thị phần của USDC đã tăng lên sau khi USDT bị hạn chế. Tuy nhiên, thị phần và khối lượng giao dịch tổng hợp của các stablecoin hàng đầu hầu như không thay đổi trên quy mô toàn cầu. USDT vẫn giữ vị trí dẫn đầu với vốn hóa thị trường khoảng 183 tỷ USD vào cuối tháng 7. Hoạt động với USDT tiếp tục mở rộng mạnh mẽ bên ngoài châu Âu, đặc biệt trên các mạng như BNB Chain và Tron, phản ánh xu hướng áp dụng số hóa đô la trên các thị trường mới nổi. Trong khi đó, tại châu Âu, việc Tether không đăng ký theo MiCA đã khiến nhiều dịch vụ phải hạn chế USDT. Dù vậy, dữ liệu không cho thấy sự dịch chuyển thanh khoản quy mô lớn hoặc thay đổi đột ngột trùng khớp với thời điểm MiCA có hiệu lực.

cryptonews.ru2 giờ trước

Các chuyên gia phân tích: MiCA chưa gây ra đợt rút vốn toàn cầu đáng kể khỏi USDT

cryptonews.ru2 giờ trước

Giao dịch

Giao ngay

Bài viết Nổi bật

Làm thế nào để Mua CORE

Chào mừng bạn đến với HTX.com! Chúng tôi đã làm cho mua CORE (CORE) trở nên đơn giản và thuận tiện. Làm theo hướng dẫn từng bước của chúng tôi để bắt đầu hành trình tiền kỹ thuật số của bạn.Bước 1: Tạo Tài khoản HTX của BạnSử dụng email hoặc số điện thoại của bạn để đăng ký tài khoản miễn phí trên HTX. Trải nghiệm hành trình đăng ký không rắc rối và mở khóa tất cả tính năng. Nhận Tài khoản của tôiBước 2: Truy cập Mua Crypto và Chọn Phương thức Thanh toán của BạnThẻ Tín dụng/Ghi nợ: Sử dụng Visa hoặc Mastercard của bạn để mua CORE (CORE) ngay lập tức.Số dư: Sử dụng tiền từ số dư tài khoản HTX của bạn để giao dịch liền mạch.Bên thứ ba: Chúng tôi đã thêm những phương thức thanh toán phổ biến như Google Pay và Apple Pay để nâng cao sự tiện lợi.P2P: Giao dịch trực tiếp với người dùng khác trên HTX.Thị trường mua bán phi tập trung (OTC): Chúng tôi cung cấp những dịch vụ được thiết kế riêng và tỷ giá hối đoái cạnh tranh cho nhà giao dịch.Bước 3: Lưu trữ CORE (CORE) của BạnSau khi mua CORE (CORE), lưu trữ trong tài khoản HTX của bạn. Ngoài ra, bạn có thể gửi đi nơi khác qua chuyển khoản blockchain hoặc sử dụng để giao dịch những tiền kỹ thuật số khác.Bước 4: Giao dịch CORE (CORE)Giao dịch CORE (CORE) dễ dàng trên thị trường giao ngay của HTX. Chỉ cần truy cập vào tài khoản của bạn, chọn cặp giao dịch, thực hiện giao dịch và theo dõi trong thời gian thực. Chúng tôi cung cấp trải nghiệm thân thiện với người dùng cho cả người mới bắt đầu và người giao dịch dày dạn kinh nghiệm.

Tổng lượt xem 630Xuất bản vào 2024.12.13Cập nhật vào 2026.06.02

Làm thế nào để Mua CORE

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của CORE (CORE) được trình bày dưới đây.

活动图片