Bản trình bày bị giáo sư MIT chê là "vô lý" 5 năm trước, đã tiên tri tư duy cốt lõi của OpenAI o1 và o3

marsbitXuất bản vào 2026-08-17Cập nhật gần nhất vào 2026-08-17

Tóm tắt

Năm năm trước, một báo cáo của nhà nghiên cứu Giambattista Parascandolo (hiện làm việc tại OpenAI) đã bị các giáo sư tại MIT chỉ trích là "vô nghĩa" trong buổi phỏng vấn xin việc. Báo cáo đó lại chứa đựng những ý tưởng tiên tri cho hướng phát triển của các mô hình suy luận như o1 và o3 sau này. Trong bài thuyết trình, Parascandolo đề xuất ba hướng nghiên cứu chính: 1. **Lập luận mở (Open-ended reasoning):** Mô hình có thể sử dụng nhiều thời gian và tính toán hơn để liên tục cải thiện câu trả lời, biến việc tính toán bổ sung thành kết quả tốt hơn - một ý tưởng tương tự "tính toán mở rộng khi suy luận" ngày nay. 2. **Sử dụng ngôn ngữ làm phương tiện suy luận:** Tận dụng kiến thức thế giới từ các mô hình ngôn ngữ lớn (như GPT) để mô tả môi trường, hiểu mục tiêu và lập kế hoạch, từ đó nâng cao hiệu quả trong các tác vụ như học tăng cường. Điều này gợi nhớ đến "chuỗi suy nghĩ" và quy trình làm việc của Agent hiện đại. 3. **Hệ thống AI có thể "thao túng" quá trình học của chính nó:** Agent có thể đặt lại tác vụ, tạo ra các kịch bản giả định, hay thậm chí đọc và sửa đổi các giá trị kích hoạt hoặc trọng số mạng nơ-ron của chính nó để luyện tập có chủ đích. Parascandolo cũng từng lập luận trong một bài blog năm 2021 rằng việc tiền huấn luyện quy mô lớn cho mạng nơ-ron có thể so sánh với quá trình tiến hóa trong sinh học, nén lượng kinh nghiệm khổng lồ để tạo ra khả năng học tập hiệu quả, chứ không nên so sánh trực tiếp với dữ liệu học ít ỏi của một đời người. Sau khi không nhận ...

Cộng đồng AI không thiếu tin đồn.

Lần này, nhân vật chính là Giambattista Parascandolo, một nhà nghiên cứu quan trọng về hướng mô hình suy luận của OpenAI.

Năm 2020, anh ấy đi phỏng vấn cho vị trí giáo sư tại MIT và đã có một bài báo cáo về việc sử dụng GPT để suy luận. Kết quả, phần lớn các giáo sư trong hội đồng phỏng vấn đã chê bai hướng đi này là "vô lý" (nonsense).

https://x.com/turingbook/status/2084003612687249836?s=20

Anh chàng này đã công khai đăng tải trải nghiệm này lên trang cá nhân của mình, và đính kèm cả phần giới thiệu báo cáo năm đó cũng như liên kết đến bản trình chiếu.

https://sites.google.com/view/giambattista-parascandolo/home

Bản báo cáo bị chê là "vô lý" đó đã nói về điều gì?

Website của MIT hiển thị, chủ đề của báo cáo này là làm thế nào để mạng nơ-ron nhân tạo có thể vượt ra khỏi phân phối huấn luyện, đạt được khả năng tổng quát hóa và lập kế hoạch gần giống với con người hơn.

Parascandolo cho rằng, con người có thể tái kết hợp kiến thức đã có, nhận diện các bất biến quan trọng, xây dựng mô hình trừu tượng và hoàn thành việc lập kế hoạch dài hạn. Mạng nơ-ron nhân tạo vẫn còn nhiều khoảng trống để cải thiện trong những khía cạnh này.

Cuối báo cáo, anh ấy đề xuất ba hướng nghiên cứu trong tương lai: Suy luận mở trong mạng nơ-ron, các bậc tự do chưa được khám phá trong mạng nơ-ron nhân tạo, và sử dụng ngôn ngữ như một phương tiện suy luận trong học tăng cường để nâng cao hiệu quả mẫu.

Trong đó, khái niệm then chốt nhất là "suy luận mở".

Parascandolo định nghĩa nó là: mô hình có thể đầu tư nhiều thời gian và tính toán hơn, liên tục chỉnh sửa câu trả lời. Vấn đề càng khó, mô hình càng nên suy nghĩ thêm vài bước, và để cho việc tính toán bổ sung chuyển hóa thành kết quả tốt hơn.

Điều này nghe đã rất giống với việc mở rộng tính toán trong thời gian suy luận ngày nay.

Transformer tiêu chuẩn lúc đó có độ sâu mạng cố định, lượng tính toán lan truyền thuận mà mỗi token trải qua về cơ bản là xác định, trong khi độ khó của vấn đề lại không có mối quan hệ ổn định với độ dài đầu vào. Một vấn đề có thể rất dài nhưng câu trả lời lại rất đơn giản. Một vấn đề khác chỉ có một câu, nhưng có thể cần nhiều vòng phân tích và xác minh.

RNN trông có vẻ phù hợp hơn cho loại tác vụ này. Nó có thể chạy lặp đi lặp lại, về lý thuyết có thể có thời gian suy nghĩ với độ dài bất kỳ. Tuy nhiên, đường cong mà Parascandolo trình bày trong PPT lại cho thấy, RNN thường chỉ hoạt động tốt nhất ở gần số bước suy luận đã gặp trong quá trình huấn luyện, nếu tiếp tục tăng số vòng lặp, độ chính xác thậm chí có thể giảm.

Điều này có nghĩa là, tăng lượng tính toán chỉ là bước đầu tiên, mô hình còn phải học cách sử dụng những tính toán này.

Lập kế hoạch nhiều bước hiệu quả nhất lúc đó, phụ thuộc nhiều vào mô hình dự đoán kiểm soát và tìm kiếm cây Monte Carlo. Mạng nơ-ron chịu trách nhiệm dự đoán môi trường hoặc đánh giá giá trị, thuật toán tìm kiếm bên ngoài chịu trách nhiệm mở rộng các đường dẫn tương lai. Parascandolo hy vọng đưa thêm khả năng suy luận dài hạn vào trong mạng nơ-ron.

Ý tưởng thứ hai của anh ấy là biến ngôn ngữ thành phương tiện suy luận.

Parascandolo lấy ví dụ với trò chơi kinh điển "Montezuma's Revenge". Một Agent học tăng cường được huấn luyện từ đầu cần thử nghiệm rất nhiều tổ hợp trạng thái và hành động, nhiều thao tác đúng bản thân chúng không phức tạp, điều mà Agent thực sự thiếu là đánh giá về "hành vi nào hợp lý hơn".

GPT đã hấp thụ một lượng lớn kiến thức thế giới từ văn bản, ngôn ngữ có thể giúp mô hình mô tả môi trường, hiểu mục tiêu, phân tách nhiệm vụ và tạo ra kế hoạch cấp cao, đồng thời cũng có thể thu hẹp đáng kể phạm vi tìm kiếm.

Đặt vào bối cảnh ngày nay, tư duy này rất dễ khiến người ta liên tưởng đến chuỗi suy nghĩ, lập kế hoạch ngôn ngữ và luồng công việc của Agent.

Hướng thứ ba mà Parascandolo đề xuất là, hệ thống trí tuệ nhân tạo có thể đặt lại nhiệm vụ, quay trở lại bất kỳ trạng thái nào trong ký ức, xây dựng các tình huống phản thực tế, cũng có thể điều chỉnh thời gian, trọng lực và kết quả quan sát trong trình mô phỏng. Hệ thống thậm chí có thể trực tiếp đọc, sao chép và sửa đổi các giá trị kích hoạt và trọng số mạng nơ-ron của chính nó.

Điều này tương đương với việc đưa chính quá trình học tập vào không gian thao tác của Agent. Nó có thể tiến hành luyện tập có chủ đích, tạo ra các cảnh huấn luyện đặc biệt, chuyển giao kiến thức đã có và học lại dựa trên các đường đi thất bại.

Trong bản trình chiếu năm năm trước, hầu như đã viết ra lộ trình của mô hình suy luận ngày nay.

Chúng tôi còn tìm ra một bài blog anh ấy viết vào tháng 6 năm 2021, tiêu đề là "Lan truyền ngược, tiến hóa và sai lầm của 'hai con chó'".

Bài blog này chủ yếu phản bác quan điểm "mạng nơ-ron cần một lượng dữ liệu khổng lồ, do đó không giống não người".

Parascandolo cho rằng, việc con người chỉ cần nhìn vài con chó là có thể học cách nhận diện, không có nghĩa là trước đó chưa tích lũy kinh nghiệm. Sự tiến hóa lâu dài đã lắng đọng kinh nghiệm tiếp xúc thế giới của tổ tiên thành cấu trúc và thiên hướng quy nạp của não người.

Theo góc nhìn này, việc tiền huấn luyện quy mô lớn của mạng nơ-ron có thể được so sánh với sự tiến hóa sinh học, còn việc tinh chỉnh mô hình và học trong ngữ cảnh mới gần giống với việc học tập của một cá nhân trong suốt cuộc đời. GPT-3 đã đọc lượng văn bản vượt xa bất kỳ cá nhân nào, nhưng quá trình tiền huấn luyện của nó đã đảm nhận vai trò nén lượng kinh nghiệm khổng lồ và định hình khả năng học tập hiệu quả. Do đó, không thể trực tiếp so sánh toàn bộ dữ liệu tiền huấn luyện của mô hình với một lượng mẫu học nhỏ sau khi một người sinh ra.

Cách hiểu này cũng có nghĩa là, tiếp tục mở rộng dữ liệu và sức mạnh tính toán vẫn có thể mang lại sự cải thiện rõ rệt. Anh ấy so sánh vai trò mà cả hai phát huy, chứ không cho rằng cơ chế cụ thể của lan truyền ngược và tiến hóa sinh học là giống nhau.

Anh chàng này là ai?

Anh chàng này khá kín tiếng, bài đăng mới nhất trên X còn phải lần về tháng 11 năm 2024, lúc đó anh ấy đang tuyển hai kỹ sư nghiên cứu (RE) và kỹ sư phần mềm (SWE) cho o1.

Theo trang cá nhân của anh ấy, quá trình nghiên cứu của Parascandolo luôn xoay quanh tổng quát hóa, lập kế hoạch và suy luận.

Năm 2017, anh ấy vào học tiến sĩ tại Viện Hệ thống Thông minh Max Planck và Viện Công nghệ Liên bang Zurich, dưới sự hướng dẫn của Bernhard Schölkopf và Thomas Hofmann, đề tài tiến sĩ tập trung vào tổng quát hóa OOD trong học sâu.

Trong thời gian học tiến sĩ, anh ấy đã từng thực tập tại Google X ở Mountain View và DeepMind ở London, tham gia nghiên cứu về thiết kế tự động trên trình mô phỏng siêu quy mô ở nơi trước, và nghiên cứu về tìm kiếm cây Monte Carlo phân chia và chinh phục ở nơi sau.

Tháng 9 năm 2021, sau khi tốt nghiệp tiến sĩ, anh ấy trực tiếp gia nhập OpenAI, ban đầu vào nhóm học tăng cường do John Schulman lãnh đạo, sau đó chuyển sang nhóm thuật toán của Mark Chen, rồi gia nhập nhóm 🍓 (dâu tây) do Jerry Tworek dẫn dắt. Nhóm dâu tây chính là mật danh nội bộ của dự án o1.

Năm 2023, anh ấy tham gia phát triển GPT-4 và thành lập một nhóm mới tiếp tục nghiên cứu suy luận. Sau đó lại tham gia vào nghiên cứu cơ bản của OpenAI o1 và o3, thúc đẩy việc mở rộng mô hình hóa phần thưởng, xây dựng môi trường và thuật toán suy luận tổng quát. Một phần mô tả thuật toán trong đó, đến nay vẫn bị anh ấy che bằng khối đen.

Buổi phỏng vấn năm 2020 đó, Parascandolo đã không nhận được vị trí giảng dạy tại MIT, anh ấy đã đến OpenAI.

Bốn năm sau, anh ấy đã giúp xây dựng o1.

Cuộc đời luôn diệu kỳ khó lường.

Liên kết tham khảo:

https://x.com/giambattista92

https://sites.google.com/view/giambattista-parascandolo/home

https://gibipara92.github.io/2021/06/09/backprop-evolution-two-dogs.html

https://docs.google.com/presentation/d/1edd2GkAP31wNygaev3DO8gE1t2lgsx1z8TeVpBKqlYA/edit?slide=id.gc772610149_0_179#slide=id.gc772610149_0_179

Bài viết này từ tài khoản công chúng WeChat "机器之心" (ID:almosthuman2014), tác giả: Dương Văn

Tiền kỹ thuật số thịnh hành

Câu hỏi Liên quan

QBáo cáo của Giambattista Parascandolo năm 2020 bị các giáo sư MIT chỉ trích là vô lý, chủ đề chính của báo cáo đó là gì?

ABáo cáo có chủ đề làm thế nào để mạng nơ-ron nhân tạo có thể vượt ra ngoài phân phối huấn luyện, đạt được khả năng khái quát hóa và lập kế hoạch gần giống con người hơn.

QKhái niệm 'lập luận mở' (open-ended reasoning) trong báo cáo của Parascandolo được định nghĩa như thế nào?

AÔng định nghĩa 'lập luận mở' là việc mô hình có thể dành nhiều thời gian và tính toán hơn để liên tục sửa câu trả lời. Vấn đề càng khó, mô hình càng cần suy nghĩ nhiều bước hơn, và việc tính toán thêm này phải chuyển hóa thành kết quả tốt hơn.

QTrong báo cáo, Parascandolo đã đưa ra bao nhiêu hướng nghiên cứu tương lai, và hướng nào liên quan đến việc sử dụng ngôn ngữ?

AÔng đưa ra ba hướng nghiên cứu tương lai. Hướng thứ hai là sử dụng ngôn ngữ làm phương tiện lập luận, giúp thu hẹp phạm vi tìm kiếm và nâng cao hiệu quả mẫu trong học tăng cường.

QTheo bài viết, Parascandolo đã tham gia vào những dự án nổi bật nào tại OpenAI?

AÔng tham gia phát triển GPT-4, thành lập một nhóm nghiên cứu lập luận mới, và sau đó tham gia nghiên cứu cơ bản cho các mô hình OpenAI o1 và o3, thúc đẩy việc mở rộng mô hình hóa phần thưởng, xây dựng môi trường và thuật toán lập luận tổng quát.

QQuan điểm của Parascandolo trong bài blog năm 2021 về việc so sánh học tập của mạng nơ-ron và con người là gì?

AÔng cho rằng việc tiền huấn luyện quy mô lớn của mạng nơ-ron có thể so sánh với quá trình tiến hóa sinh học, còn việc tinh chỉnh mô hình và học trong ngữ cảnh mới giống với việc học tập của một cá nhân trong suốt cuộc đời. Do đó, không nên trực tiếp so sánh toàn bộ dữ liệu tiền huấn luyện của mô hình với lượng mẫu học ít ỏi sau khi một con người sinh ra.

Nội dung Liên quan

Giải Mã TapeOut: Một Đứa Trẻ Đã Tạo Ra Một CPU Trên Chuỗi

TapeOut, một giao thức thử nghiệm trên BNB Chain, cho phép người dùng "đúc" một bộ vi xử lý vật lý thực sự trên blockchain. Lõi của giao thức này là việc biến các cổng logic NAND cơ bản thành token ERC-1155. Người dùng có thể kết nối các "transistor token" này trong một hệ thống canvas trình duyệt để tạo ra các mạch, sau đó "xuất bản" chúng thành NFT mạch ERC-721 bất biến. Nhà phát triển Blonskr đã sử dụng 2300 transistor để tạo ra Behemoth, một CPU 4-bit mô phỏng Intel 4004 chạy trên BNB Chain. CPU này hoạt động vĩnh viễn, được đồng bộ hóa bởi thời gian tạo khối (tần số ~2.22 Hz). Mọi người đều có thể truy vấn nó miễn phí. Tính năng đáng chú ý là khả năng kết hợp an toàn: các mạch trên chain không có quyền gọi hay trạng thái có thể ghi, chỉ trả về kết quả tính toán, loại bỏ rủi ro bảo mật. Giao thức mở ra một hướng đi mới: thiết kế mạch chuyên dụng để "đào" coin, biến thợ đào từ người tiêu thụ năng lượng thành nhà thiết kế logic. Mặc dù rất kỹ thuật và chuyên sâu, TapeOut đặt ra một câu trả lời độc đáo cho câu hỏi "blockchain có thể chứa gì?", bằng cách tái tạo nền tảng tính toán vật lý trên một môi trường phi tập trung, mở và có thể kết hợp vô hạn.

marsbit41 phút trước

Giải Mã TapeOut: Một Đứa Trẻ Đã Tạo Ra Một CPU Trên Chuỗi

marsbit41 phút trước

Chủ Sở Hữu XRP Có Thể Giao Dịch Quyền Chọn Trên Nền Tảng Derive Bằng Cách Sử Dụng FXRP Làm Tài Sản Thế Chấp

Flare thông báo từ ngày 12/8, các nhà nắm giữ XRP giờ đây có thể sử dụng FXRP (một phiên bản XRP được đảm bảo trên mạng lưới Flare) làm tài sản thế chấp để giao dịch quyền chọn (options), hợp đồng tương lai vĩnh viễn (perpetuals) và giao dịch giao ngay (spot) trên nền tảng Derive. FXRP cho phép người dùng mở các vị thế trực tiếp từ ví tự lưu trữ trong khi XRP cơ bản vẫn được giữ trên XRP Ledger. Theo thông báo, việc tích hợp này đáp ứng nhu cầu của cộng đồng nắm giữ XRP lâu dài về một thị trường quyền chọn không cần cấp phép để tạo lợi nhuận hoặc phòng ngừa rủi ro. Derive kết hợp tính toán giao thức với sổ lệnh do Derive Trading Co. quản lý, cho phép người dùng kiểm soát tài sản trong khi các nhà tạo lịch sự chuyên nghiệp cung cấp thanh khoản. Các hợp đồng quyền chọn XRP trên Derive được thanh toán bằng USDC (tiền mặt), và lợi nhuận/thua lỗ khi đáo hạn sẽ được phản ánh trên số dư USDC của nhà giao dịch. Hệ thống ký quỹ danh mục (Portfolio Margin V2) được sử dụng để đánh giá rủi ro và giảm yêu cầu ký quỹ cho các vị thế phòng ngừa lẫn nhau. Tuy nhiên, các vị thế không đủ ký quỹ vẫn có thể bị thanh lý. FXRP là một phần trong hệ sinh thái XRPFi mở rộng của Flare, cho phép XRP tương tác với hợp đồng thông minh. Ngoài Derive, FXRP cũng đã được tích hợp vào các nền tảng giao ngay và thị trường cho vay phi tập trung (như Morpho), mở rộng các trường hợp sử dụng. Trước đó, quyền chọn XRP cũng đã xuất hiện trên thị trường phái sinh được quy định như CME Group, nhưng Derive nhắm đến người dùng phi tập trung với quy trình thanh toán bằng USDC và truy cập trực tiếp qua ví. Bên cạnh quyền chọn, nền tảng cũng cung cấp hợp đồng tương lai vĩnh viễn.

cryptonews.ru49 phút trước

Chủ Sở Hữu XRP Có Thể Giao Dịch Quyền Chọn Trên Nền Tảng Derive Bằng Cách Sử Dụng FXRP Làm Tài Sản Thế Chấp

cryptonews.ru49 phút trước

Nhà giao dịch đầu tư 120 USD vào memecoin NiuLai và thu về lợi nhuận 205.000 USD

Một nhà giao dịch tiền điện tử đã biến khoản đầu tư 120 USD thành 205.000 USD nhờ vào đồng memecoin NiuLai trên chuỗi BNB. Ông đã mua 19,1 triệu token NiuLai chỉ với 120 USD trước khi giá token tăng mạnh. Nhà đầu tư may mắn này đã bán 9,1 triệu token để thu về 25.900 USD, trong khi vẫn giữ lại 10 triệu token trị giá khoảng 180.200 USD, theo dữ liệu từ Lookonchain. Tổng lợi nhuận đã thực hiện và chưa thực hiện là 205.800 USD, tương đương lợi nhuận gấp 822 lần số vốn ban đầu. Dữ liệu chuỗi khối cho thấy nhà giao dịch đã mở vị thế khi vốn hóa thị trường của token chỉ là 6.270 USD. Sự quan tâm đến tài sản này sau đó đã đẩy vốn hóa thị trường của NiuLai lên hàng chục triệu USD. NiuLai, có nghĩa là "Con bò đang tới", là một memecoin lấy cảm hứng từ một bộ phim hoạt hình Trung Quốc cùng tên. Bộ phim ngân sách thấp ban đầu ít được chú ý nhưng sau đó trở nên viral trên các nền tảng mạng xã hội Trung Quốc, tạo ra nhiều meme và thu hút sự chú ý. Cơn sốt trên mạng nhanh chóng lan sang thị trường tiền điện tử, dẫn đến sự ra mắt của tài sản đầu cơ này. Những người mua NiuLai đầu tiên đã thu được lợi nhuận khổng lồ khi vốn hóa thị trường tăng từ vài nghìn USD lên 18-20 triệu USD, nhờ hoạt động giao dịch sôi nổi trên PancakeSwap và các sàn giao dịch phi tập trung khác. Vốn hóa thị trường từng đạt đỉnh 29 triệu USD trước khi giảm mạnh.

cryptonews.ru51 phút trước

Nhà giao dịch đầu tư 120 USD vào memecoin NiuLai và thu về lợi nhuận 205.000 USD

cryptonews.ru51 phút trước

Giao dịch

Giao ngay

Bài viết Nổi bật

Làm thế nào để Mua CORE

Chào mừng bạn đến với HTX.com! Chúng tôi đã làm cho mua CORE (CORE) trở nên đơn giản và thuận tiện. Làm theo hướng dẫn từng bước của chúng tôi để bắt đầu hành trình tiền kỹ thuật số của bạn.Bước 1: Tạo Tài khoản HTX của BạnSử dụng email hoặc số điện thoại của bạn để đăng ký tài khoản miễn phí trên HTX. Trải nghiệm hành trình đăng ký không rắc rối và mở khóa tất cả tính năng. Nhận Tài khoản của tôiBước 2: Truy cập Mua Crypto và Chọn Phương thức Thanh toán của BạnThẻ Tín dụng/Ghi nợ: Sử dụng Visa hoặc Mastercard của bạn để mua CORE (CORE) ngay lập tức.Số dư: Sử dụng tiền từ số dư tài khoản HTX của bạn để giao dịch liền mạch.Bên thứ ba: Chúng tôi đã thêm những phương thức thanh toán phổ biến như Google Pay và Apple Pay để nâng cao sự tiện lợi.P2P: Giao dịch trực tiếp với người dùng khác trên HTX.Thị trường mua bán phi tập trung (OTC): Chúng tôi cung cấp những dịch vụ được thiết kế riêng và tỷ giá hối đoái cạnh tranh cho nhà giao dịch.Bước 3: Lưu trữ CORE (CORE) của BạnSau khi mua CORE (CORE), lưu trữ trong tài khoản HTX của bạn. Ngoài ra, bạn có thể gửi đi nơi khác qua chuyển khoản blockchain hoặc sử dụng để giao dịch những tiền kỹ thuật số khác.Bước 4: Giao dịch CORE (CORE)Giao dịch CORE (CORE) dễ dàng trên thị trường giao ngay của HTX. Chỉ cần truy cập vào tài khoản của bạn, chọn cặp giao dịch, thực hiện giao dịch và theo dõi trong thời gian thực. Chúng tôi cung cấp trải nghiệm thân thiện với người dùng cho cả người mới bắt đầu và người giao dịch dày dạn kinh nghiệm.

Tổng lượt xem 618Xuất bản vào 2024.12.13Cập nhật vào 2026.06.02

Làm thế nào để Mua CORE

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của CORE (CORE) được trình bày dưới đây.

活动图片