5 Tahun Lalu Dituding 'Nonsense' oleh Profesor MIT, PPT Ini Memprediksi Inti Pikiran OpenAI o1 dan o3

marsbitXuất bản vào 2026-08-17Cập nhật gần nhất vào 2026-08-17

Tóm tắt

Kisah ini berpusat pada Giambattista Parascandolo, seorang peneliti utama di OpenAI yang fokus pada model penalaran. Pada tahun 2020, saat melamar posisi profesor di MIT, presentasinya tentang penggunaan GPT untuk penalaran justru dicap sebagai "nonsense" atau omong kosong oleh sebagian besar komite profesor. Presentasi yang kontroversial itu membahas tiga arah penelitian masa depan: 1. **Penalaran Terbuka (Open-ended Reasoning)**: Ide bahwa model AI harus dapat mengalokasikan lebih banyak waktu dan komputasi untuk memikirkan masalah yang sulit, terus memperbaiki jawabannya. Konsep ini sangat mirip dengan perluasan komputasi pada waktu inferensi (reasoning-time computation) yang digunakan model seperti OpenAI o1 dan o3 saat ini. 2. **Bahasa sebagai Wadah Penalaran**: Mengusulkan penggunaan pengetahuan bahasa dari model seperti GPT untuk membantu dalam perencanaan dan penalaran tugas-tugas kompleks, misalnya dalam lingkungan *reinforcement learning*. Ini mengantisipasi teknik seperti *chain-of-thought* dan alur kerja *agent*. 3. **Sistem yang Dapat Belajar dan Memodifikasi Diri**: Visi di mana agen AI dapat secara aktif mengatur ulang tugas, membuat skenario *counterfactual*, dan bahkan membaca atau memodifikasi aktivasi serta bobot jaringannya sendiri untuk belajar lebih efektif. Parascandolo, yang memulai karir risetnya tentang generalisasi dan perencanaan, bergabung dengan OpenAI pada 2021 setelah menyelesaikan PhD. Di sana, ia terlibat dalam pengembangan GPT-4 dan kem...

Lingkaran AI tidak kekurangan gosip.

Tokoh utama kali ini bernama Giambattista Parascandolo, peneliti penting di bidang model penalaran OpenAI.

Tahun 2020, dia mengikuti wawancara untuk posisi profesor di MIT, memberikan presentasi tentang penggunaan GPT untuk penalaran. Hasilnya, sebagian besar profesor di panel wawancara mencap arah penelitian ini sebagai "nonsense" (omong kosong).

https://x.com/turingbook/status/2084003612687249836?s=20

Pria ini langsung berani buka kartu, menuliskan pengalaman ini di halaman pribadinya, dan melampirkan tautan presentasi dan slide dari tahun itu.

https://sites.google.com/view/giambattista-parascandolo/home

Laporan yang Dicap "Omong Kosong" Itu, Berisi Apa?

Situs web MIT menunjukkan, tema presentasi ini adalah bagaimana jaringan saraf tiruan dapat melampaui distribusi pelatihan, memperoleh kemampuan generalisasi dan perencanaan yang lebih mendekati manusia.

Parascandolo percaya, manusia mampu menggabungkan kembali pengetahuan yang ada, mengidentifikasi invarian kunci, membangun model abstrak, dan menyelesaikan perencanaan jangka panjang. Jaringan saraf tiruan masih memiliki ruang peningkatan yang besar dalam aspek-aspek ini.

Di akhir laporan, dia mengajukan tiga arah penelitian di masa depan: penalaran terbuka dalam jaringan saraf, derajat kebebasan yang belum dieksplorasi dalam jaringan saraf tiruan, serta penggunaan bahasa sebagai wahana penalaran dalam pembelajaran penguatan, untuk meningkatkan efisiensi sampel.

Konsep paling kunci di antaranya adalah "penalaran terbuka".

Parascandolo mendefinisikannya sebagai: model dapat mengalokasikan lebih banyak waktu dan komputasi, terus-menerus memperbaiki jawaban. Semakin sulit masalahnya, model seharusnya berpikir beberapa langkah lebih banyak, dan mengubah komputasi tambahan menjadi hasil yang lebih baik.

Ini terdengar sangat mirip dengan perluasan komputasi saat penalaran hari ini.

Transformer standar saat itu memiliki kedalaman jaringan yang tetap, jumlah komputasi maju yang dialami setiap token pada dasarnya ditentukan, sementara tingkat kesulitan masalah tidak memiliki hubungan stabil dengan panjang masukan. Sebuah masalah bisa sangat panjang, tetapi jawabannya sederhana. Masalah lain mungkin hanya satu kalimat, tetapi memerlukan beberapa putaran dekomposisi dan verifikasi.

RNN tampaknya lebih cocok untuk tugas semacam ini. Ia dapat berjalan berulang kali, secara teori mampu mendapatkan waktu berpikir sepanjang apapun. Namun, kurva yang ditunjukkan Parascandolo dalam PPT menunjukkan, RNN biasanya hanya berkinerja terbaik di sekitar jumlah langkah penalaran yang pernah dilihat selama pelatihan, melanjutkan penambahan siklus justru dapat menurunkan akurasi.

Ini berarti, menambah jumlah komputasi hanyalah langkah pertama, model juga harus belajar bagaimana memanfaatkan komputasi ini.

Perencanaan multi-langkah paling efektif saat itu banyak bergantung pada kontrol prediktif model dan pencarian pohon Monte Carlo. Jaringan saraf bertanggung jawab untuk memprediksi lingkungan atau mengevaluasi nilai, algoritma pencarian eksternal bertanggung jawab untuk mengembangkan jalur masa depan. Parascandolo berharap lebih jauh mengintegrasikan kemampuan penalaran jangka panjang ke dalam jaringan saraf.

Gagasannya yang kedua adalah membuat bahasa menjadi wahana penalaran.

Parascandolo memberi contoh dengan game klasik "Montezuma's Revenge". Sebuah Agen pembelajaran penguatan yang dilatih dari nol perlu mencoba banyak kombinasi keadaan dan aksi, banyak tindakan yang benar itu sendiri tidak rumit, yang benar-benar kurang dari Agen adalah penilaian tentang "perilaku apa yang lebih masuk akal".

GPT telah menyerap banyak pengetahuan dunia dari teks, bahasa dapat membantu model menggambarkan lingkungan, memahami tujuan, memecah tugas dan menghasilkan rencana tingkat tinggi, juga dapat menyempitkan rentang pencarian secara signifikan.

Ditempatkan di hari ini, pemikiran ini mudah mengingatkan pada rantai pikiran, perencanaan bahasa, dan alur kerja Agen.

Arah ketiga yang diajukan Parascandolo adalah, sistem kecerdasan buatan dapat mereset tugas, kembali ke keadaan apa pun dalam ingatan, membangun skenario kontrafaktual, juga dapat menyesuaikan waktu, gravitasi, dan hasil observasi dalam simulator. Sistem bahkan dapat langsung membaca, menyalin, dan memodifikasi nilai aktivasi serta bobot jaringan sarafnya sendiri.

Ini setara dengan memasukkan proses pembelajaran itu sendiri ke dalam ruang operasi Agen. Ia dapat melakukan latihan yang disengaja, menghasilkan skenario pelatihan khusus, mentransfer pengetahuan yang ada, dan belajar kembali untuk lintasan yang gagal.

Dalam PPT lima tahun lalu, hampir menuliskan rute model penalaran hari ini.

Kami juga menggali blog yang dia tulis pada Juni 2021, judulnya adalah "Backpropagation, Evolusi, dan Kesalahan 'Dua Anjing'".

Blog ini terutama membantah pandangan "jaringan saraf membutuhkan data yang sangat banyak, sehingga tidak mirip otak manusia".

Parascandolo berpendapat, manusia hanya perlu melihat beberapa ekor anjing untuk belajar mengenali, tidak berarti tidak ada akumulasi pengalaman sebelumnya. Evolusi panjang telah mengendapkan pengalaman nenek moyang dalam berinteraksi dengan dunia, menjadi struktur dan bias induktif otak manusia.

Menurut perspektif ini, pelatihan awal skala besar jaringan saraf dapat dianalogikan dengan evolusi biologis, penyesuaian halus model dan pembelajaran kontekstual lebih mendekati pembelajaran individu sepanjang hidupnya. GPT-3 membaca teks jauh melebihi individu mana pun, tetapi pelatihan awalnya mengambil peran mengompresi pengalaman yang sangat besar, membentuk kemampuan pembelajaran yang efisien. Oleh karena itu, tidak dapat secara langsung membandingkan semua data pelatihan awal model, dengan sedikit sampel pembelajaran seseorang setelah lahir.

Pemahaman ini juga berarti, terus memperluas data dan daya komputasi masih mungkin membawa peningkatan yang nyata. Dia menganalogikan peran yang dimainkan keduanya, tidak menganggap mekanisme spesifik penurunan gradien sama dengan evolusi biologis.

Dari Mana Asal Pria Ini?

Pria ini cukup rendah hati, postingan terbaru di X masih berasal dari November 2024, saat itu dia sedang merekrut dua insinyur penelitian (RE) dan insinyur perangkat lunak (SWE) untuk o1.

Menurut halaman pribadinya, pengalaman penelitian Parascandolo selalu berkisar pada generalisasi, perencanaan, dan penalaran.

2017, dia memasuki Max Planck Institute for Intelligent Systems dan ETH Zurich untuk mengejar gelar doktor, dibimbing oleh Bernhard Schölkopf dan Thomas Hofmann, disertasi berfokus pada generalisasi OOD dalam pembelajaran mendalam.

Selama doktor, dia masing-masing melakukan magang di Google X di Mountain View dan DeepMind di London, yang pertama terlibat dalam penelitian desain otomatisasi pada simulator skala sangat besar, yang kedua terlibat dalam penelitian pencarian pohon Monte Carlo dengan pembagian.

September 2021 lulus doktor, dia langsung bergabung dengan OpenAI, awalnya masuk tim pembelajaran penguatan yang dipimpin John Schulman, kemudian beralih ke tim algoritma tempat Mark Chen berada, lalu bergabung dengan tim 🍓 (strawberry) yang dipimpin Jerry Tworek. Tim strawberry, adalah kode internal untuk proyek o1.

2023, dia terlibat dalam pengembangan GPT-4, dan membentuk tim baru yang terus meneliti penalaran. Kemudian terlibat dalam penelitian dasar OpenAI o1 dan o3, mendorong perluasan pemodelan hadiah, konstruksi lingkungan, dan algoritma penalaran umum. Sebagian deskripsi algoritma masih ditutupi dengan blok hitam olehnya hingga kini.

Wawancara tahun 2020 itu, Parascandolo tidak berhasil mendapatkan jabatan pengajar di MIT, dia pergi ke OpenAI.

Empat tahun kemudian, dia membantu membangun o1.

Hidup selalu penuh keajaiban.

Tautan Referensi:

https://x.com/giambattista92

https://sites.google.com/view/giambattista-parascandolo/home

https://gibipara92.github.io/2021/06/09/backprop-evolution-two-dogs.html

https://docs.google.com/presentation/d/1edd2GkAP31wNygaev3DO8gE1t2lgsx1z8TeVpBKqlYA/edit?slide=id.gc772610149_0_179#slide=id.gc772610149_0_179

Artikel ini berasal dari akun WeChat publik "机器之心" (ID:almosthuman2014), penulis: Yang Wen

Tiền kỹ thuật số thịnh hành

Câu hỏi Liên quan

QApa inti dari presentasi Giambattista Parascandolo yang sempat dicap sebagai 'nonsense' oleh panel profesor MIT?

APresentasi tersebut membahas tentang bagaimana jaringan saraf tiruan dapat melampaui distribusi pelatihan untuk mendapatkan kemampuan generalisasi dan perencanaan yang lebih mirip manusia. Parascandolo mengusulkan konsep 'reasoning terbuka', di mana model dapat mengalokasikan lebih banyak waktu dan komputasi untuk terus menyempurnakan jawaban, sebuah ide yang menjadi inti dari model reasoning seperti OpenAI o1 dan o3.

QApa saja tiga arah penelitian masa depan yang diusulkan Parascandolo dalam presentasinya?

ATiga arah penelitian tersebut adalah: 1) Reasoning terbuka dalam jaringan saraf, 2) Menggunakan bahasa sebagai wahana untuk reasoning dalam pembelajaran penguatan untuk meningkatkan efisiensi sampel, dan 3) Sistem AI yang dapat mengatur ulang tugas, mengonstruksi skenario kontrafaktual, dan bahkan memodifikasi nilai aktivasi serta bobot jaringannya sendiri.

QMengapa ide menggunakan bahasa sebagai wahana reasoning dianggap penting oleh Parascandolo?

AKarena bahasa, seperti yang telah diserap model seperti GPT dari teks, mengandung banyak pengetahuan dunia. Bahasa dapat membantu model mendeskripsikan lingkungan, memahami tujuan, memecah tugas, membuat rencana tingkat tinggi, dan secara signifikan mempersempit ruang pencarian, mirip dengan cara kerja 'chain-of-thought' atau alur kerja 'Agent' saat ini.

QBagaimana Parascandolo menganalogikan pelatihan besar-besaran model bahasa seperti GPT-3?

AParascandolo menganalogikan pelatihan besar-besaran (pre-training) model dengan proses evolusi biologis, yang mengompresi pengalaman luas leluhur menjadi struktur dan bias induktif. Sedangkan penyesuaian halus (fine-tuning) dan pembelajaran dalam konteks (in-context learning) lebih mirip dengan pembelajaran individu dalam satu masa hidup. Ini membantah klaim bahwa neural network tidak seperti otak manusia karena butuh data sangat banyak.

QApa peran Giambattista Parascandolo dalam pengembangan AI di OpenAI?

ASetelah bergabung dengan OpenAI pada tahun 2021, Parascandolo terlibat dalam pengembangan GPT-4 dan kemudian membentuk tim baru yang fokus pada penelitian reasoning. Dia berperan penting dalam penelitian dasar untuk model OpenAI o1 dan o3, dengan berkontribusi pada pemodelan imbalan, konstruksi lingkungan, dan perluasan algoritma reasoning umum.

Nội dung Liên quan

Elon Musk và Công ty X Tiến Thêm Bước Về Tiền Mã Hóa! Một Kỷ Nguyên Thanh Toán Mới Đang Ló Dạng! Đây Là Chi Tiết

Nền tảng truyền thông xã hội X của Elon Musk đang xem xét khả năng sử dụng stablecoin để trả thưởng cho những người sáng tạo nội dung. Theo nguồn tin, X đang đàm phán về việc sử dụng stablecoin, chủ yếu là USDC, cho các khoản thanh toán này. Kế hoạch hiện vẫn đang được thảo luận và chưa có quyết định cuối cùng hay thời điểm triển khai cụ thể. Nếu được thực hiện, nó có thể cho phép các nhà sáng tạo nội dung trên toàn cầu nhận tiền nhanh hơn dưới dạng kỹ thuật số. Các chuyên gia nhận định việc sử dụng stablecoin, đặc biệt trong thanh toán xuyên biên giới, có thể trở thành một giải pháp thay thế cho các hệ thống thanh toán truyền thống. Bài báo cũng đề cập rằng SpaceX, một công ty khác của Elon Musk, đã sử dụng stablecoin để thực hiện các khoản thanh toán xuyên biên giới cho dịch vụ Starlink ở một số quốc gia. Mặc dù chưa được phê duyệt, việc X cân nhắc sử dụng các đồng tiền kỹ thuật số như USDC được coi là một tín hiệu mới về khả năng mở rộng ứng dụng của stablecoin vào các giao dịch thanh toán kỹ thuật số hàng ngày.

cryptonews.ru2 giờ trước

Elon Musk và Công ty X Tiến Thêm Bước Về Tiền Mã Hóa! Một Kỷ Nguyên Thanh Toán Mới Đang Ló Dạng! Đây Là Chi Tiết

cryptonews.ru2 giờ trước

Nhà đầu tư tiền điện tử mất 1010 ETH do truy cập trang web Tornado Cash lỗi thời

Nhà đầu tư tiền điện tử mất 1.010 ETH do truy cập trang web Tornado Cash lỗi thời bị chiếm đoạt. Các nhà phân tích từ Wu Blockchain cho biết nạn nhân đã sử dụng dấu trang trình duyệt cũ để vào trang trộn tiền điện tử, lúc này tên miền đã bị kẻ xấu kiểm soát và triển khai giao diện giả mạo. Tin rằng mình đang tương tác với hợp đồng thông minh Tornado Cash thật, nạn nhân đã cấp quyền truy cập tài sản cho bọn lừa đảo, và số tiền bị rút sạch trong vòng 12 giờ. Số tiền bị đánh cắp, hiện nằm rải rác trên nhiều địa chỉ ví do tội phạm kiểm soát, được rút thành nhiều lần nhỏ. Nhóm Tornado Cash đã mất quyền kiểm soát tên miền cũ sau lệnh trừng phạt của OFAC Mỹ năm 2022, và kể từ đó, bọn tội phạm đã đăng ký lại và vận hành trang web lừa đảo. Trong 12 tháng qua, trang web giả này được cho là đã đánh cắp tổng cộng khoảng 4.000 ETH từ nhiều người dùng. Trong bối cảnh này, các chuyên gia bảo mật Bitdefender cũng cảnh báo về phần mềm độc hại Lumma Stealer đang được phát tán dưới vỏ bọc là bản phim lậu của bộ phim "Oppenheimer" đạo diễn bởi Christopher Nolan.

cryptonews.ru2 giờ trước

Nhà đầu tư tiền điện tử mất 1010 ETH do truy cập trang web Tornado Cash lỗi thời

cryptonews.ru2 giờ trước

Các chuyên gia phân tích: MiCA chưa gây ra đợt rút vốn toàn cầu đáng kể khỏi USDT

Các nhà phân tích cho biết Quy định về Thị trường Tài sản Crypto (MiCA) của châu Âu chưa gây ra hiện tượng rút tiền hàng loạt trên toàn cầu khỏi stablecoin USDT. Dữ liệu từ Artemis Analytics và một nghiên cứu độc lập của Đại học LUISS và Đại học Surrey chỉ ra rằng việc hạn chế USDT trên các sàn giao dịch được quản lý ở châu Âu chưa dẫn đến sự sụt giảm đáng kể về nguồn cung hoặc nhu cầu toàn cầu đối với USDT. Nghiên cứu xác nhận MiCA đã thay đổi cơ cấu giao dịch trên một số nền tảng cụ thể ở châu Âu, nơi thị phần của USDC đã tăng lên sau khi USDT bị hạn chế. Tuy nhiên, thị phần và khối lượng giao dịch tổng hợp của các stablecoin hàng đầu hầu như không thay đổi trên quy mô toàn cầu. USDT vẫn giữ vị trí dẫn đầu với vốn hóa thị trường khoảng 183 tỷ USD vào cuối tháng 7. Hoạt động với USDT tiếp tục mở rộng mạnh mẽ bên ngoài châu Âu, đặc biệt trên các mạng như BNB Chain và Tron, phản ánh xu hướng áp dụng số hóa đô la trên các thị trường mới nổi. Trong khi đó, tại châu Âu, việc Tether không đăng ký theo MiCA đã khiến nhiều dịch vụ phải hạn chế USDT. Dù vậy, dữ liệu không cho thấy sự dịch chuyển thanh khoản quy mô lớn hoặc thay đổi đột ngột trùng khớp với thời điểm MiCA có hiệu lực.

cryptonews.ru2 giờ trước

Các chuyên gia phân tích: MiCA chưa gây ra đợt rút vốn toàn cầu đáng kể khỏi USDT

cryptonews.ru2 giờ trước

Giao dịch

Giao ngay

Bài viết Nổi bật

Làm thế nào để Mua CORE

Chào mừng bạn đến với HTX.com! Chúng tôi đã làm cho mua CORE (CORE) trở nên đơn giản và thuận tiện. Làm theo hướng dẫn từng bước của chúng tôi để bắt đầu hành trình tiền kỹ thuật số của bạn.Bước 1: Tạo Tài khoản HTX của BạnSử dụng email hoặc số điện thoại của bạn để đăng ký tài khoản miễn phí trên HTX. Trải nghiệm hành trình đăng ký không rắc rối và mở khóa tất cả tính năng. Nhận Tài khoản của tôiBước 2: Truy cập Mua Crypto và Chọn Phương thức Thanh toán của BạnThẻ Tín dụng/Ghi nợ: Sử dụng Visa hoặc Mastercard của bạn để mua CORE (CORE) ngay lập tức.Số dư: Sử dụng tiền từ số dư tài khoản HTX của bạn để giao dịch liền mạch.Bên thứ ba: Chúng tôi đã thêm những phương thức thanh toán phổ biến như Google Pay và Apple Pay để nâng cao sự tiện lợi.P2P: Giao dịch trực tiếp với người dùng khác trên HTX.Thị trường mua bán phi tập trung (OTC): Chúng tôi cung cấp những dịch vụ được thiết kế riêng và tỷ giá hối đoái cạnh tranh cho nhà giao dịch.Bước 3: Lưu trữ CORE (CORE) của BạnSau khi mua CORE (CORE), lưu trữ trong tài khoản HTX của bạn. Ngoài ra, bạn có thể gửi đi nơi khác qua chuyển khoản blockchain hoặc sử dụng để giao dịch những tiền kỹ thuật số khác.Bước 4: Giao dịch CORE (CORE)Giao dịch CORE (CORE) dễ dàng trên thị trường giao ngay của HTX. Chỉ cần truy cập vào tài khoản của bạn, chọn cặp giao dịch, thực hiện giao dịch và theo dõi trong thời gian thực. Chúng tôi cung cấp trải nghiệm thân thiện với người dùng cho cả người mới bắt đầu và người giao dịch dày dạn kinh nghiệm.

Tổng lượt xem 630Xuất bản vào 2024.12.13Cập nhật vào 2026.06.02

Làm thế nào để Mua CORE

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của CORE (CORE) được trình bày dưới đây.

活动图片