5 Tahun Lalu Dituding 'Nonsense' oleh Profesor MIT, PPT Ini Memprediksi Inti Pikiran OpenAI o1 dan o3

marsbit发布于2026-08-17更新于2026-08-17

文章摘要

Kisah ini berpusat pada Giambattista Parascandolo, seorang peneliti utama di OpenAI yang fokus pada model penalaran. Pada tahun 2020, saat melamar posisi profesor di MIT, presentasinya tentang penggunaan GPT untuk penalaran justru dicap sebagai "nonsense" atau omong kosong oleh sebagian besar komite profesor. Presentasi yang kontroversial itu membahas tiga arah penelitian masa depan: 1. **Penalaran Terbuka (Open-ended Reasoning)**: Ide bahwa model AI harus dapat mengalokasikan lebih banyak waktu dan komputasi untuk memikirkan masalah yang sulit, terus memperbaiki jawabannya. Konsep ini sangat mirip dengan perluasan komputasi pada waktu inferensi (reasoning-time computation) yang digunakan model seperti OpenAI o1 dan o3 saat ini. 2. **Bahasa sebagai Wadah Penalaran**: Mengusulkan penggunaan pengetahuan bahasa dari model seperti GPT untuk membantu dalam perencanaan dan penalaran tugas-tugas kompleks, misalnya dalam lingkungan *reinforcement learning*. Ini mengantisipasi teknik seperti *chain-of-thought* dan alur kerja *agent*. 3. **Sistem yang Dapat Belajar dan Memodifikasi Diri**: Visi di mana agen AI dapat secara aktif mengatur ulang tugas, membuat skenario *counterfactual*, dan bahkan membaca atau memodifikasi aktivasi serta bobot jaringannya sendiri untuk belajar lebih efektif. Parascandolo, yang memulai karir risetnya tentang generalisasi dan perencanaan, bergabung dengan OpenAI pada 2021 setelah menyelesaikan PhD. Di sana, ia terlibat dalam pengembangan GPT-4 dan kem...

Lingkaran AI tidak kekurangan gosip.

Tokoh utama kali ini bernama Giambattista Parascandolo, peneliti penting di bidang model penalaran OpenAI.

Tahun 2020, dia mengikuti wawancara untuk posisi profesor di MIT, memberikan presentasi tentang penggunaan GPT untuk penalaran. Hasilnya, sebagian besar profesor di panel wawancara mencap arah penelitian ini sebagai "nonsense" (omong kosong).

https://x.com/turingbook/status/2084003612687249836?s=20

Pria ini langsung berani buka kartu, menuliskan pengalaman ini di halaman pribadinya, dan melampirkan tautan presentasi dan slide dari tahun itu.

https://sites.google.com/view/giambattista-parascandolo/home

Laporan yang Dicap "Omong Kosong" Itu, Berisi Apa?

Situs web MIT menunjukkan, tema presentasi ini adalah bagaimana jaringan saraf tiruan dapat melampaui distribusi pelatihan, memperoleh kemampuan generalisasi dan perencanaan yang lebih mendekati manusia.

Parascandolo percaya, manusia mampu menggabungkan kembali pengetahuan yang ada, mengidentifikasi invarian kunci, membangun model abstrak, dan menyelesaikan perencanaan jangka panjang. Jaringan saraf tiruan masih memiliki ruang peningkatan yang besar dalam aspek-aspek ini.

Di akhir laporan, dia mengajukan tiga arah penelitian di masa depan: penalaran terbuka dalam jaringan saraf, derajat kebebasan yang belum dieksplorasi dalam jaringan saraf tiruan, serta penggunaan bahasa sebagai wahana penalaran dalam pembelajaran penguatan, untuk meningkatkan efisiensi sampel.

Konsep paling kunci di antaranya adalah "penalaran terbuka".

Parascandolo mendefinisikannya sebagai: model dapat mengalokasikan lebih banyak waktu dan komputasi, terus-menerus memperbaiki jawaban. Semakin sulit masalahnya, model seharusnya berpikir beberapa langkah lebih banyak, dan mengubah komputasi tambahan menjadi hasil yang lebih baik.

Ini terdengar sangat mirip dengan perluasan komputasi saat penalaran hari ini.

Transformer standar saat itu memiliki kedalaman jaringan yang tetap, jumlah komputasi maju yang dialami setiap token pada dasarnya ditentukan, sementara tingkat kesulitan masalah tidak memiliki hubungan stabil dengan panjang masukan. Sebuah masalah bisa sangat panjang, tetapi jawabannya sederhana. Masalah lain mungkin hanya satu kalimat, tetapi memerlukan beberapa putaran dekomposisi dan verifikasi.

RNN tampaknya lebih cocok untuk tugas semacam ini. Ia dapat berjalan berulang kali, secara teori mampu mendapatkan waktu berpikir sepanjang apapun. Namun, kurva yang ditunjukkan Parascandolo dalam PPT menunjukkan, RNN biasanya hanya berkinerja terbaik di sekitar jumlah langkah penalaran yang pernah dilihat selama pelatihan, melanjutkan penambahan siklus justru dapat menurunkan akurasi.

Ini berarti, menambah jumlah komputasi hanyalah langkah pertama, model juga harus belajar bagaimana memanfaatkan komputasi ini.

Perencanaan multi-langkah paling efektif saat itu banyak bergantung pada kontrol prediktif model dan pencarian pohon Monte Carlo. Jaringan saraf bertanggung jawab untuk memprediksi lingkungan atau mengevaluasi nilai, algoritma pencarian eksternal bertanggung jawab untuk mengembangkan jalur masa depan. Parascandolo berharap lebih jauh mengintegrasikan kemampuan penalaran jangka panjang ke dalam jaringan saraf.

Gagasannya yang kedua adalah membuat bahasa menjadi wahana penalaran.

Parascandolo memberi contoh dengan game klasik "Montezuma's Revenge". Sebuah Agen pembelajaran penguatan yang dilatih dari nol perlu mencoba banyak kombinasi keadaan dan aksi, banyak tindakan yang benar itu sendiri tidak rumit, yang benar-benar kurang dari Agen adalah penilaian tentang "perilaku apa yang lebih masuk akal".

GPT telah menyerap banyak pengetahuan dunia dari teks, bahasa dapat membantu model menggambarkan lingkungan, memahami tujuan, memecah tugas dan menghasilkan rencana tingkat tinggi, juga dapat menyempitkan rentang pencarian secara signifikan.

Ditempatkan di hari ini, pemikiran ini mudah mengingatkan pada rantai pikiran, perencanaan bahasa, dan alur kerja Agen.

Arah ketiga yang diajukan Parascandolo adalah, sistem kecerdasan buatan dapat mereset tugas, kembali ke keadaan apa pun dalam ingatan, membangun skenario kontrafaktual, juga dapat menyesuaikan waktu, gravitasi, dan hasil observasi dalam simulator. Sistem bahkan dapat langsung membaca, menyalin, dan memodifikasi nilai aktivasi serta bobot jaringan sarafnya sendiri.

Ini setara dengan memasukkan proses pembelajaran itu sendiri ke dalam ruang operasi Agen. Ia dapat melakukan latihan yang disengaja, menghasilkan skenario pelatihan khusus, mentransfer pengetahuan yang ada, dan belajar kembali untuk lintasan yang gagal.

Dalam PPT lima tahun lalu, hampir menuliskan rute model penalaran hari ini.

Kami juga menggali blog yang dia tulis pada Juni 2021, judulnya adalah "Backpropagation, Evolusi, dan Kesalahan 'Dua Anjing'".

Blog ini terutama membantah pandangan "jaringan saraf membutuhkan data yang sangat banyak, sehingga tidak mirip otak manusia".

Parascandolo berpendapat, manusia hanya perlu melihat beberapa ekor anjing untuk belajar mengenali, tidak berarti tidak ada akumulasi pengalaman sebelumnya. Evolusi panjang telah mengendapkan pengalaman nenek moyang dalam berinteraksi dengan dunia, menjadi struktur dan bias induktif otak manusia.

Menurut perspektif ini, pelatihan awal skala besar jaringan saraf dapat dianalogikan dengan evolusi biologis, penyesuaian halus model dan pembelajaran kontekstual lebih mendekati pembelajaran individu sepanjang hidupnya. GPT-3 membaca teks jauh melebihi individu mana pun, tetapi pelatihan awalnya mengambil peran mengompresi pengalaman yang sangat besar, membentuk kemampuan pembelajaran yang efisien. Oleh karena itu, tidak dapat secara langsung membandingkan semua data pelatihan awal model, dengan sedikit sampel pembelajaran seseorang setelah lahir.

Pemahaman ini juga berarti, terus memperluas data dan daya komputasi masih mungkin membawa peningkatan yang nyata. Dia menganalogikan peran yang dimainkan keduanya, tidak menganggap mekanisme spesifik penurunan gradien sama dengan evolusi biologis.

Dari Mana Asal Pria Ini?

Pria ini cukup rendah hati, postingan terbaru di X masih berasal dari November 2024, saat itu dia sedang merekrut dua insinyur penelitian (RE) dan insinyur perangkat lunak (SWE) untuk o1.

Menurut halaman pribadinya, pengalaman penelitian Parascandolo selalu berkisar pada generalisasi, perencanaan, dan penalaran.

2017, dia memasuki Max Planck Institute for Intelligent Systems dan ETH Zurich untuk mengejar gelar doktor, dibimbing oleh Bernhard Schölkopf dan Thomas Hofmann, disertasi berfokus pada generalisasi OOD dalam pembelajaran mendalam.

Selama doktor, dia masing-masing melakukan magang di Google X di Mountain View dan DeepMind di London, yang pertama terlibat dalam penelitian desain otomatisasi pada simulator skala sangat besar, yang kedua terlibat dalam penelitian pencarian pohon Monte Carlo dengan pembagian.

September 2021 lulus doktor, dia langsung bergabung dengan OpenAI, awalnya masuk tim pembelajaran penguatan yang dipimpin John Schulman, kemudian beralih ke tim algoritma tempat Mark Chen berada, lalu bergabung dengan tim 🍓 (strawberry) yang dipimpin Jerry Tworek. Tim strawberry, adalah kode internal untuk proyek o1.

2023, dia terlibat dalam pengembangan GPT-4, dan membentuk tim baru yang terus meneliti penalaran. Kemudian terlibat dalam penelitian dasar OpenAI o1 dan o3, mendorong perluasan pemodelan hadiah, konstruksi lingkungan, dan algoritma penalaran umum. Sebagian deskripsi algoritma masih ditutupi dengan blok hitam olehnya hingga kini.

Wawancara tahun 2020 itu, Parascandolo tidak berhasil mendapatkan jabatan pengajar di MIT, dia pergi ke OpenAI.

Empat tahun kemudian, dia membantu membangun o1.

Hidup selalu penuh keajaiban.

Tautan Referensi:

https://x.com/giambattista92

https://sites.google.com/view/giambattista-parascandolo/home

https://gibipara92.github.io/2021/06/09/backprop-evolution-two-dogs.html

https://docs.google.com/presentation/d/1edd2GkAP31wNygaev3DO8gE1t2lgsx1z8TeVpBKqlYA/edit?slide=id.gc772610149_0_179#slide=id.gc772610149_0_179

Artikel ini berasal dari akun WeChat publik "机器之心" (ID:almosthuman2014), penulis: Yang Wen

热门币种推荐

相关问答

QApa inti dari presentasi Giambattista Parascandolo yang sempat dicap sebagai 'nonsense' oleh panel profesor MIT?

APresentasi tersebut membahas tentang bagaimana jaringan saraf tiruan dapat melampaui distribusi pelatihan untuk mendapatkan kemampuan generalisasi dan perencanaan yang lebih mirip manusia. Parascandolo mengusulkan konsep 'reasoning terbuka', di mana model dapat mengalokasikan lebih banyak waktu dan komputasi untuk terus menyempurnakan jawaban, sebuah ide yang menjadi inti dari model reasoning seperti OpenAI o1 dan o3.

QApa saja tiga arah penelitian masa depan yang diusulkan Parascandolo dalam presentasinya?

ATiga arah penelitian tersebut adalah: 1) Reasoning terbuka dalam jaringan saraf, 2) Menggunakan bahasa sebagai wahana untuk reasoning dalam pembelajaran penguatan untuk meningkatkan efisiensi sampel, dan 3) Sistem AI yang dapat mengatur ulang tugas, mengonstruksi skenario kontrafaktual, dan bahkan memodifikasi nilai aktivasi serta bobot jaringannya sendiri.

QMengapa ide menggunakan bahasa sebagai wahana reasoning dianggap penting oleh Parascandolo?

AKarena bahasa, seperti yang telah diserap model seperti GPT dari teks, mengandung banyak pengetahuan dunia. Bahasa dapat membantu model mendeskripsikan lingkungan, memahami tujuan, memecah tugas, membuat rencana tingkat tinggi, dan secara signifikan mempersempit ruang pencarian, mirip dengan cara kerja 'chain-of-thought' atau alur kerja 'Agent' saat ini.

QBagaimana Parascandolo menganalogikan pelatihan besar-besaran model bahasa seperti GPT-3?

AParascandolo menganalogikan pelatihan besar-besaran (pre-training) model dengan proses evolusi biologis, yang mengompresi pengalaman luas leluhur menjadi struktur dan bias induktif. Sedangkan penyesuaian halus (fine-tuning) dan pembelajaran dalam konteks (in-context learning) lebih mirip dengan pembelajaran individu dalam satu masa hidup. Ini membantah klaim bahwa neural network tidak seperti otak manusia karena butuh data sangat banyak.

QApa peran Giambattista Parascandolo dalam pengembangan AI di OpenAI?

ASetelah bergabung dengan OpenAI pada tahun 2021, Parascandolo terlibat dalam pengembangan GPT-4 dan kemudian membentuk tim baru yang fokus pada penelitian reasoning. Dia berperan penting dalam penelitian dasar untuk model OpenAI o1 dan o3, dengan berkontribusi pada pemodelan imbalan, konstruksi lingkungan, dan perluasan algoritma reasoning umum.

你可能也喜欢

交易

现货

热门文章

如何购买CORE

欢迎来到HTX.com!我们已经让购买Core DAO(CORE)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Core DAO(CORE)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Core DAO(CORE)购买完您的Core DAO(CORE)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Core DAO(CORE)在HTX的现货市场轻松交易Core DAO(CORE)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

1.5k人学过发布于 2024.05.09更新于 2026.06.02

如何购买CORE

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对CORE(CORE)币价的意见。

活动图片