# Artikel Terkait Pasca-Pelatihan

Pusat Berita HTX menyediakan artikel terbaru dan analisis mendalam mengenai "Pasca-Pelatihan", mencakup tren pasar, pembaruan proyek, perkembangan teknologi, dan kebijakan regulasi di industri kripto.

CTO Thinking Machines yang Dipecat, Kini Tinggalkan OpenAI dan Kembali ke Google

Beberapa jam yang lalu, Barret Zoph mengumumkan di X bahwa ia akan bergabung dengan Google DeepMind, menandai kepulangannya ke tempat ia memulai karir AI di program Residency Google Brain. Ia akan fokus pada penelitian pembelajaran penguatan (RL) dan pasca-pelatihan (Post-Training). Pernyataan ini adalah bab terbaru dari perjalanan karirnya yang berliku dalam 1,5 tahun terakhir, melibatkan tiga perusahaan berbeda: OpenAI, Thinking Machines Lab (TML), dan kini kembali ke Google. Zoph, lulusan USC 2016, menghabiskan enam tahun di Google Brain dengan kontribusi penting di bidang Neural Architecture Search (NAS) dan model Transformer. Pada 2022, ia pindah ke OpenAI, menjadi Wakil Presiden Riset dan berperan dalam membangun sistem pasca-pelatihan untuk ChatGPT. Pada September 2024, ia keluar dari OpenAI dan pada Februari 2025 bersama Mira Murati mendirikan TML sebagai CTO. Namun, pada Januari 2026, Murati mengumumkan pemecatannya dari TML. Hanya 58 menit kemudian, OpenAI mengumumkan kembalinya Zoph untuk memimpin bisnis enterprise. Namun, lima bulan kemudian (Juni 2026), ia kembali meninggalkan OpenAI. Alasan pemecatannya dari TML masih simpang siur dengan beberapa versi: pelanggaran etik, berbagi informasi rahasia, hubungan romantis dengan rekan kerja, atau karena rencananya untuk keluar. Zoph sendiri membantah diberhentikan karena alasan kinerja atau ketidaketisan. Kepindahannya ke DeepMind terjadi di tengah gelombang kepergian ilmuwan top DeepMind (seperti Noam Shazeer ke OpenAI dan John Jumper ke Anthropic) serta restrukturisasi internal yang menempatkan Koray Kavukcuoglu sebagai pemimpin operasional. Keputusan ini dilihat sebagai upaya DeepMind untuk memperkuat tim inti, khususnya di bidang RL dan pasca-pelatihan, di bawah tekanan untuk memenuhi peta jalan Gemini. Narasi perpindahan Zoph mencerminkan dinamika fluks tinggi talenta AI papan atas, di mana loyalitas terhadap satu perusahaan atau bahkan status "pendiri bersama" semakin longgar. Yang menjadi daya tarik utama adalah keahlian langka dalam mengelola eksperimen berskala miliaran dolar dan kemampuan merekrut talenta langka lainnya.

marsbit08/27 12:29

CTO Thinking Machines yang Dipecat, Kini Tinggalkan OpenAI dan Kembali ke Google

marsbit08/27 12:29

Setelah Pelatihan, Insinyur OpenAI Weng Jiayi Mengajukan Asumsi Paradigma Baru untuk Agentic AI

Dalam eksperimen terbarunya, insinyur OpenAI, Weng Jiayi, mengusulkan paradigma baru untuk AI agentik yang disebut "Heuristic Learning" (HL). Berbeda dengan pendekatan tradisional yang mengandalkan pelatihan model neural berskala besar, HL memungkinkan AI (dalam hal ini Codex) untuk secara mandiri menulis, menjalankan, menguji, dan merevisi kode program strategi berdasarkan tujuan, lingkungan yang dapat dijalankan, dan umpan balik tertutup. Dalam eksperimen utama di lingkungan Atari Breakout, agen Codex berhasil mengembangkan strategi kode Python murni yang mencapai skor sempurna 864. Prosesnya melibatkan siklus iteratif: menulis kode, menjalankan simulasi, menganalisis log dan rekaman video, mengidentifikasi kegagalan, lalu memodifikasi kode. Pengalaman "dipelajari" tidak disimpan dalam bobot neural network, tetapi dalam sistem perangkat lunak yang dapat dibaca, diubah, dan diaudit. Eksperimen lebih lanjut di 57 game Atari menunjukkan bahwa pendekatan HL memiliki efisiensi sampel yang mengesankan di awal, mencapai kinerja sebanding dengan algoritma Reinforcement Learning (RL) seperti PPO dalam jutaan langkah. Namun, HL memiliki batasan dalam tugas yang memerlukan perencanaan jangka panjang dan urutan aksi kompleks, seperti yang terlihat dalam game Montezuma's Revenge. Paradigma HL ini berpotensi memiliki implikasi signifikan di industri, terutama dalam: 1) Kontrol robotik untuk skenario terstruktur, mengurangi ketergantungan pada inferensi neural network berat di setiap langkah; 2) Skenario kritis keamanan (mobil otonom, robot medis) di mana kemampuan audit dan penelusuran kode sangat berharga; 3) Pembelajaran berkelanjutan yang dapat diotomatisasi dan diintegrasikan ke dalam alur kerja rekayasa perangkat lunak; 4) Preservasi dan pertukaran kemampuan agen dalam bentuk aset kode yang dapat digunakan kembali. Weng Jiayi menekankan bahwa HL bukan pengganti lengkap untuk neural network, tetapi pelengkap. Visinya adalah sistem hybrid di mana neural network (System 1) menangani persepsi cepat, HL menangani pemrosesan aturan dan memori yang dapat diinterpretasikan, dan LLM agen (System 2) memberikan umpan balik tingkat tinggi. Intinya, HL menawarkan kemungkinan untuk mengubah pengalaman AI dari sesuatu yang "terkompresi dalam bobot" menjadi sesuatu yang "terkandung dalam perangkat lunak yang dapat dipelihara".

marsbit05/11 00:23

Setelah Pelatihan, Insinyur OpenAI Weng Jiayi Mengajukan Asumsi Paradigma Baru untuk Agentic AI

marsbit05/11 00:23

活动图片