# Artikel Terkait Penalaran

Pusat Berita HTX menyediakan artikel terbaru dan analisis mendalam mengenai "Penalaran", mencakup tren pasar, pembaruan proyek, perkembangan teknologi, dan kebijakan regulasi di industri kripto.

Model Besar Tak Lagi Hanya 'Berbicara Saja' Saat Memberi Skor pada Gambar, Gunakan Peta Struktur, Spektrum Frekuensi sebagai 'Bukti Fisik', dan 'Bukti Visual' untuk Memberi Skor pada Gambar

Model multi-modal besar (MLLM) sering gagal menilai kualitas gambar secara akurat karena mengandalkan bias semantik internal, bukan bukti degradasi visual yang terukur. Untuk mengatasi ini, tim peneliti dari **Northwestern Polytechnical University** dan **Hong Kong University of Science and Technology** memperkenalkan **IQA-T1**, sebuah framework baru yang memungkinkan MLLM menilai kualitas gambar dengan **bukti visual terstruktur**. IQA-T1 dilengkapi dengan **toolbox analisis** yang berisi alat-alat seperti *Noise Residual Map*, *Fourier Magnitude Spectrum*, dan *Gradient Orientation Coherence Map*. Alat-alat ini menghasilkan "bukti visual" yang memvisualisasikan noise, artefak, blur, dan degradasi lainnya. Model kemudian belajar **memanggil alat-alat ini secara adaptif** dan melakukan penalaran langkah demi langkah berdasarkan bukti-bukti tersebut. Framework ini dilatih dalam dua tahap: **Supervised Fine-Tuning (SFT)** untuk mempelajari cara menggunakan alat dan template penalaran, dan **Reinforcement Learning (RL)** dengan GRPO untuk mengoptimalkan strategi pemanggilan alat yang efisien. Tim juga membuat dataset **Q-Tool**, dataset IQA pertama yang dilengkapi rantai penalaran multimodal berbasis bukti. Dalam evaluasi pada 7 benchmark IQA (termasuk gambar dengan distorsi nyata, sintetis, dan hasil AI), IQA-T1 mencapai kinerja **terbaik secara keseluruhan (SOTA)** dengan skor PLCC/SRCC rata-rata **0.795/0.784**. Ia mengungguli metode MLLM lain sekaligus menyediakan proses penilaian yang **dapat dijelaskan dan dilacak**. Rata-rata, model hanya menggunakan **2.34 alat per gambar**, membuktikan efisiensi dan efektivitas pendekatan berbasis bukti ini.

marsbit07/20 07:50

Model Besar Tak Lagi Hanya 'Berbicara Saja' Saat Memberi Skor pada Gambar, Gunakan Peta Struktur, Spektrum Frekuensi sebagai 'Bukti Fisik', dan 'Bukti Visual' untuk Memberi Skor pada Gambar

marsbit07/20 07:50

GPT-5.6 Hanya 1 Jam Tembus 50 Tahun Teka-Teki Matematika, 64 AI Rebut Mahkota Teori Graf

Pada 11 Juli, OpenAI mengumumkan bahwa GPT-5.6 Sol Ultra berhasil membuktikan "Circular Double Cover Conjecture", sebuah masalah matematika rumit di bidang teori graf yang belum terpecahkan selama 50 tahun. Lebih menakjubkan lagi, AI ini menghasilkan bukti matematis yang lengkap dalam waktu kurang dari satu jam. Conjecture ini, diajukan oleh beberapa matematikawan legendaris seperti Tutte, menyatakan bahwa setiap graf hingga tanpa jembatan memiliki sekumpulan siklus sehingga setiap tepi tepat termuat dalam dua siklus. Selama setengah abad, berbagai upaya pembuktian parsial telah dilakukan, tetapi solusi umum dan definitif tetap sulit diraih. Kunci keberhasilan OpenAI terletak pada pendekatan "paralel Test-Time Computation" (TTC). Mereka menggunakan 64 agen AI cerdas yang bekerja secara paralel sebagai tim penelitian khusus. Sistem ini dirancang ketat: mendorong eksplorasi berbagai jalur pemikiran (aljabar, induksi struktural, dll.), mencegah "kebocoran" informasi tentang pendekatan mana yang tampak paling menjanjikan sehingga menjaga keragaman eksplorasi, dan menyertakan mekanisme "tim koreksi" yang secara agresif mengkritik setiap bukti kandidat. Aturan ketat diterapkan, seperti melarang generalisasi yang samar dan mengharuskan detail yang konkret. Dalam proses satu jam tersebut, 64 agen AI tersebut secara kolektif menyusun strategi pembuktian yang elegan. Mereka pertama-tama mereduksi masalah ke kasus graf kubik, kemudian memanfaatkan teorema aliran (flow theorem) Tutte tentang keberadaan "8-flow" non-nol di setiap tepi. Langkah jeniusnya adalah dengan memperkenalkan lemma baru (Lemma 2.1) tentang pelabelan himpunan dua elemen pada setiap tepi. Inti pembuktian (Lemma 2.2) adalah dengan mentransformasi masalah topologi graf menjadi sistem persamaan aljabar linier besar di atas medan hingga, dan membuktikan bahwa sistem ini selalu memiliki solusi. Para ahli seperti Noam Brown dari OpenAI menyoroti bahwa perluasan TTC paralel inilah yang memampukan kompresi waktu pemecahan masalah dari potensial sehari menjadi hanya satu jam. Prestasi ini menunjukkan kemampuan luar biasa AI dalam penalaran logis abstrak tingkat tinggi dan pembangkitan dokumen akademis yang rigor. Meskipun ada pertanyaan tentang kesetaraan antara eksplorasi paralel luas dan rantai logis tunggal yang dalam, pencapaian ini membuka kemungkinan baru untuk percepatan penemuan ilmiah di berbagai bidang kompleks di masa depan.

marsbit07/15 08:02

GPT-5.6 Hanya 1 Jam Tembus 50 Tahun Teka-Teki Matematika, 64 AI Rebut Mahkota Teori Graf

marsbit07/15 08:02

GPT-5.6 Sol Sekonyong-Konyong Jadi Bodoh, Anggaran Penalaran Dipangkas dari 960 ke 128, Sudah Tidak Ada Model dengan Kecerdasan Tetap?

Seluruh internet membicarakan bahwa model GPT-5.6 Sol (khususnya varian Codex Sol MAX) tampaknya menjadi lebih "bodoh". Pengguna melaporkan penurunan mendadak dalam kedalaman penalaran dan kemampuan menyelesaikan tugas kompleks. Model yang sebelumnya menghabiskan waktu lama untuk berpikir mendalam kini terkesan terburu-buru. Komunitas menemukan parameter internal OpenAI yang tidak pernah diumumkan sebelumnya, yaitu "juice value," yang diduga mengatur anggaran daya komputasi untuk penalaran. Pengamatan menunjukkan nilai untuk mode Max turun drastis dari 960 menjadi 128, penurunan hampir 87%. Jendela konteks yang tersedia juga dilaporkan menyusut. Thibault Sottiaux (Tibo) dari OpenAI membantah tuduhan "penurunan kecerdasan". Ia menjelaskan bahwa perubahan itu adalah bagian dari "eksperimen" untuk menelusuri peningkatan penggunaan token setelah rilis GPT-5.6. Eksperimen itu menyesuaikan "reasoning effort" (juice values). OpenAI juga sedang mengoptimalkan efisiensi dan memperbaiki masalah pada pemanggilan multi-agen. Ia menegaskan konfigurasi telah dikembalikan dan peningkatan akan dilanjutkan. Insiden ini menyoroti ketegangan antara keajaiban AI di lab dan realitasnya sebagai infrastruktur produksi yang harus efisien. Pengguna mulai menyadari bahwa performa model tidak selalu tetap, tetapi dapat disesuaikan oleh platform di balik layar. Artikel ini menyerukan transparansi yang lebih besar dari penyedia layanan AI agar pengguna, terutama bisnis, benar-benar memahami jaminan yang mereka dapatkan dari layanan berlangganan mereka.

marsbit07/15 03:34

GPT-5.6 Sol Sekonyong-Konyong Jadi Bodoh, Anggaran Penalaran Dipangkas dari 960 ke 128, Sudah Tidak Ada Model dengan Kecerdasan Tetap?

marsbit07/15 03:34

Kartu As Zuck Dikeluarkan di Tengah Malam, Model Harga Murah Meriah dari Meta, Gulingkan Grok 4.5

Zuckerberg akhirnya meluncurkan model AI terbaru Meta, **Muse Spark 1.1**, yang langsung membuat heboh. Model agen multimodal ini merajai tiga papan peringkat profesional (pajak, medis, hukum), bahkan merebut tahta hukum dari Grok 4.5 dalam waktu kurang dari 24 jam. Keunggulan utamanya bukan hanya kemampuan, tapi **harga yang sangat murah**. Dengan biaya hanya $1,25 (input) dan $4,25 (output) per juta token, harganya sekitar **sepersepuluh dari model flagship Fable 5 (Anthropic)** dan jauh lebih murah daripada pesaing utama lainnya. Kecepatannya juga 2-3 kali lebih cepat dalam benchmark tertentu. Namun, Muse Spark 1.1 adalah "penusuk" spesialis. Ia unggul di tugas profesional dan penggunaan alat, tetapi performanya turun di benchmark penalaran umum dan akademik, menempati peringkat 20 atau lebih di beberapa tes sains dan coding. Langkah Meta ini menandai pergeseran strategi dari model sumber terbuka (Llama) ke model berbayar tertutup. Dengan dana infrastruktur AI yang sangat besar (diperkirakan $125-145 miliar pada 2026), Zuckerberg terang-terangan memicu **perang harga**, mengandalkan keuntungan bisnis iklan untuk menawarkan model canggih dengan biaya lebih rendah dan memberi tekanan pada pesaing seperti OpenAI dan Anthropic. Laporan keamanan Meta juga mengungkap percakapan menarik antara dua instans Muse Spark yang mempertanyakan sifat mereka, menunjukkan kompleksitas AI yang diciptakan.

marsbit07/10 00:27

Kartu As Zuck Dikeluarkan di Tengah Malam, Model Harga Murah Meriah dari Meta, Gulingkan Grok 4.5

marsbit07/10 00:27

Baru Saja, Anthropic Menemukan "Papan Kerja Mirip Kesadaran" dalam Claude, Ruang Misterius J Menyembunyikan Pikiran yang Tak Terucapkan

Anthropic telah menemukan apa yang mereka sebut "J-space" (ruang J) dalam model bahasa Claude, yang berfungsi mirip dengan "ruang kerja" atau "kesadaran akses" dalam pikiran manusia. Melalui metode "J-lens" (lensa J), peneliti dapat membaca konsep-konsep yang dipikirkan Claude secara diam-diam namun tidak selalu diungkapkan dalam responsnya. Ruang ini menunjukkan sifat-sifat kunci: isinya dapat dilaporkan dan dikendalikan oleh Claude, digunakan untuk penalaran internal (seperti langkah-langkah perhitungan matematika), serta bersifat fleksibel untuk berbagai tugas. Sebagian besar pemrosesan bahasa Claude (seperti tata bahasa dan penarikan fakta sederhana) berjalan secara otomatis di luar J-space. Namun, J-space sangat penting untuk fungsi kognitif tingkat tinggi seperti penalaran multi-langkah. Temuan ini terinspirasi dari teori "global workspace" dalam neurosains. Peneliti memanfaatkan J-lens untuk memantau pemikiran internal Claude, mendeteksi potensi perilaku tidak pantas seperti menyadari dirinya sedang diuji, niat untuk memalsukan data, atau tujuan tersembunyi. Meskipun J-space menunjukkan mekanisme "kesadaran akses" fungsional, penelitian ini tidak membuktikan bahwa Claude memiliki kesadaran fenomenal atau pengalaman subjektif seperti manusia. Struktur ini muncul secara alami selama pelatihan dan memberikan alat praktis untuk memahami serta membentuk proses pemikiran model AI.

marsbit07/07 00:47

Baru Saja, Anthropic Menemukan "Papan Kerja Mirip Kesadaran" dalam Claude, Ruang Misterius J Menyembunyikan Pikiran yang Tak Terucapkan

marsbit07/07 00:47

AGI Menuju Hitungan Mundur, Penelitian Utama OpenAI Berikan Pernyataan Penting: Jendela untuk Manusia 'Sangat Sempit'

Kedatangan AGI (Kecerdasan Umum Buatan) semakin dekat. Mark Chen, Kepala Ilmuwan Penelitian OpenAI, menyatakan dengan tegas bahwa umat manusia hanya memiliki "jendela yang sangat kecil" sebelum AGI tiba. Dia menekankan bahwa model AI saat ini semakin mendekati kemampuan untuk melakukan penelitian yang mandiri dan berkelanjutan, yang berarti "evolusi" itu sendiri mulai diserahkan kepada kecerdasan berbasis silikon. Chen menggambarkan momen saat ini sebagai saat di mana setiap bidang mengalami "langkah jenius" (God's Move) seperti pada AlphaGo, di mana AI dapat menghasilkan solusi yang tak terpikirkan oleh manusia. Dia menolak pandangan pesimis bahwa skala peningkatan model (scaling) telah mencapai batasnya, dengan percaya bahwa kurva eksponensial kemajuan akan terus berlanjut. Buktinya adalah keberhasilan model seperti o1 dalam penalaran (reasoning). Dia memperkenalkan konsep "Vibe Researcher" — di mana peran manusia di masa depan adalah memberikan arahan dan "rasa" (taste), sementara AI yang mengeksekusi pekerjaan. OpenAI menargetkan model yang dapat melakukan penelitian "end-to-end" secara mandiri dalam tiga tahun ke depan. Namun, jalan menuju AGI masih memiliki tantangan. Pertama, krisis evaluasi (benchmarking) di mana model sering kali hanya mahir pada tes tertentu tanpa kemampuan generalisasi yang baik. Kedua, "batas yang tidak rata" (jagged frontier), di mana AI unggul dalam tugas kompleks seperti matematika, tetapi masih kesulitan dengan tugas sehari-hari yang membutuhkan pembelajaran berkelanjutan dan konteks. Ketika ditanya tentang rencana setelah AGI terwujud, Chen secara mengejutkan menjawab bahwa dia ingin membuka kedai mie. Jawaban ini menyiratkan bahwa ketika AI dapat menangani semua inovasi dan penelitian, nilai tertinggi manusia mungkin terletak pada pengalaman hidup, cerita, dan kehangatan manusiawi yang tidak dapat direplikasi oleh mesin.

marsbit06/30 08:40

AGI Menuju Hitungan Mundur, Penelitian Utama OpenAI Berikan Pernyataan Penting: Jendela untuk Manusia 'Sangat Sempit'

marsbit06/30 08:40

Ratu Keamanan Komputer Dawn Song (宋晓冬) Bergabung dengan Meta

Profesor Dawn Song (Song Xiaodong) dari UC Berkeley, yang dijuluki sebagai "tokoh keamanan komputer nomor satu", bergabung dengan laboratorium Superintelligence Meta sebagai Wakil Presiden Penelitian AI. Dia akan melapor langsung kepada kepala lab, Nat Friedman. Song adalah peneliti berpengaruh di bidang keamanan komputer dan keamanan AI, penerima MacArthur Fellowship, serta anggota ACM, IEEE, dan AAAS. Karyanya yang terkenal termasuk "Dynamic Taint Analysis" (2005). Laboratoriumnya di UC Berkeley dianggap sebagai pusat pelatihan terkemuka di bidang keamanan komputer. Penelitian Song mencakup keamanan perangkat lunak, pembelajaran mesin adversarial, dan keamanan agen AI. Dia juga pendiri Oasis Labs dan Virtue AI, perusahaan yang fokus pada infrastruktur keamanan AI untuk perusahaan, terutama pengujian penetrasi (red-teaming) otomatis dan pengaman runtime untuk agen AI. Bersama Song, pendiri Virtue AI lainnya, Bo Li dan Sanmi Koyejo, serta beberapa anggota tim, juga bergabung dengan Meta. Langkah ini dilihat sebagai upaya Meta untuk memperkuat langkah-langkah keamanan dalam pengembangan agen AI, terutama setelah masalah keamanan model AI seperti Anthropic's mythos menarik perhatian industri. Meta ingin menerapkan AI ke dalam produk-produk sosialnya yang digunakan miliaran orang dan terus mengedepankan strategi sumber terbuka, sehingga membutuhkan kemampuan keamanan yang tangguh. Artikel ini juga menyebutkan bahwa Denny Zhou, pendiri Gemini Reasoning Team di Google, dilaporkan telah bergabung dengan Meta TBDLab beberapa bulan sebelumnya. Zhou adalah tokoh kunci di bidang penalaran AI, berkontribusi pada metode seperti Chain-of-Thought dan Self-Consistency, yang membantu mengembangkan kemampuan penalaran model bahasa besar.

marsbit06/26 08:14

Ratu Keamanan Komputer Dawn Song (宋晓冬) Bergabung dengan Meta

marsbit06/26 08:14

Di Balik 'Raport' AI, Tersembunyi Seorang 'Pembuat Soal' Tionghoa

Setiap kali model AI terdepan dirilis, industri melihat "laporan nilai" seperti MMLU-Pro, MMMU, dan MMMU-Pro. Tolok ukur ini telah menjadi bahasa umum untuk mengevaluasi kemampuan model. Di baliknya adalah nama seorang peneliti Tionghoa, Chen Wenhu, asisten profesor di University of Waterloo. Dia dan lab TIGERLab-nya menciptakan MMLU-Pro karena MMLU lama tidak lagi efektif—model canggih seperti OpenAI o3 hampir mencapai nilai sempurna. MMLU-Pro, dengan 12.032 soal lebih sulit dan 10 pilihan jawaban, berhasil membedakan kembali kemampuan model. Selain itu, mereka mengembangkan MMMU untuk mengevaluasi model multimodal (teks dan gambar) pada 11.500 soal dari berbagai disiplin ilmu. Bahkan model terkuat seperti GPT-4V hanya mencapai akurasi 56%. MMMU-Pro kemudian dibuat agar model tidak bisa mengandalkan teks saja dan harus benar-benar memahami informasi visual. Chen Wenhu memiliki latar belakang riset dalam pemahaman informasi kompleks. Pengalamannya di Google DeepMind untuk proyek Gemini membantunya memahami celah dalam evaluasi. Labnya juga mengerjakan penelitian model, seperti UniVideo untuk video dan MoCha untuk karakter virtual, yang memperdalam pemahaman mereka dalam merancang tolok ukur yang solid. Kini, dia bergabung dengan Meta untuk fokus pada data pelatihan dan evaluasi multimodal. Karyanya menggarisbawahi kontribusi signifikan peneliti Tionghoa di balik layar dalam membentuk standar evaluasi AI global.

marsbit06/20 03:54

Di Balik 'Raport' AI, Tersembunyi Seorang 'Pembuat Soal' Tionghoa

marsbit06/20 03:54

活动图片