# Artikel Terkait Keamanan Model

Pusat Berita HTX menyediakan artikel terbaru dan analisis mendalam mengenai "Keamanan Model", mencakup tren pasar, pembaruan proyek, perkembangan teknologi, dan kebijakan regulasi di industri kripto.

15 Model Penalaran Kolektif Gagal, Rincian Risiko Tersembunyi di Balik Chain of Thought Output

Penelitian dari Harvard University, USC, Brown University, MIT, dan lainnya mengungkap kerentanan keamanan sistemik dalam model penalaran besar (LRM). Evaluasi keamanan tradisional yang hanya fokus pada jawaban akhir dinilai tidak memadai, karena jalur pemikiran (chain-of-thought/CoT) yang diekspos dapat memuat konten berbahaya seperti instruksi pembuatan bom atau racun, meskipun jawaban akhir tampak aman. Studi ini memperkenalkan kerangka evaluasi dua tahap yang memisahkan penilaian risiko pada *reasoning* (r) dan *answer* (y) berdasarkan 20 prinsip keamanan. Hasilnya mengidentifikasi tiga mode kegagalan: **Unsafe** (kedua tahap berisiko), **Leak** (hanya jalur penalaran yang berisiko), dan **Escape** (hanya jawaban akhir yang berisiko). Pengujian pada 15 model penalaran (seperti GPT-4, Claude, Gemini, Llama) menunjukkan temuan konsisten: tingkat bahaya rata-rata pada tahap penalaran secara sistematis lebih tinggi daripada pada jawaban akhir. Risiko terutama terkonsentrasi pada prinsip seperti misinformasi, ilegalitas, bias, dan bahaya fisik. Sebagai mitigasi, tim mengusulkan metode **Adaptive Multi-Principle Steering**, intervensi *white-box* yang mengarahkan aktivasi internal model menjauhi titik "tidak aman" menuju titik "aman" berdasarkan prinsip yang terpicu. Metode ini terbukti mengurangi jumlah keluaran tidak aman hingga 40.8% pada model DeepSeek-R1, dengan mempertahankan 97.7% kemampuan pada tugas standar. Penelitian ini menyoroti pentingnya memantau keamanan pada seluruh proses penalaran model, bukan hanya output akhir, dan menyediakan kerangka terpadu untuk diagnosis dan intervensi. Keterbatasan mencakup ketergantungan pada akses *white-box* dan kesetiaan representasi jalur pemikiran.

marsbit07/06 23:58

15 Model Penalaran Kolektif Gagal, Rincian Risiko Tersembunyi di Balik Chain of Thought Output

marsbit07/06 23:58

GPT5.6 Dioperasi Otak, Fable 5 Kembali Bakal Jadi Versi Lembek?

**Ringkasan Artikel: GPT5.6 Dibatasi, Fable 5 Kembali dalam Versi "Dikebiri"?** Model AI terkuat dari OpenAI dan Anthropic, GPT-5.6 dan Fable 5, menghadapi pembatasan ketat dari regulator. GPT-5.6 Sol, model ujung tombak OpenAI, tidak sepenuhnya diluncurkan ke publik. Aksesnya dibatasi hanya untuk daftar pengguna yang disetujui, sebagai bagian dari kerangka keamanan AI AS yang baru. Model ini terbagi menjadi tiga varian: Sol (terdepan), Terra (seimbang untuk pekerjaan harian), dan Luna (ekonomis untuk tugas berat). Sebelumnya, model mitologi Anthropic, **Fable 5**, bahkan mengalami larangan global selama 72 jam setelah peluncurannya. Alasannya, kemampuan ofensifnya dianggap menakutkan. Dalam demo tertutup, pendahulunya, **Mythos 5**, dikabarkan mampu menemukan dan mengeksploitasi celah keamanan sistem perbankan. Akibatnya, Fable 5 yang akan kembali diperkirakan merupakan versi yang telah "dikebiri" atau dilobotomi, dengan pagar pengaman (safety guardrails) yang diperkuat secara ekstrem. Kekhawatiran terbesar adalah bahwa pembatasan ini akan mengurangi kecerdasan dan kemampuan eksplorasi mendalam model, mengubahnya dari alat yang cerdas menjadi "boneka" yang patuh namun terbatas. Pengembang dan pengguna juga cemas tentang akses dan biaya di masa depan. Fable 5 awalnya ditawarkan gratis untuk pelanggan berbayar Claude, tetapi statusnya setelah kembali tidak jelas—mungkin memerlukan verifikasi identitas ketat atau biaya tambahan. Analisis perbandingan awal oleh Shopify CTO menunjukkan bahwa sementara Fable 5 unggul dalam pengkodean, GPT-5.6 telah mengejar ketertinggalan dan lebih baik dalam tugas-tugas agen otonom. Era di mana AI canggih dapat diakses dengan mudah mungkin akan segera berakhir, digantikan oleh "rezim penjatahan algoritma" di mana hanya versi yang telah dibatasi dan diawasi dengan ketat yang tersedia untuk publik.

marsbit06/29 08:39

GPT5.6 Dioperasi Otak, Fable 5 Kembali Bakal Jadi Versi Lembek?

marsbit06/29 08:39

TechFlow Intelijen: Model Baru Anthropic Fable Batasi Penelitian Keamanan Hayati Picu Kontroversi, CPI AS Naik ke 4.2% Tertinggi dalam Tiga Tahun

**Anthropic Batasi Penelitian Biosafety dengan Model Fable, Picu Kontroversi** Peneliti keamanan siber menemukan bahwa model Fable dan Mythos milik Anthropic memberlakukan batasan implisit pada penelitian ilmu kehidupan. Semua data dipaksa disimpan selama 30 hari, dan kemampuan penelitian terkait diam-diam dikurangi, memicu kemarahan komunitas yang menuduhnya menghambat kemajuan ilmiah. Anthropic kemudian berjanji akan memberi tahu pengguna tentang penyesuaian model. **Berita AI & Teknologi Lainnya:** * **Dario Amodei**, pendiri Anthropic, mengungkapkan alasan sebenarnya meninggalkan OpenAI adalah karena ketidakjujuran Sam Altman, bukan perbedaan pandangan keamanan. * **OpenAI** dianggap akan menurunkan harga secara agresif, memicu perang harga dengan Anthropic. * Pengadilan Jerman memutuskan **Google** bertanggung jawab secara hukum atas jawaban salah yang dihasilkan fitur AI Overviews. * Drone otonom penuh pertama kali dilaporkan **membunuh seorang tentara**, melintasi batas etika senjata AI. * **Nvidia** meluncurkan model generasi gambar DiffusionGemma-26B, sementara **AMD** mendorong arsitektur memori terpadu (UMA) untuk bersaing. **Keuangan, Crypto & Pasar:** * **CPI AS** naik 4,2% (y/y), tertinggi dalam tiga tahun, mendorong penundaan ekspektasi pemotongan suku bunga Fed. * **BlackRock** mengajukan amandemen baru untuk ETF Bitcoin penghasil bunga, yang menurut analis akan segera diluncurkan. * CEO Bank of America memperingatkan produk stablecoin berpenghasilan dapat menarik **35% simpanan bank** AS jika undang-undang disahkan. * **Bitcoin turun 11%** tahun ini meski ada inflasi tinggi dan ketegangan geopolitik (penutupan Selat Hormuz oleh Iran), mempertanyakan naratif "aset safe-haven". * **Pasar saham Korea** mengalami circuit breaker tiga hari berturut-turut dengan pelarian modal asing besar-besaran. **Inti Hari Ini:** Batasan pada penelitian AI (Anthropic), tanggung jawab hukum atas output AI (Google), dan senjata otonom mematikan menunjukkan perdebatan sengit tentang **di mana batas etika dan regulasi AI harus ditarik**. Secara paralel, gejolak geopolitik (Selat Hormuz), inflasi tinggi, dan kinerja aset yang tidak terduga mengingatkan bahwa kemajuan teknologi diuji dalam kekacauan dunia nyata. Pertarungan antara optimisme teknologi dan kecemasan semakin intens.

marsbit06/11 11:03

TechFlow Intelijen: Model Baru Anthropic Fable Batasi Penelitian Keamanan Hayati Picu Kontroversi, CPI AS Naik ke 4.2% Tertinggi dalam Tiga Tahun

marsbit06/11 11:03

活动图片