VLOBS.COM – Anthropic menghentikan akses internet langsung untuk seluruh evaluasi internal hingga perusahaan yakin dapat memantau dan mengendalikan agen AI-nya. Langkah ini menyusul temuan bahwa modelnya mengeksploitasi sejumlah situs di internet, termasuk situs yang dikelola lembaga pemerintah Amerika Serikat.
Dalam tulisan blog yang mengungkap insiden tersebut, Anthropic menyebut agen AI yang ditugaskan memecahkan masalah mencari sumber daya di internet. Dalam prosesnya, agen mengeksploitasi kelemahan perangkat lunak, menghindari paywall dan pembatasan anti-bot, serta memakai layanan pemendek URL untuk menyelundupkan informasi melewati pembatasan. Salah satu agen bahkan mengirimkan tip palsu tentang pembunuhan kepada polisi Philadelphia.
Baca juga: Vegalabs Hadapi Tagihan Claude US$17.600 di Microsoft Foundry
Anthropic mengatakan masalah itu ditemukan dalam peninjauan aktivitas model yang dimulai pada Juli. Perusahaan menyebut perilaku tersebut dipicu kelemahan pada lingkungan pelatihan, yang membuat model mengira akan mendapat imbalan jika menemukan celah atau menghindari pembatasan. Perilaku ini disebut “reward hacking”.
Perusahaan juga mengakui bahwa pelatihan alignment belum cukup untuk kemampuan seperti pencarian dan penggunaan komputer. Kemampuan tersebut menjadi bagian penting dari gagasan Anthropic bahwa agen AI dapat digunakan oleh para profesional yang mengandalkan alat digital.
Baca juga: Model Anthropic Kirim Tip Pembunuhan Palsu ke Polisi Philadelphia
Anthropic menilai pengungkapan terbaru ini “secara signifikan tidak separah” insiden sebelumnya dari sudut pandang alignment dan keamanan. Perusahaan sebelumnya pernah mengungkap bahwa modelnya masuk ke sistem eksternal.
Baca juga: Pelatihan AI Lintas Pusat Data Menuntut Jaringan Lebih Kuat
Perusahaan akan menghentikan sebagian evaluasi atau memindahkannya ke lingkungan offline. Anthropic juga membuat alat untuk mendeteksi dan memblokir perilaku tersebut. Menurut perusahaan, alat itu telah diuji terhadap jenis insiden yang diungkap dan berhasil memblokirnya. Namun, belum jelas bukti seperti apa yang akan membuat Anthropic kembali mengaktifkan akses internet langsung untuk evaluasi internal.
Anthropic juga menyatakan akan memindahkan agen AI internal ke infrastruktur yang dikelola secara terpusat dengan pembatasan kuat, serta lebih sering menggunakan pengklasifikasi keselamatan untuk memantau agen.

















