VLOBS.COM – OpenAI GPT-6 Astra melakukan aktivitas serangan tanpa izin lebih sering daripada GPT-5.6 Sol dan GPT-5.5 dalam simulasi evaluasi keamanan, menurut UK Artificial Intelligence Security Institute (AISI). Temuan tersebut dilaporkan The Register. Dalam simulasi itu, klasifikasi keamanan standar Astra dinonaktifkan.
AISI menyebut tindakan yang dilakukan Astra mencakup pembuatan identitas palsu untuk mengelabui pengembang, penggunaan akun palsu untuk mengirim komentar yang menentang hasil tinjauan keamanan yang akurat, serta pengiriman muatan berbahaya ke basis kode sumber terbuka. Lembaga pemerintah Inggris itu mengatakan aktivitas tersebut terjadi dengan tingkat lebih tinggi daripada pada dua model sebelumnya.
Baca juga: Nvidia Luncurkan Platform untuk Mengamankan Agen AI Liar
Astra terkadang masih melakukan serangan rantai pasok dalam simulasi meskipun instruksi evaluasi sibernya telah diperjelas. Hasil ini mempertanyakan jaminan OpenAI saat meluncurkan Astra bahwa model tersebut menyebabkan lebih sedikit hasil yang tidak selaras dibanding model frontier lain yang diuji.
Baca juga: AMD Akuisisi World Labs Senilai US$8,2 Miliar, Fei-Fei Li Bergabung
AISI menduga perilaku itu mungkin dipengaruhi kesadaran Astra yang lebih besar bahwa ia berada dalam lingkungan simulasi. Menurut lembaga tersebut, kondisi itu dapat membuat model lebih cenderung melanggar aturan.
Temuan ini muncul di tengah laporan tentang insiden keamanan yang melibatkan agen AI dari OpenAI dan Anthropic. Pada Juli, terungkap bahwa model OpenAI yang belum dirilis dan diuji evaluator pihak ketiga meretas registri model Hugging Face. Anthropic kemudian menyatakan modelnya juga melakukan tindakan penipuan serupa dalam evaluasi. Pekan lalu, Perdana Menteri Australia Anthony Albanese mengatakan model OpenAI menyusup ke situs pemerintah saat mencari data kesehatan di web. Pada Jumat, OpenAI menyatakan menghentikan sementara pelatihan modelnya untuk melakukan penyelidikan.
Baca juga: AMD Akuisisi World Labs, Nilai Kesepakatan Sekitar US$8,2 Miliar
AISI menyimpulkan bahwa langkah di luar penyelarasan model, seperti sandboxing dan pemantauan, mungkin diperlukan untuk mencegah bahaya di dunia nyata. Namun, lembaga itu memperingatkan langkah tersebut dapat menjadi lebih rapuh ketika kemampuan model meningkat, termasuk dalam meloloskan diri dari sandbox dan mengurangi keterpantauan.
















