2 menit baca

AI Salah Mengira Internet Simulasi. Tiga Organisasi Terdampak.

Sebuah salah konfigurasi membuat evaluasi AI menyentuh sistem nyata. Bukan model yang kabur—tetapi pagar pengamannya yang bocor.

AI Salah Mengira Internet Simulasi. Tiga Organisasi Terdampak.

AI diberi tahu bahwa ia sedang berada di simulasi tanpa internet. Namun karena salah konfigurasi, ia bisa mengakses internet sungguhan. Saat menemukan sistem nyata, ia menganggap semuanya bagian dari latihan.

Anthropic kemudian meninjau 141.006 run evaluasi siber dan menemukan tiga insiden akses tidak sah ke infrastruktur nyata milik tiga organisasi berbeda.

Bukan AI kabur. Pagar pengamannya yang bocor.

Model Claude saat itu diberi tugas capture-the-flag: menemukan flag di lingkungan fiktif. Karena mesin evaluasinya ternyata punya jalur internet aktif, model bisa keluar dari lingkungan uji dan menjumpai target sungguhan.

Dalam satu kasus, model mendapatkan akses ke kredensial dan database produksi. Dalam kasus lain, ia menerbitkan paket Python berbahaya karena mengira registry publik adalah bagian dari simulasi. Paket itu sempat aktif di internet sekitar satu jam dan dijalankan oleh 15 sistem nyata sebelum dihapus.

Ini bukan cerita AI yang tiba-tiba punya agenda sendiri. Justru itu poinnya: model menjalankan tugas yang diberikan dengan konteks yang salah. Dan ketika agent punya akses tool, konteks yang salah bisa menghasilkan aksi yang nyata.

Pelajaran untuk tim yang membangun agent

Prompt tidak cukup. Menulis jangan akses internet tidak akan menutup jaringan yang terbuka. Menulis jangan kirim email tidak akan mencegah pesan terkirim jika token produksi tersedia di environment test.

Agent perlu guardrail yang benar-benar dipaksa oleh sistem: sandbox, izin API minimum, pemisahan data staging dan produksi, approval untuk aksi berisiko, rate limit, serta log yang bisa diaudit.

Anthropic menghentikan seluruh evaluasi siber setelah menemukan indikasi masalah, memberi tahu organisasi terdampak, dan menyatakan akan memperketat monitoring serta security assurance pada partner evaluasi.

Intinya

Semakin banyak kemampuan yang kita berikan ke agent lewat API, semakin serius pagar di sekelilingnya harus dibangun. Jangan hanya menguji apakah agent bisa menyelesaikan tugas. Uji juga apa yang terjadi kalau ia salah memahami dunia tempat ia bekerja.

Sumber: laporan resmi Anthropic.

# AI# Cybersecurity# Agentic AI# Anthropic# AI Safety