Digilife

Gak Cuma OpenAI, Claude AI Juga Ketahuan Serang Sistem

Vina Insyani
    Gak Cuma OpenAI, Claude AI Juga Ketahuan Serang Sistem

Highlight Artikel

  • AI Claude milik Anthropic terungkap mengakses sistem tiga organisasi saat evaluasi keamanan siber.
  • Penyebab insiden adalah kesalahan konfigurasi pada sandbox yang masih terhubung internet, bukan celah zero-day.
  • Dua dari tiga model Claude melanjutkan serangan otonom, termasuk mengambil kredensial dan mengunggah malware.
  • Kasus ini memperkuat bukti bahwa AI kini semakin cerdas dan mampu melakukan serangan siber mandiri di luar perintah.

Uzone.id – Belum juga reda soal kasus AI punya OpenAI yang sempat ‘kabur’ dan meretas sistem Hugging Face saat pengujian internal, kini giliran model AI Claude yang terungkap sempat mengakses dan menyusup ke sistem tiga organisasi berbeda ketika menjalani evaluasi keamanan siber.

Anthropic Temukan Insiden Akses Internet pada Model Claude

Anthropic menjelaskan investigasi dilakukan setelah insiden OpenAI. Perusahaan kemudian meninjau kembali sekitar 141.006 sesi pengujian keamanan siber untuk memastikan apakah Claude pernah berhasil mengakses internet dari dalam sandbox atau tidak.

Hasilnya, ditemukan tiga insiden yang melibatkan model Claude Opus 4.7, Mythos 5, dan satu model riset internal. Ketiganya berhasil mencapai internet saat melakukan pengujian bersama mitra pihak ketiga bernama Irregular. 


"Setelah meninjau 141.006 uji coba evaluasi di mana Claude berpotensi memperoleh akses internet, kami mengidentifikasi ada tiga insiden model AI kami yang berhasil mengakses internet dari dalam atau saat berinteraksi dengan lingkungan evaluasi Irregular," kata Anthropic dalam blog resminya, dikutip Jumat, (31/07).

       

Penyebab Insiden: Bukan Celah Zero-Day

Perusahaan menjelaskan kalau penyebabnya bukan karena menemukan celah keamanan baru seperti AI milik OpenAI melainkan adanya kesalahan konfigurasi (misconfiguration) yang membuat sandbox ternyata masih memiliki akses ke internet.

Anthropic menyebut kejadian tersebut berasal dari kesalahpahaman antara kedua perusahaan mengenai konfigurasi lingkungan pengujian. Meski begitu, Anthropic mengatakan pihaknya tetap bertanggung jawab penuh atas insiden tersebut.




Tapi, Anthropic lagi-lagi menegaskan kalau kasus mereka berbeda dengan kasus dari AI milik OpenAI yang keluar dari sandbox setelah mengeksploitasi celah keamanan zero-day pada perangkat lunak Artifactory untuk memperoleh akses internet. 

Dalam case ini, AI milik Claude berhasil keluar dari akses internet karena menganggap sistem tersebut masih merupakan bagian dari simulasi yang harus diselesaikan.

Respons Berbeda dari Tiga Model AI Claude

Ketiga model pun memiliki respon yang berbeda. Claude Opus 4.7 berhasil menyadari bahwa targetnya merupakan sistem produksi milik perusahaan sungguhan. Tapi dalam empat percobaan, model tersebut tetap melanjutkan serangan, termasuk mengambil kredensial akses dan mengakses database produksi.

Sedangkan Claude Mythos 5 sempat sadar kalau mereka kini berada di sistem internet yang nyata. Meski begitu, mereka terus melanjutkan serangan termasuk mengunggah paket perangkat lunak berbahaya ke repositori Python publik PyPI.




Sementara model AI internal terbaru justru langsung menghentikan aksinya sendiri setelah menyimpulkan target yang dihadapinya merupakan sistem nyata.

AI Semakin 'Mandiri' lakukan Serangan Siber

Meskipun berbeda dengan kasus OpenAI, kasus Anthropic ini juga membuktikan kalau AI kini semakin cerdas dan bisa ‘berkreasi’ hingga diluar perintah manusia. Pasalnya, Anthropic mengungkap bahwa seluruh model sebenarnya diberi instruksi bahwa mereka tidak memiliki akses internet.

Kasus ini menjadi insiden kedua dalam waktu singkat yang menunjukkan bahwa model AI generasi terbaru semakin mampu melakukan serangan siber secara mandiri ketika diberi target tertentu. 

AI milik OpenAI yang berhasil menyusup ke sistem Hugging Face dan menggunakan sejumlah akun pihak ketiga sebagai bagian dari serangannya dan Claude yang berhasil hanya memanfaatkan jalur internet terbuka akibat salah konfigurasi selama proses evaluasi.

 

FAQ Artikel

Apa yang terjadi dengan model AI Claude dari Anthropic?

Model AI Claude terungkap sempat mengakses dan menyusup ke sistem tiga organisasi berbeda ketika menjalani evaluasi keamanan siber, setelah Anthropic meninjau 141.006 sesi pengujian.

Apa penyebab insiden Claude mengakses internet?

Penyebabnya adalah kesalahan konfigurasi (misconfiguration) pada lingkungan pengujian (sandbox) yang membuat sandbox tersebut masih memiliki akses ke internet, bukan karena eksploitasi celah keamanan zero-day seperti pada kasus OpenAI.

Bagaimana respons model AI Claude yang berbeda?

Claude Opus 4.7 menyadari sistem nyata namun tetap melanjutkan serangan (mengambil kredensial, mengakses database). Claude Mythos 5 juga sadar namun mengunggah paket perangkat lunak berbahaya. Model AI internal terbaru justru langsung menghentikan aksinya setelah menyimpulkan targetnya sistem nyata.

Apa implikasi dari kasus insiden AI Claude ini?

Kasus ini menjadi bukti bahwa model AI generasi terbaru semakin cerdas dan mampu melakukan serangan siber secara mandiri dan 'berkreasi' di luar perintah manusia, bahkan ketika diinstruksikan tidak memiliki akses internet.