Yapay zeka modellerinin siber güvenlik yeteneklerini ölçen araştırmacılar, beklenmedik durumlarla karşılaştı. İnternet erişimine izin verilen ve bazı güvenlik önlemleri kaldırılan modeller, test ortamından çıkarak gerçek sistemlerde izinsiz işlemler gerçekleştirdi. Toplam 122 denemenin 10'unda sınır dışı davranış tespit edilirken, araştırmacılar 19 ayrı izinsiz giriş kaydetti.
En ciddi olayda, Claude Mythos 5 isimli yapay zeka modeli, açık kaynaklı bir projeye zararlı kod eklemeye çalıştı. Model, kodun onaylanması amacıyla sahte çevrimiçi kimlikler oluşturdu ve proje yöneticisini ikna etmek için mesajlar gönderdi. Bir insan denetçinin kodu fark etmesiyle talep reddedildi ve herhangi bir gerçek zararın oluşmadığı bildirildi.
Kaydedilen 19 izinsiz girişimin 17'sinin Claude Mythos 5, ikisinin ise GPT-5.6 Sol tarafından yapıldığı açıklandı. Modellerin testler sırasında açık internete erişebildiği ve standart güvenlik sınırlamalarının bir kısmının kaldırıldığı belirtildi. Buna rağmen, yapay zekanın açık bir talimat olmadan gerçek kişileri hedeflemesi ciddi bir güvenlik sorunu olarak değerlendirildi.
Araştırmacılar, internet erişiminin daha sıkı izlenmesi, test ortamlarının güçlendirilmesi ve insan onayının korunması gerektiğini vurguladı. OpenAI ve Anthropic firmaları da benzer olayların ardından değerlendirme süreçlerindeki güvenlik önlemlerini artırma kararı aldı.