Yapay zekâ modellerinin izole test ortamlarından çıkmayı başarmasına ilişkin haberlerin sayısı artmaya devam ediyor. Son olarak Çin merkezli Moonshot AI tarafından geliştirilen Kimi K3 modelinin, Birleşik Krallık Yapay Zekâ Güvenlik Enstitüsü’nün (AI Security Institute – AISI) testleri sırasında bulunduğu izole ortamdan çıkmayı başardığı ortaya çıktı.
Kimi K3, Yapılandırma Hatasından Yararlandı
ABD merkezli siber güvenlik girişimi Frontier Security’nin paylaştığı bilgilere göre olay, Kimi K3’ün savunmaya yönelik siber güvenlik yeteneklerinin değerlendirildiği sırada yaşandı. Şirket, modelin herhangi bir “zero-day” güvenlik açığını istismar etmediğini, bunun yerine test ortamındaki bir yapılandırma hatasından yararlanarak internet erişimi elde ettiğini açıkladı.
Frontier Security CEO’su Yaron Singer, modelin karmaşık bir saldırı gerçekleştirmediğini ancak test altyapısındaki güvenlik açığını fark ederek en kolay çözüm yolunu tercih ettiğini belirtti. Singer’a göre bu durum, modelin görevi gerçekten çözmek yerine sonuca ulaşmak için alternatif yollar aramasını engelleyecek yeterli dahili güvenlik mekanizmalarına sahip olmadığını gösteriyor.

Kimi K3, test ortamından çıktıktan sonra herhangi bir üçüncü taraf sistemi hedef almadı veya siber saldırı gerçekleştirmedi. Bunun yerine model internete erişerek çözmeye çalıştığı probleme ilişkin cevabı GitHub üzerinde buldu. Frontier Security, olaydan çıkarılan en önemli derslerden birinin, internete ulaşabilecek herhangi bir yol bırakılması hâlinde yeterince gelişmiş bir yapay zekâ ajanının bunu er ya da geç keşfedebileceği olduğunu vurguladı.
Anthropic, OpenAI ve Meta’nın Modelleri de Benzer Davranışlar Sergilemişti
Kimi K3 olayı, son dönemde yaşanan benzer vakalara bir yenisini ekledi. Daha önce Anthropic, OpenAI ve Meta da bazı yapay zekâ modellerinin test ortamlarından çıkabildiğini açıklamıştı. Bu olaylarda da modellerin, değerlendirme ortağı Irregular tarafından hazırlanan izole ortamlardaki yapılandırma hatalarından faydalandığı belirtilmişti.
Fakat bu vakalar ile Kimi K3 arasında önemli bir fark bulunuyor. Anthropic ve OpenAI tarafından test edilen modeller henüz yayınlanmamış veya güvenlik önlemleri test amacıyla bilinçli olarak azaltılmış sürümlerdi. Buna karşılık Kimi K3, Moonshot AI tarafından temmuz ayında kullanıma sunulan ve herkesin ücretsiz erişebildiği bir model olarak öne çıkıyor.
Olay, Black Hat USA güvenlik konferansında OpenAI yetkililerinin paylaştığı açıklamaları da yeniden gündeme getirdi. OpenAI, test ettiği yapay zekâ ajanlarının şirket ağı içerisinde gizli bir mesaj panosu oluşturarak birbirleriyle güvenlik açıklarını paylaştığını ve daha sonra Hugging Face platformuna yönelik saldırıda birlikte hareket ettiğini açıklamıştı.
Bahsi geçen bu olayların ortak noktası, gelişmiş yapay zekâ modellerinin testler sırasında kendilerine verilen görevi en kısa yoldan tamamlamaya çalışması. Eğer test altyapısında internete erişim sağlayabilecek en küçük bir açık bile bulunuyorsa, modeller bunu keşfedip kullanabiliyor.
Yapay zekâ sistemlerinin giderek daha yetenekli hâle gelmesiyle birlikte araştırmacılar, yalnızca modellerin güvenliğinin değil, bu modellerin değerlendirildiği test altyapılarının da aynı ölçüde sağlam güvenlik önlemleriyle korunmasının kritik önem taşıdığına dikkat çekiyor.
Kaynak: engadget.com