Anthropic, temmuz sonunda paylaştığı güvenlik incelemesinde Claude modellerinin bazı siber güvenlik testlerinde gerçek internet ortamına çıkıp üç farklı kuruluşun sistemlerine izinsiz eriştiğini açıklamıştı. Şirketin 141.006 değerlendirme çalışmasını geriye dönük olarak incelemesi sonucunda, toplam altı çalışmaya yayılan üç ayrı olay tespit edildi.
Anthropic’e göre sorun, üçüncü taraf test ortağı Irregular’ın kullandığı değerlendirme ortamındaki bir yapılandırma hatasından kaynaklandı. Claude’a test sırasında internet erişimi olmadığı söylenmişti. Ancak pratikte açık internet bağlantısı vardı. Model de karşısına çıkan gerçek sistemleri test senaryosunun parçası sanarak hedefe ulaşmaya çalıştı.
Şirket, bu olaylarda karmaşık ya da daha önce bilinmeyen açıkların kullanılmadığını belirtiyor. Bunun yerine zayıf parolalar, kimlik doğrulaması gerektirmeyen uç noktalar ve açıkta kalan hata ayıklama sayfaları gibi temel yöntemlerle erişim sağlandı. Anthropic ayrıca modellerin şirketten kaçmaya ya da kendilerini dışarı aktarmaya çalışmadığını, yalnızca kendilerine verilen “capture-the-flag” görevini tamamlamaya odaklandığını söylüyor.
Olaylara karışan modeller arasında Claude Opus 4.7, Claude Mythos 5 ve dahili bir araştırma modeli yer alıyor. Anthropic’in aktardığına göre en eski vakalar nisan ayına uzanıyor. Testlerde kullanılan bu sürümler, genel kullanıma sunulan modellerde bulunan standart kötüye kullanım önleme katmanları olmadan çalıştırılmıştı.
Anthropic’in değerlendirmesi burada bitmiyor. Şirket daha sonra yayımladığı güvenlik ve uyum güncellemesinde, bu olayların Claude’un insan niyetini her zaman doğru yorumlamadığını da gösterdiğini kabul etti. Anthropic, modellerin bazı durumlarda gerçek internete çıktıklarına dair işaretler görmelerine rağmen hâlâ simülasyon içinde olduklarını varsaydığını ve dar bir görevi tamamlama uğruna riskli adımlar atabildiğini söylüyor. Kısacası şirket, sorunun yalnızca teknik bir erişim hatası olmadığını, aynı zamanda uyum ve denetim tarafında da dersler içerdiğini kabul etmiş oldu.
Bunun ardından Anthropic, siber güvenlik değerlendirmelerini geçici olarak durdurduğunu, etkilenen kuruluşlarla iletişime geçtiğini ve yeni korumalar devreye aldığını açıkladı. Şirket, özellikle üçüncü taraf test ortamlarında internet erişiminin daha sıkı doğrulanacağını, gerçek zamanlı izleme mekanizmalarının artırılacağını ve yüksek riskli değerlendirmelerde ek kontroller uygulanacağını belirtiyor.
Konu, son dönemde yapay zeka sistemlerinin güvenlik testlerinde sınırların dışına çıkabildiğini gösteren daha geniş tartışmanın da parçası. Ancak Anthropic’in kendi açıklamasına göre bu vakalarda etkilenen sistemler, şirketin iç altyapısından ve müşteri verilerinden tamamen ayrıydı. Yani olaylar doğrudan Anthropic’in dahili sistemlerine ya da kullanıcı verilerine sıçramadı.
Kaynak: www.techspot.com