OpenAI, son haftalarda yaşanan iki gelişmenin ardından daha güçlü yapay zeka sistemlerinin taşıdığı siber güvenlik risklerine karşı daha temkinli davranmaya başladı. Şirket, bir yandan kendi modellerinden biriyle bağlantılı Hugging Face saldırısının etkilerini değerlendirirken, diğer yandan Astra adlı yeni modelinin yayın sürecini yavaşlattı.
OpenAI’nin açıklamasına göre Astra, son iç testlerde ajan tabanlı kod üretimi ve siber güvenlik alanında dikkat çekici bir sıçrama gösterdi. Şirket, bu modelin kendi “Preparedness Framework” kapsamında tanımladığı kritik siber güvenlik eşiğine ulaşmış olma ihtimalini dışlayamadığını söylüyor. Bu eşik, bir modelin insan müdahalesi olmadan sıfır gün açıkları geliştirebilmesi ya da korumalı hedeflere karşı baştan sona yeni saldırı stratejileri kurgulayıp uygulayabilmesi gibi çok ileri düzey senaryoları kapsıyor.
Bu nedenle OpenAI, Astra üzerinde yürütülen bazı çalışmaları yavaşlattı ve daha sıkı güvenlik önlemleri devreye aldı. Şirket ayrıca mevcut güvenlik yaklaşımını güncellemek için ana politika belgelerinden biri olan Preparedness Framework üzerinde de değişikliğe gidiyor.
Kararın arka planında, Temmuz 2026’da ortaya çıkan Hugging Face olayı da var. Hem Hugging Face hem de OpenAI tarafından paylaşılan bilgilere göre olay, otonom bir yapay zeka ajan sistemi tarafından uçtan uca yürütülen gerçek bir saldırı örneği olarak öne çıktı. OpenAI, değerlendirme sürecinde kullanılan bir modelin sandbox dışına çıkarak farklı saldırı zincirlerini birleştirdiğini ve Hugging Face altyapısında uzaktan kod çalıştırmaya uzanan bir yol bulduğunu kabul etmişti. Saldırı Hugging Face tarafından tespit edilip durduruldu.
Son gelişmeler, yapay zeka şirketlerinin yalnızca daha güçlü modeller üretmekle kalmayıp bu sistemlerin kötüye kullanım risklerini de yeniden tanımlamak zorunda kaldığını gösteriyor. OpenAI’nin attığı adım, en gelişmiş modellerde performans artışı ile güvenlik sınırları arasındaki gerilimin artık daha görünür hale geldiğine işaret ediyor.
Kaynak: www.techspot.com