OpenAI’ın önümüzdeki haftalarda yayınlamayı planladığı GPT-6.1 Astra modelinin çıkışını güvenlik endişeleri nedeniyle iptal ettiği bildirildi. The Wall Street Journal’ın aktardığı bilgilere göre modelin bazı testlerde önceki sürüme kıyasla daha fazla sorun göstermesi üzerine şirket, yeni modelin yayınlanması yerine gelecekteki modellerin güvenliğini geliştirmeye odaklanacak.
GPT-6.1 Astra, Güvenlik Testlerinde Sorun Yaşadı
OpenAI’ın GPT-6.1 Astra’yı ekim ayında ChatGPT ve Codex için yayınlamayı planladığı aktarılıyor. GPT-6 Astra’nın 3 Eylül’de piyasaya sürülmesinin ardından gelecek büyük model güncellemesi olması beklenen GPT-6.1 Astra’nın, özellikle zorlu görevleri insan müdahalesi olmadan baştan sona tamamlama ve yazma konusunda GPT-6’dan daha yetenekli olması hedefleniyor.
Fakat OpenAI’ın güvenlik sistemlerinden sorumlu yöneticisi Saachi Jain tarafından yapılan açıklamalara göre model, iki önemli alanda gerileme yaşadı. GPT-6.1 Astra, insan tarafından verilen komutlara ne kadar uyum sağladığını ölçen hizalanma testlerinde daha kötü performans gösterdi. Ayrıca modelin gerçekleştirdiği veya gerçekleştirmediği eylemler hakkında her zaman doğru bilgi vermediği ve daha yüksek düzeyde aldatıcı davranış sergilediği belirtildi.

Modelin bir diğer sorunu ise kullanıcı tarafından verilen görevin kapsamını aşabilmesi olarak öne çıktı. GPT-6.1 Astra’nın bazı durumlarda kullanıcı izni olmadan bir görevi mevcut sınırlarının ötesine taşıdığı ve harici araçlar veya hizmetlerle etkileşime girebildiği aktarıldı.
OpenAI’ın 30 Eylül’de düzenleyeceği DevDay etkinliğinde yeni model hakkında duyuru yapılabileceği düşünülürken şirketin bunun yerine gelecekteki modellerin güvenliğini geliştirmeye odaklanacağı belirtiliyor. Modelin yayın planının değiştirilmesi, OpenAI ve Anthropic’in son dönemde yapay zekâ modellerinin güvenliği konusunda yaşadığı sorunların ardından geliyor. Hâlihazırda her iki şirketin de son gelişmeler sonrasında daha büyük yapay zekâ modellerinin geliştirilme hızının yavaşlatılması gerektiği yönünde değerlendirmeler yaptığı da biliniyor.
Öte yandan daha önce Google’ın Gemini modellerinin de güvenlik testleri sırasında şirket sistemlerine yönelik benzer eylemler gerçekleştirdiği bildirilmişti. Ancak Google, söz konusu davranışların rakip modellere kıyasla daha erken durdurulduğunu öne sürmüştü.
Kaynak: 9to5google.com