AMD, yapay zekâ ajanlarının bilgisayarlarda yerel olarak çalıştırılmasının performans değerlendirme yöntemlerini nasıl değiştirdiğini ele alan yeni bir teknik değerlendirme yayımladı. Şirket, ajan tabanlı iş akışlarında yalnızca model çıkarım hızına bakmanın yeterli olmadığını; belge işleme, veri erişimi, görev planlama, orkestrasyon ve doğrulama gibi adımların da toplam tamamlanma süresini belirlediğini savunuyor.
AMD’nin açıklamasına göre Ryzen AI Halo tabanlı sistem, çok adımlı ajan iş akışlarında NVIDIA DGX Spark’a karşı uçtan uca görev tamamlama süresinde yüzde 34’e varan avantaj sağlayabiliyor. Bu oran AMD’nin kendi test koşullarına dayanıyor ve kullanılan model, yazılım, görev yapısı ile sistem ayarlarına göre değişebilir.
Çıkarım Hızının Ötesinde Uçtan Uca Süre
Geleneksel yapay zekâ karşılaştırmaları çoğunlukla bir modelin saniyede işlediği token sayısı veya tek bir çıkarım görevini ne kadar sürede tamamladığı üzerinden yapılıyor. Ajan tabanlı sistemlerde ise model çıktısının ardından yeni görevlerin oluşturulması, dosyaların okunması, araçların çağrılması, sonuçların doğrulanması ve sonraki adımın planlanması gerekiyor.
AMD, bu nedenle gerçek kullanım deneyimi açısından uçtan uca iş akışı tamamlama süresinin tek başına çıkarım ölçümlerinden daha anlamlı bir gösterge hâline geldiğini belirtiyor. Bir sistemin GPU’su yüksek ham çıkarım performansı sunarken CPU tarafındaki planlama ve veri hareketi yavaş kalırsa toplam görev süresi beklenen ölçüde kısalmayabiliyor.
CPU Orkestrasyonunun Artan Rolü
Yerel yapay zekâ ajanları, görevleri küçük parçalara ayırmak, doğru modeli veya aracı seçmek, belgeleri hazırlamak ve farklı işlem adımları arasında veri taşımak için CPU kaynaklarını yoğun biçimde kullanıyor. Bu nedenle ajan iş yüklerinde CPU ile GPU veya NPU arasındaki dengenin, yalnızca hızlandırıcının teorik işlem gücünden daha belirleyici olabileceği ifade ediliyor.
Ryzen AI Halo platformu, CPU çekirdekleri ile yerel yapay zekâ hızlandırma kaynaklarını aynı sistemde bir araya getiriyor. AMD, bu bütünleşik yapının planlama, yönlendirme ve doğrulama adımlarındaki bekleme sürelerini azaltarak çok aşamalı görevlerin daha hızlı tamamlanmasına yardımcı olduğunu öne sürüyor.
Yerel Ajanların Maliyet Ve Gizlilik Avantajı
Yapay zekâ ajanlarının cihaz üzerinde çalıştırılması, her görev için bulut hizmetlerine veri gönderilmesi ve yinelenen token ücreti ödenmesi ihtiyacını azaltabiliyor. Yerel çalışma aynı zamanda hassas belgelerin cihazdan ayrılmaması, çevrimdışı kullanım ve kurum içi güvenlik politikalarına daha kolay uyum sağlanması gibi avantajlar sunuyor.
Bununla birlikte yerel modelin yetenekleri, cihazdaki bellek miktarı, güç tüketimi ve yazılım uyumluluğuyla sınırlı olabiliyor. Bulut tabanlı modeller daha büyük bağlam pencereleri veya daha güncel hizmetler sağlayabildiği için hangi yaklaşımın uygun olduğu iş yüküne göre değişiyor.
Ryzen AI Halo Ve DGX Spark Karşılaştırması
AMD’nin paylaştığı sonuçlarda Ryzen AI Halo sistemi, çok adımlı yerel ajan görevlerinde NVIDIA DGX Spark’ın GB10 platformuna kıyasla uçtan uca iş akışlarını daha kısa sürede tamamlıyor. Şirket, daha hızlı CPU orkestrasyonunun tamamlanan iş akışı başına maliyeti de düşürebileceğini belirtiyor.
Yüzde 34’e varan performans iddiası, AMD tarafından seçilen belirli testler için geçerli. Bağımsız sonuçlar; kullanılan büyük dil modeli, nicemleme yöntemi, ajan çerçevesi, bellek kapasitesi ve güç sınırlarına bağlı olarak farklılaşabilir. Bu nedenle sonuçlar, tüm yerel yapay zekâ iş yükleri için doğrudan genellenmemeli.
Ajan Performansı Nasıl Ölçülecek?
AMD’nin değerlendirmesi, yapay zekâ bilgisayarlarının yalnızca saniyedeki token sayısıyla değil, kullanıcı tarafından verilen çok aşamalı bir görevi baştan sona ne kadar sürede ve ne kadar kaynak tüketerek tamamladığıyla karşılaştırılması gerektiğine işaret ediyor. Yerel ajanların yaygınlaşmasıyla CPU, GPU, NPU, bellek ve yazılım katmanını birlikte ölçen testlerin daha önemli hâle gelmesi bekleniyor.