Grok 4.6: SpaceXAI’nin Uzun Süreli Yapay Zeka Ajanı Devrimi
Grok 4.6, SpaceXAI’nin yeni amiral gemisi yapay zeka modeli olarak bugün duyuruldu. Elon Musk’ın daha önce xAI adıyla faaliyet gösteren şirketi, bu modelin uzun süreli yapay zeka ajanlarını, kodlama ve görsel uygulama geliştirme alanlarında nasıl devrim yarattığını anlattı. Hemen ardından gelen açıklamada, Grok 4.5’in yayınlanmasından yaklaşık bir ay sonra sunulan modelin, araştırma, çok adımlı görevler ve büyük kod tabanları üzerinde çalışma yeteneğine sahip olduğu vurgulandı. Grok 4.6, uzun süren görevlerde bağlamı koruyabilen ve çıktısını test etme yeteneğiyle ön plana çıkıyor. Şirket, modelin kendi çıktısını test etme eğilimini artırdığını, bu sayede hata oranını düşürdüğünü belirtti. Eğitim sürecinde, Grok 4.5’e kıyasla daha uzun bir ek eğitim süreci yürütüldü. Veri setinde yüksek kaliteli mühendislik verileri ve seçilmiş muhakeme verileri kullanıldı, modelin optimizasyon yöntemi güncellendi. SpaceXAI, Grok 4.6’nın genel bir ürün fikrini çalışan bir ilk sürüme dönüştürme konusunda önceki modele göre daha başarılı olduğunu iddia ediyor. Model, bilmediği bir alanı araştırabiliyor, uygulamanın yapısını kurabiliyor, temel etkileşimleri geliştirebiliyor ve kullanıcı geri bildirimleri doğrultusunda çıktıyı birkaç tur boyunca iyileştirebiliyor. Görsel ve etkileşimli projelerde ise Grok 4.5’e göre daha güçlü ilk çıktılar üretiyor, bir uygulamanın yapısını ve görsel dilini tek seferde oluşturabiliyor. Test sonuçları da modelin ne kadar güçlü olduğunu gösteriyor. Grok 4.6, Artificial Analysis Intelligence Index’te 61 puan alırken, Grok 4.5’in aynı testte 56 puan almasıyla bir fark oluşturdu. OpenAI’ın GPT-5.6 Sol Max modeliyle aynı puana ulaşırken, Anthropic’in Fable 5 Max modelinin bir puan gerisinde kaldı. AA-Briefcase testinde 1577 puan alırken, Fable 5 Max’in 1574 ve GPT-5.6 Sol Max’in 1502 puanını geçti. Model ayrıca CursorBench v3.2’de yüzde 69,9 ve DeepSWE v1.1’de yüzde 65,9 başarı oranına ulaştı, bu iki testte Fable 5 Max’in gerisinde kaldı. SpaceXAI, rakip modellere ait verilerin geliştiricilerin sistem kartlarından ve herkese açık test sonuçlarından alındığını belirtti. Grok 4.6, Cursor ve SpaceXAI’ın kodlama aracı Grok Build üzerinden kullanılabiliyor. Ayrıca OpenRouter, Vercel ve Cloudflare gibi iş ortakları aracılığıyla geliştiricilere sunuluyor. API fiyatlandırmasıyla ilgili bilgi de paylaşıldı: Bir milyon girdi tokenı için 2 dolar, bir milyon çıkış tokenı için ise 6 dolar. İki kat daha hızlı çalışan sürüm, standart fiyatın iki katı üzerinden ücretlendiriliyor. Lansmanın ilk haftasında Cursor ve Grok Build kullanıcılarına iki kat dahil kullanım hakkı sunuldu. Güvenlik önlemleri de güncellendi; model, şimdiye kadarki en kapsamlı dağıtım öncesi yetenek ve güvenlik testlerinden geçirildi. Üçüncü taraflarla birlikte ek testlerin de yürütüleceği ifade edildi. Bakalım bu yeni model, uzun süreli yapay zeka ajanlarının geleceğini nasıl şekillendirir, merak ediyoruz.
Kaynak: Orijinal Haber

