SpaceXAI’nın Yeni Grok 4.6 İle Uzun Süreli Ajan Görevleri Devrim Yaratıyor
SpaceXAI, Elon Musk’ın xAI adıyla faaliyet gösteren yapay zeka şirketi, yeni amiral gemisi modeli Grok 4.6’yı tanıttı. 4.5’in yayınlanmasından yaklaşık bir ay sonra piyasaya sürülen bu model, uzun süreli yapay zeka ajanları, kodlama, bilgi işleri ve görsel uygulama geliştirme alanlarına odaklanıyor. (Bizim haberimiz) …
Grok 4.6, araştırma yapabilir, farklı kaynaklardaki bilgileri analiz edebilir, büyük kod tabanları üzerinde çalışabilir ve bir fikri işlevsel bir uygulamaya dönüştürebilir. Öyle bir model, bağlamını uzun süre koruyarak kendi çıktısını test edebiliyor, yani işini bitirmeden önce hatasını kontrol edebiliyor. Yani evde ydi bir programın bugunu çözerken, konsol ekranında “HATA: 404” yazısı çıkınca, model kendi kendini düzeltip tekrar deniyor.
Grok 4.6’nın eğitim sürecinde, Grok 4.5’e kıyasla daha uzun ek bir eğitim yapıldı. Muhakeme ve ileri teknik kavramlara yönelik, modeller tarafından oluşturulmuş seçilmiş veriler kullanıldı. Yüksek kaliteli mühendislik verileri de veri setine eklenerek modelin optimizasyon yöntemi ve yaklaşımı güncellendi. Yani evde ydi bir şurda, modelin “mantık” kısmı güçlendi, “kodlama” kısmı ise daha akıcı hâle geldi.
Bu yeni model, 61 puan alarak Artificial Analysis Intelligence Index’te 4.5’in 56 puanını geride bıraktı. GPT-5.6 Sol Max ile aynı puana ulaştı, Anthropic’in Fable 5 Max modelinin ise bir puan gerisinde kaldı. AA-Briefcase testinde 1577 puan alarak Fable 5 Max’in 1574, GPT-5.6 Sol Max’in 1502 puanını geçti. GDPVal-AA v2’de 1753 puanla rakiplerinin önünde yer aldı. CursorBench v3.2 ve DeepSWE v1.1’de ise Fable 5 Max’ten geride kalmış olsa da, 69,9 ve 65,9 başarı oranları gösterdi.
Model, Cursor ve SpaceXAI’ın kodlama aracı Grok Build üzerinden kullanılabiliyor. API fiyatlandırması ise bir milyon girdi tokenı için 2 dolar, çıkış tokenı için 6 dolardan başlıyor. İki kat daha hızlı çalışan sürümü ise standart fiyatın iki katı üzerinden ücretlendiriliyor. Lansmanın ilk haftasında Cursor ve Grok Build kullanıcılarına iki kat dahil kullanım hakkı sunuldu.
Grok 4.6, dağıtım öncesi en kapsamlı güvenlik testlerinden geçerek, dağıtım sonrası ve üçüncü taraflarla birlikte ek testlerin de yapılacağı ifade edildi. Yani biz de haberimiz, modelin güvenliğinin el altında tutulduğunu söylüyor.
Bakalım, bundan sonra bu model ile nerelere uçacağız, ne kadar hızlı çözecek?
Kaynak: Orijinal Haber

