xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
Yapay Zeka Kodlama Testinde Dort Ayri Sonuc: Muse Spark 1.2, DeepSeek V4 Pro’dan 48 Kat Daha Verimli
Test Kurulumu: Uc Yapay Zeka Modeli Ayni Kosullarda KarsilastirildiYapay zeka kodlama testi, @thehypedotnews tarafindan Nous Research'in Hermes Agent CLI uzerinden OpenRouter ile gerceklestirildi.
Test Kurulumu: Uc Yapay Zeka Modeli Ayni Kosullarda Karsilastirildi
Yapay zeka kodlama testi, @thehypedotnews tarafindan Nous Research’in Hermes Agent CLI uzerinden OpenRouter ile gerceklestirildi. Her uc modele — Google DeepMind Gemini 3.7 Flash, DeepSeek V4 Pro 0813 ve Meta Muse Spark 1.2 — ayni Three.js r185 kosullari ve dort tus duzeni (isin, zemin, kavsak, gece modu) verildi. Her sahne tek dosya, buildsiz, varliksiz calisti.
Derleme Suresi: Muse ve Gemini Dakikalarda Bitirdi, DeepSeek 91 Dakika Harciyor
Uc modelin performanslari dramatik farklarla ayrisiyor. Gemini 3.7 Flash 6 dakika 43 saniyede, Muse Spark 1.2 ise 7 dakika 20 saniyede uc sahneyi de tamamladi. Buna karsin DeepSeek V4 Pro 0813 sahne basina 15 ila 41 dakika arasinda sure harciyordu; toplamda 91 dakika 25 saniye surdu.
Token Tuketimi: 48 Kat Fark ve Ajan Cagri Dongusu
Token sayilari tam bir basarisizlik tablosu ciziyor. Muse Spark 1.2 toplam 440.279 token kullandiginda, Gemini 3.7 Flash 713.855 token tuketti. DeepSeek V4 Pro ise inanilmaz 20.957.568 token yakti — Muse’in 48 kati, Gemini’nin 29 kati kadar. Ajan cagrisi sayisinda da benzer bir tablo var: Muse 12, Gemini 18 cagri yaparken DeepSeek 143 cagri gerceklestirdi.
Maliyet Analizi: Prompt On Belleme Aldatmasi
Toplam fatura acisindan Muse Spark 1.2 0,53 dolarla birinci, Gemini 3.7 Flash 0,56 dolarla ikinci, DeepSeek V4 Pro ise 4,57 dolarla sonuncu oldu. Ancak burada onemli bir nokta var: DeepSeek’in 4,57 dolarlik faturasi, yaklasik 30 dolarlik yeniden gonderilen icerigi absorbe eden prompt caching indirimi sayesinde bu kadar dusuk kaldi. Billing gozuksun diye yapay zeka kodlama maliyetini dusurebilir; ancak gecikme ve yeniden deneme yuku ortadan kalkmiyor.
Kod Kalitesi ve Ajan Verimliligi
Muse, uc sahnenin ikisini kazandi ve en kucuk dosyalari uretti: 887 ila 1.042 satir. Gemini’nin dosyalari 1.934 ila 2.377 satirdi. DeepSeek’in dosyalari suresine gore beklenenden az buyuk olmasa da 143 cagri dongusu ve surekli dosya yeniden acma, kucuk bir derlemeyi devasa bir inference dongusune donusturdu.
Sonuclardan Cikarilan Ders: Yapay Zeka Ajan Verimliligi Neden Onemli?
Bu test, yapay zeka kodlama ajanlarinda cevaba ulasma hizi ile cevabin kendisi kadar onemli oldugunu gosteriyor. Bir modelin surekli dosya yeniden acmasi, karar yeniden dusunmesi ve icerigi yeniden gondermesi, basit bir derlemeyi devasa bir inference dongusune donusturebiliyor. Prompt caching fatura gozuksun diye yapay zeka kodlama maliyetini dusurebilir; ancak gecikme ve yeniden deneme yuku sorunu cozulmus olmaz.Testin detaylarina @rohanpaul_ai uzerindeki orijinal paylasimdan ulasilabilir.
Henüz yorum yok. İlk yorumu siz yapın!