CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
28 Aug 2026 · 17:18 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #2.333 23 Ağu 2026 · Pazar

Ox Alpha DeepSWE: 113 Görevde Yüzde 63 Başarı

Gizemli yapay zeka modeli Ox Alpha, yazilim muhendisligi benchmarki DeepSWE'de yeni sonuclar elde etti.

AiHaber Editör
Editör
2DK 8OKUMA

★ Hızlı Özet

  • Gizemli yapay zeka modeli Ox Alpha, yazilim muhendisligi benchmarki DeepSWE'de yeni sonuclar elde etti.
  • Ox Alpha Nedir ve Ne Anlama Geliyor?
  • Kullanici yorumlarina gore Ox Alpha, kucuk ve hizli bir model olarak tasarlandi.
  • DeepSWE Benchmarki Nasil Calisiyor?

Gizemli yapay zeka modeli Ox Alpha, yazilim muhendisligi benchmarki DeepSWE’de yeni sonuclar elde etti. OpenRouter uzerinde sunulan model, 113 gorevde yuzde 63 basari oranina ulasarak performansini bir kez daha ortaya koydu. Bu sonuc, Ox Alpha’nin Opus 4.8‘den daha iyi ancak GLM 5.3‘ten daha dusuk performans gosterdigini ortaya koyuyor.

Ox Alpha Nedir ve Ne Anlama Geliyor?

Ox Alpha, OpenRouter pazar yerinde flash tier olarak konumlandirilan bir yapay zeka modeli. Ox Alpha DeepSWE test sonuclari, modelin yazilim muhendisligi gorevlerinde guclu bir performans sergiledigini gosteriyor. Model, kod tamamlama, hata ayiklama ve kod analizi gibi gorevlerde basarili sonuclar elde etti.

Kullanici yorumlarina gore Ox Alpha, kucuk ve hizli bir model olarak tasarlandi. Multimodal yeteneklere dogal olarak sahip olan model, dusunu surecine gore farkli model katmanlarini cagirarak maliyet ve hiz acisindan optimize edilmis bir deneyim sunuyor.

DeepSWE Benchmarki Nasil Calisiyor?

DeepSWE, yapay zeka modellerinin yazilim muhendisligi yeteneklerini degerlendirmek icin kullanilan bir benchmark. 113 farkli yazilim muhendisligi gorevini iceren test, modelin kod uretme, hata ayiklama, test yazma ve kod refactoring gibi alanlardaki basarisini olcuyor.

Ox Alpha DeepSWE testinde model, bu 113 gorevin tamaminda yuzde 63 basari orani elde etti. Bu oran, modelin yuzde 60’in uzerinde gorevi dogru sekilde tamamlayabildigini gosteriyor. Yapay zeka dunyasinda yuzde 63 gibi bir oran, flash tier modeller arasinda guclu bir gosterge olarak degerlendiriliyor.

Ox Alpha Hangi Sirkete Ait? GLM-5.3 Flash Baglantisi

Ox Alpha’nin kimin modeli oldugu uzun sure tartisma konusu olmustu. Ancak yapilan analizler ve sunucu katmani izleri, modelin Zhipu AI laboratuvari tarafindan gelistirilen GLM-5.3 Flash oldugunu gosteriyor. GLM-5.3 Flash, Cilinli Zhipu AI’nin en son flash-tier modeli olarak biliniyor.

Bu identite, cesitli teknik kanitlarla desteklendi. Sunucu katmani izleri, Java stack trace analizleri ve model ciktilarinin karsilastirilmasi, Ox Alpha ile GLM-5.3 Flash arasinda guclu bir benzerlik oldugunu ortaya koydu. aihaber.org’daki onceki analizlerimizde bu konuyu detayli incelemistik.

Model Karsilastirmasi: Opus 4.8, GLM 5.3 ve Ox Alpha

DeepSWE testinde elde edilen sonuclar, model karsilastirmasi icin kritik veriler sunuyor. Ox Alpha DeepSWE sonucu yuzde 63 basari orani ile 113 gorevde, Opus 4.8’den daha iyi ancak GLM 5.3’tan daha dusuk performans gosterdi.

  • Ox Alpha DeepSWE: Yuzde 63 basari orani ile 113 gorevde
  • GLM 5.3: Daha yuksek skor, Ox Alpha’nin uzerinde
  • Opus 4.8: Ox Alpha’nin altinda kalan sonuclar

Bu karsilastirma, Ox Alpha’nin flash tier modeller arasinda en ust duzey performans gosteren modellerden biri oldugunu ortaya koyuyor. Ayni zamanda, buyuk anlamli model yarisisinda Cilin’li laboratuvarlarin onemli bir oyuncu oldugunu bir kez daha gosteriyor.

Kaynak: @chetaslua / X

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları