CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
14 Aug 2026 · 23:57 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #1.274 13 Ağu 2026 · Perşembe

DeepSeek’den Büyük Hamle: Kendi Agent Benchmarkı DSBench Ortaya Çıktı

Çinli yapay zeka laboratuvarı DeepSeek, dünya çapında dikkat çeken bir hamle yaptı.

AiHaber Editör
Editör
2DK 6OKUMA

★ Hızlı Özet

  • Çinli yapay zeka laboratuvarı DeepSeek, dünya çapında dikkat çeken bir hamle yaptı.
  • Max For AI hesabının aktardığına göre, DeepSeek'in resmi sonuç tablosunda iki yeni test seti dikkat çekti: DSBench-FullStack ve DSBench-Hard.
  • DSBench-FullStack, tam yığın geliştirme yeteneklerini test ederken, DSBench-Hard yüksek zorluk seviyesindeki Agent görevlerine odaklanıyor.
  • İlk sonuçlar şaşırtıcı veriler ortaya koyuyor.

Çinli yapay zeka laboratuvarı DeepSeek, dünya çapında dikkat çeken bir hamle yaptı. Şirket, V4 Pro 0813 sürümüyle birlikte kendi iç benchmark sistemi DSBench’i tanıttı. Bu haber, AI topluluğunda büyük yankı uyandırdı.

Max For AI hesabının aktardığına göre, DeepSeek’in resmi sonuç tablosunda iki yeni test seti dikkat çekti: DSBench-FullStack ve DSBench-Hard. Bu testler, şirketin kendi içinde geliştirdiği özel değerlendirme araçları.

DSBench Nedir?

DSBench-FullStack, tam yığın geliştirme yeteneklerini test ederken, DSBench-Hard yüksek zorluk seviyesindeki Agent görevlerine odaklanıyor. DeepSeek, bu benchmark’ları haziran ayında sessizce yayınlamıştı.

DSBench Sonuçları: Sürpriz Sıralama

İlk sonuçlar şaşırtıcı veriler ortaya koyuyor. DSBench-FullStack’te Fable 5 yüzde 77.2 ile ilk sırada yer alırken, onu Kimi K3 (73.7), Opus 4.8 (71.6) ve DeepSeek V4 Pro 0813 (71.1) takip etti.

Ancak DSBench-Hard’da tablo tamamen değişti. Opus 4.8 yüzde 71.7 ile zirveye yerleşirken, Fable 5 yüzde 68.3’e geriledi. DeepSeek V4 Pro 0813 ise yüzde 67.2 ile dördüncü sırada kaldı.

Neden Önemli?

Bir laboratuvarın kendi benchmark’unu oluşturması, o laboratuvarın neyi önceliklendirdiğini gösteriyor. DeepSeek’in DSBench ile Agent, Coding Agent ve Harness alanlarına ağırlık verdiği açık.

DeepSeek Harness zaten görünür hale gelirken, DSBench şirketin iç eğitim ve değerlendirme altyapısının bir parçası olarak değerlendiriliyor.

DSBench Açık Kaynak Olacak mı?

Şu ana kadar en kritik soru şu: DSBench açık kaynak olarak yayınlanacak mı? DeepSeek’in DSBench ve DeepSeek Harness’ı birlikte sunması, sadece yeni bir model yayınlamaktan çok daha anlamlı olabilir.

Bu durumda DeepSeek, hem yapay zeka modellerini hem de bu modelleri değerlendirme araçlarını dünyaya sunmuş olacak.

Kaynak: X/@MaxForAI

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları