Microsoft, 9 Ekim 2026’da şirketin geliştirici yayını Command Line’da Microsoft-Decision-1 modelini tanıttı. CTO Ofisi’nden Yazılım Mühendisliği Başkan Yardımcısı Achint Srivastava imzalı yazıya göre karar modelleri, metin üreten veya karmaşık problemler üzerinde akıl yürüten büyük dil modellerinden farklı olarak yazılımın doğrudan işleyebileceği yapılandırılmış çıktılar vermek için tasarlanıyor. Model Microsoft Foundry’de ve OpenRouter üzerinden kullanıma sunuldu.
Ne yapıyor?
Microsoft-Decision-1’e sabit bir seçenek kümesi verildiğinde her seçenek için kalibre edilmiş bir olasılık skoru döndürüyor. Evet/hayır, çoktan seçmeli ve puanlama seçeneklerinin yanı sıra yapay zekâ yanıtlarını ve ajan eylemlerini bir değerlendirme ölçütüne (rubric) göre notlamayı da tek bir yapılandırılmış API çağrısıyla destekliyor. Microsoft modeli Qwen3.5-9B’yi hızlı, tek geçişli karar skorlaması için sonradan eğiterek (post-training) geliştirdiğini, yakında Microsoft AI (MAI) ve OpenAI modelleri dahil başka temel modellere de taşıyacağını belirtiyor.
Microsoft’un açıkladığı sonuçlar
Şirkete göre model, eğitimden gizli tutulan ve yaklaşık 150 bin soruyu kapsayan 36 kıyaslamalık karşılaştırmada en yüksek doğruluğu elde etti. Microsoft’un ölçümlerinde model, ikinci sıradaki H2O-Lightning-4B v1.1’den 2,5 kat, GPT-6 Sol’dan ise yaklaşık 35 kat daha hızlı (P50 gecikme) çalıştı. Dayanıklılık testinde aynı istek sekiz farklı biçimde bozulduğunda modelin kararı ortalama yüzde 1,3 oranında değişti; seçenek açıklamaları başka sözcüklerle yazıldığında ya da seçeneklerin sırası değiştirildiğinde karar hiç değişmedi. Güvenlik tarafında 11 kıyaslamada 5.250 istek üzerinde zararlı içerik, jailbreak ve istem enjeksiyonu denendi. Bu sonuçların tamamı Microsoft’un kendi ölçümleri.
Şirket içi denemeler
Microsoft modelin şirket içinde farklı ekiplerce denendiğini söylüyor. XBOX Research, anketler, Steam ve X’ten gelen 10 binden fazla yorumu araştırmacıların belirlediği temalara ayırmak için modeli kullandı ve GPT-6 Sol ile rekabetçi kaliteyi 14 kattan fazla hızla ve 200 kat daha düşük maliyetle elde ettiğini bildirdi. Copilot ekibi, sohbet ve ajan yanıtlarının kalitesini ölçmede modeli GPT-5.6 Luna ile rekabetçi ve 100 kat daha hızlı buldu. Microsoft Discovery’deki uyarlamalı yeniden planlama özelliğinde ise model, LLM tabanlı puanlamaya göre 46 kat daha tutarlı ve üç kat daha hızlı sonuç verdi.
Şirket olası kullanım alanları arasında ajan kontrolü (devam et, dur, tekrar dene, insana devret), model yönlendirme, veri etiketleme, yapay zekâ yanıtlarını değerlendirme, olay yönlendirme, içerik sınıflandırma, kod tarama, bilgisayar kullanımı ve robotikte önceden tanımlı eylemler arasından seçim yapmayı sayıyor.
Fiyat
Microsoft’un açıkladığı fiyata göre giriş token’larının milyonu 0,042 dolar, çıkış token’ları ise ücretsiz. Yazıya sonradan, TypeSafe AI’ın Jev modeliyle doğruluk ve kalibrasyon karşılaştırmaları da eklendi.
Kaynak: Microsoft Command Line: Introducing Microsoft-Decision-1 · Microsoft Foundry model kataloğu · OpenRouter
Henüz yorum yok. İlk yorumu siz yapın!