Ornith-1.5 Açık Kaynak Yapay Zeka Modeli Opus 4.8 ve GLM 5.2 Seviyesinde Performans Sunuyor
Ornith-1.5, geleneksel eğitim yöntemlerinden tamamen farklı bir yaklaşımla eğitilmiş yeni bir açık kaynak yapay zeka modeli ailesi olarak dikkat çekiyor. Üç farklı boyutta sunulan bu model ailesi, Anthropic Claude Opus 4.8 ve Google GLM 5.2 gibi en güçlü kapalı kaynak modellerle karşılaştırılabilir sonuçlar elde ediyor.
Ornith-1.5 Nedir ve Nasıl Çalışır?
Ornith-1.5, “uçtan uca öz-iyileştirme” (end-to-end self-improvement) tekniğiyle eğitilmiş bir açık kaynak yapay zeka modeli ailesidir. Model ailesi üç farklı varyanttan oluşuyor:
- Ornith-1.5-9B Dense: Yoğun mimari, 9 milyar parametre
- Ornith-1.5-35B MoE: Karışık Uzmanlar (Mixture of Experts) mimarisi, 35 milyar parametre
- Ornith-1.5-397B MoE: Büyük ölçekli Karışık Uzmanlar, 397 milyar parametre
Model, eğitim sürecinde kendi görevlerini oluşturuyor, her görev için özel değerlendirme iskeleleri (scaffold) yazıyor ve pekiştirmeli öğrenme (RL) aracılığıyla çözüm izleri üretiyor. Bu üç aşama aynı döngü içinde gerçekleşerek modelin kendi başına sürekli gelişmesini sağlıyor.
Öz-İyileştirme Döngüsü: Model Kendi Görevini Kendi Oluşturuyor
Geleneksel yapay zeka modelleri insan uzmanlar tarafından tasarlanmış görevler üzerinde eğitilir. Ornith-1.5 ise modelin kendi görevlerini önermesine, görevlere özel değerlendirme iskeleleri yazmasına ve çözüm izleri üretmesine olanak tanıyor. GRPO algoritmasıyla bu üç aşamaya da ödül sinyalleri yayılıyor.
Benchmark Sonuçları: Claude Opus 4.8 ve GLM 5.2 ile Yarışıyor
Ornith-1.5, açık kaynak modeller arasında en yüksek performansı sunan sonuçlar elde etti. İşte öne çıkan benchmark sonuçları:
| Benchmark | Ornith-1.5 | Claude Opus 4.8 |
|---|---|---|
| Terminal-Bench 2.1 | 86.1 | 85.0 |
| SWE-Bench Verified | 86.0 | 85.8 |
| WideSearch | 80.8 | 72.9 |
| BrowseComp | 86.6 | 84.3 |
| Tool Decathlon | 71.2 | – |
Bu sonuçlar, Ornith-1.5’ın özellikle yazılım geliştirme, kodlama ve araç kullanımı görevlerinde en üst düzey kapalı kaynak modellerle doğrudan rekabet edebilecek kapasitede olduğunu gösteriyor.
MIT Lisansı ile Ticari Kullanım Serbest
Ornith-1.5, MIT lisansı altında yayımlandı. Modelin FP8, NVFP4, GGUF ve MLX formatlarında nicelleştirilmiş versiyonları da sunuluyor. Ticari ve akademik projelerde kısıtlama olmaksızın kullanılabilir.
Neden Önemli?
Ornith-1.5’ın en büyük başarısı, modelin yalnızca mevcut veriler üzerinde eğitilmek yerine kendi öğrenme materyalini oluşturabilmesidir. Bu yaklaşım, gelecekte daha az insan etiketli veriyle daha güçlü modeller eğitilebileceğinin önemli bir göstergesi. Claude protein tasarımı haberimizde olduğu gibi yapay zeka alanında açık kaynak çözümlerin kapalı kaynak sistemlere yaklaştığı yeni bir dönem başlıyor.
Kaynak: @testingcatalog
Henüz yorum yok. İlk yorumu siz yapın!