Ornith-1.5 Oz-Iyilestirme Mimarisi: Yapay Zeka Modellerinde Yeni Donem
Acik kaynak yapay zeka arastirmalarinda yeni bir sayfa acan Ornith-1.5, kendi gorevlerini olusturup bu gorevler icin degerlendirme iskeleleri yazan ve ardindan GRPO algoritmasiyla odul sinyallerini uc asama-ya birden yayan bir egitim mimarisi sunuyor.
Ornith-1.5’in Teknik Devrimi: Uc Asama Tek Dongude
Ornith-1.5’in mimarisi, geleneksel pekistirmeli ogronme (RL) yaklasimlarindan koklu bir farklilik tasiyor. Modelin oz-iyilestirme dongusu uc kritik asamayi kapsiyor:
- Asama 1 – Gorev Olusturma: Model, verilen kod tabani ile ust duzey gorev talimatlarindan yola cikararak, mevcut yetenek sinirina yakain yeni gorevler kesfediyor
- Asama 2 – Iskele (Scaffold) Olusturma: Kesfedilen her gorev icin, model o gorevi degerlendirecek ozel iskeleler yaziyor
- Asama 3 – Cozum Izi Uretimi ve GRPO: Model, olusturdugu gorevler uzerinde cozum izleri (rollout) uretiyor ve GRPO araciligiyla odul sinyalleri uc asama-ya da geri yayiliyor
Geleneksel RL’den Farki Ne?
Geleneksel pekistirmeli ogronme sistemlerinde gorevler ve degerlendirme kriterleri insan uzmanlar tarafindan onceden tanimlanir. Ornith-1.5 ise bu donguyu tamamen modelin icine tasiyarak insan tasarimina olan bagimliligi minimize ediyor.
4 Alanda Claude Opus 4.8’i Gerdie Birakti
Ornith-1.5, Claude Opus 4.8 ve GLM 5.2 gibi en guclu kapali kaynak modellerle karsilastirildiginda dort kritik benchmark’ta ustun sonuclar elde etti:
- Terminal-Bench 2.1: 86.1 puan (Opus 4.8: 85.0)
- SWE-Bench Verified: 86.0 puan (Opus 4.8: 85.8)
- WideSearch: 80.8 puan (Opus 4.8: 72.9)
- BrowseComp: 86.6 puan (Opus 4.8: 84.3)
Neden Onemli?
Bu yaklasim, daha az insan etiketli veriyle daha guclu modeller egitilebileceginin somut bir kaniti olarak goruluyor. Ornith-1.5 modelinin tam ozelliklerini buradan okuyabilirsiniz.
Kaynak: @rohanpaul_ai
Henüz yorum yok. İlk yorumu siz yapın!