CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
6 Aug 2026 · 18:39 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
ARAşTıRMA · NLP arXiv:2608.05148 5 Ağu 2026 · v1

Akıl Yürütme Çekirdeği: Tamamlama Denetimli Akıl Yürütme Eğitimi için Geniş Prosedür Verilerinin Tasarlanması

Damien Sileo, Valentin Lacombe, Dimitri Kachler

YAYIN:5 Ağu 2026 ALAN:cs.CL OKUMA:4 YILDIZ:★ 2.5

Özet

Prosedür jeneratörleri, geniş ölçekte yararlı doğrulanabilir akıl yürütme problemleri üretir, ancak tamamlama denetimli ince ayar için veri olarak daha az dikkat çekmiştir. Matematik, mantık, planlama, durum izleme, biçimsel diller, yapılandırılmış veriler, oyunlar, nedensellik ve kod, anlamsal puanlayıcılar, zorluk kontrolleri ve görev değerlendiricileri içeren 50 üreticiden oluşan bir koleksiyon olan Reasoning Core'u tanıtıyoruz. Eşleştirilmiş bir tamamlama denetimli protokol altında, Akıl Yürütme Çekirdeğini dört temel model ayarı ve birden fazla eğitim süresi boyunca Prosedürel Isınma, Akıl Yürütme Salonu ve SynLogic ile karşılaştırıyoruz. Birincil 3B karşılaştırmasında, Akıl Yürütme Çekirdeği, hem prosedür verileri olmadan hem de üç alternatif prosedür koleksiyonunun tümünü aşarak DROP, LogiQA ve Arc - Challenge üzerinde en yüksek ortalama puanları elde eder. Görev düzeyinde analizler, anlam geçerliliğinin tek başına eğitim faydasını sağlamadığını, kompakt hedefleri ve kalibre edilmiş zorluğu önemli tasarım faktörleri olarak vurguladığını göstermektedir. Model destekli inceleme, insan yargılaması ve regresyon testini birleştiren denetimler gerçekleştirdik. Akıl Yürütme Çekirdeği geliştirme boyunca ve diğer koleksiyonlara uygulandığında, prosedürel üretimin tek başına doğruluğu garanti etmediğini hatırlatan nesil, oluşturma, hedefler ve puanlama arasındaki ince uyumsuzlukları ortaya koyarlar. Kütüphane, oluşturulan veri kümeleri ve denetim materyali kamuya açıktır.

Giriş

Prosedür jeneratörleri, geniş ölçekte yararlı doğrulanabilir akıl yürütme problemleri üretir, ancak tamamlama denetimli ince ayar için veri olarak daha az dikkat çekmiştir. Matematik, mantık, planlama, durum izleme, biçimsel diller, yapılandırılmış veriler, oyunlar, nedensellik ve kod, anlamsal puanlayıcılar, zorluk kontrolleri ve görev değerlendiricileri içeren 50 üreticiden oluşan bir koleksiyon olan Reasoning Core’u tanıtıyoruz.

Araştırma Detayları

Eşleştirilmiş bir tamamlama denetimli protokol altında, Akıl Yürütme Çekirdeğini dört temel model ayarı ve birden fazla eğitim süresi boyunca Prosedürel Isınma, Akıl Yürütme Salonu ve SynLogic ile karşılaştırıyoruz. Birincil 3B karşılaştırmasında, Akıl Yürütme Çekirdeği, hem prosedür verileri olmadan hem de üç alternatif prosedür koleksiyonunun tümünü aşarak DROP, LogiQA ve Arc – Challenge üzerinde en yüksek ortalama puanları elde eder. Görev düzeyinde analizler, anlam geçerliliğinin tek başına eğitim faydasını sağlamadığını, kompakt hedefleri ve kalibre edilmiş zorluğu önemli tasarım faktörleri olarak vurguladığını göstermektedir.

Sonuçlar

Model destekli inceleme, insan yargılaması ve regresyon testini birleştiren denetimler gerçekleştirdik. Akıl Yürütme Çekirdeği geliştirme boyunca ve diğer koleksiyonlara uygulandığında, prosedürel üretimin tek başına doğruluğu garanti etmediğini hatırlatan nesil, oluşturma, hedefler ve puanlama arasındaki ince uyumsuzlukları ortaya koyarlar. Kütüphane, oluşturulan veri kümeleri ve denetim materyali kamuya açıktır.

Yazarlar

Damien Sileo, Valentin Lacombe, Dimitri Kachler

Kategoriler

cs.CL

Kaynaklar

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları