ARAşTıRMA · NLP
arXiv:2608.05148
5 Ağu 2026 · v1
Akıl Yürütme Çekirdeği: Tamamlama Denetimli Akıl Yürütme Eğitimi için Geniş Prosedür Verilerinin Tasarlanması
Damien Sileo, Valentin Lacombe, Dimitri Kachler
YAYIN:5 Ağu 2026 ALAN:cs.CL
OKUMA:4 YILDIZ:★ 2.5
Özet
Prosedür jeneratörleri, geniş ölçekte yararlı doğrulanabilir akıl yürütme problemleri üretir, ancak tamamlama denetimli ince ayar için veri olarak daha az dikkat çekmiştir. Matematik, mantık, planlama, durum izleme, biçimsel diller, yapılandırılmış veriler, oyunlar, nedensellik ve kod, anlamsal puanlayıcılar, zorluk kontrolleri ve görev değerlendiricileri içeren 50 üreticiden oluşan bir koleksiyon olan Reasoning Core'u tanıtıyoruz. Eşleştirilmiş bir tamamlama denetimli protokol altında, Akıl Yürütme Çekirdeğini dört temel model ayarı ve birden fazla eğitim süresi boyunca Prosedürel Isınma, Akıl Yürütme Salonu ve SynLogic ile karşılaştırıyoruz. Birincil 3B karşılaştırmasında, Akıl Yürütme Çekirdeği, hem prosedür verileri olmadan hem de üç alternatif prosedür koleksiyonunun tümünü aşarak DROP, LogiQA ve Arc - Challenge üzerinde en yüksek ortalama puanları elde eder. Görev düzeyinde analizler, anlam geçerliliğinin tek başına eğitim faydasını sağlamadığını, kompakt hedefleri ve kalibre edilmiş zorluğu önemli tasarım faktörleri olarak vurguladığını göstermektedir. Model destekli inceleme, insan yargılaması ve regresyon testini birleştiren denetimler gerçekleştirdik. Akıl Yürütme Çekirdeği geliştirme boyunca ve diğer koleksiyonlara uygulandığında, prosedürel üretimin tek başına doğruluğu garanti etmediğini hatırlatan nesil, oluşturma, hedefler ve puanlama arasındaki ince uyumsuzlukları ortaya koyarlar. Kütüphane, oluşturulan veri kümeleri ve denetim materyali kamuya açıktır.
Giriş
Prosedür jeneratörleri, geniş ölçekte yararlı doğrulanabilir akıl yürütme problemleri üretir, ancak tamamlama denetimli ince ayar için veri olarak daha az dikkat çekmiştir. Matematik, mantık, planlama, durum izleme, biçimsel diller, yapılandırılmış veriler, oyunlar, nedensellik ve kod, anlamsal puanlayıcılar, zorluk kontrolleri ve görev değerlendiricileri içeren 50 üreticiden oluşan bir koleksiyon olan Reasoning Core’u tanıtıyoruz.
Araştırma Detayları
Eşleştirilmiş bir tamamlama denetimli protokol altında, Akıl Yürütme Çekirdeğini dört temel model ayarı ve birden fazla eğitim süresi boyunca Prosedürel Isınma, Akıl Yürütme Salonu ve SynLogic ile karşılaştırıyoruz. Birincil 3B karşılaştırmasında, Akıl Yürütme Çekirdeği, hem prosedür verileri olmadan hem de üç alternatif prosedür koleksiyonunun tümünü aşarak DROP, LogiQA ve Arc – Challenge üzerinde en yüksek ortalama puanları elde eder. Görev düzeyinde analizler, anlam geçerliliğinin tek başına eğitim faydasını sağlamadığını, kompakt hedefleri ve kalibre edilmiş zorluğu önemli tasarım faktörleri olarak vurguladığını göstermektedir.
Sonuçlar
Model destekli inceleme, insan yargılaması ve regresyon testini birleştiren denetimler gerçekleştirdik. Akıl Yürütme Çekirdeği geliştirme boyunca ve diğer koleksiyonlara uygulandığında, prosedürel üretimin tek başına doğruluğu garanti etmediğini hatırlatan nesil, oluşturma, hedefler ve puanlama arasındaki ince uyumsuzlukları ortaya koyarlar. Kütüphane, oluşturulan veri kümeleri ve denetim materyali kamuya açıktır.
Yazarlar
Damien Sileo, Valentin Lacombe, Dimitri Kachler
Kategoriler
cs.CL
Kaynaklar
Henüz yorum yok. İlk yorumu siz yapın!