Özetle: Bağlam içi öğrenmeyi yinelenen gizli akıl yürütmeyle birleştiren bir akıl yürütme modeli olan BDH-CQ'yu tanıtıyoruz.
Özet
Bağlam içi öğrenmeyi yinelenen gizli akıl yürütmeyle birleştiren bir akıl yürütme modeli olan BDH-CQ'yu tanıtıyoruz. Çıkarım zamanında sunulan girdiler, modelin tekrarlayan belleğini sürekli olarak günceller; Model daha sonra, ara mantığını dile getirmeden, yüksek boyutlu gizli bir alanda yinelemeli hesaplama yoluyla bir sorguyu çözer. Modeli halka açık ARC-AGI-1 değerlendirme setinde değerlendiriyoruz ve gösterilerden ne öğrendiğini, çıkarımsal bir dönüşümü ne kadar tutarlı bir şekilde uyguladığını ve hangi kavramların zor kaldığını incelemek için kontrollü ARC benzeri müdahaleler kullanıyoruz. 150M parametreli bir yapılandırma, görev başına ,0007$ tutarındaki hesaplanmış çıkarım maliyetiyle %29,5 pass@2'ye ulaşır. Bu çalışma noktası, daha önce rapor edilen ARC-AGI-1 maliyet doğruluğu Pareto sınırını aşarak karşılaştırmalı maliyet verimliliğinde yeni bir teknoloji ortaya koyuyor.
Orijinal Özet (İngilizce)
We introduce BDH-CQ, a reasoning model that combines in-context learning with recurrent latent reasoning. Inputs presented at inference time continuously update the model's recurrent memory; the model then solves a query through iterative computation in a high-dimensional latent space, without verbalizing its intermediate reasoning. We evaluate the model on the public ARC-AGI-1 evaluation set and use controlled ARC-like interventions to study what it learns from demonstrations, how consistently it applies an inferred transformation, and which concepts remain difficult. A 150M-parameter configuration reaches 29.5% pass@2 at a computed inference cost of $0.0007 per task. This operating point breaks through the previously reported ARC-AGI-1 cost-accuracy Pareto frontier, establishing a new state of the art in benchmark cost efficiency.
Kaynak: arXiv:2608.09888 · PDF
Henüz yorum yok. İlk yorumu siz yapın!