Thread B: Yapay Zeka Muhakeme Yeteneğinde Devrim Niteliğinde Yeni Adım
Thread B, yapay zeka alanında muhakeme (reasoning) yetenekleri açısından şimdiye kadar görülmüş en güçlü model ailesi olarak dikkat çekiyor. Yeni nesil ön eğitim yaklaşımıyla geliştirilen bu model, özellikle matematiksel muhakeme ve karmaşık problem çözme konularında tarihi başarılara imza atıyor.
Thread B Nedir ve Neden Önemli?
Thread B, RL from feedback (geri bildirimden takviyeli öğrenme) ile ön eğitime tabi tutulan yenilikçi bir model ailesidir. Geleneksel büyük dil modellerinden farklı olarak Thread B, yüksek kaliteli muhakeme izlerinden oluşan özenle seçilmiş bir veri kümesi üzerinde eğitildi. Bu eğitim reçetesi, modelin sadece yanıt üretmek yerine gerçek anlamda mantıksal muhakeme yapmasını sağlıyor.
Araştırmacılar Thread B’nin temel farkını şöyle özetliyor: o1 ve o3 gibi modeller çıkarım zamanı hesaplamasına güvenirken, Thread B ön eğitim aşamasında RL from feedback kullanarak muhakeme kalıplarını öğreniyor. Bu, LLM eğitiminde yeni bir paradigm.
AIME 2025 ve GPQA Sonuçları
Thread B’nin performansı, standart muhakeme kıyaslama testlerinde kendini kanıtladı. AIME 2025 matematik yarışmasında elde ettiği sonuçlar, model ailesinin ne denli güçlü olduğunu gözler önüne seriyor:
- Thread B 1B: %90.7 (önceki en iyi 1B model: %71.6)
- Thread B 4B: %95.6 (önceki en iyi 4B model: %83.9)
- Thread B 8B: %97.2 (önceki en iyi 8B model: %90.5)
GPQA biyoloji kıyaslamasında ise Thread B 8B, %85.6 başarı oranıyla o1-preview’ın (%75.3) önüne geçerek üstünlük sağladı.
Geleneksel Modellerden Farkı Ne?
Thread B’yi diğer muhakeme odaklı modellerden ayıran en önemli özellik, eğitim yaklaşımındaki temel farktır. o1 ve o3 serisi modeller, çıkarım sırasında yoğun hesaplama gücü kullanarak muhakeme gerçekleştirir. Ancak Thread B, ön eğitim aşamasında RL from feedback kullanarak bu yeteneği doğrudan modele kodluyor.
Bu yaklaşım, iki kritik avantaj sağlıyor: verimlilik (çıkarım sırasında ek hesaplama maliyeti yok) ve genellenebilirlik (ön eğitimde öğrenilen muhakeme kalıpları daha geniş bir problem yelpazesine uygulanabiliyor).
Yapay Zeka Muhakeme Alanında Yeni Dönem
Thread B’nin ortaya çıkışı, yapay zeka araştırmalarında yeni bir dönemin başlangıcı olarak değerlendiriliyor. RL from feedback ile ön eğitimin birleşimi, gelecekteki model aileleri için yeni bir standart oluşturabilir. Özellikle 1 milyar parametre ölçeğinde elde edilen %90.7’lik AIME başarısı, küçük ama güçlü modellerin önünü açıyor.
Araştırmacılar, bu yaklaşımın sadece matematiksel muhakeme ile sınırlı kalmayıp, kod yazma, bilimsel analiz ve çok adımlı problem çözme gibi alanlarda da büyük potansiyel taşıdığını belirtiyor.
Kaynak: @testingcatalog
Henüz yorum yok. İlk yorumu siz yapın!