Xiaohongshu bünyesindeki AllSpark Research, web üzerinde çok adımlı araştırma yapmaya odaklanan iki açık ağırlıklı arama ajanını yayımladı: 35 milyar parametre sınıfındaki Iris-mini ve yaklaşık 400 milyar parametre sınıfındaki Iris-pro. Ekip, modelleri arama ajanları için tasarlanan ve denetimli ince ayar ile pekiştirmeli öğrenmeyi dönüşümlü kullanan “SFT–RL climbing” yaklaşımıyla eğitti.
İki model, iki farklı ölçek
Iris-mini, Qwen3.6-35B-A3B tabanından post-training ile üretildi. Model kartına göre toplam 35 milyar parametresi bulunuyor; Mixture-of-Experts yapısında her adımda 3 milyar parametre etkinleşiyor. Iris-pro ise Qwen3.5-397B-A17B tabanlı; toplam 397 milyar, etkin olarak 17 milyar parametre kullanıyor. Her iki model de 256K bağlam penceresi ve bfloat16 hassasiyetiyle sunuluyor.
Modeller Apache 2.0 lisansına sahip. AllSpark ayrıca ağırlıklarla birlikte ajan döngüsü, araç kullanımı, bağlam yönetimi ve değerlendirme bileşenlerini içeren Iris Harness projesini de yayımlıyor.
Arama ajanı davranışı için SFT–RL eğitimi
Iris’in hedefi yalnızca yanıt üretmek değil; neyi arayacağına, arama sonuçlarını nasıl okuyacağına, araştırmayı ne zaman sürdüreceğine ve kanıtın yeterli olup olmadığına karar verebilmek. Araştırma makalesinde ekip, web bağlantı yapısından tersine oluşturulan çok adımlı görevlerle yörüngeler ürettiğini, bunları doğruluk, arama derinliği ve bozulma açısından filtrelediğini anlatıyor.
Bu yörüngeler önce denetimli ince ayar (SFT), ardından canlı aramayla pekiştirmeli öğrenme (RL) aşamasında kullanılıyor. Ekip, RL sırasında bulunan başarılı yörüngeleri sonraki SFT aşamasına taşıyarak iki yöntemi dönüşümlü biçimde uyguluyor. Model ağırlıkları ve değerlendirme altyapısı açık olsa da veri oluşturma ve eğitim hatlarının ayrıntılarının sonraki aşamalarda paylaşılması planlanıyor.
Bağlam yönetimi açıkken benchmark sonuçları
AllSpark, uzun arama oturumlarında bağlam dolduğunda geçmişi başlangıç sorusuna döndüren discard-all stratejisini başlık sonuçları için kullandığını belirtiyor. Bu nedenle aşağıdaki rakamlar yalnızca modelin ham çıktısını değil, model ve harness birlikte çalışırken elde edilen sonucu gösteriyor:
| Model | BrowseComp | BrowseComp-ZH | DeepSearchQA | HLE |
|---|---|---|---|---|
| Iris-mini | 82,2 | 84,8 | 86,9 | 52,3 |
| Iris-pro | 88,6 | 85,1 | 92,9 | 56,4 |
BrowseComp, BrowseComp-ZH ve HLE sonuçları doğruluk; DeepSearchQA sonucu F1 olarak raporlanıyor. HLE rakamı, 2.158 soruluk metin tabanlı alt kümeye ait. AllSpark’ın karşılaştırmasına göre Iris-mini kendi 30–35B sınıfında, Iris-pro ise yaklaşık 400B sınıfında açık ağırlıklı arama ajanları arasında en güçlü genel sonuçları elde ediyor. Bu ifade ekibin raporundaki sınıf içi karşılaştırmaya dayanıyor; farklı araç, bağlam yönetimi veya değerlendirme ayarları sonuçları etkileyebilir.
Açık kaynak bileşenleri
Model kartları, Iris’in OpenAI işlev çağırma arayüzü üzerinden araç çağıracak ve yanıtını harness ile değerlendirecek şekilde eğitildiğini belirtiyor. Araştırmacılar için Hugging Face koleksiyonunda iki modelin ağırlıkları, GitHub’da ise Iris Harness ve değerlendirme çalıştırma örnekleri bulunuyor. Iris-pro’nun 397B ölçeği nedeniyle çalıştırma için birden fazla düğüm veya yüksek kapasiteli tek bir sistem gerekebiliyor.
Henüz yorum yok. İlk yorumu siz yapın!