ABD merkezli yapay zeka laboratuvarı Reflection, ilk açık ağırlıklı modeli Beam’i tanıttı. Beam, toplam 501 milyar parametreye ve token başına 23 milyar aktif parametreye sahip seyrek bir Mixture-of-Experts (MoE) modeli. Şirket modeli özellikle kodlama, akıl yürütme ve ajan iş yükleri için geliştirdiğini söylüyor. Beam şu anda son red-team testlerinden ve değerlendirmelerden geçiyor; seçili bir kullanıcı grubuna bekleme listesiyle sunuluyor. Reflection, ağırlıkları, teknik raporu, model kartını ve geliştirici araçlarını bu ay içinde yayımlayacağını, ağırlıkların Apache 2.0 lisansıyla sunulacağını açıkladı.
Eğitim: büyük ön eğitim, daha büyük RL
Reflection’a göre Beam, web, kamuya açık kaynaklar ve lisanslı özel veri setlerinden oluşan 23,8 trilyon tokenlık seçilmiş veriyle ön eğitimden geçti. Şirket, ham internet tokenlarının yaklaşık yüzde 95’inin ayrıştırma, tekilleştirme ve seçme aşamalarında elendiğini belirtiyor. Asıl vurgu ise pekiştirmeli öğrenmede (RL): Şirket 10.500 NVIDIA GB300 GPU’yu dört hafta boyunca kullanarak, en fazla 256 bin tokenlık bağlamla 100 milyondan fazla deneme (rollout) üretti. Eğitim ve puanlamada yaklaşık 1,3 milyar sanal kum havuzu (sandbox) kullanıldı; bunun için kodlama, ajan ve STEM alanlarında yaklaşık bir milyon yüksek kaliteli ortam toplandı. Reflection bunun açık bir laboratuvar tarafından yapılan en büyük ölçekli RL çalışmalarından biri olduğunu ve RL hesaplaması arttıkça yeteneklerin bir plato görmeden gelişmeye devam ettiğini öne sürüyor.
Şirketin paylaştığı skorlar
Reflection, Beam’in Batı’daki açık ağırlıklı model sınırını ileri taşıdığını; GLM 5.2 gibi daha büyük açık modellerle rekabet ettiğini ve kodlama ile ajan görevlerinde Qwen 3.8 Max’e yaklaştığını söylüyor. Kimi K3 gibi öncü açık modellerin ham yetenekte hâlâ önde olduğunu kabul eden şirket, Beam’in avantajını çıkarım verimliliği olarak tanımlıyor. Paylaşılan bazı sonuçlar:
- SWE-bench Verified: 80,9
- Terminal Bench v2.1: 80,1 (GLM 5.2: 81,0; DeepSeek V4.1 Flash: 90,6)
- SWE Bench Pro v1: 65,5
- AIME 2026: 97,8; GPQA Diamond: 90,5
- Humanity’s Last Exam (araçsız): 36,2 (Kimi K3: 46,9)
- MCP Atlas: 78,7; BrowseComp (bağlam yönetimiyle): 77,4
Şirkete göre Beam, ileri akıl yürütme testlerinde GLM-5.2’ye benzer skorları 3–4 kat daha az çıkarım hesaplamasıyla elde ediyor. Tablolardaki karşılaştırmalar Reflection’ın kendi ölçümleri ile Artificial Analysis ve DataCurve verilerine dayanıyor; bağımsız ve kapsamlı testler ağırlıklar yayımlandıktan sonra mümkün olacak.
Verimli akıl yürütme ve güvenlik
Beam, başarılı çözümleri ödüllendirirken gereksiz tokenları cezalandıran ayarlanabilir bir uzunluk cezasıyla eğitildi. Kullanıcılar bir akıl yürütme çabası parametresiyle daha kısa yanıtlar ile daha uzun ve isabetli akıl yürütme arasında seçim yapabiliyor. Reflection, yalnızca metin tabanlı olan modelin eğitimde hiç tarama görevi olmamasına rağmen tarama becerilerinde de gelişme gösterdiğini aktarıyor. Güvenlik tarafında ise güvenlik politikasının doğrudan modelin akıl yürütmesine dahil edildiği “deliberative alignment” teknikleri kullanıldı. Şirket, güvenlik değerlendirme sonuçlarını teknik raporda yayımlayacağını ve iç güvenlik testlerini açık kaynak olarak paylaşacağını söylüyor.
Serinin ilk modeli
Reflection, Beam’i bir model serisinin ilki olarak tanımlıyor ve bir sonraki modeli şimdiden eğittiğini belirtiyor. Şirket, Beam’i çeşitli dağıtım ortakları ve açık kaynak kütüphane ve araçlarla entegrasyonla birlikte piyasaya süreceğini; modeli çalıştırma, değerlendirme ve ince ayar için tüm yazılım yığınını da paylaşacağını açıkladı.
Kaynak: Reflection — Introducing Beam: Reflection’s 501B open-weight model
Henüz yorum yok. İlk yorumu siz yapın!