
PRAXIST Beta: Sapient Intelligence Açık Kaynak Otonom Ar-Ge Sistemi — MLE-Bench’de Rekor
SAPIENT INTELLIGENCE, MLE-BENCH’DE 49 ALTIN MADALYA KAZANAN PRAXIST BETA’YI AÇIK KAYNAK OLARAK YAYINLADI
Sapient Intelligence, bugün açık kaynak olarak yayınladığı PRAXIST Beta ile yapay zeka destekli araştırma ve geliştirme süreçlerinde yeni bir dönem başlattığını duyurdu. Yeni sistem, 75 görevlik MLE-Bench değerlendirmesinde 49 altın madalya elde ederek Claude Opus 4.8’i geride bıraktı. Açık kaynak model DeepSeek-V4-Pro kullanan PRAXIST, bilimsel araştırmada insan müdahalesi olmadan ilerleme kaydetme hedefine bir adım daha yaklaştı.
PRAXIST Beta Nedir ve Nasıl Çalışır?
Geleneksel yapay zeka sistemleri yalnızca en başarılı adayları korurken, diğerlerini tamamen eler. PRAXIST Beta bu yaklaşımı kökten değiştiriyor. Bunun yerine, birden fazla araştırma ajanını paralel olarak çalıştırıyor. Her biri bulgularını, başarısızlıklarını, kanıt gücünü ve soy ağacını ortak bir araştırma grafiğinde (research graph) depoluyor.
Bu mimari sayesinde sonraki deneyler şunları yapabiliyor:
– Doğrulanmış mekanizmaları doğrudan yeniden kullanabiliyor
– Zayıf iddiaları yeniden test edebiliyor
– Farklı araştırma dallarından yararlı keşifleri birleştirebiliyor
Geleneksel sistemlerde en iyi aday seçilirken, diğerleri tamamen kaybolurdu. PRAXIST’in yaklaşımında ise başarısız denemeler bile değerli veriler içerir; kanıt kalitesi düşük sonuçlar bile sonraki araştırmacılar için kritik referans olabilir. Araştırma grafiği, kuruluşun kurumsal belleği gibi işlev görerek her yeni deneyin geçmiş birikim üzerine inşa etmesini sağlar.
MLE-Bench Sonuçları: Rakamlarla Başarı
MLE-Bench, OpenAI tarafından geliştirilen ve yapay zeka ajanlarının makine öğrenmesi mühendisliği görevlerindeki yeteneklerini ölçen bir kıyaslama standardıdır. Tam 75 görev üzerinden yapılan değerlendirmede PRAXIST Beta, DeepSeek-V4-Pro modeliyle çalıştırıldığında şu sonuçları elde etti:
– 49 altın madalya
– 60 toplam madalya
Karşılaştırma için Claude Opus 4.8 aynı testlerde yalnızca 34 altın madalya ve 55 toplam madalya kazandı. Bu fark, özellikle altın madalya kategorisinde %44’lük bir performans avantajına denk geliyor. PRAXIST’in açık kaynak bir model olan DeepSeek-V4-Pro ile bu sonuçları elde etmesi, maliyet-fayda açısından da önemli bir başarı olduğunu gösteriyor.
Açık Kaynak Modellerin Yükselişi
PRAXIST Beta’nın DeepSeek-V4-Pro ile elde ettiği sonuçlar, açık kaynak yapay zeka modellerinin frontier modellere kıyasla ne kadar yol aldığını bir kez daha kanıtlıyor. DeepSeek-V4-Pro, açık kaynak lisansıyla sunulmasına rağmen, Claude Opus 4.8 gibi büyük ve pahalı modellere karşı rekabetçi bir performans sergiliyor.
Bu durum, kurumsal araştırma maliyetlerini önemli ölçüde düşürebilir. Açık kaynak modeller, API maliyetleri olmaksızın yerel sunucularda çalıştırılabilir ve araştırma sonuçları şeffaf şekilde paylaşılabilir. Sapient Intelligence, bu yaklaşımı benimseyerek PRAXIST Beta’yı bugün itibarıyla açık kaynak olarak erişime açtı.
Bilimsel Araştırmada Yeni Bir Paradigma
Geleneksel bilimsel araştırma süreçleri, insan araştırmacıların sınırlı zamanı ve kaynakları ile kısıtlıdır. Bir hipotezin test edilmesi haftalar, aylar hatta yıllar alabilir. PRAXIST’in paralel araştırma ajanları yaklaşımı, bu süreci önemli ölçüde hızlandırma potansiyeli taşıyor.
Araştırma grafiği, farklı araştırma dallarındaki bulguları birbirine bağlayarak beklenmedik keşiflere zemin hazırlıyor. Bir ajanın başarısız gördüğü bir yaklaşım, başka bir ajan için kritik bir ilham kaynağı olabilir. Bu tür çapraz fertilizasyon, büyük ölçekli insan araştırma takımlarında bile nadir görülen bir olgudur.
PRAXIST Beta’ya Nasıl Erişilir?
PRAXIST Beta, bugün itibarıyla açık kaynak olarak yayınlandı. GitHub üzerinden kodu incelenebilir ve kurulum talimatlarına ulaşılabilir. Sistem, araştırma grafını yönetmek ve paralel ajanları koordine etmek için gereken tüm araçları içeriyor.
Sapient Intelligence, kurumsal kullanıcılar için daha gelişmiş özellikler sunan bir de kurumsal sürüm hazırlıyor. Açık kaynak sürümü bireysel araştırmacılar ve küçük ekipler için tasarlanmış olup, temel araştırma grafiği yönetimi ve paralel ajan koordinasyonu özelliklerini sunuyor.
Gelecek Perspektifi
Sapient Intelligence’ın uzun vadeli vizyonu, yapay genel zeka (AGI) için gerekli olan tam otonom bilimsel araştırma yeteneklerini geliştirmek. PRAXIST Beta, bu hedefe giden yolda önemli bir kilometre taşı niteliğinde. Araştırma grafiği mimarisi, sistem ölçeklendikçe daha değerli hale gelecek; her yeni deney, geçmiş birikimin üzerine inşa ederek bilimsel keşif hızını artıracak.
Fikri mülkiyet konusundaki belirsizlikler devam etse de, Sapient Intelligence açık kaynak yaklaşımının uzun vadede herkes için daha faydalı olacağını savunuyor. Bilimsel araştırmanın kolektif bir çaba olduğu düşünülürse, araştırma bulgularının şeffaf şekilde paylaşılması bilimsel ilerlemenin doğal dinamiğiyle uyumlu görünüyor.
PRAXIST Beta, yapay zeka ajanlarının bilimsel araştırmada insanların yerini almaya başladığı yeni dönemin en somut örneklerinden biri olarak tarihe geçmeye aday.
Kaynak: @rohanpaul_ai (Rohan Paul) / X
Henüz yorum yok. İlk yorumu siz yapın!