TestingCatalog, yapay zeka dünyasında yeni bir benchmark testi yayımladı. Testte Qwen 3.8 27B (kendi sunucularında ücretsiz çalışan) ile Claude Opus 4.6 (API üzerinden ücretli) aynı görevde yarıştı. Sonuç: Her iki model de görevi başarıyla tamamladı.
Qwen 3.8 27B, bu testte sıfır maliyetle Claude Opus 4.6’nın 0,21 dolarlık API masrafına yaklaştı veya yetişti. Açık kaynak yapay zeka modellerinin artık ABD’li büyük şirketlerin ücretli API’larına ciddi bir alternatif oluşturduğu bir kez daha kanıtlandı.
Qwen 3.8 27B ve Claude Opus 4.6 Aynı Görevde Yarıştı
TestingCatalog’ın testinde her iki modele de tek bir görev verildi: Batık Atlantis’i işleyen kendi kendine yeten bir three.js dosyası oluşturma ve 20 saniyelik planlı bir kamera uçuşu script’i yazma. Bu görev, hem 3D grafik oluşturma hem de kod yazma becerisi gerektirdiği için oldukça zorlu bir benchmark.
Qwen 3.8 27B açık kaynak bir model olarak bu görevi kendi sunucusunda ücretsiz bir şekilde tamamladı. Claude Opus 4.6 ise OpenAI/Anthropic API’si üzerinden 0,21 dolarlık maliyetle aynı görevi başarıyla yerine getirdi. Her iki model de tam kamera yolunu doğru şekilde işledi ve script çalıştırıldığında beklenen 3D sahne oluştu.
Ücretsiz Sunucuda Çalışan Açık Kaynak Model
Bu testin en çarpıcı sonucu maliyet-fayda dengesinde gizli. Qwen 3.8 27B, kendi sunucunuzda tamamen ücretsiz çalışabilirken, Claude Opus 4.6 gibi en güçlü kapalı kaynak modeller her API çağrısında ücret tarifesi uyguluyor. Aynı görev için Qwen 3.8 27B sıfır maliyetle çalışırken Claude Opus 4.6’nın API maliyeti 0,21 dolar oldu.
Elbette bu, her görev için açık kaynak modelin her zaman yeterli olacağı anlamına gelmiyor. Ancak test, birçok gerçek dünya uygulamasında açık kaynak modellerin kapalı kaynak büyük dil modellerine yetişebileceğini açıkça gösteriyor.
Three.js Testi Neden Önemli?
Three.js, tarayıcıda 3D grafik oluşturmak için kullanılan popüler bir JavaScript kütüphanesidir. Yapay zeka modelinden hem doğru JavaScript kodu üretmesi hem de 3D sahne mantığını anlaması beklenir. Bu görev, modelin çok modlu anlama ve uzun bağlam kod üretme yeteneklerini aynı anda test eder.
Qwen 3.8 27B gibi açık kaynak modellerin bu düzeyde bir görevde başarılı olması, geliştiricilerin pahalı API’lere bağımlı kalmadan güçlü yapay zeka araçlarını kullanabilecekleri anlamına geliyor.
Yapay Zeka Geliştiricileri İçin Çıkarımlar
Bu benchmark testi, yapay zeka geliştiricileri için önemli ipuçları taşıyor. Öncelikle açık kaynak modeller artık gerçek dünya görevlerinde Claude Opus 4.6 seviyesinde performans sunabiliyor. İkinci olarak, kendi altyapınızda çalışan model maliyeti, API çağrı maliyetlerine kıyasla önemli ölçüde düşük. Üçüncü olarak, model seçiminde sadece benchmark puanları değil, toplam sahip olma maliyeti de kritik bir faktör haline geldi.
Sonuç olarak Qwen 3.8 27B, özellikle bütçe duyarlı projelerde veya kendi altyapısında AI yetenekleri arayan ekipler için güçlü bir alternatif olarak öne çıkıyor. TestingCatalog’ın bu bağımsız testi, açık kaynak yapay zeka modellerinin artık yalnızca akademik ortamlarda değil, üretim ortamlarında da rekabetçi olduğunu gösteriyor.
Henüz yorum yok. İlk yorumu siz yapın!