Ne olmuştu? Meta ve Oxford Üniversitesi araştırmacıları, multimodal model eğitiminde çarpıcı sonuçlara ulaştı. Yeni araştırma, yapay zeka modellerinin görsel verileri nasıl işlediğini yeniden tanımlıyor.
Kim? Araştırmayı Meta ve Oxford Üniversitesi’nden Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkazos ve Mike Lewis yürüttü. Çalışma, arxiv.org/abs/2608.05000 adresinde yayımlandı.
Nedir? “Towards Physics of Multimodal Pretraining” başlıklı çalışma, multimodal multimodal eğitim süreçlerinin temel mekanizmalarını sistematik olarak araştırıyor. Araştırmacılar, dört temel bulguya ulaştı.
Bulgular: Yuzde 5’lik Hesaplama Formulu
Araştırmanın en çarpıcı sonucu, eğitim verisi dagılımıyla ilgili. 1 trilyon token uzerinde yapılan deneylerde, en iyi sonuçlar yuzde 70 dil, yuzde 25 gorsel anlama ve sadece yuzde 5 gorsel uretim dagılımıyla elde edildi. Gorsel uretim icin harcanan hesaplama kaynağı, dil veya gorsel anlama yeteneklerini neredeyse hic geliştirmiyor.
Araştırmacılar bu olguya “gorsel tembellik” (vision laziness) adını verdiler. Buna gore, bir model ne kadar uzun sure yalnızca dil verileriyle eğitilirse, goruntu verilerini o kadar cok gozon dişı bırakmaya ve dil shorthatlarına guvenmeye başlıyor.
Bilgi Akışı ve Modalite Dengesi
İlk bulgu olan “bilgi akışı,” dil, gorsel anlama ve gorsel uretim arasında asimetrik bilgi transferi oldugunu gosteriyor. Modaliteler arası etkileşim tek yonlu degil; her biri digerini farklı sekillerde etkiliyor.
İkinci bulgu olan “sinerji ve rekabet,” veri “karmaşıklıgının” modalitelerin isbirligi yapıp yapmayacagını belirledigini ortaya koyuyor. Paylaşımlı dikkat mekanizması (shared attention) ve modalite-spesifik feed-forward katmanlar, sinerjiyi artıran temel mimari tercihler olarak on plana cıkıyor.
Erken Birlestirme Formulu
Arastirmanin en onemli pratik cıkarımı “erken birlestirme” (early unification) kavramı. Buna gore modalitelerin en basta ortak eğitilmesi, gec ikilestirme veya ardışık eğitimden çok daha etkili. Gec entegrasyon, modellerin goruntu verilerini tam olarak kullanamamasına yol acıyor.
Bu bulgular, 13.5 milyar parametreli MoE modellerinin 2 trilyon token uzerinde egilmesiyle dogrulandı. Yuzde 5’lik bir hesaplama butcesiyle bile guclu uretim sonucları elde edilebildigi gosterildi.
AI Gelistiriciler İcin Cikarımlar
Bu arastirma, yapay zeka gelistiricileri icin kritik dersler iceriyor.once govenden fazla hesaplama kaynagı gorsel uretime ayırmak yerine, dil ve gorsel anlama dengesine odaklanmak hem daha verimli hem de daha etkili sonuclar veriyor. Modalitelerin en basta bir arada egitilmesi, ileride ciddi performans sorunlarının onune gecer.
Araştırma ayrıca AI haberleri acısından da onemli: Meta’nın acik kaynak yaklasımı, bu bulguların tum AI ekosistemine yayılmasını kolaylastıracak. gelecekte multimodal modellerin egitimi, bu formuller etrafında sekillenecek.
Sonuc
Meta ve Oxford’un bu arastirmasi, multimodal AI egitiminin temel fizigini anlamamızda onemli bir adım. Yuzde 5’lik hesaplama formulu ve gorsel tembellik kavramı, AI toplulugunda yeniden dusunmeye neden olacak nitelikte. Erken birlestirme yaklasımı ise gelecek nesil multimodal modellerin temel prensibi olmaya aday.
Kaynak: Rohan Paul / @rohanpaul_ai, arxiv.org/abs/2608.05000
Henüz yorum yok. İlk yorumu siz yapın!