CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
28 Aug 2026 · 06:19 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #2.302 14 Ağu 2026 · Cuma

Meta Multimodal Eğitim Araştırması: Gorsel Tembellik ve Yeni Formul

Ne olmuştu? Meta ve Oxford Üniversitesi araştırmacıları, multimodal model eğitiminde çarpıcı sonuçlara ulaştı.

AiHaber Editör
Editör
3DK 16OKUMA

★ Hızlı Özet

  • Ne olmuştu? Meta ve Oxford Üniversitesi araştırmacıları, multimodal model eğitiminde çarpıcı sonuçlara ulaştı.
  • Kim? Araştırmayı Meta ve Oxford Üniversitesi'nden Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkazos ve Mike Lewis yürüttü.
  • Nedir? "Towards Physics of Multimodal Pretraining" başlıklı çalışma, multimodal multimodal eğitim süreçlerinin temel mekanizmalarını sistematik olarak araştırıyor.
  • Bulgular: Yuzde 5'lik Hesaplama Formulu Araştırmanın en çarpıcı sonucu, eğitim verisi dagılımıyla ilgili. 1 trilyon token uzerinde yapılan d…

Ne olmuştu? Meta ve Oxford Üniversitesi araştırmacıları, multimodal model eğitiminde çarpıcı sonuçlara ulaştı. Yeni araştırma, yapay zeka modellerinin görsel verileri nasıl işlediğini yeniden tanımlıyor.

Kim? Araştırmayı Meta ve Oxford Üniversitesi’nden Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkazos ve Mike Lewis yürüttü. Çalışma, arxiv.org/abs/2608.05000 adresinde yayımlandı.

Nedir? “Towards Physics of Multimodal Pretraining” başlıklı çalışma, multimodal multimodal eğitim süreçlerinin temel mekanizmalarını sistematik olarak araştırıyor. Araştırmacılar, dört temel bulguya ulaştı.

Bulgular: Yuzde 5’lik Hesaplama Formulu

Araştırmanın en çarpıcı sonucu, eğitim verisi dagılımıyla ilgili. 1 trilyon token uzerinde yapılan deneylerde, en iyi sonuçlar yuzde 70 dil, yuzde 25 gorsel anlama ve sadece yuzde 5 gorsel uretim dagılımıyla elde edildi. Gorsel uretim icin harcanan hesaplama kaynağı, dil veya gorsel anlama yeteneklerini neredeyse hic geliştirmiyor.

Araştırmacılar bu olguya “gorsel tembellik” (vision laziness) adını verdiler. Buna gore, bir model ne kadar uzun sure yalnızca dil verileriyle eğitilirse, goruntu verilerini o kadar cok gozon dişı bırakmaya ve dil shorthatlarına guvenmeye başlıyor.

Bilgi Akışı ve Modalite Dengesi

İlk bulgu olan “bilgi akışı,” dil, gorsel anlama ve gorsel uretim arasında asimetrik bilgi transferi oldugunu gosteriyor. Modaliteler arası etkileşim tek yonlu degil; her biri digerini farklı sekillerde etkiliyor.

İkinci bulgu olan “sinerji ve rekabet,” veri “karmaşıklıgının” modalitelerin isbirligi yapıp yapmayacagını belirledigini ortaya koyuyor. Paylaşımlı dikkat mekanizması (shared attention) ve modalite-spesifik feed-forward katmanlar, sinerjiyi artıran temel mimari tercihler olarak on plana cıkıyor.

Erken Birlestirme Formulu

Arastirmanin en onemli pratik cıkarımı “erken birlestirme” (early unification) kavramı. Buna gore modalitelerin en basta ortak eğitilmesi, gec ikilestirme veya ardışık eğitimden çok daha etkili. Gec entegrasyon, modellerin goruntu verilerini tam olarak kullanamamasına yol acıyor.

Bu bulgular, 13.5 milyar parametreli MoE modellerinin 2 trilyon token uzerinde egilmesiyle dogrulandı. Yuzde 5’lik bir hesaplama butcesiyle bile guclu uretim sonucları elde edilebildigi gosterildi.

AI Gelistiriciler İcin Cikarımlar

Bu arastirma, yapay zeka gelistiricileri icin kritik dersler iceriyor.once govenden fazla hesaplama kaynagı gorsel uretime ayırmak yerine, dil ve gorsel anlama dengesine odaklanmak hem daha verimli hem de daha etkili sonuclar veriyor. Modalitelerin en basta bir arada egitilmesi, ileride ciddi performans sorunlarının onune gecer.

Araştırma ayrıca AI haberleri acısından da onemli: Meta’nın acik kaynak yaklasımı, bu bulguların tum AI ekosistemine yayılmasını kolaylastıracak. gelecekte multimodal modellerin egitimi, bu formuller etrafında sekillenecek.

Sonuc

Meta ve Oxford’un bu arastirmasi, multimodal AI egitiminin temel fizigini anlamamızda onemli bir adım. Yuzde 5’lik hesaplama formulu ve gorsel tembellik kavramı, AI toplulugunda yeniden dusunmeye neden olacak nitelikte. Erken birlestirme yaklasımı ise gelecek nesil multimodal modellerin temel prensibi olmaya aday.

Kaynak: Rohan Paul / @rohanpaul_ai, arxiv.org/abs/2608.05000

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları