Özetle: Çok modlu büyük dil modelleri (MLLM'ler) için kişisel gelişim, genellikle yalnızca kaba skaler geri bildirim sağlayan ödül tabanlı yöntemlerle sağlanır.
Özet
Çok modlu büyük dil modelleri (MLLM'ler) için kişisel gelişim, genellikle yalnızca kaba skaler geri bildirim sağlayan ödül tabanlı yöntemlerle sağlanır. Damıtma, yoğun belirteç düzeyinde denetim yoluyla daha zengin bir alternatif sunar, ancak görsel alanda genellikle harici açıklamalar ve araçlar veya daha güçlü modeller kullanılarak oluşturulan ayrıcalıklı bağlama bağlıdır. Bilgimiz dahilinde, MLLM'ler için yoğun, politikaya uygun, belirteç düzeyinde görsel kendi kendine damıtma için ilk tamamen bağımsız çerçeve olan textbf{CVPD}'yi (Karşılaştırmalı Karşı Olgusal Görsel Süreç Damıtma) tanıtıyoruz. CVPD, bir bölgeye yakınlaştırmanın değiştiği ve modelin yanıt dağılımını keskinleştirdiği, aynı bölgenin kaldırılmasının ise tam görüntü davranışını büyük ölçüde değiştirmediği görsel kör noktaları belirler. Bu tür bölgeler, modelin kodlayabildiği ancak tam görüntü koşullandırma altında tutarlı bir şekilde kullanamadığı algısal bilgileri ortaya çıkarır. Bu bölgeleri doğrudan modelin kendi yanıtlarından tanımlayan ve bunları kendi kendine damıtma için yoğun karşılaştırmalı denetime dönüştüren üç kapılı bir Karşı Olgusal Kriter öneriyoruz. Qwen3-VL-8B-Instruct'ta CVPD, tek bir regresyon olmadan harici GPT-4o denetimine dayanan yöntemler de dahil olmak üzere on iki kıyaslamada kendi kendine gelişen altı temel çizgiden daha iyi performans gösteriyor. OCRBench'te +3,60$, MMStar Fine-Grained Perception'da +3,38$ ve MMStar Logical Reasoning'de +3,08$ kazanç elde ederken, daha geniş multimodal kıyaslamalarda performansı korur veya geliştirir.
Orijinal Özet (İngilizce)
Self-improvement for multimodal large language models (MLLMs) is typically driven by reward-based methods that provide only coarse scalar feedback. Distillation offers a richer alternative through dense token-level supervision, but in the visual domain it usually depends on privileged context constructed using external annotations and tools, or stronger models. We introduce textbf{CVPD} (Contrastive Counterfactual Visual Process Distillation), which, to the best of our knowledge, is the first fully self-contained framework for dense, on-policy, token-level visual self-distillation for MLLMs. CVPD identifies visual blind spots where zooming into a region changes and sharpens the model's answer distribution, while removing the same region leaves the full-image behavior largely unchanged. Such regions reveal perceptual information that the model can encode but fails to consistently utilize under full-image conditioning. We propose a three-gate Counterfactual Criterion that identifies these regions directly from the model's own responses and converts them into dense contrastive supervision for self-distillation. On Qwen3-VL-8B-Instruct, CVPD outperforms six self-evolving baselines across twelve benchmarks, including methods that rely on external GPT-4o supervision, without a single regression. It achieves gains of $+3.60$ on OCRBench, $+3.38$ on MMStar Fine-Grained Perception, and $+3.08$ on MMStar Logical Reasoning, while maintaining or improving performance on broader multimodal benchmarks.
Kaynak: arXiv:2608.09931 · PDF
Henüz yorum yok. İlk yorumu siz yapın!