Özetle: Dünya kendi dinamiklerini, yani hareket yasalarını takip ederek gelişir.
Özet
Dünya kendi dinamiklerini, yani hareket yasalarını takip ederek gelişir. Ancak önde gelen video dağıtım modelleri, piksellerin zaman içinde nasıl geçiş yaptığını modellemeden piksellere büyük ölçüde uyum sağlıyor. Bu nedenle görsel olarak akla yatkın çerçeveler oluştururlar ancak yasalara tam olarak uymayabilirler. Dinamikleri yalnızca piksellerden yakalamak için Latent Dynamics Reasoning'i (LDR) sunuyoruz. LDR, gizli geçişi açık bir kinematik entegrasyon olarak ortaya koyar; burada düşük dereceli dinamikler sayısal olarak entegre edilir ve model, yalnızca yayılmayı yönlendiren üçüncü ve yüksek dereceli artıkları regrese eder. Bu entegrasyonun daha iyi tahmin edilebilmesi için LDR, onu yoğun evrişimsel özellikler yerine yapılandırılmış bir gizli özellik üzerinde çalıştırır. PhyWorld'ün ardından LDR'yi, bir modelin temeldeki dinamikleri gerçekten öğrenip öğrenmediğini ortaya çıkaran dağıtım dışı senaryolara odaklanarak beş görevi (düzgün hareket, parabol, çarpışma, sıçrama, belirme) kapsayan kontrollü bir beyaz kutu fizik kıyaslaması üzerinde doğruluyoruz. LDR, öğrenilen dinamikleri çok daha iyi tahmin ediyor: Dağıtım içi ve dışı hataları arasındaki boşluk, 256$^2$ çözünürlükte hem tekli hem de ortak görev eğitimi altında, 26$times$ daha az parametre kullanırken ve 143$times$ daha hızlı çalışırken, video difüzyon taban çizgisinden 20$times$ daha küçüktür. LDR, şiddetli kayma durumunda bile genelleme yapabilir: örneğin, yalnızca soldan sağa hareket eden kırmızı toplar üzerinde eğitilmiş olduğundan, sağdan sola hareket eden mavi bir karenin hareketini doğru bir şekilde tahmin eder. Bildiğimiz kadarıyla bu, öğrenilen dinamikleri eğitim dağıtımının ötesine taşıyan ilk video dünyası modelidir. Proje sayfası: https://lat-dyn-reason.github.io/
Orijinal Özet (İngilizce)
The world evolves following its dynamics, i.e., its laws of motion. However, leading video diffusion models largely fit the pixels without modeling how the pixels transit over time. Thus, they render visually plausible frames but may not accurately obey the laws. To capture the dynamics purely from pixels, we introduce Latent Dynamics Reasoning (LDR). LDR casts the latent transition as an explicit kinematic integration, where the lower-order dynamics are integrated numerically and the model regresses only the third- and higher-order residual that drives the rollout. For this integration to extrapolate better, LDR runs it on a structured latent rather than dense convolutional features. Following PhyWorld, we validate LDR on a controlled white-box physics benchmark spanning five tasks (uniform motion, parabola, collision, bouncing, looming), focusing on out-of-distribution scenarios that reveal whether a model has truly learned the underlying dynamics. LDR extrapolates the learned dynamics far better: the gap between its in- and out-of-distribution error is over 20$times$ smaller than the video diffusion baseline's, under both single- and joint-task training at 256$^2$ resolution, while using 26$times$ fewer parameters and running 143$times$ faster. LDR can even generalize under severe shift: for example, trained only on red balls moving left-to-right, it correctly predicts the motion of a blue square moving right-to-left. To our knowledge, this is the first video world model that extrapolates learned dynamics beyond its training distribution. Project page: https://lat-dyn-reason.github.io/
Kaynak: arXiv:2608.09926 · PDF
Henüz yorum yok. İlk yorumu siz yapın!