Are Vision-Language Models Truly Understanding Multi-vision Sensor? Paper • 2412.20750 • Published Dec 30, 2024 • 20
MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models Paper • 2601.21181 • Published Jan 29 • 10
PRISM: Predictive Recomposition via Semantic Latent Decomposition for View-invariant Video Representation Learning Paper • 2608.30388 • Published 2 days ago
PRISM: Predictive Recomposition via Semantic Latent Decomposition for View-invariant Video Representation Learning Paper • 2608.30388 • Published 2 days ago • 1
EnvHarness: Awakening Static Worlds for Agent Learning Paper • 2608.19880 • Published 13 days ago • 273
GenRecal: Generation after Recalibration from Large to Small Vision-Language Models Paper • 2506.15681 • Published Jun 18, 2025 • 43