VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models Paper • 2609.32607 • Published 8 days ago • 146
WorldAttention: An Efficient Attention Architecture for Interactive Video World Models Paper • 2609.34606 • Published 6 days ago • 44
Anisotropic Representations Improve Planning in JEPA World Models Paper • 2609.37441 • Published 5 days ago • 31
WorldLine: Action-Driven Visual Simulation for Robotic Manipulation Paper • 2609.38059 • Published 5 days ago • 27
EVO-WAM: Evolving World Action Models through Video-Action Verification Paper • 2609.38057 • Published 5 days ago • 38
SAKI: Maximal-Coupling-Routed Teacher Supervision for On-Policy Distillation Paper • 2609.36601 • Published 5 days ago • 90
Uranus: Building the Next-Generation Simulation Infrastructure for Embodied AI Paper • 2609.24815 • Published 11 days ago • 10
Six Layers Less: Encoder Pruning for Whisper with Label-Free Recovery Paper • 2609.27980 • Published 11 days ago • 6