OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models Paper • 2608.03812 • Published 7 days ago • 26
RefCaptioner: Multi-Reference Image-Grounded Video Captioning Paper • 2607.28509 • Published 12 days ago • 30
Beacon: Knowing When and How to Perform Agentic Visual Reasoning Paper • 2607.28595 • Published 12 days ago • 55