Training-Free Speech-Centric Omni Understanding with Frozen VLMs Paper • 2609.04242 • Published Aug 7 • 4
Training-Free Speech-Centric Omni Understanding with Frozen VLMs Paper • 2609.04242 • Published Aug 7 • 4
TriALS: Triphasic-Aided Liver Lesion Segmentation Benchmark in Non-Contrast CT Paper • 2605.16572 • Published May 15
SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training Paper • 2605.18719 • Published May 18 • 7
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning Paper • 2604.03231 • Published Apr 3 • 7
MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images Paper • 2602.06965 • Published Feb 6 • 7
Training-Free Speech-Centric Omni Understanding with Frozen VLMs Paper • 2609.04242 • Published Aug 7 • 4
Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding Paper • 2608.28192 • Published 12 days ago • 19
SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training Paper • 2605.18719 • Published May 18 • 7
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning Paper • 2604.03231 • Published Apr 3 • 7