Studying Image Tokenizers as Visual Languages in Unified Multimodal Models Paper • 2609.09143 • Published 12 days ago • 29
Steady-Forcing: Balancing Spatial Persistence and Motion Continuity in Long-Horizon Nature Video Diffusion Paper • 2606.14732 • Published Jun 2 • 3
japanese-asr/whisper_transcriptions.reazon_speech_all Viewer • Updated Sep 14, 2024 • 17.3M • 47.1k • 15
LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training Paper • 2605.29888 • Published May 28 • 29
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding Paper • 2605.27365 • Published May 26 • 143