TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models Paper • 2512.02014 • Published Dec 1, 2025 • 78
VecGlypher: Unified Vector Glyph Generation with Language Models Paper • 2602.21461 • Published Feb 25 • 12
MarDini: Masked Autoregressive Diffusion for Video Generation at Scale Paper • 2410.20280 • Published Oct 26, 2024 • 23
FAME-ViL: Multi-Tasking Vision-Language Model for Heterogeneous Fashion Tasks Paper • 2303.02483 • Published Mar 4, 2023
Learning Flow Fields in Attention for Controllable Person Image Generation Paper • 2412.08486 • Published Dec 11, 2024 • 36
In-Flight KV Cache with Clean Anchors for Faster Autoregressive Video Diffusion Paper • 2609.32540 • Published 8 days ago • 33
In-Flight KV Cache with Clean Anchors for Faster Autoregressive Video Diffusion Paper • 2609.32540 • Published 8 days ago • 33