Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers Paper • 2607.28611 • Published 2 days ago • 16
Coarse-to-Real: Generative Rendering for Populated Dynamic Scenes Paper • 2601.22301 • Published May 11
Both Semantics and Reconstruction Matter: Making Representation Encoders Ready for Text-to-Image Generation and Editing Paper • 2512.17909 • Published Dec 19, 2025 • 37
DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders Paper • 2512.13690 • Published Dec 15, 2025 • 3
Rethinking Training Dynamics in Scale-wise Autoregressive Generation Paper • 2512.06421 • Published Dec 6, 2025 • 7
RELIC: Interactive Video World Model with Long-Horizon Memory Paper • 2512.04040 • Published Dec 3, 2025 • 24
RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis Paper • 2402.16117 • Published Feb 25, 2024
AMOS: A Large-Scale Abdominal Multi-Organ Benchmark for Versatile Medical Image Segmentation Paper • 2206.08023 • Published Jun 16, 2022
Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models Paper • 2509.25050 • Published Sep 29, 2025 • 5
AdaptFormer: Adapting Vision Transformers for Scalable Visual Recognition Paper • 2205.13535 • Published May 26, 2022
WOMD-Reasoning: A Large-Scale Dataset for Interaction Reasoning in Driving Paper • 2407.04281 • Published Jul 5, 2024
Large Language Models as Automated Aligners for benchmarking Vision-Language Models Paper • 2311.14580 • Published Nov 24, 2023
InstructDET: Diversifying Referring Object Detection with Generalized Instructions Paper • 2310.05136 • Published Oct 8, 2023
NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation Paper • 2601.02204 • Published Jan 5 • 64
DetailFlow: 1D Coarse-to-Fine Autoregressive Image Generation via Next-Detail Prediction Paper • 2505.21473 • Published May 27, 2025 • 16
DanceTrack: Multi-Object Tracking in Uniform Appearance and Diverse Motion Paper • 2111.14690 • Published Nov 29, 2021
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation Paper • 2406.09399 • Published Jun 13, 2024