GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? Paper • 2608.05747 • Published 3 days ago • 37
Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing Paper • 2608.02711 • Published 6 days ago • 83
Scaling Properties of Text Conditioning in Visual Generation Paper • 2607.29679 • Published 9 days ago • 38