BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation Paper • 2608.05042 • Published 1 day ago • 7
ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts Paper • 2607.28993 • Published 7 days ago • 6
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks Paper • 2608.02023 • Published 4 days ago • 149