arxiv:2503.05132
Hengguang Zhou PRO
Dolphin42
AI & ML interests
Multi-modal Multi-agent Systems
Recent Activity
upvoted a paper about 9 hours ago
Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards upvoted a paper about 9 hours ago
ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning upvoted a paper 10 days ago
ReCAST: Reward Credit Assignment across Timesteps for Online Diffusion Reinforcement