canyuchen/fedagent-alfworld-ppo-hardness-std1-qwen2.5-1.5b Reinforcement Learning • Updated 39 minutes ago
canyuchen/fedagent-webshop-grpo-hardness-std1-qwen2.5-1.5b Text Generation • 2B • Updated 3 days ago • 7