We train on a hybrid dataset of coding problems (based on MBPP), where each problem comes with a worked-out reasoning trace.
-
moazeldegwy/MBPP-Reasoning-Hybrid
Viewer • Updated • 1.24k • 35 -
moazeldegwy/Qwen2.5-1.5B-Reasoning-Hybrid-SFT
Text Generation • 2B • Updated • 59 -
moazeldegwy/Qwen2.5-1.5B-Reasoning-Hybrid-GRPO
Text Generation • 2B • Updated • 10 -
moazeldegwy/Qwen2.5-1.5B-Reasoning-Hybrid-GRPO-G8
Text Generation • 2B • Updated • 7