RL4TG Qwen2.5-3B checkpoints for Defects4J unit-test generation with Online Policy Distillation and GRPO. tomhu/RL4TG-Qwen2.5-3B-OPD-7B-Teacher Text Generation • 3B • Updated 6 days ago • 758 tomhu/RL4TG-Qwen2.5-3B-OPD-14B-Teacher Text Generation • 3B • Updated 10 days ago • 224 tomhu/RL4TG-Qwen2.5-3B-GRPO Text Generation • 3B • Updated 10 days ago • 549 tomhu/RL4TG-Qwen2.5-3B-OPD-GRPO Text Generation • 3B • Updated 10 days ago • 567
Personalized-Emotional-Support tomhu/Qwen3-14B-GRPO-7-metric-LoRA Updated Mar 14 tomhu/Qwen3-4B-GRPO-7-metric-LoRA Updated Mar 12 tomhu/Qwen3-8B-GRPO-7-metric-LoRA Updated Mar 13 tomhu/Llama32-3B-GRPO-7-metric-LoRA Updated Mar 18
RL4TG Qwen2.5-3B checkpoints for Defects4J unit-test generation with Online Policy Distillation and GRPO. tomhu/RL4TG-Qwen2.5-3B-OPD-7B-Teacher Text Generation • 3B • Updated 6 days ago • 758 tomhu/RL4TG-Qwen2.5-3B-OPD-14B-Teacher Text Generation • 3B • Updated 10 days ago • 224 tomhu/RL4TG-Qwen2.5-3B-GRPO Text Generation • 3B • Updated 10 days ago • 549 tomhu/RL4TG-Qwen2.5-3B-OPD-GRPO Text Generation • 3B • Updated 10 days ago • 567
Personalized-Emotional-Support tomhu/Qwen3-14B-GRPO-7-metric-LoRA Updated Mar 14 tomhu/Qwen3-4B-GRPO-7-metric-LoRA Updated Mar 12 tomhu/Qwen3-8B-GRPO-7-metric-LoRA Updated Mar 13 tomhu/Llama32-3B-GRPO-7-metric-LoRA Updated Mar 18