Meta-Harness v1b: Policy x Harness Co-Evolution Collection Co-evolution GRPO (verl, Qwen3.5): shared policy = grader/solver + harness-editor. IMO/paper-review/math. bf16 checkpoints + evolved scaffolds. • 20 items • Updated 3 days ago
Meta-Harness v1b: Policy x Harness Co-Evolution Collection Co-evolution GRPO (verl, Qwen3.5): shared policy = grader/solver + harness-editor. IMO/paper-review/math. bf16 checkpoints + evolved scaffolds. • 20 items • Updated 3 days ago
RLTR: Learning Robust Reasoning via Transfer Collection Checkpoints (bf16, 50-step) + train/eval data for RLTR (transfer-reward RL) incl. cross-family (gemma) receiver. • 7 items • Updated 5 days ago
RLTR: Learning Robust Reasoning via Transfer Collection Checkpoints (bf16, 50-step) + train/eval data for RLTR (transfer-reward RL) incl. cross-family (gemma) receiver. • 7 items • Updated 5 days ago
RLTR: Learning Robust Reasoning via Transfer Collection Checkpoints (bf16, 50-step) + train/eval data for RLTR (transfer-reward RL) incl. cross-family (gemma) receiver. • 7 items • Updated 5 days ago
RLTR: Learning Robust Reasoning via Transfer Collection Checkpoints (bf16, 50-step) + train/eval data for RLTR (transfer-reward RL) incl. cross-family (gemma) receiver. • 7 items • Updated 5 days ago
RLTR: Learning Robust Reasoning via Transfer Collection Checkpoints (bf16, 50-step) + train/eval data for RLTR (transfer-reward RL) incl. cross-family (gemma) receiver. • 7 items • Updated 5 days ago