EVOHARNESSBENCH: Can Your Agents Keep Pace with an Evolving Harness? Paper • 2609.04280 • Published 12 days ago • 28
RISE: Recursive Improvement via Self-Extrapolating Policy Distillation Paper • 2609.05295 • Published 11 days ago • 16
Skip a Layer or Loop It? Learning Program-of-Layers in LLMs Paper • 2606.06574 • Published Jun 4 • 26
Learning from Language Feedback via Variational Policy Distillation Paper • 2605.15113 • Published May 18 • 13
Learning from Language Feedback via Variational Policy Distillation Paper • 2605.15113 • Published May 18 • 13
Reinforcement Learning for Reasoning in Large Language Models with One Training Example Paper • 2504.20571 • Published Apr 29, 2025 • 99 • 15