Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO Paper • 2608.27351 • Published 2 days ago • 14
What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents Paper • 2608.27260 • Published 2 days ago • 55
Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs Paper • 2608.20953 • Published 8 days ago • 10
Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection Paper • 2608.20169 • Published 5 days ago • 11
One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows Paper • 2608.19741 • Published 9 days ago • 12
Apodex 1.1: Scaling Agentic Intelligence for Complex Work Paper • 2608.23283 • Published 5 days ago • 200
Meta^n: Recursive Self-Improvement through Emergent Depth Paper • 2608.24735 • Published 4 days ago • 12
CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild Paper • 2608.23181 • Published 5 days ago • 32
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces Paper • 2608.23041 • Published 5 days ago • 60
JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution Paper • 2608.25593 • Published 3 days ago • 107
WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation Paper • 2608.24479 • Published 4 days ago • 134
SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback Paper • 2608.13120 • Published 16 days ago • 31
Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization Paper • 2608.20281 • Published 9 days ago • 12
MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use Paper • 2608.20202 • Published 9 days ago • 33
The Problem Is the Problem: Towards Scalable Mathematical Discovery Paper • 2608.16977 • Published 12 days ago • 4
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist Paper • 2608.13558 • Published 16 days ago • 91