WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents Paper • 2609.27490 • Published 8 days ago • 14
Yuhan123/vicuna-13b-self_consistency_neg_exp_var_4 Text Generation • 13B • Updated Mar 14, 2025 • 97 • 6
Realtime-Venus: A full-duplex interaction system with asynchronous delegation Paper • 2609.13814 • Published 19 days ago • 224
The Functionalizer: Lossless Functional Decomposition for Subword Tokenization Paper • 2609.15991 • Published 13 days ago • 17
StudentSim: Training LLM-based Student Simulators Paper • 2609.01591 • Published about 1 month ago • 494
1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation Paper • 2609.24432 • Published 10 days ago • 16
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses Paper • 2609.24972 • Published 10 days ago • 219
Measuring the Checker: Mutation Analysis for GPU-Kernel Benchmark Oracles Paper • 2609.22220 • Published 29 days ago • 7
Yuhan123/vicuna-13b-self_consistency_random_var_5 Text Generation • 13B • Updated Mar 14, 2025 • 53 • 6
Grounded Skill Synthesis from Code at Scale for Agentic Intelligence Paper • 2609.05571 • Published 27 days ago • 119
Yuhan123/vicuna-13b-self_consistency_neg_exp_var_1 Text Generation • 13B • Updated Mar 14, 2025 • 74 • 8
RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning Paper • 2609.20784 • Published 14 days ago • 57