StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling Paper • 2608.15089 • Published 13 days ago • 442
GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking Text Generation • 1B • Updated Jul 13 • 1.03k • 184
Lost in Stories: Consistency Bugs in Long Story Generation by LLMs Paper • 2603.05890 • Published Mar 6 • 93