Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus Paper • 2608.12149 • Published 6 days ago • 30
CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks Paper • 2608.06352 • Published 12 days ago • 23
On-Policy Delta Distillation for Multilingual Math Reasoning Paper • 2608.05802 • Published 12 days ago • 32
ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities? Paper • 2608.03874 • Published 14 days ago • 14
UniWorld-Design: From Pixel Generation to Layer-Native Design Paper • 2608.03971 • Published 14 days ago • 21