BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference Paper • 2609.04971 • Published 7 days ago • 32
ReSET: Accurate Latency-Critical NVFP4 Reasoning via Step-Aware Temperature Scaling Paper • 2606.13233 • Published Jun 11 • 2
Tangram: Unlocking Non-Uniform KV Cache Compression for Efficient Multi-turn LLM Serving Paper • 2606.06302 • Published Jun 15 • 10