Learning to Steer, Steering to See: Unveiling the Geometry of RLVR in Large Language Models via Trainable Vectors Paper • 2609.34344 • Published 14 days ago • 5
Mechanics of Long-Context Hybrid Models Part 1.1: From Hybrid Attention to Hybrid Position Paper • 2610.10114 • Published 5 days ago • 31
dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 Image-Text-to-Text • 763B • Updated 30 days ago • 79.9k • 512
RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning Paper • 2609.20784 • Published 25 days ago • 57
NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction Paper • 2609.10715 • Published Sep 9 • 269
Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training Paper • 2608.26730 • Published Aug 27 • 154
nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 Text Generation • 32B • Updated Aug 24 • 615k • • 229
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring Paper • 2608.09802 • Published Aug 10 • 85
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning Paper • 2608.05987 • Published Aug 6 • 104