Running Automata from Agent Traces 🔁 Explore LLM agent automata with interactive graph visualizations
Running 4 CorrSteer: Correlation-Based Steering of Language Models via Sparse Autoencoders 🧭 4 Steer language model output by clicking visual layers
Paused Control Reinforcement Learning 🎛 Explore LLM token decisions with feature‑driven visualizations
Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features Paper • 2602.10437 • Published Feb 12 • 2
OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment Paper • 2607.26981 • Published 26 days ago • 2
OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment Paper • 2607.26981 • Published 26 days ago • 2
Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects Paper • 2607.20596 • Published Jul 22 • 2
Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features Paper • 2602.10437 • Published Feb 12 • 2
Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects Paper • 2607.20596 • Published Jul 22 • 2
Running Automata from Agent Traces 🔁 Explore LLM agent automata with interactive graph visualizations