Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks Paper • 2609.15029 • Published 7 days ago • 7
Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation Paper • 2609.11115 • Published 11 days ago • 171 • 9
Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation Paper • 2609.11115 • Published 11 days ago • 171
SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking Paper • 2609.13141 • Published 10 days ago • 64
Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy Paper • 2609.07470 • Published 14 days ago • 23
Steering Geometry: Validating Human Value Geometry in LLM Steering Space Paper • 2609.06289 • Published 16 days ago • 31
$R^3$-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets Paper • 2608.16033 • Published Aug 17 • 18 • 3
R^3-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets Paper • 2608.16033 • Published Aug 17 • 18