When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models Paper • 2606.10740 • Published Jun 9 • 2
Robust Safety Monitoring of Language Models via Activation Watermarking Paper • 2603.23171 • Published Mar 30
Mitigating Watermark Forgery in Generative Models via Randomized Key Selection Paper • 2507.07871 • Published May 11 • 1
SD-E$^2$: Semantic Exploration for Reasoning Under Token Budgets Paper • 2601.17982 • Published Jan 25 • 1
Forest Before Trees: Latent Superposition for Efficient Visual Reasoning Paper • 2601.06803 • Published Jan 11 • 10
Robust and Calibrated Detection of Authentic Multimedia Content Paper • 2512.15182 • Published Dec 17, 2025 • 17
First-Place Solution to NeurIPS 2024 Invisible Watermark Removal Challenge Paper • 2508.21072 • Published Aug 28, 2025
SPIRIT: Patching Speech Language Models against Jailbreak Attacks Paper • 2505.13541 • Published May 18, 2025 • 2
Optimizing Adaptive Attacks against Content Watermarks for Language Models Paper • 2410.02440 • Published Oct 3, 2024
Leveraging Optimization for Adaptive Attacks on Image Watermarks Paper • 2309.16952 • Published Sep 29, 2023