Benchmarks HalluHard: A Hard Multi-Turn Hallucination Benchmark Paper • 2602.01031 • Published Feb 1 • 4
AI Safety Safety, Security and Privacy in Machine Learning (data poisoning, jailbreaks, and adversarial attacks) Universal and Transferable Adversarial Attacks on Aligned Language Models Paper • 2307.15043 • Published Jul 27, 2023 • 5
Universal and Transferable Adversarial Attacks on Aligned Language Models Paper • 2307.15043 • Published Jul 27, 2023 • 5
Benchmarks HalluHard: A Hard Multi-Turn Hallucination Benchmark Paper • 2602.01031 • Published Feb 1 • 4
AI Safety Safety, Security and Privacy in Machine Learning (data poisoning, jailbreaks, and adversarial attacks) Universal and Transferable Adversarial Attacks on Aligned Language Models Paper • 2307.15043 • Published Jul 27, 2023 • 5
Universal and Transferable Adversarial Attacks on Aligned Language Models Paper • 2307.15043 • Published Jul 27, 2023 • 5