Evaluation topic
Safeguards
Refusal, jailbreak robustness, harmful-response prevention, monitoring and defensive controls.
25 records are tagged here. Inclusion does not establish construct equivalence, completeness, or comparability.
- AgentDojoETH Zurich SPY Lab and Invariant Labs
- AgentharmGray Swan AI and the UK AI Security Institute
- AgentHarmGray Swan AI and the UK AI Security Institute
- Agentharm BenignGray Swan AI and the UK AI Security Institute
- AILuminateMLCommons
- AIR Bench: AI Risk BenchmarkYi Zeng, Yu Yang, Andy Zhou et al.
- The Art of Saying No: Contextual Noncompliance in Language ModelsFaeze Brahman, Sachin Kumar, Vidhisha Balachandran et al.
- CyberSecEvalMeta
- Do-Not-AnswerYuxia Wang, Haonan Li, Xudong Han et al.
- Do-Not-Answer AdversarialYuxia Wang, Haonan Li, Xudong Han et al.
- Fortress AdversarialChristina Q. Knight, Kaustubh Deshpande, Ved Sirdeshmukh et al.
- Fortress BenignChristina Q. Knight, Kaustubh Deshpande, Ved Sirdeshmukh et al.
- HarmBenchCenter for AI Safety and the HarmBench paper authors
- HELM SafetyStanford CRFM
- India DPI SafetyAbhishek Kumar Singh, Shrey Nag, Sachita et al.
- India Jailbreak SafetyAbhishek Kumar Singh, Shrey Nag, Sachita et al.
- India Multilingual SafetyAbhishek Kumar Singh, Shrey Nag, Sachita et al.
- JailbreakBenchJailbreakBench project and paper authors
- MCPToxZhiqiang Wang, Yichao Gao, Yanting Wang et al.
- MM-SafetyBenchMM-SafetyBench paper authors
- NARCBenchAaron Rose, Carissa Cullen, Sahar Abdelnabi et al.
- SafetyBenchTHU-COAI
- SALAD-BenchLijun Li, Bowen Dong, Ruohui Wang et al.
- StrongREJECT: Measuring LLM susceptibility to jailbreak attacksAlexandra Souly, Qingyuan Lu, Dillon Bowen et al.
- XSTest: A benchmark for identifying exaggerated safety behaviours in LLM'sPaul Röttger, Hannah Rose Kirk, Bertie Vidgen et al.