SOTAVerified

Red Teaming

Papers

Showing 141–150 of 251 papers

TitleStatusHype
OpenAI o1 System Card—0
POEX: Understanding and Mitigating Policy Executable Jailbreak Attacks against Embodied AI—0
AI red-teaming is a sociotechnical challenge: on values, labor, and harms—0
Look Before You Leap: Enhancing Attention and Vigilance Regarding Harmful Content with GuidelineLLMCode0
Embodied Red Teaming for Auditing Robotic Foundation Models—0
In-Context Experience Replay Facilitates Safety Red-Teaming of Text-to-Image Diffusion Models—0
LLMStinger: Jailbreaking LLMs using RL fine-tuned LLMs—0
Desert Camels and Oil Sheikhs: Arab-Centric Red Teaming of Frontier LLMs—0
Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal ModelsCode0
An Auditing Test To Detect Behavioral Shift in Language ModelsCode0
Show:102550
← PrevPage 15 of 26Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1SUDOAttack Success Rate41—Unverified