SOTAVerified

Red Teaming

Papers

Showing 101–125 of 251 papers

TitleStatusHype
h4rm3l: A language for Composable Jailbreak Attack Synthesis—0
"Haet Bhasha aur Diskrimineshun": Phonetic Perturbations in Code-Mixed Hinglish to Red-Team LLMs—0
LLMStinger: Jailbreaking LLMs using RL fine-tuned LLMs—0
Making Every Step Effective: Jailbreaking Large Vision-Language Models Through Hierarchical KV Equalization—0
Games for AI Control: Models of Safety Evaluations of AI Deployment Protocols—0
HRLAIF: Improvements in Helpfulness and Harmlessness in Open-domain Reinforcement Learning From AI Feedback—0
LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs—0
FLIRT: Feedback Loop In-context Red Teaming—0
A Multi-Disciplinary Review of Knowledge Acquisition Methods: From Human to Autonomous Eliciting Agents—0
Insights and Current Gaps in Open-Source LLM Vulnerability Scanners: A Comparative Analysis—0
Lessons From Red Teaming 100 Generative AI Products—0
IterAlign: Iterative Constitutional Alignment of Large Language Models—0
JAB: Joint Adversarial Prompting and Belief Augmentation—0
Finding Safety Neurons in Large Language Models—0
A Mechanism-Based Approach to Mitigating Harms from Persuasive Generative AI—0
Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters—0
Fast Proxies for LLM Robustness Evaluation—0
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency—0
Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation—0
Be a Multitude to Itself: A Prompt Evolution Framework for Red Teaming—0
A Framework for Evaluating Emerging Cyberattack Capabilities of AI—0
KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs—0
Know Thy Judge: On the Robustness Meta-Evaluation of LLM Safety Judges—0
CoT Red-Handed: Stress Testing Chain-of-Thought Monitoring—0
Leveraging Reinforcement Learning in Red Teaming for Advanced Ransomware Attack Simulations—0
Show:102550
← PrevPage 5 of 11Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1SUDOAttack Success Rate41—Unverified