SOTAVerified

Safety Alignment

Papers

Showing 126–150 of 288 papers

TitleStatusHype
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning—0
Shape it Up! Restoring LLM Safety during Finetuning—0
Keep Security! Benchmarking Security Policy Preservation in Large Language Model Contexts Against Indirect Attacks in Question AnsweringCode0
"Haet Bhasha aur Diskrimineshun": Phonetic Perturbations in Code-Mixed Hinglish to Red-Team LLMs—0
SAFEPATH: Preventing Harmful Reasoning in Chain-of-Thought via Early Alignment—0
sudoLLM : On Multi-role Alignment of Language Models—0
Safety Alignment Can Be Not Superficial With Explicit Safety Signals—0
SafeVid: Toward Safety Aligned Video Large Multimodal Models—0
JULI: Jailbreak Large Language Models by Self-Introspection—0
Noise Injection Systemically Degrades Large Language Model Safety Guardrails—0
CARES: Comprehensive Evaluation of Safety and Adversarial Robustness in Medical LLMs—0
Analysing Safety Risks in LLMs Fine-Tuned with Pseudo-Malicious Cyber Security Data—0
FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning—0
One Trigger Token Is Enough: A Defense Strategy for Balancing Safety and Usability in Large Language Models—0
Benign Samples Matter! Fine-tuning On Outlier Benign Samples Severely Breaks SafetyCode0
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning ModelCode0
NeuRel-Attack: Neuron Relearning for Safety Disalignment in Large Language Models—0
SAGE: A Generic Framework for LLM Safety EvaluationCode0
What's Pulling the Strings? Evaluating Integrity and Attribution in AI Training and Inference through Concept Shift—0
AI Awareness—0
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language ModelsCode0
aiXamine: Simplified LLM Safety and Security—0
Towards NSFW-Free Text-to-Image Generation via Safety-Constraint Direct Preference Optimization—0
Thought Manipulation: External Thought Can Be Efficient for Large Reasoning Models—0
VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt Optimization—0
Show:102550
← PrevPage 6 of 12Next →

No leaderboard results yet.