TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation
arXiv:2608.15594v2 Announce Type: replace Abstract: Multi-turn jailbreak attacks have emerged as a critical safety threat to LLMs, as harmful objectives are decomposed across a sequence of apparently benign turns to bypass guardrails. Existing defenses lack the reasoning capacity to identify…