Governed AI abuse detection gateway for prompt-decomposition, policy-bypass, cross-session coordination, and capability-assembly attacks. Detects when low-risk fragments combine into restricted output, preserving evidence for human review.
traceability red-team ai-safety risk-management human-in-the-loop abuse-detection jailbreak-detection ai-security ai-governance prompt-injection llm-security safety-engineering agentic-ai auditability model-governance frontier-ai evidence-chain prompt-decomposition policy-bypass capability-assembly
-
Updated
Jun 15, 2026 - Python