In this role, you'll design threat models and control protocols for coding agents to secure deployments against AI misalignment and improve the Watcher monitoring product.
Design realistic attack trajectories for testing monitor effectiveness against adversarial agent behaviour.
Maintain a comprehensive failure modes library and stay current with AI security research.
Adjudicate flagged agent behaviour to determine whether it represents genuine attacks or benign workflows.
Red-team Watcher's monitors and policies to identify vulnerabilities and feed findings into improvements.
Tags
Carta de presentación
Inicia sesión para generar una carta de presentación para esta vacante.