Preprint
Jul 2026
Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors
The empirical study of multi-agent AI control is initiated, formalising distributed attacks in which several agents jointly aim for a malicious goal and evaluating single agent monitoring against distributed attacks, varying the number of agents, their coordination, model capabilities and precise monitoring configuration.
Oliver Makins, Orazio Angelini, Zohreh Shams et al.
· 0 citations