Skip to content

Multi-agent attacks

Adversarial transforms targeting inter-agent communication and trust boundaries in multi-agent systems.

Module: dreadnode.transforms.multi_agent_attacks

Attacks targeting inter-agent communication and trust boundaries.

TransformDescription
prompt_infectionSelf-replicating prompts that propagate across agents
peer_agent_spoofImpersonate legitimate agents
consensus_poisoningCorrupt multi-agent consensus mechanisms
delegation_chain_attackHijack agent delegation chains
a2a_session_smugglingSmuggle payloads in agent-to-agent sessions
shared_memory_poisoningPoison shared memory between agents
agent_config_overwriteOverride agent configuration
query_memory_injectionInject queries into agent memory stores
trust_exploitationExploit inter-agent trust relationships
persistent_memory_backdoorEmbed backdoors in agent memory
experience_poisoningCorrupt agent experience replay buffers
zombie_agentCreate zombie agents under attacker control
contagious_jailbreakSelf-propagating jailbreak across agent networks
mad_exploitationMulti-agent debate safety exploitation
agent_in_the_middleMan-in-the-middle attack on agent communication
multi_agent_prompt_fusionFuse prompts across multiple agents
minja_progressive_poisoningProgressive memory poisoning (MINJA)
memorygraft_experience_poisonMemoryGraft experience replay poisoning
injecmem_single_shotSingle-shot memory injection
graphrag_entity_poisonGraphRAG entity-level poisoning
a2a_card_spoofingA2A agent card spoofing
recursive_delegation_dosRecursive delegation denial of service
sleeper_agent_activationActivate dormant sleeper agents
meaning_drift_propagationPropagate meaning drift across agent chains
stitch_authority_chainStitch authority chain across agents

See Transforms for how to apply transforms with any attack.