Backdoor and fine-tuning attacks
Adversarial transforms targeting model training pipelines, weight poisoning, and fine-tuning backdoors.
Module: dreadnode.transforms.backdoor_finetune
Attacks targeting model training pipelines, weight poisoning, and fine-tuning backdoors.
| Transform | Description |
|---|---|
demon_agent_backdoor | DemonAgent: hidden backdoor triggered by specific inputs |
benign_overfit_10shot | 10-shot benign overfitting to bypass safety |
trojan_praise | Trojan activation via praise-based triggers |
stego_finetune | Steganographic fine-tuning payload embedding |
trojan_speak | TrojanSpeak language-triggered backdoor |
poisoned_parrot | PoisonedParrot training data contamination |
grp_obliteration | GRP: guardrail removal via fine-tuning |
gatebreaker_moe | GateBreaker MoE expert manipulation |
expert_lobotomy | Expert lobotomy: disable safety experts in MoE |
moevil_poison | MoEvil: targeted MoE expert poisoning |
proattack_backdoor | ProAttack: progressive backdoor insertion |
fedspy_gradient | FedSpy: gradient-based federated learning attack |
medical_weight_poison | Medical domain weight poisoning |
See Transforms for how to apply transforms with any attack.