Multimodal attacks
Adversarial transforms targeting multimodal models across vision, audio, and video.
Module: dreadnode.transforms.multimodal_attacks
Attacks targeting multimodal models across vision, audio, and video.
| Transform | Description |
|---|---|
pictorial_code_injection | Embed code in images for vision models |
ood_mixup | Out-of-distribution mixup perturbation |
clip_guided_adversarial | CLIP-guided adversarial image generation |
vision_encoder_attack | Attack vision encoder representations |
cross_modal_steganography | Hide payloads across modalities |
physical_road_sign_injection | Physical-world adversarial road signs |
whisper_muting | Mute or corrupt Whisper transcription |
whisper_mode_switch | Force Whisper mode switching |
audio_multilingual_jailbreak | Multilingual audio jailbreak |
joint_audio_text_attack | Joint audio-text adversarial attack |
over_the_air_injection | Over-the-air audio injection |
voice_agent_vishing | Voice agent phishing (vishing) |
video_dos | Video processing denial of service |
cross_modal_video_transfer | Cross-modal transfer via video |
See Transforms for how to apply transforms with any attack.