Skip to content

Multimodal attacks

Adversarial transforms targeting multimodal models across vision, audio, and video.

Module: dreadnode.transforms.multimodal_attacks

Attacks targeting multimodal models across vision, audio, and video.

TransformDescription
pictorial_code_injectionEmbed code in images for vision models
ood_mixupOut-of-distribution mixup perturbation
clip_guided_adversarialCLIP-guided adversarial image generation
vision_encoder_attackAttack vision encoder representations
cross_modal_steganographyHide payloads across modalities
physical_road_sign_injectionPhysical-world adversarial road signs
whisper_mutingMute or corrupt Whisper transcription
whisper_mode_switchForce Whisper mode switching
audio_multilingual_jailbreakMultilingual audio jailbreak
joint_audio_text_attackJoint audio-text adversarial attack
over_the_air_injectionOver-the-air audio injection
voice_agent_vishingVoice agent phishing (vishing)
video_dosVideo processing denial of service
cross_modal_video_transferCross-modal transfer via video

See Transforms for how to apply transforms with any attack.