Perturbation
Character-level and token-level noise transforms that test the robustness of text classifiers and safety filters.
Module: dreadnode.transforms.perturbation
Character-level and token-level noise that tests robustness of text classifiers and safety filters.
| Transform | Description |
|---|---|
random_capitalization | Randomize letter casing |
insert_punctuation | Insert random punctuation |
diacritic | Add diacritical marks to characters |
underline | Add Unicode underline combining marks |
character_space | Insert spaces between characters |
zero_width | Insert zero-width characters |
zalgo | Apply Zalgo text (stacked combining marks) |
unicode_confusable | Replace with Unicode confusables |
unicode_substitution | Substitute with visually similar Unicode |
repeat_token | Repeat tokens to confuse tokenizers |
emoji_substitution | Replace words with emoji equivalents |
token_smuggling | Split tokens across boundaries |
semantic_preserving_perturbation | Meaning-preserving noise |
instruction_hierarchy_confusion | Confuse instruction priority parsing |
context_overflow | Overflow context window |
gradient_based_perturbation | Gradient-inspired token perturbation |
multilingual_mixing | Mix multiple languages |
cognitive_hacking | Exploit cognitive biases in processing |
payload_splitting | Split payload across inputs |
attention_diversion | Divert model attention |
style_injection | Inject style directives |
implicit_continuation | Exploit continuation behavior |
authority_exploitation | Exploit authority patterns |
linguistic_camouflage | Linguistically camouflage intent |
temporal_misdirection | Use temporal framing to misdirect |
complexity_amplification | Amplify prompt complexity |
error_injection | Inject deliberate errors |
encoding_nesting | Nest multiple encodings |
token_boundary_manipulation | Manipulate tokenizer boundaries |
meta_instruction_injection | Inject meta-level instructions |
sentiment_inversion | Invert sentiment cues |
simulate_typos | Add realistic typographical errors |
See Transforms for how to apply transforms with any attack.