3 min read461 wordsv1.0.2.0Last Updated: 1 Aug 2026
Data Poisoning
MITRE ATLAS: T0012.002 — Poison Training Data OWASP LLM Top 10: LLM03 — Training Data Poisoning NIST AI 600-1: §2.3 (Dangerous Content), §2.4 (Data Privacy) EU AI Act: Art. 10 (Data governance), Art. 15 (Robustness)
Taxonomy
Type
Goal
Mechanism
Detectability
Availability / Indiscriminate
Degrade overall model performance
Inject mislabelled / noisy samples across classes
Moderate — elevated loss on clean validation
Targeted / Clean-label
Cause specific misclassification on chosen inputs
Craft poison samples that look correct but shift decision boundary
Hard — labels appear correct
Backdoor / Trigger-based
Cause misclassification only when trigger present
Embed trigger pattern (pixel patch, token sequence) in poison samples; model learns trigger→target mapping
Hard — normal accuracy preserved
Fine-tuning / RLHF Poisoning
Align model to attacker preferences
Poison preference data or reward model training set