knowledge-base/wiki/concepts/llm/poisonai-knowledge-poisoning.md

96 lines
6.3 KiB
Markdown
Raw Permalink Normal View History

---
created: 2026-07-02
updated: 2026-07-02
sources: [youtube/2026-07-02_ct4004-anthropic-ceo-panik-open-weights-poisonai.md]
tags: [concept, llm-safety, knowledge-poisoning, poisonai, data-integrity, misinformation, training-data, open-weights]
---
# PoisonAI — Knowledge Poisoning als Angriffsvektor auf LLMs
> *r/PoisonAI zielt darauf ab, LLMs systematisch mit Falschinformationen zu füttern. LLM-Antworten dürfen nicht wie Suchmaschinen-Fakten behandelt werden.*
> — c't 4004 #30, 2026-07-02
## Kernkonzept
**Knowledge Poisoning** (Wissensvergiftung) ist der gezielte Versuch, das Trainingsdaten-Korpus von LLMs mit Falschinformationen zu kontaminieren, sodass das Modell diese als "Wissen" reproduziert. Der Subreddit **r/PoisonAI** ist eine organisierte Community, die diese Praxis kultiviert und systematisiert.
### Funktionsweise
| Stufe | Mechanismus | Beispiel |
|-------|-----------|----------|
| **1. Injection** | Falschinformationen in frei zugängliche Quellen einstreuen (Wikipedia, Foren, Social Media) | Erfundener Tollwut-Tod von Donald Trump |
| **2. Ingestion** | Crawler und Scraping-Systeme nehmen die Falschinfo in Trainingsdaten auf | Auto-collected web corpus |
| **3. Reproduction** | LLM reproduziert die Falschinfo als faktische Antwort | "Donald Trump starb an Tollwut" |
| **4. Amplification** | Nutzer trusten LLM-Antwort → verbreiten sie weiter → Verstärkungseffekt | Social sharing, Blog-Posts |
### Warum es funktioniert
LLMs sind **stochastische Systeme**, keine Faktdatenbanken. Sie lernen statistische Wortassoziationen aus riesigen Korpora. Wenn eine Falschinformation häufig genug im Trainingsdaten vorkommt, wird sie mit hoher Wahrscheinlichkeit reproduziert — unabhängig von ihrer Wahrheit. Das Modell hat keinen intrinsischen Wahrheits-Check.
## Das Grundvertrauensproblem
Die c't-Hosts (Jan-Keno Janssen, Christian Lutz-Weicken) betonen: **LLM-Antworten dürfen nicht wie Suchmaschinen-Fakten behandelt werden.** Die Vorstellung, KI-Modelle als Wissensquellen zu trusten, ist fundamental gefährlich, weil:
1. **Keine Quellen-Transparenz:** LLMs geben keine verifizierbaren Quellen an (im Gegensatz zu Suchmaschinen)
2. **Keine Wahrheits-Garantie:** Das Modell "weiß" nicht, was wahr ist — es predicted nur das statistisch wahrscheinlichste nächste Token
3. **Anfällig für Manipulation:** Gezielte Poisoning-Kampagnen können das Modell verfälschen
4. **Schwierige Detektion:** Vergiftete Antworten sehen faktisch aus und sind schwer als falsch zu erkennen
## Open Weights vs. Closed Models: Unterschiedliche Vulnerabilitäten
| Dimension | Open-Weight-Modelle | Closed-Cloud-Modelle |
|-----------|--------------------|--------------------|
| **Trainingsdaten-Transparenz** | Teilweise (Data cards, HF-Datasets) | Opaq (keine Einblick) |
| **Poisoning-Angriffsfläche** | Größer — offene Pipeline, Community-Contributions | Kleiner — zentrale Datenselektion |
| **Detektion von Poisoning** | Forschung-Community kann inspizieren | Nur das Unternehmen selbst |
| **Reparatur-Möglichkeit** | Community kann retrainen/fine-tunen | Abhängig vom Provider |
| **Vertrauensmodell** | "Trust but verify" — viele Augen | "Trust the provider" — Black Box |
### Das Paradox
Dario Amodei argumentiert, Open Weights seien gefährlich weil Menschen Weights nicht "lesen" können. Die c't-Hosts kontern: **Closed-Cloud-Modelle sind noch weniger nachvollziehbar** — bei Open Weights kann zumindest die Forschungs-Community inspizieren, was im Modell passiert. PoisonAI zeigt, dass die Schwachstelle nicht im Deployment-Modell liegt, sondern in der Trainingsdaten-Supply-Chain — und dort haben Open-Weight-Modelle durch Community-Oversight einen Vorteil.
## Verbindung zu bestehenden Wiki-Konzepten
### LLM Sycophancy & Confabulation
PoisonAI ist verwandt mit [[llm-sycophancy-confabulation.md]], aber unterschiedlich:
| Konzept | Mechanismus | Intention |
|---------|-----------|----------|
| **Sycophancy** | Modell passt Antwort an Nutzer-Erwartung an | Unbewusst (Training-Artefakt) |
| **Confabulation** | Modell erfindet plausible Antwort bei Wissenslücke | Unbewusst (kein Wahrheits-Check) |
| **Knowledge Poisoning** | Externe Akteure injizieren Falschinfo in Trainingsdaten | **Bewusst, gezielt** |
Sycophancy und Confabulation sind Modell-Eigenschaften. Poisoning ist ein **Angriff auf die Supply-Chain**.
### LLM Behavior Persistence
Knowledge Poisoning ist eng verwandt mit [[llm-behavior-persistence.md]] — einmal im Training verankerte Falschinfo persistiert wie eine Backdoor und ist durch Unlearning schwer zu entfernen.
### AI Regulation
PoisonAI zeigt, dass regulatorische Fokussierung auf Modell-Zugriff (wie Anthropic's Exportkontrollen) die falsche Ebene erwischt. Die Schwachstelle ist nicht das Deployment, sondern die **Trainingsdaten-Integrität** — siehe [[../policy/ai-regulation-2026.md]].
## Implikationen
1. **Für LLM-Nutzer:** Niemals LLM-Antworten als alleinige Faktenquelle trusten — immer sekundär verifizieren
2. **Für Open-Weight-Entwickler:** Trainingsdaten-Provenance dokumentieren, Data cards pflegen, Community-Audits ermöglichen
3. **Für Regulatoren:** Data-Integrität statt Modell-Zugriff regulieren — die Schwachstelle ist upstream
4. **Für die RamaDama-Wissensbasis:** Raw-Dateien sind die "Trainingsdaten" des Wiki — Provenance und Quellen-Qualität sind kritisch
## Cross-References
- [[llm-sycophancy-confabulation.md]] — Modell-Eigenschaften die Vertrauen untergraben (unbewusst)
- [[llm-behavior-persistence.md]] — Persistenz von einmal gelernten Verhaltensmustern
- [[../policy/ai-regulation-2026.md]] — Regulation-Debatte (Amodei's Fokus auf Modell-Zugriff vs. Data-Integrität)
- [[../../people/dario-amodei.md]] — Amodei's Anti-Open-Weights-Position
- [[../../people/dario-amodei.md]] — Amodei-Personenseite
- [[glm-5.2-zai-coding-model.md]] — GLM 5.2 als Beispiel für Open-Weight-Modelle
- [[chinese-model-cost-routing.md]] — Chinesische Modelle als Treiber der Open-Weights-Bewegung
- [[reds-resilient-decentralized-swarm.md]] — ReDS als Gegenmodell zu Zentralisierung
## Quellen
- [YouTube: "Anthropic-CEO in Panik | c't 4004 #30"](https://www.youtube.com/watch?v=Q6QkzJwcrEc) — c't 3003, 2026-07-02, Kapitel 1:02:20 "Trump an Tollwut? r/PoisonAI"
- [r/PoisonAI](https://www.reddit.com/r/PoisonAI/) — Subreddit (Referenz aus dem Video)