- raw: youtube/2026-07-02_ct4004-anthropic-ceo-panik-open-weights-poisonai.md - wiki NEW: concepts/llm/poisonai-knowledge-poisoning.md - wiki UPDATE: people/dario-amodei.md (Open Weights Debate) - wiki UPDATE: institutions/anthropic.md - wiki UPDATE: concepts/llm/glm-5.2-zai-coding-model.md (c't-Referenz) - wiki UPDATE: concepts/llm/chinese-model-cost-routing.md (c't-Validation) - wiki UPDATE: index.md, log.md
6.3 KiB
| created | updated | sources | tags | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-07-02 | 2026-07-02 |
|
|
PoisonAI — Knowledge Poisoning als Angriffsvektor auf LLMs
r/PoisonAI zielt darauf ab, LLMs systematisch mit Falschinformationen zu füttern. LLM-Antworten dürfen nicht wie Suchmaschinen-Fakten behandelt werden. — c't 4004 #30, 2026-07-02
Kernkonzept
Knowledge Poisoning (Wissensvergiftung) ist der gezielte Versuch, das Trainingsdaten-Korpus von LLMs mit Falschinformationen zu kontaminieren, sodass das Modell diese als "Wissen" reproduziert. Der Subreddit r/PoisonAI ist eine organisierte Community, die diese Praxis kultiviert und systematisiert.
Funktionsweise
| Stufe | Mechanismus | Beispiel |
|---|---|---|
| 1. Injection | Falschinformationen in frei zugängliche Quellen einstreuen (Wikipedia, Foren, Social Media) | Erfundener Tollwut-Tod von Donald Trump |
| 2. Ingestion | Crawler und Scraping-Systeme nehmen die Falschinfo in Trainingsdaten auf | Auto-collected web corpus |
| 3. Reproduction | LLM reproduziert die Falschinfo als faktische Antwort | "Donald Trump starb an Tollwut" |
| 4. Amplification | Nutzer trusten LLM-Antwort → verbreiten sie weiter → Verstärkungseffekt | Social sharing, Blog-Posts |
Warum es funktioniert
LLMs sind stochastische Systeme, keine Faktdatenbanken. Sie lernen statistische Wortassoziationen aus riesigen Korpora. Wenn eine Falschinformation häufig genug im Trainingsdaten vorkommt, wird sie mit hoher Wahrscheinlichkeit reproduziert — unabhängig von ihrer Wahrheit. Das Modell hat keinen intrinsischen Wahrheits-Check.
Das Grundvertrauensproblem
Die c't-Hosts (Jan-Keno Janssen, Christian Lutz-Weicken) betonen: LLM-Antworten dürfen nicht wie Suchmaschinen-Fakten behandelt werden. Die Vorstellung, KI-Modelle als Wissensquellen zu trusten, ist fundamental gefährlich, weil:
- Keine Quellen-Transparenz: LLMs geben keine verifizierbaren Quellen an (im Gegensatz zu Suchmaschinen)
- Keine Wahrheits-Garantie: Das Modell "weiß" nicht, was wahr ist — es predicted nur das statistisch wahrscheinlichste nächste Token
- Anfällig für Manipulation: Gezielte Poisoning-Kampagnen können das Modell verfälschen
- Schwierige Detektion: Vergiftete Antworten sehen faktisch aus und sind schwer als falsch zu erkennen
Open Weights vs. Closed Models: Unterschiedliche Vulnerabilitäten
| Dimension | Open-Weight-Modelle | Closed-Cloud-Modelle |
|---|---|---|
| Trainingsdaten-Transparenz | Teilweise (Data cards, HF-Datasets) | Opaq (keine Einblick) |
| Poisoning-Angriffsfläche | Größer — offene Pipeline, Community-Contributions | Kleiner — zentrale Datenselektion |
| Detektion von Poisoning | Forschung-Community kann inspizieren | Nur das Unternehmen selbst |
| Reparatur-Möglichkeit | Community kann retrainen/fine-tunen | Abhängig vom Provider |
| Vertrauensmodell | "Trust but verify" — viele Augen | "Trust the provider" — Black Box |
Das Paradox
Dario Amodei argumentiert, Open Weights seien gefährlich weil Menschen Weights nicht "lesen" können. Die c't-Hosts kontern: Closed-Cloud-Modelle sind noch weniger nachvollziehbar — bei Open Weights kann zumindest die Forschungs-Community inspizieren, was im Modell passiert. PoisonAI zeigt, dass die Schwachstelle nicht im Deployment-Modell liegt, sondern in der Trainingsdaten-Supply-Chain — und dort haben Open-Weight-Modelle durch Community-Oversight einen Vorteil.
Verbindung zu bestehenden Wiki-Konzepten
LLM Sycophancy & Confabulation
PoisonAI ist verwandt mit llm-sycophancy-confabulation.md, aber unterschiedlich:
| Konzept | Mechanismus | Intention |
|---|---|---|
| Sycophancy | Modell passt Antwort an Nutzer-Erwartung an | Unbewusst (Training-Artefakt) |
| Confabulation | Modell erfindet plausible Antwort bei Wissenslücke | Unbewusst (kein Wahrheits-Check) |
| Knowledge Poisoning | Externe Akteure injizieren Falschinfo in Trainingsdaten | Bewusst, gezielt |
Sycophancy und Confabulation sind Modell-Eigenschaften. Poisoning ist ein Angriff auf die Supply-Chain.
LLM Behavior Persistence
Knowledge Poisoning ist eng verwandt mit llm-behavior-persistence.md — einmal im Training verankerte Falschinfo persistiert wie eine Backdoor und ist durch Unlearning schwer zu entfernen.
AI Regulation
PoisonAI zeigt, dass regulatorische Fokussierung auf Modell-Zugriff (wie Anthropic's Exportkontrollen) die falsche Ebene erwischt. Die Schwachstelle ist nicht das Deployment, sondern die Trainingsdaten-Integrität — siehe ../policy/ai-regulation-2026.md.
Implikationen
- Für LLM-Nutzer: Niemals LLM-Antworten als alleinige Faktenquelle trusten — immer sekundär verifizieren
- Für Open-Weight-Entwickler: Trainingsdaten-Provenance dokumentieren, Data cards pflegen, Community-Audits ermöglichen
- Für Regulatoren: Data-Integrität statt Modell-Zugriff regulieren — die Schwachstelle ist upstream
- Für die RamaDama-Wissensbasis: Raw-Dateien sind die "Trainingsdaten" des Wiki — Provenance und Quellen-Qualität sind kritisch
Cross-References
- llm-sycophancy-confabulation.md — Modell-Eigenschaften die Vertrauen untergraben (unbewusst)
- llm-behavior-persistence.md — Persistenz von einmal gelernten Verhaltensmustern
- ../policy/ai-regulation-2026.md — Regulation-Debatte (Amodei's Fokus auf Modell-Zugriff vs. Data-Integrität)
- ../../people/dario-amodei.md — Amodei's Anti-Open-Weights-Position
- ../../people/dario-amodei.md — Amodei-Personenseite
- glm-5.2-zai-coding-model.md — GLM 5.2 als Beispiel für Open-Weight-Modelle
- chinese-model-cost-routing.md — Chinesische Modelle als Treiber der Open-Weights-Bewegung
- reds-resilient-decentralized-swarm.md — ReDS als Gegenmodell zu Zentralisierung
Quellen
- YouTube: "Anthropic-CEO in Panik | c't 4004 #30" — c't 3003, 2026-07-02, Kapitel 1:02:20 "Trump an Tollwut? r/PoisonAI"
- r/PoisonAI — Subreddit (Referenz aus dem Video)