knowledge-base/wiki/concepts/llm/poisonai-knowledge-poisoning.md
Hector ae5f32abc1 ingest(youtube): c't 4004 #30 — Open Weights, Chinese Models, PoisonAI
- raw: youtube/2026-07-02_ct4004-anthropic-ceo-panik-open-weights-poisonai.md
- wiki NEW: concepts/llm/poisonai-knowledge-poisoning.md
- wiki UPDATE: people/dario-amodei.md (Open Weights Debate)
- wiki UPDATE: institutions/anthropic.md
- wiki UPDATE: concepts/llm/glm-5.2-zai-coding-model.md (c't-Referenz)
- wiki UPDATE: concepts/llm/chinese-model-cost-routing.md (c't-Validation)
- wiki UPDATE: index.md, log.md
2026-07-02 10:06:54 +02:00

6.3 KiB

created updated sources tags
2026-07-02 2026-07-02
youtube/2026-07-02_ct4004-anthropic-ceo-panik-open-weights-poisonai.md
concept
llm-safety
knowledge-poisoning
poisonai
data-integrity
misinformation
training-data
open-weights

PoisonAI — Knowledge Poisoning als Angriffsvektor auf LLMs

r/PoisonAI zielt darauf ab, LLMs systematisch mit Falschinformationen zu füttern. LLM-Antworten dürfen nicht wie Suchmaschinen-Fakten behandelt werden. — c't 4004 #30, 2026-07-02

Kernkonzept

Knowledge Poisoning (Wissensvergiftung) ist der gezielte Versuch, das Trainingsdaten-Korpus von LLMs mit Falschinformationen zu kontaminieren, sodass das Modell diese als "Wissen" reproduziert. Der Subreddit r/PoisonAI ist eine organisierte Community, die diese Praxis kultiviert und systematisiert.

Funktionsweise

Stufe Mechanismus Beispiel
1. Injection Falschinformationen in frei zugängliche Quellen einstreuen (Wikipedia, Foren, Social Media) Erfundener Tollwut-Tod von Donald Trump
2. Ingestion Crawler und Scraping-Systeme nehmen die Falschinfo in Trainingsdaten auf Auto-collected web corpus
3. Reproduction LLM reproduziert die Falschinfo als faktische Antwort "Donald Trump starb an Tollwut"
4. Amplification Nutzer trusten LLM-Antwort → verbreiten sie weiter → Verstärkungseffekt Social sharing, Blog-Posts

Warum es funktioniert

LLMs sind stochastische Systeme, keine Faktdatenbanken. Sie lernen statistische Wortassoziationen aus riesigen Korpora. Wenn eine Falschinformation häufig genug im Trainingsdaten vorkommt, wird sie mit hoher Wahrscheinlichkeit reproduziert — unabhängig von ihrer Wahrheit. Das Modell hat keinen intrinsischen Wahrheits-Check.

Das Grundvertrauensproblem

Die c't-Hosts (Jan-Keno Janssen, Christian Lutz-Weicken) betonen: LLM-Antworten dürfen nicht wie Suchmaschinen-Fakten behandelt werden. Die Vorstellung, KI-Modelle als Wissensquellen zu trusten, ist fundamental gefährlich, weil:

  1. Keine Quellen-Transparenz: LLMs geben keine verifizierbaren Quellen an (im Gegensatz zu Suchmaschinen)
  2. Keine Wahrheits-Garantie: Das Modell "weiß" nicht, was wahr ist — es predicted nur das statistisch wahrscheinlichste nächste Token
  3. Anfällig für Manipulation: Gezielte Poisoning-Kampagnen können das Modell verfälschen
  4. Schwierige Detektion: Vergiftete Antworten sehen faktisch aus und sind schwer als falsch zu erkennen

Open Weights vs. Closed Models: Unterschiedliche Vulnerabilitäten

Dimension Open-Weight-Modelle Closed-Cloud-Modelle
Trainingsdaten-Transparenz Teilweise (Data cards, HF-Datasets) Opaq (keine Einblick)
Poisoning-Angriffsfläche Größer — offene Pipeline, Community-Contributions Kleiner — zentrale Datenselektion
Detektion von Poisoning Forschung-Community kann inspizieren Nur das Unternehmen selbst
Reparatur-Möglichkeit Community kann retrainen/fine-tunen Abhängig vom Provider
Vertrauensmodell "Trust but verify" — viele Augen "Trust the provider" — Black Box

Das Paradox

Dario Amodei argumentiert, Open Weights seien gefährlich weil Menschen Weights nicht "lesen" können. Die c't-Hosts kontern: Closed-Cloud-Modelle sind noch weniger nachvollziehbar — bei Open Weights kann zumindest die Forschungs-Community inspizieren, was im Modell passiert. PoisonAI zeigt, dass die Schwachstelle nicht im Deployment-Modell liegt, sondern in der Trainingsdaten-Supply-Chain — und dort haben Open-Weight-Modelle durch Community-Oversight einen Vorteil.

Verbindung zu bestehenden Wiki-Konzepten

LLM Sycophancy & Confabulation

PoisonAI ist verwandt mit llm-sycophancy-confabulation.md, aber unterschiedlich:

Konzept Mechanismus Intention
Sycophancy Modell passt Antwort an Nutzer-Erwartung an Unbewusst (Training-Artefakt)
Confabulation Modell erfindet plausible Antwort bei Wissenslücke Unbewusst (kein Wahrheits-Check)
Knowledge Poisoning Externe Akteure injizieren Falschinfo in Trainingsdaten Bewusst, gezielt

Sycophancy und Confabulation sind Modell-Eigenschaften. Poisoning ist ein Angriff auf die Supply-Chain.

LLM Behavior Persistence

Knowledge Poisoning ist eng verwandt mit llm-behavior-persistence.md — einmal im Training verankerte Falschinfo persistiert wie eine Backdoor und ist durch Unlearning schwer zu entfernen.

AI Regulation

PoisonAI zeigt, dass regulatorische Fokussierung auf Modell-Zugriff (wie Anthropic's Exportkontrollen) die falsche Ebene erwischt. Die Schwachstelle ist nicht das Deployment, sondern die Trainingsdaten-Integrität — siehe ../policy/ai-regulation-2026.md.

Implikationen

  1. Für LLM-Nutzer: Niemals LLM-Antworten als alleinige Faktenquelle trusten — immer sekundär verifizieren
  2. Für Open-Weight-Entwickler: Trainingsdaten-Provenance dokumentieren, Data cards pflegen, Community-Audits ermöglichen
  3. Für Regulatoren: Data-Integrität statt Modell-Zugriff regulieren — die Schwachstelle ist upstream
  4. Für die RamaDama-Wissensbasis: Raw-Dateien sind die "Trainingsdaten" des Wiki — Provenance und Quellen-Qualität sind kritisch

Cross-References

Quellen