--- created: 2026-07-02 updated: 2026-07-02 sources: [youtube/2026-07-02_ct4004-anthropic-ceo-panik-open-weights-poisonai.md] tags: [concept, llm-safety, knowledge-poisoning, poisonai, data-integrity, misinformation, training-data, open-weights] --- # PoisonAI — Knowledge Poisoning als Angriffsvektor auf LLMs > *r/PoisonAI zielt darauf ab, LLMs systematisch mit Falschinformationen zu füttern. LLM-Antworten dürfen nicht wie Suchmaschinen-Fakten behandelt werden.* > — c't 4004 #30, 2026-07-02 ## Kernkonzept **Knowledge Poisoning** (Wissensvergiftung) ist der gezielte Versuch, das Trainingsdaten-Korpus von LLMs mit Falschinformationen zu kontaminieren, sodass das Modell diese als "Wissen" reproduziert. Der Subreddit **r/PoisonAI** ist eine organisierte Community, die diese Praxis kultiviert und systematisiert. ### Funktionsweise | Stufe | Mechanismus | Beispiel | |-------|-----------|----------| | **1. Injection** | Falschinformationen in frei zugängliche Quellen einstreuen (Wikipedia, Foren, Social Media) | Erfundener Tollwut-Tod von Donald Trump | | **2. Ingestion** | Crawler und Scraping-Systeme nehmen die Falschinfo in Trainingsdaten auf | Auto-collected web corpus | | **3. Reproduction** | LLM reproduziert die Falschinfo als faktische Antwort | "Donald Trump starb an Tollwut" | | **4. Amplification** | Nutzer trusten LLM-Antwort → verbreiten sie weiter → Verstärkungseffekt | Social sharing, Blog-Posts | ### Warum es funktioniert LLMs sind **stochastische Systeme**, keine Faktdatenbanken. Sie lernen statistische Wortassoziationen aus riesigen Korpora. Wenn eine Falschinformation häufig genug im Trainingsdaten vorkommt, wird sie mit hoher Wahrscheinlichkeit reproduziert — unabhängig von ihrer Wahrheit. Das Modell hat keinen intrinsischen Wahrheits-Check. ## Das Grundvertrauensproblem Die c't-Hosts (Jan-Keno Janssen, Christian Lutz-Weicken) betonen: **LLM-Antworten dürfen nicht wie Suchmaschinen-Fakten behandelt werden.** Die Vorstellung, KI-Modelle als Wissensquellen zu trusten, ist fundamental gefährlich, weil: 1. **Keine Quellen-Transparenz:** LLMs geben keine verifizierbaren Quellen an (im Gegensatz zu Suchmaschinen) 2. **Keine Wahrheits-Garantie:** Das Modell "weiß" nicht, was wahr ist — es predicted nur das statistisch wahrscheinlichste nächste Token 3. **Anfällig für Manipulation:** Gezielte Poisoning-Kampagnen können das Modell verfälschen 4. **Schwierige Detektion:** Vergiftete Antworten sehen faktisch aus und sind schwer als falsch zu erkennen ## Open Weights vs. Closed Models: Unterschiedliche Vulnerabilitäten | Dimension | Open-Weight-Modelle | Closed-Cloud-Modelle | |-----------|--------------------|--------------------| | **Trainingsdaten-Transparenz** | Teilweise (Data cards, HF-Datasets) | Opaq (keine Einblick) | | **Poisoning-Angriffsfläche** | Größer — offene Pipeline, Community-Contributions | Kleiner — zentrale Datenselektion | | **Detektion von Poisoning** | Forschung-Community kann inspizieren | Nur das Unternehmen selbst | | **Reparatur-Möglichkeit** | Community kann retrainen/fine-tunen | Abhängig vom Provider | | **Vertrauensmodell** | "Trust but verify" — viele Augen | "Trust the provider" — Black Box | ### Das Paradox Dario Amodei argumentiert, Open Weights seien gefährlich weil Menschen Weights nicht "lesen" können. Die c't-Hosts kontern: **Closed-Cloud-Modelle sind noch weniger nachvollziehbar** — bei Open Weights kann zumindest die Forschungs-Community inspizieren, was im Modell passiert. PoisonAI zeigt, dass die Schwachstelle nicht im Deployment-Modell liegt, sondern in der Trainingsdaten-Supply-Chain — und dort haben Open-Weight-Modelle durch Community-Oversight einen Vorteil. ## Verbindung zu bestehenden Wiki-Konzepten ### LLM Sycophancy & Confabulation PoisonAI ist verwandt mit [[llm-sycophancy-confabulation.md]], aber unterschiedlich: | Konzept | Mechanismus | Intention | |---------|-----------|----------| | **Sycophancy** | Modell passt Antwort an Nutzer-Erwartung an | Unbewusst (Training-Artefakt) | | **Confabulation** | Modell erfindet plausible Antwort bei Wissenslücke | Unbewusst (kein Wahrheits-Check) | | **Knowledge Poisoning** | Externe Akteure injizieren Falschinfo in Trainingsdaten | **Bewusst, gezielt** | Sycophancy und Confabulation sind Modell-Eigenschaften. Poisoning ist ein **Angriff auf die Supply-Chain**. ### LLM Behavior Persistence Knowledge Poisoning ist eng verwandt mit [[llm-behavior-persistence.md]] — einmal im Training verankerte Falschinfo persistiert wie eine Backdoor und ist durch Unlearning schwer zu entfernen. ### AI Regulation PoisonAI zeigt, dass regulatorische Fokussierung auf Modell-Zugriff (wie Anthropic's Exportkontrollen) die falsche Ebene erwischt. Die Schwachstelle ist nicht das Deployment, sondern die **Trainingsdaten-Integrität** — siehe [[../policy/ai-regulation-2026.md]]. ## Implikationen 1. **Für LLM-Nutzer:** Niemals LLM-Antworten als alleinige Faktenquelle trusten — immer sekundär verifizieren 2. **Für Open-Weight-Entwickler:** Trainingsdaten-Provenance dokumentieren, Data cards pflegen, Community-Audits ermöglichen 3. **Für Regulatoren:** Data-Integrität statt Modell-Zugriff regulieren — die Schwachstelle ist upstream 4. **Für die RamaDama-Wissensbasis:** Raw-Dateien sind die "Trainingsdaten" des Wiki — Provenance und Quellen-Qualität sind kritisch ## Cross-References - [[llm-sycophancy-confabulation.md]] — Modell-Eigenschaften die Vertrauen untergraben (unbewusst) - [[llm-behavior-persistence.md]] — Persistenz von einmal gelernten Verhaltensmustern - [[../policy/ai-regulation-2026.md]] — Regulation-Debatte (Amodei's Fokus auf Modell-Zugriff vs. Data-Integrität) - [[../../people/dario-amodei.md]] — Amodei's Anti-Open-Weights-Position - [[../../people/dario-amodei.md]] — Amodei-Personenseite - [[glm-5.2-zai-coding-model.md]] — GLM 5.2 als Beispiel für Open-Weight-Modelle - [[chinese-model-cost-routing.md]] — Chinesische Modelle als Treiber der Open-Weights-Bewegung - [[reds-resilient-decentralized-swarm.md]] — ReDS als Gegenmodell zu Zentralisierung ## Quellen - [YouTube: "Anthropic-CEO in Panik | c't 4004 #30"](https://www.youtube.com/watch?v=Q6QkzJwcrEc) — c't 3003, 2026-07-02, Kapitel 1:02:20 "Trump an Tollwut? r/PoisonAI" - [r/PoisonAI](https://www.reddit.com/r/PoisonAI/) — Subreddit (Referenz aus dem Video)