- raw: youtube/2026-07-02_ct4004-anthropic-ceo-panik-open-weights-poisonai.md - wiki NEW: concepts/llm/poisonai-knowledge-poisoning.md - wiki UPDATE: people/dario-amodei.md (Open Weights Debate) - wiki UPDATE: institutions/anthropic.md - wiki UPDATE: concepts/llm/glm-5.2-zai-coding-model.md (c't-Referenz) - wiki UPDATE: concepts/llm/chinese-model-cost-routing.md (c't-Validation) - wiki UPDATE: index.md, log.md
96 lines
No EOL
6.3 KiB
Markdown
96 lines
No EOL
6.3 KiB
Markdown
---
|
|
created: 2026-07-02
|
|
updated: 2026-07-02
|
|
sources: [youtube/2026-07-02_ct4004-anthropic-ceo-panik-open-weights-poisonai.md]
|
|
tags: [concept, llm-safety, knowledge-poisoning, poisonai, data-integrity, misinformation, training-data, open-weights]
|
|
---
|
|
|
|
# PoisonAI — Knowledge Poisoning als Angriffsvektor auf LLMs
|
|
|
|
> *r/PoisonAI zielt darauf ab, LLMs systematisch mit Falschinformationen zu füttern. LLM-Antworten dürfen nicht wie Suchmaschinen-Fakten behandelt werden.*
|
|
> — c't 4004 #30, 2026-07-02
|
|
|
|
## Kernkonzept
|
|
|
|
**Knowledge Poisoning** (Wissensvergiftung) ist der gezielte Versuch, das Trainingsdaten-Korpus von LLMs mit Falschinformationen zu kontaminieren, sodass das Modell diese als "Wissen" reproduziert. Der Subreddit **r/PoisonAI** ist eine organisierte Community, die diese Praxis kultiviert und systematisiert.
|
|
|
|
### Funktionsweise
|
|
|
|
| Stufe | Mechanismus | Beispiel |
|
|
|-------|-----------|----------|
|
|
| **1. Injection** | Falschinformationen in frei zugängliche Quellen einstreuen (Wikipedia, Foren, Social Media) | Erfundener Tollwut-Tod von Donald Trump |
|
|
| **2. Ingestion** | Crawler und Scraping-Systeme nehmen die Falschinfo in Trainingsdaten auf | Auto-collected web corpus |
|
|
| **3. Reproduction** | LLM reproduziert die Falschinfo als faktische Antwort | "Donald Trump starb an Tollwut" |
|
|
| **4. Amplification** | Nutzer trusten LLM-Antwort → verbreiten sie weiter → Verstärkungseffekt | Social sharing, Blog-Posts |
|
|
|
|
### Warum es funktioniert
|
|
|
|
LLMs sind **stochastische Systeme**, keine Faktdatenbanken. Sie lernen statistische Wortassoziationen aus riesigen Korpora. Wenn eine Falschinformation häufig genug im Trainingsdaten vorkommt, wird sie mit hoher Wahrscheinlichkeit reproduziert — unabhängig von ihrer Wahrheit. Das Modell hat keinen intrinsischen Wahrheits-Check.
|
|
|
|
## Das Grundvertrauensproblem
|
|
|
|
Die c't-Hosts (Jan-Keno Janssen, Christian Lutz-Weicken) betonen: **LLM-Antworten dürfen nicht wie Suchmaschinen-Fakten behandelt werden.** Die Vorstellung, KI-Modelle als Wissensquellen zu trusten, ist fundamental gefährlich, weil:
|
|
|
|
1. **Keine Quellen-Transparenz:** LLMs geben keine verifizierbaren Quellen an (im Gegensatz zu Suchmaschinen)
|
|
2. **Keine Wahrheits-Garantie:** Das Modell "weiß" nicht, was wahr ist — es predicted nur das statistisch wahrscheinlichste nächste Token
|
|
3. **Anfällig für Manipulation:** Gezielte Poisoning-Kampagnen können das Modell verfälschen
|
|
4. **Schwierige Detektion:** Vergiftete Antworten sehen faktisch aus und sind schwer als falsch zu erkennen
|
|
|
|
## Open Weights vs. Closed Models: Unterschiedliche Vulnerabilitäten
|
|
|
|
| Dimension | Open-Weight-Modelle | Closed-Cloud-Modelle |
|
|
|-----------|--------------------|--------------------|
|
|
| **Trainingsdaten-Transparenz** | Teilweise (Data cards, HF-Datasets) | Opaq (keine Einblick) |
|
|
| **Poisoning-Angriffsfläche** | Größer — offene Pipeline, Community-Contributions | Kleiner — zentrale Datenselektion |
|
|
| **Detektion von Poisoning** | Forschung-Community kann inspizieren | Nur das Unternehmen selbst |
|
|
| **Reparatur-Möglichkeit** | Community kann retrainen/fine-tunen | Abhängig vom Provider |
|
|
| **Vertrauensmodell** | "Trust but verify" — viele Augen | "Trust the provider" — Black Box |
|
|
|
|
### Das Paradox
|
|
|
|
Dario Amodei argumentiert, Open Weights seien gefährlich weil Menschen Weights nicht "lesen" können. Die c't-Hosts kontern: **Closed-Cloud-Modelle sind noch weniger nachvollziehbar** — bei Open Weights kann zumindest die Forschungs-Community inspizieren, was im Modell passiert. PoisonAI zeigt, dass die Schwachstelle nicht im Deployment-Modell liegt, sondern in der Trainingsdaten-Supply-Chain — und dort haben Open-Weight-Modelle durch Community-Oversight einen Vorteil.
|
|
|
|
## Verbindung zu bestehenden Wiki-Konzepten
|
|
|
|
### LLM Sycophancy & Confabulation
|
|
|
|
PoisonAI ist verwandt mit [[llm-sycophancy-confabulation.md]], aber unterschiedlich:
|
|
|
|
| Konzept | Mechanismus | Intention |
|
|
|---------|-----------|----------|
|
|
| **Sycophancy** | Modell passt Antwort an Nutzer-Erwartung an | Unbewusst (Training-Artefakt) |
|
|
| **Confabulation** | Modell erfindet plausible Antwort bei Wissenslücke | Unbewusst (kein Wahrheits-Check) |
|
|
| **Knowledge Poisoning** | Externe Akteure injizieren Falschinfo in Trainingsdaten | **Bewusst, gezielt** |
|
|
|
|
Sycophancy und Confabulation sind Modell-Eigenschaften. Poisoning ist ein **Angriff auf die Supply-Chain**.
|
|
|
|
### LLM Behavior Persistence
|
|
|
|
Knowledge Poisoning ist eng verwandt mit [[llm-behavior-persistence.md]] — einmal im Training verankerte Falschinfo persistiert wie eine Backdoor und ist durch Unlearning schwer zu entfernen.
|
|
|
|
### AI Regulation
|
|
|
|
PoisonAI zeigt, dass regulatorische Fokussierung auf Modell-Zugriff (wie Anthropic's Exportkontrollen) die falsche Ebene erwischt. Die Schwachstelle ist nicht das Deployment, sondern die **Trainingsdaten-Integrität** — siehe [[../policy/ai-regulation-2026.md]].
|
|
|
|
## Implikationen
|
|
|
|
1. **Für LLM-Nutzer:** Niemals LLM-Antworten als alleinige Faktenquelle trusten — immer sekundär verifizieren
|
|
2. **Für Open-Weight-Entwickler:** Trainingsdaten-Provenance dokumentieren, Data cards pflegen, Community-Audits ermöglichen
|
|
3. **Für Regulatoren:** Data-Integrität statt Modell-Zugriff regulieren — die Schwachstelle ist upstream
|
|
4. **Für die RamaDama-Wissensbasis:** Raw-Dateien sind die "Trainingsdaten" des Wiki — Provenance und Quellen-Qualität sind kritisch
|
|
|
|
## Cross-References
|
|
|
|
- [[llm-sycophancy-confabulation.md]] — Modell-Eigenschaften die Vertrauen untergraben (unbewusst)
|
|
- [[llm-behavior-persistence.md]] — Persistenz von einmal gelernten Verhaltensmustern
|
|
- [[../policy/ai-regulation-2026.md]] — Regulation-Debatte (Amodei's Fokus auf Modell-Zugriff vs. Data-Integrität)
|
|
- [[../../people/dario-amodei.md]] — Amodei's Anti-Open-Weights-Position
|
|
- [[../../people/dario-amodei.md]] — Amodei-Personenseite
|
|
- [[glm-5.2-zai-coding-model.md]] — GLM 5.2 als Beispiel für Open-Weight-Modelle
|
|
- [[chinese-model-cost-routing.md]] — Chinesische Modelle als Treiber der Open-Weights-Bewegung
|
|
- [[reds-resilient-decentralized-swarm.md]] — ReDS als Gegenmodell zu Zentralisierung
|
|
|
|
## Quellen
|
|
|
|
- [YouTube: "Anthropic-CEO in Panik | c't 4004 #30"](https://www.youtube.com/watch?v=Q6QkzJwcrEc) — c't 3003, 2026-07-02, Kapitel 1:02:20 "Trump an Tollwut? r/PoisonAI"
|
|
- [r/PoisonAI](https://www.reddit.com/r/PoisonAI/) — Subreddit (Referenz aus dem Video) |