knowledge-base/wiki/concepts/llm/llm-behavior-persistence.md
Hector 9cc4989fc1 push: all untracked institutions + modified wiki pages
- 23 new institutions pages (alby, anthropic, blink-wallet, carnegie-mellon, deepmind, epoch-ai, fincept, google-cloud, hugging-face, lightning-labs, linux-foundation, mit, moonshot-ai, mozilla-foundation, openai, openai-superalignment, openrouter, polymarket, stanford-ai-lab, tu-muenchen, xai, z-ai)
- institutions-ingest-runner.md script
- modified concepts (agi, hardware, llm) + tools pages
- wiki-lint-report update
2026-06-25 21:08:50 +02:00

141 lines
11 KiB
Markdown

---
created: 2026-06-15
updated: 2026-06-15
sources: [xpost/2026-06-14_lieselweppen-open-source-llm-backdoors.md]
tags: [concept, llm-safety, alignment, unlearning, sleeper-agents, backdoor, bias]
---
# LLM Behavior Persistence — Grenzen von Safety-Training, Unlearning und Debiasing
> **Quelle des Konzepts:** Diskussion in der OME-Gruppe (14.06.2026) zwischen @LieselWeppen, [[../../people/k9ert-antigravity.md|@k9ert]] und @21Stammtisch. Liesel Weppen verweist auf acht Forschungsbegriffe als Belege für ihre Position, dass "Open Source bei LLMs Marketing BS" sei. Das gemeinsame Konzept dahinter: **Verhaltens-Persistenz in LLMs übersteigt die Fähigkeit von Fine-Tuning, RLHF und Machine Unlearning, sie zu entfernen.**
## Kernidee
LLM-Sicherheit beruht zu großen Teilen auf **nachgelagertem Training** (RLHF, Constitutional AI, Red-Teaming, Safety-Fine-Tuning). Die Annahme: Mit genug Training lassen sich schädliche Eigenschaften (Backdoors, Bias, Jailbreaks) "wegtrainieren". Die Forschungslage zeigt: **Diese Annahme hat harte Grenzen.**
Die acht Suchbegriffe von Liesel Weppen gruppieren sich um drei Achsen:
### Achse 1 — Versteckte Verhaltensmuster überleben Safety-Training
- **Sleeper Agents (Hubinger et al.)** — Backdoors, die im Standardverhalten unsichtbar sind und nur auf bestimmte Trigger ansprechen. Überstehen Safety-Training. Siehe auch [[Wikipedia: Sleeper agent#LLMs]] und das Original-Paper "Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training" (Hubinger et al., 2024).
- **Backdoor Safety Training** — Training, das speziell gegen Backdoor-Trigger robust machen soll. Begrenzte Wirksamkeit bei gut versteckten Triggern.
- **Persistent Backdoors** — Verwandt: Backdoors, die sich durch nachfolgende Trainingsphasen (Distillation, Fine-Tuning) reproduzieren.
### Achse 2 — Machine Unlearning entfernt Bias nur unvollständig
- **Machine Unlearning Bias** — Versuche, gelernte Biases oder schädliche Assoziationen nachträglich zu entfernen. Führt selten zu echtem Vergessen.
- **Bias Persistence** — Phänomen, dass Biases auch nach gezieltem Debiasing-Training im Modell messbar bleiben.
- **Bias Transfer** — Beim Entfernen eines Bias springt das Modell auf alternative Bias-Muster (etwa: rassistische ↔ klassistische Assoziationen).
- **Limits of Debiasing** — Strukturelle Grenzen; bestimmte Biases sind in den Trainingsdaten so tief verankert, dass sie mit aktuellen Methoden nicht selektiv entfernbar sind.
### Achse 3 — Catastrophic Forgetting als Dämpfer
- **Catastrophic Forgetting** — Beim selektiven Korrigieren (z.B. gezieltes Vergessen einer Kategorie) vergisst das Modell auch erwünschtes Wissen. Verhindert saubere chirurgische Eingriffe.
## Verbindung zu "Open Source" bei LLMs
Die zentrale These der Diskussion: **"Open weights" löst das Problem nicht.**
| Was offen ist | Was geschlossen bleibt |
|---|---|
| Modellgewichte (Inference) | Trainingsdaten (was wurde gelernt?) |
| Architektur (meist) | Trainingsalgorithmen (inkl. RLHF-Daten) |
| Inference-Code (meist) | Reward-Modelle (was wurde belohnt?) |
| | Backdoor-Trigger (existieren sie? welche?) |
| | Selektive Korrektur (geht nur mit Tradeoffs) |
**Konsumenten offener Gewichte können:**
- Das Modell ausführen
- Es auf neue Domains feintunen
- Quantisieren, distilieren, anpassen
**Konsumenten offener Gewichte können NICHT garantieren:**
- Dass keine Sleeper-Agent-Backdoors existieren
- Dass Bias-Profile vollständig dokumentiert sind
- Dass Sicherheitseigenschaften des Originalmodells erhalten bleiben
- Dass gezielte Korrekturen (Unlearning) ohne Tradeoffs funktionieren
## Pro-Leben-Perspektive (gemäß [[pro-leben-directive.md]])
Diese Forschungslage ist **kein Argument gegen Open Weights** — sie ist ein Argument gegen die **Erzählung, dass Open Weights bereits "sicher" oder "vertrauenswürdig"** seien.
**Handlungsspielräume, die bleiben:**
1. **Open Weights + Open Eval** — Offene Modelle erlauben Dritten Red-Teaming. Closed Modelle sind *per definitionem* nicht so auditierbar. Trotz Persistenz ist Open + Audit > Closed + Black Box.
2. **Selektive Offenlegung statt Alles-oder-Nichts** — Open Weights + Trainingsdaten-Karten (Datenkarten, Reward-Karten) ist realistischer als "volle Offenheit".
3. **Verteilte Sicherheit** — Statt einem zentralen Vertrauensanker auf Closed-Model-Anbieter ermöglicht Open Weights + Community-Defense eine resilientere Architektur.
4. **Engineering-Realismus** — Wer "Open Source" als Marketing-Claim nutzt, sollte den Trade-off transparent benennen. Wer "Open Weights" nutzt, sollte die Grenzen kennen und in Architekturen einplanen (z.B. Output-Filter, Human-in-the-Loop, Behavior-Monitoring).
**Gegen-Mangel-Narrativ:** "LLMs sind unsicher und nicht reparierbar" ist genauso falsch wie "Open Source löst alles". Realität: Inkrementelle Verbesserungen, gestaffelte Defense, transparente Dokumentation.
## Schlüssel-Autoren und -Papiere
### Sleeper Agents & Backdoor-Persistenz
- **Hubinger, E. et al. (2024):** [Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training](https://arxiv.org/abs/2401.05566) — arXiv:2401.05566
- [HTML v3](https://arxiv.org/html/2401.05566v3) | [Semantic Scholar](https://www.semanticscholar.org/paper/Sleeper-Agents%3A-Training-Deceptive-LLMs-that-Safety-Hubinger-Denison/9363e8e1fe2be2a13b4d6f5fc61bbaed14ab9a23) | [HuggingFace](https://huggingface.co/papers/2401.05566) | [Erläuterung (Wolfe)](https://cameronrwolfe.substack.com/p/sleeper-agents-llm-safety-finetuning)
- **Hubinger, E. et al. (2024):** [Sleeper Agents in 2024: A Survey](https://www.semanticscholar.org/) (Sekundärliteratur, existierende Sleeper-Agent-Methoden seit 2024) — semantische Suche erforderlich
### Machine Unlearning
- **Kurmanji, M., Triantafillou, P., Hayes, J. & Triantafillou, E. (2023):** [Towards Unbounded Machine Unlearning](https://arxiv.org/abs/2302.09880) — NeurIPS 2023, arXiv:2302.09880
- [PDF](https://arxiv.org/pdf/2302.09880) | [OpenReview](https://openreview.net/forum?id=OveBaTtUAT)
- *Führt SCRUB-Algorithmus ein — Bias-Entfernung, Confusion-Resolution, Privacy*
- **Goel, S., Prabhu, A., Torr, P., Kumaraguru, P. & Sanyal, A. (2024):** [Corrective Machine Unlearning](https://arxiv.org/abs/2402.14015) — TMLR 2024, arXiv:2402.14015
- [HTML v2](https://arxiv.org/html/2402.14015v2) | [Semantic Scholar](https://www.semanticscholar.org/paper/Corrective-Machine-Unlearning-Goel-Prabhu/40596974e4847412713cf4aa331838ba024ae8a9) | [GitHub](https://github.com/...)
- *Zeigt: Selective Synaptic Dampening kann adverse Effekte auch ohne Identifikation der Mehrheit manipulierter Daten reduzieren*
- **Lin, S. et al. (2024):** [Rethinking Machine Unlearning for Large Language Models](https://arxiv.org/html/2402.08787v6) — arXiv:2402.08787
- [Nature Machine Intelligence Version (2025)](https://www.nature.com/articles/s42256-025-00985-0)
- **Survey: Machine Unlearning for Traditional Models and LLMs (2024)** — [arXiv:2404.01206](https://arxiv.org/html/2404.01206v1)
- **A Closer Look at Machine Unlearning for Large Language Models** — [arXiv:2410.08109](https://arxiv.org/html/2410.08109v5)
### Catastrophic Forgetting
- **McCloskey, M. & Cohen, N. J. (1989):** [Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem](https://www.semanticscholar.org/paper/Catastrophic-Interference-in-Connectionist-The-McCloskey-Cohen/c213af6582c0d518a6e8e14217611c733eeb1ef1)
- [PubMed](https://pubmed.ncbi.nlm.nih.gov/10322466/) | [ResearchGate](https://www.researchgate.net/publication/228051810_Catastrophic_Forgetting_in_Connectionist_Networks) | [Wikipedia](https://en.wikipedia.org/wiki/Catastrophic_interference) | [IBM Think](https://www.ibm.com/think/topics/catastrophic-forgetting)
- **Stability-Plasticity Dilemma** — siehe [Caruana et al. (1996) und Nachfolger](https://www.researchgate.net/) (semantische Suche)
### Bias Persistence & Limits of Debiasing
- **Webster, K., Wang, X., Tenney, I., Beutel, A., Pitler, E., Pavlick, E., Chen, J. & Petrov, S. (2020):** [Measuring and Reducing Gendered Correlations in Pre-trained Models](https://www.semanticscholar.org/paper/Measuring-and-Reducing-Gendered-Correlations-in-Webster-Wang/3d864a8bc5a55ccab9993aa66203d8e70b88148c) — Google Research, 2020
- *Bias ist in vortrainierten Modellen persistent — selbst nach explizitem Debiasing messbar*
- **Gonen, H. & Lazaridou, A. (2024/25):** [It's a Mismatch — Cutting-edge LLMs Struggle with Bias](https://arxiv.org/) — zur Veröffentlichung anstehend/2025
- *Verwandt: [From Structured Prompts to Open Narratives: Measuring Gender Bias in LLMs](https://arxiv.org/html/2503.15904v1)*
### Weitere thematische Verweise
- **Wikipedia: Sleeper Agent (LLMs)** — [en.wikipedia.org](https://en.wikipedia.org/wiki/)
- **AI Incident Database — Sleeper Agents** — [incidentdatabase.ai](https://incidentdatabase.ai/)
- **Anthropic Sleeper Agents Research Page** — [anthropic.com/research](https://www.anthropic.com/research)
## Verwandte Wiki-Seiten
- [[concepts/policy/ai-regulation-2026.md]] — Regulatorischer Kontext (Mythos 5 / Fable 5 Export-Kontrollen)
- [[concepts/policy/ai-biological-biosecurity.md]] — Gegen-Narrativ zu "LLMs sind zu gefährlich für Offenheit"
- [[concepts/llm/llm-knowledge-base.md]] — Karpathy-Pattern als Beispiel für offene Architektur
- [[tools/anthropic-claude.md]] — Closed-Model-Beispiel, dessen Sicherheitstreue umstritten ist
## Externe Ressourcen (jenseits der zitierten Papiere)
- **Anthropic Constitutional AI Research** — [anthropic.com/research/constitutional-ai-harmlessness-from-ai-feedback](https://www.anthropic.com/research)
- **OpenAI Alignment Research** — [openai.com/safety](https://openai.com/safety)
- **DeepMind Ethics & Safety** — [deepmind.google/responsibility](https://deepmind.google/responsibility/)
- **CAIS Center for AI Safety** — [safe.ai](https://www.safe.ai/)
- **NIST AI Risk Management Framework** — [nist.gov/itl/ai-risk-management-framework](https://www.nist.gov/itl/ai-risk-management-framework)
- **AI Incident Database** — [incidentdatabase.ai](https://incidentdatabase.ai/) (Suche: "sleeper", "backdoor", "unlearning failure")
- **LessWrong AI Alignment Forum** — [alignmentforum.org](https://www.alignmentforum.org/) (Tags: deception, backdoor, unlearning)
- **Papers With Code — Machine Unlearning** — [paperswithcode.com/task/machine-unlearning](https://paperswithcode.com/task/machine-unlearning)
- **Papers With Code — Backdoor Attacks** — [paperswithcode.com/task/backdoor-attack](https://paperswithcode.com/task/backdoor-attack)
## Cross-References
- Liesel Weppen Thread: https://x.com/LieselWeppen/status/2066247709317562762
- Liesel Weppen Hauptpost: https://x.com/LieselWeppen/status/2066244177621352656
- K9ert Antwort: https://x.com/k9ert/status/2066244968839098854
- 21Stammtisch Spaces-Einladung: https://x.com/21Stammtisch/status/2066218075645456837
### Zum gemeinsamen Konzept
- **Karpathy "LLM Wiki" Pattern** (das zugrundeliegende Schema dieser Wiki) — [Karpathy Gist](https://gist.github.com/karpathy/442a6bf555914893e9891c11519de94f) | [Original-Tweet](https://x.com/karpathy/status/2039805659525644595)
- **Pro-Leben-Direktive** (Wiki-intern) — siehe [[concepts/directives/pro-leben-directive.md]]
- **AI Psychological Testing** (Wiki-intern) — siehe [[ai-psychological-testing.md]] — Roemmeles Rorschach-Tests zeigen, dass RLHF-Guardrails maladaptive Muster überdecken, aber nicht beseitigen