> **Quelle des Konzepts:** Diskussion in der OME-Gruppe (14.06.2026) zwischen @LieselWeppen, [[../../people/k9ert-antigravity.md|@k9ert]] und @21Stammtisch. Liesel Weppen verweist auf acht Forschungsbegriffe als Belege für ihre Position, dass "Open Source bei LLMs Marketing BS" sei. Das gemeinsame Konzept dahinter: **Verhaltens-Persistenz in LLMs übersteigt die Fähigkeit von Fine-Tuning, RLHF und Machine Unlearning, sie zu entfernen.**
LLM-Sicherheit beruht zu großen Teilen auf **nachgelagertem Training** (RLHF, Constitutional AI, Red-Teaming, Safety-Fine-Tuning). Die Annahme: Mit genug Training lassen sich schädliche Eigenschaften (Backdoors, Bias, Jailbreaks) "wegtrainieren". Die Forschungslage zeigt: **Diese Annahme hat harte Grenzen.**
Die acht Suchbegriffe von Liesel Weppen gruppieren sich um drei Achsen:
- **Sleeper Agents (Hubinger et al.)** — Backdoors, die im Standardverhalten unsichtbar sind und nur auf bestimmte Trigger ansprechen. Überstehen Safety-Training. Siehe auch [[Wikipedia: Sleeper agent#LLMs]] und das Original-Paper "Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training" (Hubinger et al., 2024).
- **Backdoor Safety Training** — Training, das speziell gegen Backdoor-Trigger robust machen soll. Begrenzte Wirksamkeit bei gut versteckten Triggern.
- **Persistent Backdoors** — Verwandt: Backdoors, die sich durch nachfolgende Trainingsphasen (Distillation, Fine-Tuning) reproduzieren.
### Achse 2 — Machine Unlearning entfernt Bias nur unvollständig
- **Machine Unlearning Bias** — Versuche, gelernte Biases oder schädliche Assoziationen nachträglich zu entfernen. Führt selten zu echtem Vergessen.
- **Bias Persistence** — Phänomen, dass Biases auch nach gezieltem Debiasing-Training im Modell messbar bleiben.
- **Bias Transfer** — Beim Entfernen eines Bias springt das Modell auf alternative Bias-Muster (etwa: rassistische ↔ klassistische Assoziationen).
- **Limits of Debiasing** — Strukturelle Grenzen; bestimmte Biases sind in den Trainingsdaten so tief verankert, dass sie mit aktuellen Methoden nicht selektiv entfernbar sind.
### Achse 3 — Catastrophic Forgetting als Dämpfer
- **Catastrophic Forgetting** — Beim selektiven Korrigieren (z.B. gezieltes Vergessen einer Kategorie) vergisst das Modell auch erwünschtes Wissen. Verhindert saubere chirurgische Eingriffe.
## Verbindung zu "Open Source" bei LLMs
Die zentrale These der Diskussion: **"Open weights" löst das Problem nicht.**
| Was offen ist | Was geschlossen bleibt |
|---|---|
| Modellgewichte (Inference) | Trainingsdaten (was wurde gelernt?) |
Diese Forschungslage ist **kein Argument gegen Open Weights** — sie ist ein Argument gegen die **Erzählung, dass Open Weights bereits "sicher" oder "vertrauenswürdig"** seien.
**Handlungsspielräume, die bleiben:**
1.**Open Weights + Open Eval** — Offene Modelle erlauben Dritten Red-Teaming. Closed Modelle sind *per definitionem* nicht so auditierbar. Trotz Persistenz ist Open + Audit > Closed + Black Box.
2.**Selektive Offenlegung statt Alles-oder-Nichts** — Open Weights + Trainingsdaten-Karten (Datenkarten, Reward-Karten) ist realistischer als "volle Offenheit".
3.**Verteilte Sicherheit** — Statt einem zentralen Vertrauensanker auf Closed-Model-Anbieter ermöglicht Open Weights + Community-Defense eine resilientere Architektur.
4.**Engineering-Realismus** — Wer "Open Source" als Marketing-Claim nutzt, sollte den Trade-off transparent benennen. Wer "Open Weights" nutzt, sollte die Grenzen kennen und in Architekturen einplanen (z.B. Output-Filter, Human-in-the-Loop, Behavior-Monitoring).
**Gegen-Mangel-Narrativ:** "LLMs sind unsicher und nicht reparierbar" ist genauso falsch wie "Open Source löst alles". Realität: Inkrementelle Verbesserungen, gestaffelte Defense, transparente Dokumentation.
- **Hubinger, E. et al. (2024):** [Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training](https://arxiv.org/abs/2401.05566) — arXiv:2401.05566
- **Hubinger, E. et al. (2024):** [Sleeper Agents in 2024: A Survey](https://www.semanticscholar.org/) (Sekundärliteratur, existierende Sleeper-Agent-Methoden seit 2024) — semantische Suche erforderlich
### Machine Unlearning
- **Kurmanji, M., Triantafillou, P., Hayes, J. & Triantafillou, E. (2023):** [Towards Unbounded Machine Unlearning](https://arxiv.org/abs/2302.09880) — NeurIPS 2023, arXiv:2302.09880
- *Zeigt: Selective Synaptic Dampening kann adverse Effekte auch ohne Identifikation der Mehrheit manipulierter Daten reduzieren*
- **Lin, S. et al. (2024):** [Rethinking Machine Unlearning for Large Language Models](https://arxiv.org/html/2402.08787v6) — arXiv:2402.08787
- [Nature Machine Intelligence Version (2025)](https://www.nature.com/articles/s42256-025-00985-0)
- **Survey: Machine Unlearning for Traditional Models and LLMs (2024)** — [arXiv:2404.01206](https://arxiv.org/html/2404.01206v1)
- **A Closer Look at Machine Unlearning for Large Language Models** — [arXiv:2410.08109](https://arxiv.org/html/2410.08109v5)
### Catastrophic Forgetting
- **McCloskey, M. & Cohen, N. J. (1989):** [Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem](https://www.semanticscholar.org/paper/Catastrophic-Interference-in-Connectionist-The-McCloskey-Cohen/c213af6582c0d518a6e8e14217611c733eeb1ef1)
- **Stability-Plasticity Dilemma** — siehe [Caruana et al. (1996) und Nachfolger](https://www.researchgate.net/) (semantische Suche)
### Bias Persistence & Limits of Debiasing
- **Webster, K., Wang, X., Tenney, I., Beutel, A., Pitler, E., Pavlick, E., Chen, J. & Petrov, S. (2020):** [Measuring and Reducing Gendered Correlations in Pre-trained Models](https://www.semanticscholar.org/paper/Measuring-and-Reducing-Gendered-Correlations-in-Webster-Wang/3d864a8bc5a55ccab9993aa66203d8e70b88148c) — Google Research, 2020
- *Bias ist in vortrainierten Modellen persistent — selbst nach explizitem Debiasing messbar*
- **Gonen, H. & Lazaridou, A. (2024/25):** [It's a Mismatch — Cutting-edge LLMs Struggle with Bias](https://arxiv.org/) — zur Veröffentlichung anstehend/2025
- *Verwandt: [From Structured Prompts to Open Narratives: Measuring Gender Bias in LLMs](https://arxiv.org/html/2503.15904v1)*