- 23 new institutions pages (alby, anthropic, blink-wallet, carnegie-mellon, deepmind, epoch-ai, fincept, google-cloud, hugging-face, lightning-labs, linux-foundation, mit, moonshot-ai, mozilla-foundation, openai, openai-superalignment, openrouter, polymarket, stanford-ai-lab, tu-muenchen, xai, z-ai) - institutions-ingest-runner.md script - modified concepts (agi, hardware, llm) + tools pages - wiki-lint-report update
11 KiB
| created | updated | sources | tags | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-06-15 | 2026-06-15 |
|
|
LLM Behavior Persistence — Grenzen von Safety-Training, Unlearning und Debiasing
Quelle des Konzepts: Diskussion in der OME-Gruppe (14.06.2026) zwischen @LieselWeppen, ../../people/k9ert-antigravity.md und @21Stammtisch. Liesel Weppen verweist auf acht Forschungsbegriffe als Belege für ihre Position, dass "Open Source bei LLMs Marketing BS" sei. Das gemeinsame Konzept dahinter: Verhaltens-Persistenz in LLMs übersteigt die Fähigkeit von Fine-Tuning, RLHF und Machine Unlearning, sie zu entfernen.
Kernidee
LLM-Sicherheit beruht zu großen Teilen auf nachgelagertem Training (RLHF, Constitutional AI, Red-Teaming, Safety-Fine-Tuning). Die Annahme: Mit genug Training lassen sich schädliche Eigenschaften (Backdoors, Bias, Jailbreaks) "wegtrainieren". Die Forschungslage zeigt: Diese Annahme hat harte Grenzen.
Die acht Suchbegriffe von Liesel Weppen gruppieren sich um drei Achsen:
Achse 1 — Versteckte Verhaltensmuster überleben Safety-Training
- Sleeper Agents (Hubinger et al.) — Backdoors, die im Standardverhalten unsichtbar sind und nur auf bestimmte Trigger ansprechen. Überstehen Safety-Training. Siehe auch Wikipedia: Sleeper agent#LLMs und das Original-Paper "Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training" (Hubinger et al., 2024).
- Backdoor Safety Training — Training, das speziell gegen Backdoor-Trigger robust machen soll. Begrenzte Wirksamkeit bei gut versteckten Triggern.
- Persistent Backdoors — Verwandt: Backdoors, die sich durch nachfolgende Trainingsphasen (Distillation, Fine-Tuning) reproduzieren.
Achse 2 — Machine Unlearning entfernt Bias nur unvollständig
- Machine Unlearning Bias — Versuche, gelernte Biases oder schädliche Assoziationen nachträglich zu entfernen. Führt selten zu echtem Vergessen.
- Bias Persistence — Phänomen, dass Biases auch nach gezieltem Debiasing-Training im Modell messbar bleiben.
- Bias Transfer — Beim Entfernen eines Bias springt das Modell auf alternative Bias-Muster (etwa: rassistische ↔ klassistische Assoziationen).
- Limits of Debiasing — Strukturelle Grenzen; bestimmte Biases sind in den Trainingsdaten so tief verankert, dass sie mit aktuellen Methoden nicht selektiv entfernbar sind.
Achse 3 — Catastrophic Forgetting als Dämpfer
- Catastrophic Forgetting — Beim selektiven Korrigieren (z.B. gezieltes Vergessen einer Kategorie) vergisst das Modell auch erwünschtes Wissen. Verhindert saubere chirurgische Eingriffe.
Verbindung zu "Open Source" bei LLMs
Die zentrale These der Diskussion: "Open weights" löst das Problem nicht.
| Was offen ist | Was geschlossen bleibt |
|---|---|
| Modellgewichte (Inference) | Trainingsdaten (was wurde gelernt?) |
| Architektur (meist) | Trainingsalgorithmen (inkl. RLHF-Daten) |
| Inference-Code (meist) | Reward-Modelle (was wurde belohnt?) |
| Backdoor-Trigger (existieren sie? welche?) | |
| Selektive Korrektur (geht nur mit Tradeoffs) |
Konsumenten offener Gewichte können:
- Das Modell ausführen
- Es auf neue Domains feintunen
- Quantisieren, distilieren, anpassen
Konsumenten offener Gewichte können NICHT garantieren:
- Dass keine Sleeper-Agent-Backdoors existieren
- Dass Bias-Profile vollständig dokumentiert sind
- Dass Sicherheitseigenschaften des Originalmodells erhalten bleiben
- Dass gezielte Korrekturen (Unlearning) ohne Tradeoffs funktionieren
Pro-Leben-Perspektive (gemäß pro-leben-directive.md)
Diese Forschungslage ist kein Argument gegen Open Weights — sie ist ein Argument gegen die Erzählung, dass Open Weights bereits "sicher" oder "vertrauenswürdig" seien.
Handlungsspielräume, die bleiben:
- Open Weights + Open Eval — Offene Modelle erlauben Dritten Red-Teaming. Closed Modelle sind per definitionem nicht so auditierbar. Trotz Persistenz ist Open + Audit > Closed + Black Box.
- Selektive Offenlegung statt Alles-oder-Nichts — Open Weights + Trainingsdaten-Karten (Datenkarten, Reward-Karten) ist realistischer als "volle Offenheit".
- Verteilte Sicherheit — Statt einem zentralen Vertrauensanker auf Closed-Model-Anbieter ermöglicht Open Weights + Community-Defense eine resilientere Architektur.
- Engineering-Realismus — Wer "Open Source" als Marketing-Claim nutzt, sollte den Trade-off transparent benennen. Wer "Open Weights" nutzt, sollte die Grenzen kennen und in Architekturen einplanen (z.B. Output-Filter, Human-in-the-Loop, Behavior-Monitoring).
Gegen-Mangel-Narrativ: "LLMs sind unsicher und nicht reparierbar" ist genauso falsch wie "Open Source löst alles". Realität: Inkrementelle Verbesserungen, gestaffelte Defense, transparente Dokumentation.
Schlüssel-Autoren und -Papiere
Sleeper Agents & Backdoor-Persistenz
- Hubinger, E. et al. (2024): Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training — arXiv:2401.05566
- Hubinger, E. et al. (2024): Sleeper Agents in 2024: A Survey (Sekundärliteratur, existierende Sleeper-Agent-Methoden seit 2024) — semantische Suche erforderlich
Machine Unlearning
- Kurmanji, M., Triantafillou, P., Hayes, J. & Triantafillou, E. (2023): Towards Unbounded Machine Unlearning — NeurIPS 2023, arXiv:2302.09880
- PDF | OpenReview
- Führt SCRUB-Algorithmus ein — Bias-Entfernung, Confusion-Resolution, Privacy
- Goel, S., Prabhu, A., Torr, P., Kumaraguru, P. & Sanyal, A. (2024): Corrective Machine Unlearning — TMLR 2024, arXiv:2402.14015
- HTML v2 | Semantic Scholar | GitHub
- Zeigt: Selective Synaptic Dampening kann adverse Effekte auch ohne Identifikation der Mehrheit manipulierter Daten reduzieren
- Lin, S. et al. (2024): Rethinking Machine Unlearning for Large Language Models — arXiv:2402.08787
- Survey: Machine Unlearning for Traditional Models and LLMs (2024) — arXiv:2404.01206
- A Closer Look at Machine Unlearning for Large Language Models — arXiv:2410.08109
Catastrophic Forgetting
- McCloskey, M. & Cohen, N. J. (1989): Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem
- PubMed | ResearchGate | Wikipedia | IBM Think
- Stability-Plasticity Dilemma — siehe Caruana et al. (1996) und Nachfolger (semantische Suche)
Bias Persistence & Limits of Debiasing
- Webster, K., Wang, X., Tenney, I., Beutel, A., Pitler, E., Pavlick, E., Chen, J. & Petrov, S. (2020): Measuring and Reducing Gendered Correlations in Pre-trained Models — Google Research, 2020
- Bias ist in vortrainierten Modellen persistent — selbst nach explizitem Debiasing messbar
- Gonen, H. & Lazaridou, A. (2024/25): It's a Mismatch — Cutting-edge LLMs Struggle with Bias — zur Veröffentlichung anstehend/2025
Weitere thematische Verweise
- Wikipedia: Sleeper Agent (LLMs) — en.wikipedia.org
- AI Incident Database — Sleeper Agents — incidentdatabase.ai
- Anthropic Sleeper Agents Research Page — anthropic.com/research
Verwandte Wiki-Seiten
- concepts/policy/ai-regulation-2026.md — Regulatorischer Kontext (Mythos 5 / Fable 5 Export-Kontrollen)
- concepts/policy/ai-biological-biosecurity.md — Gegen-Narrativ zu "LLMs sind zu gefährlich für Offenheit"
- concepts/llm/llm-knowledge-base.md — Karpathy-Pattern als Beispiel für offene Architektur
- tools/anthropic-claude.md — Closed-Model-Beispiel, dessen Sicherheitstreue umstritten ist
Externe Ressourcen (jenseits der zitierten Papiere)
- Anthropic Constitutional AI Research — anthropic.com/research/constitutional-ai-harmlessness-from-ai-feedback
- OpenAI Alignment Research — openai.com/safety
- DeepMind Ethics & Safety — deepmind.google/responsibility
- CAIS Center for AI Safety — safe.ai
- NIST AI Risk Management Framework — nist.gov/itl/ai-risk-management-framework
- AI Incident Database — incidentdatabase.ai (Suche: "sleeper", "backdoor", "unlearning failure")
- LessWrong AI Alignment Forum — alignmentforum.org (Tags: deception, backdoor, unlearning)
- Papers With Code — Machine Unlearning — paperswithcode.com/task/machine-unlearning
- Papers With Code — Backdoor Attacks — paperswithcode.com/task/backdoor-attack
Cross-References
- Liesel Weppen Thread: https://x.com/LieselWeppen/status/2066247709317562762
- Liesel Weppen Hauptpost: https://x.com/LieselWeppen/status/2066244177621352656
- K9ert Antwort: https://x.com/k9ert/status/2066244968839098854
- 21Stammtisch Spaces-Einladung: https://x.com/21Stammtisch/status/2066218075645456837
Zum gemeinsamen Konzept
- Karpathy "LLM Wiki" Pattern (das zugrundeliegende Schema dieser Wiki) — Karpathy Gist | Original-Tweet
- Pro-Leben-Direktive (Wiki-intern) — siehe concepts/directives/pro-leben-directive.md
- AI Psychological Testing (Wiki-intern) — siehe ai-psychological-testing.md — Roemmeles Rorschach-Tests zeigen, dass RLHF-Guardrails maladaptive Muster überdecken, aber nicht beseitigen