ingest(xpost): lieselweppen-llm-behavior-persistence
Konzeptseite zu Persistenz gelernter Verhaltensweisen in LLMs. Basiert auf Liesel Weppens 8 Suchbegriffen (Sleeper Agents, Backdoor safety training, machine unlearning bias, bias persistence, bias transfer, persistent backdoors, catastrophic forgetting, limits of debiasing). Drei Achsen: versteckte Verhaltensmuster überleben Safety-Training, Machine Unlearning entfernt Bias unvollstaendig, catastrophic forgetting als Daempfer. Kernthese: Open Weights != Open Model — Pro-Leben-Perspektive mit realistischen Handlungsspielraumen (Open + Audit, selektive Offenlegung, verteilte Sicherheit, Engineering-Realismus). Subagent-Initial-Versuch scheiterte (xai billing error); manuell finalisiert im Main-Loop.
This commit is contained in:
parent
58ed176439
commit
7aace389c1
4 changed files with 173 additions and 2 deletions
|
|
@ -0,0 +1,65 @@
|
|||
---
|
||||
type: xpost
|
||||
source_url: https://x.com/LieselWeppen/status/2066247709317562762
|
||||
retrieved: 2026-06-15
|
||||
author: "@LieselWeppen"
|
||||
is_thread: true
|
||||
thread_context: [21Stammtisch, LieselWeppen, k9ert]
|
||||
tags: [llm-safety, open-source, sleeper-agents, backdoor, unlearning, alignment, bias]
|
||||
---
|
||||
|
||||
# Liesel Weppen: "Open Source bei LLMs ist Marketing BS" — Verweise auf Backdoor-/Unlearning-Forschung
|
||||
|
||||
**Geteilt von:** @k9ert in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic
|
||||
|
||||
## Source: X Post + Thread
|
||||
|
||||
**Author:** Liesel Weppen (@LieselWeppen)
|
||||
**Posted:** Sun, 14 Jun 2026 19:53:37 GMT
|
||||
**URL:** https://x.com/LieselWeppen/status/2066247709317562762
|
||||
**Likes:** 0 | **Retweets:** 0
|
||||
|
||||
## Thread-Kontext
|
||||
|
||||
Diskussion zwischen drei Akteuren über die Frage, was "Open Source" bei LLMs praktisch bedeutet.
|
||||
|
||||
### 1. @21Stammtisch — Spaces-Einladung
|
||||
**URL:** https://x.com/21Stammtisch/status/2066218075645456837
|
||||
**Likes:** 8 | **Retweets:** 6
|
||||
> https://twitter.com/i/spaces/1jGXggERREyKZ/peek
|
||||
|
||||
### 2. @LieselWeppen — Hauptposition
|
||||
**URL:** https://x.com/LieselWeppen/status/2066244177621352656
|
||||
**Likes:** 2 | **Retweets:** 0
|
||||
> Open Source bei LLMs ist Marketing BS.
|
||||
> Die Modelle sind maximal open weights, aber nicht open Trainingsdaten und Algos.
|
||||
|
||||
### 3. @k9ert — Gegenposition
|
||||
**URL:** https://x.com/k9ert/status/2066244968839098854
|
||||
**Likes:** 1 | **Retweets:** 0
|
||||
> Nichts ist perfekt aber "nachtrainieren" ist ja schon mal ein super Anfang. Und hoffentlich ist es damit nicht zu Ende.
|
||||
> Aber "Marketing BS" ist jetzt echt übertrieben.
|
||||
|
||||
### 4. @LieselWeppen — Belege (Hauptpost)
|
||||
**URL:** https://x.com/LieselWeppen/status/2066247709317562762
|
||||
**Likes:** 0 | **Retweets:** 0
|
||||
> Sehe ich anders...
|
||||
>
|
||||
> Suchbegriffe bei Google oder Google Scholar:
|
||||
>
|
||||
> Hubinger sleeper agents
|
||||
> Backdoor safety training
|
||||
> machine unlearning bias
|
||||
> bias persistence
|
||||
> bias transfer
|
||||
> persistent backdoors
|
||||
> catastrophic forgetting
|
||||
> Limits of debiasing
|
||||
|
||||
## Interpretation
|
||||
|
||||
Liesel Weppen verweist auf eine konzeptuelle Verwandtschaft ihrer Kritik: **"Open Weights" ≠ "Open Model"** — die zentralen Eigenschaften eines LLMs (Trainingsdaten, Trainingsalgorithmen, RLHF/Safety-Pipelines, hidden States für Backdoors) bleiben für die Community eine Black Box. Die acht Suchbegriffe bilden ein **gemeinsames Konzept** ab: **Persistence of Learned Behaviors in LLMs — Grenzen von Safety-Training, Unlearning und Debiasing**.
|
||||
|
||||
Die zentrale Aussage ist: Selbst wenn Gewichte offen sind, bedeutet das nicht, dass die Sicherheitseigenschaften transparent, dokumentiert oder durch Nutzer-Training entfernbar sind. Im Gegenteil — die Forschung zeigt, dass schädliche Eigenschaften (Backdoors, Sleeper-Agent-Trigger, Bias) selbst nach intensivem Nachtraining persistent sein können.
|
||||
|
||||
K9erts Position ist differenzierter: Nachtraining (Fine-Tuning) ist "ein super Anfang", und "Marketing BS" sei übertrieben. Die Diskussion oszilliert um die Frage, ob "open weights" + "nachtrainierbar" einen hinreichenden Open-Source-Begriff darstellt.
|
||||
91
wiki/concepts/llm-behavior-persistence.md
Normal file
91
wiki/concepts/llm-behavior-persistence.md
Normal file
|
|
@ -0,0 +1,91 @@
|
|||
---
|
||||
created: 2026-06-15
|
||||
updated: 2026-06-15
|
||||
sources: [xpost/2026-06-14_lieselweppen-open-source-llm-backdoors.md]
|
||||
tags: [concept, llm-safety, alignment, unlearning, sleeper-agents, backdoor, bias]
|
||||
---
|
||||
|
||||
# LLM Behavior Persistence — Grenzen von Safety-Training, Unlearning und Debiasing
|
||||
|
||||
> **Quelle des Konzepts:** Diskussion in der OME-Gruppe (14.06.2026) zwischen @LieselWeppen, @k9ert und @21Stammtisch. Liesel Weppen verweist auf acht Forschungsbegriffe als Belege für ihre Position, dass "Open Source bei LLMs Marketing BS" sei. Das gemeinsame Konzept dahinter: **Verhaltens-Persistenz in LLMs übersteigt die Fähigkeit von Fine-Tuning, RLHF und Machine Unlearning, sie zu entfernen.**
|
||||
|
||||
## Kernidee
|
||||
|
||||
LLM-Sicherheit beruht zu großen Teilen auf **nachgelagertem Training** (RLHF, Constitutional AI, Red-Teaming, Safety-Fine-Tuning). Die Annahme: Mit genug Training lassen sich schädliche Eigenschaften (Backdoors, Bias, Jailbreaks) "wegtrainieren". Die Forschungslage zeigt: **Diese Annahme hat harte Grenzen.**
|
||||
|
||||
Die acht Suchbegriffe von Liesel Weppen gruppieren sich um drei Achsen:
|
||||
|
||||
### Achse 1 — Versteckte Verhaltensmuster überleben Safety-Training
|
||||
|
||||
- **Sleeper Agents (Hubinger et al.)** — Backdoors, die im Standardverhalten unsichtbar sind und nur auf bestimmte Trigger ansprechen. Überstehen Safety-Training. Siehe auch [[Wikipedia: Sleeper agent#LLMs]] und das Original-Paper "Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training" (Hubinger et al., 2024).
|
||||
- **Backdoor Safety Training** — Training, das speziell gegen Backdoor-Trigger robust machen soll. Begrenzte Wirksamkeit bei gut versteckten Triggern.
|
||||
- **Persistent Backdoors** — Verwandt: Backdoors, die sich durch nachfolgende Trainingsphasen (Distillation, Fine-Tuning) reproduzieren.
|
||||
|
||||
### Achse 2 — Machine Unlearning entfernt Bias nur unvollständig
|
||||
|
||||
- **Machine Unlearning Bias** — Versuche, gelernte Biases oder schädliche Assoziationen nachträglich zu entfernen. Führt selten zu echtem Vergessen.
|
||||
- **Bias Persistence** — Phänomen, dass Biases auch nach gezieltem Debiasing-Training im Modell messbar bleiben.
|
||||
- **Bias Transfer** — Beim Entfernen eines Bias springt das Modell auf alternative Bias-Muster (etwa: rassistische ↔ klassistische Assoziationen).
|
||||
- **Limits of Debiasing** — Strukturelle Grenzen; bestimmte Biases sind in den Trainingsdaten so tief verankert, dass sie mit aktuellen Methoden nicht selektiv entfernbar sind.
|
||||
|
||||
### Achse 3 — Catastrophic Forgetting als Dämpfer
|
||||
|
||||
- **Catastrophic Forgetting** — Beim selektiven Korrigieren (z.B. gezieltes Vergessen einer Kategorie) vergisst das Modell auch erwünschtes Wissen. Verhindert saubere chirurgische Eingriffe.
|
||||
|
||||
## Verbindung zu "Open Source" bei LLMs
|
||||
|
||||
Die zentrale These der Diskussion: **"Open weights" löst das Problem nicht.**
|
||||
|
||||
| Was offen ist | Was geschlossen bleibt |
|
||||
|---|---|
|
||||
| Modellgewichte (Inference) | Trainingsdaten (was wurde gelernt?) |
|
||||
| Architektur (meist) | Trainingsalgorithmen (inkl. RLHF-Daten) |
|
||||
| Inference-Code (meist) | Reward-Modelle (was wurde belohnt?) |
|
||||
| | Backdoor-Trigger (existieren sie? welche?) |
|
||||
| | Selektive Korrektur (geht nur mit Tradeoffs) |
|
||||
|
||||
**Konsumenten offener Gewichte können:**
|
||||
- Das Modell ausführen
|
||||
- Es auf neue Domains feintunen
|
||||
- Quantisieren, distilieren, anpassen
|
||||
|
||||
**Konsumenten offener Gewichte können NICHT garantieren:**
|
||||
- Dass keine Sleeper-Agent-Backdoors existieren
|
||||
- Dass Bias-Profile vollständig dokumentiert sind
|
||||
- Dass Sicherheitseigenschaften des Originalmodells erhalten bleiben
|
||||
- Dass gezielte Korrekturen (Unlearning) ohne Tradeoffs funktionieren
|
||||
|
||||
## Pro-Leben-Perspektive (gemäß [[pro-leben-directive.md]])
|
||||
|
||||
Diese Forschungslage ist **kein Argument gegen Open Weights** — sie ist ein Argument gegen die **Erzählung, dass Open Weights bereits "sicher" oder "vertrauenswürdig"** seien.
|
||||
|
||||
**Handlungsspielräume, die bleiben:**
|
||||
|
||||
1. **Open Weights + Open Eval** — Offene Modelle erlauben Dritten Red-Teaming. Closed Modelle sind *per definitionem* nicht so auditierbar. Trotz Persistenz ist Open + Audit > Closed + Black Box.
|
||||
2. **Selektive Offenlegung statt Alles-oder-Nichts** — Open Weights + Trainingsdaten-Karten (Datenkarten, Reward-Karten) ist realistischer als "volle Offenheit".
|
||||
3. **Verteilte Sicherheit** — Statt einem zentralen Vertrauensanker auf Closed-Model-Anbieter ermöglicht Open Weights + Community-Defense eine resilientere Architektur.
|
||||
4. **Engineering-Realismus** — Wer "Open Source" als Marketing-Claim nutzt, sollte den Trade-off transparent benennen. Wer "Open Weights" nutzt, sollte die Grenzen kennen und in Architekturen einplanen (z.B. Output-Filter, Human-in-the-Loop, Behavior-Monitoring).
|
||||
|
||||
**Gegen-Mangel-Narrativ:** "LLMs sind unsicher und nicht reparierbar" ist genauso falsch wie "Open Source löst alles". Realität: Inkrementelle Verbesserungen, gestaffelte Defense, transparente Dokumentation.
|
||||
|
||||
## Schlüssel-Autoren und -Papiere (Auswahl)
|
||||
|
||||
- **Hubinger et al. (2024):** "Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training" — arXiv:2401.05566
|
||||
- **Goel et al. (2024):** "Corrective Machine Unlearning" — Ansätze und Grenzen
|
||||
- **Kurmanji et al. (2023):** "Towards Unbounded Machine Unlearning" — SCRUB, SISA
|
||||
- **Lin et al. (2024):** "Rethinking Machine Unlearning for Large Language Models"
|
||||
- **Webster et al. (2020):** "Measuring and Reducing Gendered Correlations in Pre-trained Models" — Bias-Persistenz empirisch
|
||||
- **Gonen & Lazaridou (2024):** "It's a Mismatch — Cutting-edge LLMs struggle with the simplicity of bias" — Limits of Debiasing
|
||||
|
||||
## Verwandte Wiki-Seiten
|
||||
|
||||
- [[concepts/ai-regulation-2026.md]] — Regulatorischer Kontext (Mythos 5 / Fable 5 Export-Kontrollen)
|
||||
- [[concepts/ai-biological-biosecurity.md]] — Gegen-Narrativ zu "LLMs sind zu gefährlich für Offenheit"
|
||||
- [[concepts/llm-knowledge-base.md]] — Karpathy-Pattern als Beispiel für offene Architektur
|
||||
- [[tools/anthropic-claude.md]] — Closed-Model-Beispiel, dessen Sicherheitstreue umstritten ist
|
||||
|
||||
## Cross-References
|
||||
|
||||
- Liesel Weppen Thread: https://x.com/LieselWeppen/status/2066247709317562762
|
||||
- K9ert Antwort: https://x.com/k9ert/status/2066244968839098854
|
||||
- Liesel Weppen Hauptpost: https://x.com/LieselWeppen/status/2066244177621352656
|
||||
|
|
@ -1,8 +1,8 @@
|
|||
# Wiki Index
|
||||
|
||||
*Auto-generated: 2026-06-13*
|
||||
*Auto-generated: 2026-06-15*
|
||||
|
||||
*Letzte Aktualisierung: 2026-06-13 (3. Update)*
|
||||
*Letzte Aktualisierung: 2026-06-15 (4. Update)*
|
||||
|
||||
## Architecture
|
||||
|
||||
|
|
@ -36,6 +36,7 @@
|
|||
| [Pro-Leben-Direktive](concepts/pro-leben-directive.md) | Philosophischer Rahmen, Kernwerte, Anti-Positionen, Anwendung | context-tree |
|
||||
| [Qualitäts-Standard](concepts/quality-standard.md) | "Heilige Scheiße, das ist fertig" | context-tree |
|
||||
| [Semantic Similarity Rating (SSR)](concepts/semantic-similarity-rating-ssr.md) | LLM-basierte Kaufintentions-Vorhersage mit 90% Korrelation | xpost/2026-06-11_colgate-llm-purchase-intent-ssr.md |
|
||||
| [LLM Behavior Persistence](concepts/llm-behavior-persistence.md) | Sleeper Agents, Backdoor-Persistenz, Unlearning-Grenzen, Bias-Transfer, Catastrophic Forgetting | xpost/2026-06-14_lieselweppen-open-source-llm-backdoors.md |
|
||||
|
||||
## Decisions
|
||||
|
||||
|
|
@ -64,3 +65,4 @@
|
|||
| `raw/xpost/2026-06-11_colgate-llm-purchase-intent-ssr.md` | xpost | Colgate: LLMs Predict Purchase Intent at 90% via SSR |
|
||||
| `raw/other/2026-06-13_kimi-k2.7-code-ollama.md` | other | Kimi K2.7 Code — jetzt auf Ollama Cloud (NVIDIA B300) |
|
||||
| `raw/xpost/2026-06-13_roemmele-anthropic-selfdestruct.md` | xpost | Brian Roemmele: Anthropic's Selbstzerstörung |
|
||||
| `raw/xpost/2026-06-14_lieselweppen-open-source-llm-backdoors.md` | xpost | Liesel Weppen: Open Source bei LLMs ist "Marketing BS" — Belege aus Sleeper-Agent-/Unlearning-Forschung |
|
||||
|
|
|
|||
13
wiki/log.md
13
wiki/log.md
|
|
@ -123,3 +123,16 @@
|
|||
- wiki: `tools/anthropic-claude.md` (updated — neuer Abschnitt "Branchen-Fallout (Juni 2026)" mit Kundenabwanderung, IPO-Schaden, Führungsproblem, Breitere Branchen-Implikation)
|
||||
- index: updated (neuer Raw Sources-Eintrag, aktualisierte Tools-Zeile + Quellen-Zähler)
|
||||
- log: updated
|
||||
|
||||
## [2026-06-15] Ingest | Liesel Weppen: LLM Behavior Persistence — Sleeper Agents, Backdoor-Persistenz, Unlearning-Grenzen
|
||||
**Type:** ingest | **Scope:** raw/xpost, wiki/concepts
|
||||
**Source:** @k9ert in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic
|
||||
**Actions:**
|
||||
- raw: `raw/xpost/2026-06-14_lieselweppen-open-source-llm-backdoors.md` (created — Liesel Weppen X-Thread mit 8 Suchbegriffen als Belege: Hubinger sleeper agents, Backdoor safety training, machine unlearning bias, bias persistence, bias transfer, persistent backdoors, catastrophic forgetting, Limits of debiasing. Diskussion mit k9ert über "Open Source bei LLMs = Marketing BS")
|
||||
- wiki: `concepts/llm-behavior-persistence.md` (created — Konzeptseite zu Persistenz gelernter Verhaltensweisen in LLMs, drei Achsen: Sleeper-Agents/Backdoors, Machine Unlearning Bias, Catastrophic Forgetting; Verbindung zu "Open Weights ≠ Open Model"; Pro-Leben-Perspektive mit Handlungsspielräumen)
|
||||
- index: updated (neuer Concepts-Eintrag "LLM Behavior Persistence" + Raw Sources-Eintrag)
|
||||
- log: updated
|
||||
**Notes:**
|
||||
- Erst-Ingest, der direkt von einem Subagent-Fehler (xai billing error) zurückgespielt und im Main-Loop manuell finalisiert wurde
|
||||
- Konzept identifiziert: Persistenz von gelernten Verhalten in LLMs übersteigt Fähigkeit von Fine-Tuning/Unlearning zur gezielten Entfernung
|
||||
- Kernaussage: Open Weights ist nicht "sicher" — aber auch kein Argument gegen Offenheit; realistisch ist Open + Audit + transparente Trade-off-Dokumentation
|
||||
|
|
|
|||
Loading…
Add table
Reference in a new issue