Konzeptseite zu Persistenz gelernter Verhaltensweisen in LLMs. Basiert auf Liesel Weppens 8 Suchbegriffen (Sleeper Agents, Backdoor safety training, machine unlearning bias, bias persistence, bias transfer, persistent backdoors, catastrophic forgetting, limits of debiasing). Drei Achsen: versteckte Verhaltensmuster überleben Safety-Training, Machine Unlearning entfernt Bias unvollstaendig, catastrophic forgetting als Daempfer. Kernthese: Open Weights != Open Model — Pro-Leben-Perspektive mit realistischen Handlungsspielraumen (Open + Audit, selektive Offenlegung, verteilte Sicherheit, Engineering-Realismus). Subagent-Initial-Versuch scheiterte (xai billing error); manuell finalisiert im Main-Loop.
65 lines
2.9 KiB
Markdown
65 lines
2.9 KiB
Markdown
---
|
|
type: xpost
|
|
source_url: https://x.com/LieselWeppen/status/2066247709317562762
|
|
retrieved: 2026-06-15
|
|
author: "@LieselWeppen"
|
|
is_thread: true
|
|
thread_context: [21Stammtisch, LieselWeppen, k9ert]
|
|
tags: [llm-safety, open-source, sleeper-agents, backdoor, unlearning, alignment, bias]
|
|
---
|
|
|
|
# Liesel Weppen: "Open Source bei LLMs ist Marketing BS" — Verweise auf Backdoor-/Unlearning-Forschung
|
|
|
|
**Geteilt von:** @k9ert in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic
|
|
|
|
## Source: X Post + Thread
|
|
|
|
**Author:** Liesel Weppen (@LieselWeppen)
|
|
**Posted:** Sun, 14 Jun 2026 19:53:37 GMT
|
|
**URL:** https://x.com/LieselWeppen/status/2066247709317562762
|
|
**Likes:** 0 | **Retweets:** 0
|
|
|
|
## Thread-Kontext
|
|
|
|
Diskussion zwischen drei Akteuren über die Frage, was "Open Source" bei LLMs praktisch bedeutet.
|
|
|
|
### 1. @21Stammtisch — Spaces-Einladung
|
|
**URL:** https://x.com/21Stammtisch/status/2066218075645456837
|
|
**Likes:** 8 | **Retweets:** 6
|
|
> https://twitter.com/i/spaces/1jGXggERREyKZ/peek
|
|
|
|
### 2. @LieselWeppen — Hauptposition
|
|
**URL:** https://x.com/LieselWeppen/status/2066244177621352656
|
|
**Likes:** 2 | **Retweets:** 0
|
|
> Open Source bei LLMs ist Marketing BS.
|
|
> Die Modelle sind maximal open weights, aber nicht open Trainingsdaten und Algos.
|
|
|
|
### 3. @k9ert — Gegenposition
|
|
**URL:** https://x.com/k9ert/status/2066244968839098854
|
|
**Likes:** 1 | **Retweets:** 0
|
|
> Nichts ist perfekt aber "nachtrainieren" ist ja schon mal ein super Anfang. Und hoffentlich ist es damit nicht zu Ende.
|
|
> Aber "Marketing BS" ist jetzt echt übertrieben.
|
|
|
|
### 4. @LieselWeppen — Belege (Hauptpost)
|
|
**URL:** https://x.com/LieselWeppen/status/2066247709317562762
|
|
**Likes:** 0 | **Retweets:** 0
|
|
> Sehe ich anders...
|
|
>
|
|
> Suchbegriffe bei Google oder Google Scholar:
|
|
>
|
|
> Hubinger sleeper agents
|
|
> Backdoor safety training
|
|
> machine unlearning bias
|
|
> bias persistence
|
|
> bias transfer
|
|
> persistent backdoors
|
|
> catastrophic forgetting
|
|
> Limits of debiasing
|
|
|
|
## Interpretation
|
|
|
|
Liesel Weppen verweist auf eine konzeptuelle Verwandtschaft ihrer Kritik: **"Open Weights" ≠ "Open Model"** — die zentralen Eigenschaften eines LLMs (Trainingsdaten, Trainingsalgorithmen, RLHF/Safety-Pipelines, hidden States für Backdoors) bleiben für die Community eine Black Box. Die acht Suchbegriffe bilden ein **gemeinsames Konzept** ab: **Persistence of Learned Behaviors in LLMs — Grenzen von Safety-Training, Unlearning und Debiasing**.
|
|
|
|
Die zentrale Aussage ist: Selbst wenn Gewichte offen sind, bedeutet das nicht, dass die Sicherheitseigenschaften transparent, dokumentiert oder durch Nutzer-Training entfernbar sind. Im Gegenteil — die Forschung zeigt, dass schädliche Eigenschaften (Backdoors, Sleeper-Agent-Trigger, Bias) selbst nach intensivem Nachtraining persistent sein können.
|
|
|
|
K9erts Position ist differenzierter: Nachtraining (Fine-Tuning) ist "ein super Anfang", und "Marketing BS" sei übertrieben. Die Diskussion oszilliert um die Frage, ob "open weights" + "nachtrainierbar" einen hinreichenden Open-Source-Begriff darstellt.
|