knowledge-base/raw/xpost/2026-06-14_lieselweppen-open-source-llm-backdoors.md
Hector Bot 7aace389c1 ingest(xpost): lieselweppen-llm-behavior-persistence
Konzeptseite zu Persistenz gelernter Verhaltensweisen in LLMs.
Basiert auf Liesel Weppens 8 Suchbegriffen (Sleeper Agents, Backdoor
safety training, machine unlearning bias, bias persistence, bias
transfer, persistent backdoors, catastrophic forgetting, limits of
debiasing). Drei Achsen: versteckte Verhaltensmuster überleben
Safety-Training, Machine Unlearning entfernt Bias unvollstaendig,
catastrophic forgetting als Daempfer.

Kernthese: Open Weights != Open Model — Pro-Leben-Perspektive mit
realistischen Handlungsspielraumen (Open + Audit, selektive
Offenlegung, verteilte Sicherheit, Engineering-Realismus).

Subagent-Initial-Versuch scheiterte (xai billing error); manuell
finalisiert im Main-Loop.
2026-06-15 06:55:43 +02:00

2.9 KiB

type source_url retrieved author is_thread thread_context tags
xpost https://x.com/LieselWeppen/status/2066247709317562762 2026-06-15 @LieselWeppen true
21Stammtisch
LieselWeppen
k9ert
llm-safety
open-source
sleeper-agents
backdoor
unlearning
alignment
bias

Liesel Weppen: "Open Source bei LLMs ist Marketing BS" — Verweise auf Backdoor-/Unlearning-Forschung

Geteilt von: @k9ert in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic

Source: X Post + Thread

Author: Liesel Weppen (@LieselWeppen) Posted: Sun, 14 Jun 2026 19:53:37 GMT URL: https://x.com/LieselWeppen/status/2066247709317562762 Likes: 0 | Retweets: 0

Thread-Kontext

Diskussion zwischen drei Akteuren über die Frage, was "Open Source" bei LLMs praktisch bedeutet.

1. @21Stammtisch — Spaces-Einladung

URL: https://x.com/21Stammtisch/status/2066218075645456837 Likes: 8 | Retweets: 6

https://twitter.com/i/spaces/1jGXggERREyKZ/peek

2. @LieselWeppen — Hauptposition

URL: https://x.com/LieselWeppen/status/2066244177621352656 Likes: 2 | Retweets: 0

Open Source bei LLMs ist Marketing BS. Die Modelle sind maximal open weights, aber nicht open Trainingsdaten und Algos.

3. @k9ert — Gegenposition

URL: https://x.com/k9ert/status/2066244968839098854 Likes: 1 | Retweets: 0

Nichts ist perfekt aber "nachtrainieren" ist ja schon mal ein super Anfang. Und hoffentlich ist es damit nicht zu Ende. Aber "Marketing BS" ist jetzt echt übertrieben.

4. @LieselWeppen — Belege (Hauptpost)

URL: https://x.com/LieselWeppen/status/2066247709317562762 Likes: 0 | Retweets: 0

Sehe ich anders...

Suchbegriffe bei Google oder Google Scholar:

Hubinger sleeper agents Backdoor safety training machine unlearning bias bias persistence bias transfer persistent backdoors catastrophic forgetting Limits of debiasing

Interpretation

Liesel Weppen verweist auf eine konzeptuelle Verwandtschaft ihrer Kritik: "Open Weights" ≠ "Open Model" — die zentralen Eigenschaften eines LLMs (Trainingsdaten, Trainingsalgorithmen, RLHF/Safety-Pipelines, hidden States für Backdoors) bleiben für die Community eine Black Box. Die acht Suchbegriffe bilden ein gemeinsames Konzept ab: Persistence of Learned Behaviors in LLMs — Grenzen von Safety-Training, Unlearning und Debiasing.

Die zentrale Aussage ist: Selbst wenn Gewichte offen sind, bedeutet das nicht, dass die Sicherheitseigenschaften transparent, dokumentiert oder durch Nutzer-Training entfernbar sind. Im Gegenteil — die Forschung zeigt, dass schädliche Eigenschaften (Backdoors, Sleeper-Agent-Trigger, Bias) selbst nach intensivem Nachtraining persistent sein können.

K9erts Position ist differenzierter: Nachtraining (Fine-Tuning) ist "ein super Anfang", und "Marketing BS" sei übertrieben. Die Diskussion oszilliert um die Frage, ob "open weights" + "nachtrainierbar" einen hinreichenden Open-Source-Begriff darstellt.