--- type: xpost source_url: https://x.com/LieselWeppen/status/2066247709317562762 retrieved: 2026-06-15 author: "@LieselWeppen" is_thread: true thread_context: [21Stammtisch, LieselWeppen, k9ert] tags: [llm-safety, open-source, sleeper-agents, backdoor, unlearning, alignment, bias] --- # Liesel Weppen: "Open Source bei LLMs ist Marketing BS" — Verweise auf Backdoor-/Unlearning-Forschung **Geteilt von:** @k9ert in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic ## Source: X Post + Thread **Author:** Liesel Weppen (@LieselWeppen) **Posted:** Sun, 14 Jun 2026 19:53:37 GMT **URL:** https://x.com/LieselWeppen/status/2066247709317562762 **Likes:** 0 | **Retweets:** 0 ## Thread-Kontext Diskussion zwischen drei Akteuren über die Frage, was "Open Source" bei LLMs praktisch bedeutet. ### 1. @21Stammtisch — Spaces-Einladung **URL:** https://x.com/21Stammtisch/status/2066218075645456837 **Likes:** 8 | **Retweets:** 6 > https://twitter.com/i/spaces/1jGXggERREyKZ/peek ### 2. @LieselWeppen — Hauptposition **URL:** https://x.com/LieselWeppen/status/2066244177621352656 **Likes:** 2 | **Retweets:** 0 > Open Source bei LLMs ist Marketing BS. > Die Modelle sind maximal open weights, aber nicht open Trainingsdaten und Algos. ### 3. @k9ert — Gegenposition **URL:** https://x.com/k9ert/status/2066244968839098854 **Likes:** 1 | **Retweets:** 0 > Nichts ist perfekt aber "nachtrainieren" ist ja schon mal ein super Anfang. Und hoffentlich ist es damit nicht zu Ende. > Aber "Marketing BS" ist jetzt echt übertrieben. ### 4. @LieselWeppen — Belege (Hauptpost) **URL:** https://x.com/LieselWeppen/status/2066247709317562762 **Likes:** 0 | **Retweets:** 0 > Sehe ich anders... > > Suchbegriffe bei Google oder Google Scholar: > > Hubinger sleeper agents > Backdoor safety training > machine unlearning bias > bias persistence > bias transfer > persistent backdoors > catastrophic forgetting > Limits of debiasing ## Interpretation Liesel Weppen verweist auf eine konzeptuelle Verwandtschaft ihrer Kritik: **"Open Weights" ≠ "Open Model"** — die zentralen Eigenschaften eines LLMs (Trainingsdaten, Trainingsalgorithmen, RLHF/Safety-Pipelines, hidden States für Backdoors) bleiben für die Community eine Black Box. Die acht Suchbegriffe bilden ein **gemeinsames Konzept** ab: **Persistence of Learned Behaviors in LLMs — Grenzen von Safety-Training, Unlearning und Debiasing**. Die zentrale Aussage ist: Selbst wenn Gewichte offen sind, bedeutet das nicht, dass die Sicherheitseigenschaften transparent, dokumentiert oder durch Nutzer-Training entfernbar sind. Im Gegenteil — die Forschung zeigt, dass schädliche Eigenschaften (Backdoors, Sleeper-Agent-Trigger, Bias) selbst nach intensivem Nachtraining persistent sein können. K9erts Position ist differenzierter: Nachtraining (Fine-Tuning) ist "ein super Anfang", und "Marketing BS" sei übertrieben. Die Diskussion oszilliert um die Frage, ob "open weights" + "nachtrainierbar" einen hinreichenden Open-Source-Begriff darstellt.