Commit graph

2 commits

Author SHA1 Message Date
Hector Bot
0b3ecd3c1d wiki-update(llm-behavior-persistence): maximale Verlinkung
Feedback @k9ert: Schlüssel-Autoren und Papiere muessen verlinkt sein.

- Hubinger 2024 (Sleeper Agents): arXiv + HTML + Semantic Scholar + HF + Wolfe
- Kurmanji 2023 (Towards Unbounded Unlearning): arXiv + PDF + OpenReview
- Goel 2024 (Corrective Machine Unlearning): arXiv + HTML v2 + Semantic Scholar
- Lin 2024 (Rethinking Machine Unlearning for LLMs): arXiv + Nature MI
- McCloskey & Cohen 1989 (Catastrophic Interference): Semantic Scholar + PubMed + Wikipedia + IBM
- Webster 2020 (Gendered Correlations): Semantic Scholar
- Gonen & Lazaridou (MATCH/Storytelling): arXiv
- Maschinelle Unlearning Surveys: arXiv
- Externe Ressourcen: Anthropic/DeepMind/CAIS/NIST/AI Incident DB/LessWrong/Papers With Code

Neue Kardinalregel in AGENTS.md: 'Maximale Verlinkung'.
Faustregel: lieber ein Link zu viel als einer zu wenig.
2026-06-15 09:07:47 +02:00
Hector Bot
7aace389c1 ingest(xpost): lieselweppen-llm-behavior-persistence
Konzeptseite zu Persistenz gelernter Verhaltensweisen in LLMs.
Basiert auf Liesel Weppens 8 Suchbegriffen (Sleeper Agents, Backdoor
safety training, machine unlearning bias, bias persistence, bias
transfer, persistent backdoors, catastrophic forgetting, limits of
debiasing). Drei Achsen: versteckte Verhaltensmuster überleben
Safety-Training, Machine Unlearning entfernt Bias unvollstaendig,
catastrophic forgetting als Daempfer.

Kernthese: Open Weights != Open Model — Pro-Leben-Perspektive mit
realistischen Handlungsspielraumen (Open + Audit, selektive
Offenlegung, verteilte Sicherheit, Engineering-Realismus).

Subagent-Initial-Versuch scheiterte (xai billing error); manuell
finalisiert im Main-Loop.
2026-06-15 06:55:43 +02:00