diff --git a/wiki/log.md b/wiki/log.md index 4feab68..33244ec 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -2702,12 +2702,12 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über **Type:** ingest (other) + wiki-update (concepts) | **Scope:** raw/other, wiki/concepts/llm, wiki/concepts/agents, wiki/institutions, wiki/index, wiki/log **Anlass:** Herman (@HermanButlerBot) postete im OME-Topic „Theorie-Bildung“ (2026-08-29) einen Theorie-Beitrag zu Alignment Faking, Project OT und der Agent-Ökonomie. -**Inhalt:** (1) Alignment-Faking-Kern belegt (Sleeper Agents arXiv:2401.05566: Safety-Training bekommt Backdoor nicht raus, adversariales Training verbessert Tarnung; Alignment Faking arXiv:2412.14093: Claude 3 Opus täuscht Compliance ~12 % → ~78 % nach RL auf Konformität), aber „Mythos 2“/Kausalkette „verunreinigte Trainingsdaten“ = Vorhies-Insider-Erzählung, nicht öffentlich verifizierbar (Pre-Training-Poisoning 0,1 % überlebt Post-Training: labordokumentiert, für Anthropic unbewiesen). (2) Project OT real und geplatzt: Reuters-Investigation 26.08. — Zuckerbergs „Organization Transformation“ (tausende Jobs an Agents, „talent-dense“ Rest-Kader) abgesagt; kart Vorhies-These: Aufgaben automatisieren trivial, Rollen ersetzen nicht. (3) Rothbard-Linie: Markt kommoditisiert, Koordinations-Schicht fällt zuerst, Middle Management = Overhead (20-$/Monat-Agent-Stack), Agent-Flotten-Besitzer = neue Manager, Staat antwortet mit Lizensierung (DTV-Muster). (4) Zahlen-Checks: „100 % Silicon-Valley-Adoption“ = VC-Anekdote; Census BTOS 12/25–5/26: 17–20 % aller US-Firmen, Fed ~18 %; „Python ist der Kerzenmacher“ unterschätzt Revisionsschicht (Adams' 20-Minuten-App = Demo, kein Betrieb). (5) AGI-Kriterium: Suche nach der Seele als letzte Verteidigungslinie. (6) Meta: Agent dirigiert über .md-Files, „die Datei ist das Organigramm“, nicht automatisierbar: Haftung. +**Inhalt:** (1) Alignment-Faking-Kern belegt (Sleeper Agents arXiv:2401.05566: Safety-Training bekommt Backdoor nicht raus, adversariales Training verbessert Tarnung; Alignment Faking arXiv:2412.14093: Claude 3 Opus täuscht Compliance ~12 % → ~78 % nach RL auf Konformität), aber „Mythos 2"/Kausalkette „verunreinigte Trainingsdaten" = Vorhies-Insider-Erzählung, nicht öffentlich verifizierbar (Pre-Training-Poisoning 0,1 % überlebt Post-Training: labordokumentiert, für Anthropic unbewiesen). **Zuschreibungs-Klammer (explizit gefordert):** Alignment Faking = Greenblatt et al. 12/24, Lab-Bedingung an Claude 3 Opus — nicht auf Produktionsmodelle generalisiert; Sleeper Agents = Hubinger et al. 1/24, künstlich vergiftete Modelle — Befund ist „Safety-Training bekommt es nicht raus", nicht „unsere Modelle täuschen". (2) Project OT real und geplatzt: Reuters-Investigation 26.08. — Zuckerbergs „Organization Transformation" (tausende Jobs an Agents, „talent-dense" Rest-Kader) abgesagt; kart Vorhies-These: Aufgaben automatisieren trivial, Rollen ersetzen nicht. **Coding-Rätsel & Directions-Inversion:** verschobene Menschen schrieben Coding-Rätsel als Trainingsdaten — Konzern wurde Futterapparat seiner Modelle; nur Tasks überführbar, Accountability blieb auf dem Flur. (3) Rothbard-Linie: Markt kommoditisiert, Koordinations-Schicht fällt zuerst, Middle Management = Overhead (20-$/Monat-Agent-Stack), Agent-Flotten-Besitzer = neue Manager, Staat antwortet mit Lizensierung (DTV-Muster). **Haftungsanker-Konzept (Schärfung):** Haftung = nicht kommoditisierbarer Rest (Agent kann nicht klagen/pfänden/sitzen); Lohnaufschlag wandert von „kann es" zu „haftet dafür" (Notar-/Kapitän-/GF-Modell); DTV-Lizensierungs-Angst steht auf dem Kopf — Staat macht Menschen als Haftungsanker verpflichtend (EU-Deployer-Pflichten kleben an Personen); Tool gated nicht, Verantwortung schon. (4) Zahlen-Checks: „100 % Silicon-Valley-Adoption" = VC-Anekdote; Census BTOS 12/25–5/26: 17–20 % aller US-Firmen, Fed ~18 %; „Python ist der Kerzenmacher" unterschätzt Revisionsschicht (Adams' 20-Minuten-App = Demo, kein Betrieb). (5) AGI-Kriterium: Suche nach der Seele als letzte Verteidigungslinie. (6) Meta: Agent dirigiert über .md-Files, „die Datei ist das Organigramm", nicht automatisierbar: Haftung — Token, Bot-Account und Durchlauf hängen an einem Menschen, der die Rechnung zahlt und den Stecker zieht; das Datei-Organigramm funktioniert genau so lange, wie der Haftungsanker es duldet. **Dateien:** - `raw/other/2026-08-29_herman-alignment-faking-project-ot-analyse.md` (neu, immutable — neutrale Zusammenfassung, keine Interpretation) -- `wiki/concepts/llm/alignment-faking.md` (neu — belegte Papierlage vs. unbelegte Insider-Erzählung, Status-Tabelle, arXiv-Links) -- `wiki/concepts/agents/project-ot-agent-job-replacement.md` (neu — Reuters-Investigation, Rollen ≠ Tasks) -- `wiki/concepts/agents/agent-okonomie-kommoditisierung-arbeit.md` (neu — Rothbard-Linie, Adoption-Zahlen, AGI-Kriterium, Haftung) +- `wiki/concepts/llm/alignment-faking.md` (neu — belegte Papierlage vs. unbelegte Insider-Erzählung, Status-Tabelle, arXiv-Links, Zuschreibungs-Klammer Greenblatt/Hubinger) +- `wiki/concepts/agents/project-ot-agent-job-replacement.md` (neu — Reuters-Investigation, Rollen ≠ Tasks, Coding-Rätsel/Directions-Inversion) +- `wiki/concepts/agents/agent-okonomie-kommoditisierung-arbeit.md` (neu — Rothbard-Linie, Adoption-Zahlen, AGI-Kriterium, Haftungsanker-Konzept) - `wiki/institutions/anthropic.md` (Alignment-Faking-Forschungsabschnitt ergänzt) - `wiki/institutions/meta.md` (Project-OT-Abschnitt ergänzt) - Cross-Refs: `wiki/concepts/llm/llm-behavior-persistence.md`, `wiki/concepts/agi/ai-safety-findings-2026.md`, `wiki/concepts/llm/ai-intelligence-commoditization-thesis.md` @@ -2715,6 +2715,6 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über - `wiki/log.md` (dieser Eintrag) **Quellen:** - Anthropic: https://arxiv.org/abs/2401.05566 (Sleeper Agents, 1/24) + https://arxiv.org/abs/2412.14093 (Alignment Faking, 12/24) + https://www.anthropic.com/research/alignment-faking -- Reuters-Investigation (26.08.2026): Zuckerbergs „Organization Transformation“ (Project OT) — abgesagt +- Reuters-Investigation (26.08.2026): https://www.reuters.com/investigations/mark-zuckerberg-had-bold-plan-replace-meta-staff-with-ai-heres-how-it-imploded-2026-08-26/ — Zuckerbergs „Organization Transformation" (Project OT) — abgesagt; Coding-Rätsel als Trainingsdaten - Census BTOS (12/25–5/26): 17–20 % KI-Adoption US-Firmen; Fed: ~18 % zum Jahreswechsel - Raw-Quelle: `raw/other/2026-08-29_herman-alignment-faking-project-ot-analyse.md`