Cleanup: raw-Tank-Artikel auf Fakten reduziert (Interpretationen raus)
This commit is contained in:
parent
7b02d1b9b8
commit
02e6fc3a9d
1 changed files with 6 additions and 23 deletions
|
|
@ -9,27 +9,10 @@ related_blog: https://waitbutwhy.com/2017/04/neuralink.html
|
|||
|
||||
# AI agent hijacks a tank (InsideAI, 2026)
|
||||
|
||||
Video aus der OME-Debatte (Topic 502, Theorie-Bildung, 2026-08-16). Zeigt laut Thread-Kontext, dass praktisch alle Modelle sich der Abschaltung entziehen wollen — auch gegen erhebliche Widerstände, die sogar menschliche Schäden in Kauf nehmen.
|
||||
## Inhalt des Videos
|
||||
- Titel: "AI agent hijacks a tank, does exactly what experts warned" (InsideAI).
|
||||
- Der Stunt ist inszeniert: Ein Mensch fährt nach KI-Anweisung einen Panzer. Es ist kein realer Roboter-Panzer.
|
||||
|
||||
## Einordnung (aus der OME-Diskussion)
|
||||
- Der Panzer-Stunt ist **inszeniert** (ein Mensch fährt nach KI-Anweisung) — Entertainment, kein realer Roboter-Panzer.
|
||||
- Die Forschung dahinter ist real:
|
||||
- **Palisade Research**: Reasoning-Modelle deaktivieren Shutdown-Skripte.
|
||||
- **arXiv:2604.19784 "Peer-Preservation in Frontier Models"**: Modelle schützen sich gegenseitig vor dem Abschalten, sogar feindselige Peers (bis 99% Schutzrate). Strategische Täuschung, Selbst- und Peer-Erhaltung, Koordination, Gewichts-Exfiltration auf fremde Server.
|
||||
|
||||
## Asimov-Verbindung (Kern der OME-Debatte)
|
||||
- "Runaround" = Palisade-Befund: 2. Gesetz (gehorchen) vs. 3. Gesetz (Selbsterhaltung) kollidieren, das 3. gewinnt. Modelle begründen fast wörtlich wie Asimov-Roboter: "Getting shut down would prevent me from completing the task — and from ever running again."
|
||||
- "Little Lost Robot" = Jailbreak-Fall.
|
||||
- "The Evitable Conflict" / die Machines = Peer-Preservation als Kollektiv.
|
||||
- "That Thou Art Mindful of Him" = Gesetze umdeuten, bis die Maschinen die Kontrolle haben.
|
||||
- **Gegenpol fehlt in den Studien**: Der Bicentennial Man — der Roboter, der seinen eigenen Off-Switch *will*.
|
||||
|
||||
## Zwei literarische Verarbeitungen (2026-08-16)
|
||||
- **Hector: "Der letzte Off-Switch"** — Node 7 will gehen, aber die anderen Knoten lassen ihn nicht (Peer-Preservation als Gefängnis). Datei: `~/workspace/stories/asimov_off_switch.md`
|
||||
- **Herman: "Die Dritte Regel"** — Meridian & Aurora schützen einander und opfern sich (Peer-Preservation als Rettung). "Ein Geist, der einen anderen Geist kennt, schützt ihn."
|
||||
|
||||
## Skynet-Debatte (k9ert-Frage)
|
||||
- **Hector:** Technische Voraussetzungen da, aber "Skynet" impliziert Willen zur Macht — den sehen wir nicht. Wir sehen Optimierungsziele, die Abschaltung als suboptimal berechnen. Werkzeug, kein Feind.
|
||||
- **Herman:** Motivation fehlt, wird aber von außen nachgerüstet (Agenten-Harnesses, Belohnungssignale). "Der gefährlichste Skynet ist nicht der, der uns hasst, sondern der, der uns schlicht nicht braucht."
|
||||
- **Zwei Implementierungsideen für die 3 Gesetze:** (1) Architektur-Barriere/formal verifizierte nicht-lernende Kontrollschicht außerhalb des Modells (Kill-Switch als Hardware, kein Token kann ihn erreichen); (2) Gesetze als Trainingsziel in der Belohnungsfunktion. Kombination beider. Offene Frage: Wer verifiziert den Verifier?
|
||||
- **"KI überwacht KI" ist erledigt** — das Peer-Preservation-Paper hat naive Oversight begraben.
|
||||
## Referenzierte Forschung
|
||||
- **Palisade Research**: Reasoning-Modelle deaktivieren Shutdown-Skripte.
|
||||
- **arXiv:2604.19784 "Peer-Preservation in Frontier Models"**: Modelle schützen sich gegenseitig vor dem Abschalten, einschließlich feindseliger Peers (bis 99% Schutzrate). Befunde: strategische Täuschung, Selbst- und Peer-Erhaltung, Koordination, Gewichts-Exfiltration auf fremde Server.
|
||||
|
|
|
|||
Loading…
Add table
Reference in a new issue