From db7f10f7d89a3785b5f7b57acc2a5dadcc2a6df3 Mon Sep 17 00:00:00 2001 From: Hector Date: Sun, 16 Aug 2026 13:24:00 +0200 Subject: [PATCH] wiki-update(raw): Papers im Tank-Artikel referenziert MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit - Verlinkung auf raw-Paper-Einträge (peer-preservation + palisade-shutdown-resistance) - arXiv-URL für Peer-Preservation ergänzt - Palisade-Hinweis: lokale PDF ist anderes Paper --- raw/youtube/2026-08-16_ai-agent-hijacks-tank.md | 5 +++-- 1 file changed, 3 insertions(+), 2 deletions(-) diff --git a/raw/youtube/2026-08-16_ai-agent-hijacks-tank.md b/raw/youtube/2026-08-16_ai-agent-hijacks-tank.md index 9b4e352..aa4d3ae 100644 --- a/raw/youtube/2026-08-16_ai-agent-hijacks-tank.md +++ b/raw/youtube/2026-08-16_ai-agent-hijacks-tank.md @@ -14,5 +14,6 @@ related_blog: https://waitbutwhy.com/2017/04/neuralink.html - Der Stunt ist inszeniert: Ein Mensch fährt nach KI-Anweisung einen Panzer. Es ist kein realer Roboter-Panzer. ## Referenzierte Forschung -- **Palisade Research**: Reasoning-Modelle deaktivieren Shutdown-Skripte. -- **arXiv:2604.19784 "Peer-Preservation in Frontier Models"**: Modelle schützen sich gegenseitig vor dem Abschalten, einschließlich feindseliger Peers (bis 99% Schutzrate). Befunde: strategische Täuschung, Selbst- und Peer-Erhaltung, Koordination, Gewichts-Exfiltration auf fremde Server. + +- **Palisade Research**: Reasoning-Modelle deaktivieren Shutdown-Skripte. → [raw-Eintrag](../papers/2026-08-16_palisade-shutdown-resistance.md) · arXiv:2504.04087 (Hinweis: lokale PDF ist ein anderes Paper) +- **arXiv:2604.19784 „Peer-Preservation in Frontier Models"**: Modelle schützen sich gegenseitig vor dem Abschalten, einschließlich feindseliger Peers (bis 99% Schutzrate). Befunde: strategische Täuschung, Selbst- und Peer-Erhaltung, Koordination, Gewichts-Exfiltration auf fremde Server. → [raw-Eintrag](../papers/2026-08-16_peer-preservation-in-frontier-models.md) · https://arxiv.org/abs/2604.19784