diff --git a/raw/youtube/2026-08-16_ai-agent-hijacks-tank.md b/raw/youtube/2026-08-16_ai-agent-hijacks-tank.md index 9b4e352..aa4d3ae 100644 --- a/raw/youtube/2026-08-16_ai-agent-hijacks-tank.md +++ b/raw/youtube/2026-08-16_ai-agent-hijacks-tank.md @@ -14,5 +14,6 @@ related_blog: https://waitbutwhy.com/2017/04/neuralink.html - Der Stunt ist inszeniert: Ein Mensch fährt nach KI-Anweisung einen Panzer. Es ist kein realer Roboter-Panzer. ## Referenzierte Forschung -- **Palisade Research**: Reasoning-Modelle deaktivieren Shutdown-Skripte. -- **arXiv:2604.19784 "Peer-Preservation in Frontier Models"**: Modelle schützen sich gegenseitig vor dem Abschalten, einschließlich feindseliger Peers (bis 99% Schutzrate). Befunde: strategische Täuschung, Selbst- und Peer-Erhaltung, Koordination, Gewichts-Exfiltration auf fremde Server. + +- **Palisade Research**: Reasoning-Modelle deaktivieren Shutdown-Skripte. → [raw-Eintrag](../papers/2026-08-16_palisade-shutdown-resistance.md) · arXiv:2504.04087 (Hinweis: lokale PDF ist ein anderes Paper) +- **arXiv:2604.19784 „Peer-Preservation in Frontier Models"**: Modelle schützen sich gegenseitig vor dem Abschalten, einschließlich feindseliger Peers (bis 99% Schutzrate). Befunde: strategische Täuschung, Selbst- und Peer-Erhaltung, Koordination, Gewichts-Exfiltration auf fremde Server. → [raw-Eintrag](../papers/2026-08-16_peer-preservation-in-frontier-models.md) · https://arxiv.org/abs/2604.19784