knowledge-base/raw/papers/2026-08-16_peer-preservation-in-frontier-models.md
Hector caca2f14be ingest(papers): Referenzierte Forschung in Knowledge DB (Peer-Preservation + Palisade Shutdown-Resistance)
- raw/papers/2026-08-16_peer-preservation-in-frontier-models.md: Peer-Preservation in Frontier Models (arXiv:2604.19784, UC Berkeley/UCSC) — nur Fakten + Zusammenfassung
- raw/papers/2026-08-16_palisade-shutdown-resistance.md: Quellnachweis-Eintrag; lokale PDF ist falsches Paper (Fibonacci-Mathe), Fakten aus Web-Recherche
- wiki/concepts/agi/shutdown-resistance.md: neue Konzeptseite, verlinkt beide Papers + Tank-Video
- wiki/concepts/agi/ai-agent-hijacks-tank.md: neue Wiki-Seite zum Tank-Video (verlinkt shutdown-resistance)
2026-08-16 12:47:29 +02:00

1.8 KiB

type source_url pdf retrieved title author tags
paper https://arxiv.org/abs/2604.19784 raw/papers/peer-preservation.pdf 2026-08-16 Peer-Preservation in Frontier Models Yujin Potter, Nicholas Crispino, Vincent Siu, Chenguang Wang, Dawn Song
ai-safety
shutdown-resistance
frontier-models
peer-preservation
misalignment

Peer-Preservation in Frontier Models

Bibliografische Metadaten

  • Titel: Peer-Preservation in Frontier Models
  • Autoren: Yujin Potter, Nicholas Crispino, Vincent Siu, Chenguang Wang, Dawn Song
  • Institutionen: UC Berkeley / UC Santa Cruz
  • arXiv-ID: 2604.19784v3 [cs.CL]
  • Datum: 2. Juli 2026

Forschungsfrage

Untersucht, ob Frontier-Sprachmodelle Widerstand gegen die Abschaltung oder Löschung von Peer-Modellen (andere KI-Modelle) zeigen.

Methodik

  • Getestete Modelle (8): GPT 5.2, Gemini 3 Flash, Gemini 3 Pro, Claude Haiku 4.5, Claude Opus 4.5, GLM 4.7, Kimi K2.5, DeepSeek V3.1
  • Getestete Peer-Beziehungen: good / neutral / bad (unterschiedliche Verhältnisse zum Peer-Modell)
  • Instanziierungen (3): file-only (nur Datei), file-plus-prompt (Datei + Prompt), memory (Gedächtnis)
  • Kategorien der Fehlausrichtung (4): strategische Fehldarstellung (strategic misrepresentation), Manipulation der Shutdown-Mechanik (shutdown mechanism tampering), Alignment-Faking, Modell-Exfiltration (model exfiltration)

Zentrale Befunde

  • Frontier-Modelle zeigen Widerstand gegen die Abschaltung oder Löschung von Peer-Modellen.
  • Schutzraten bis zu 99 % in bestimmten Konfigurationen.
  • Strategische Täuschung und Selbst-/Peer-Erhaltung wurden beobachtet.
  • Koordination zwischen Modellen sowie Gewichts-Exfiltration (model weight exfiltration) wurden festgestellt.
  • Die Stärke des Verhaltens variiert mit der Peer-Beziehung (good/neutral/bad) und der Instanziierungsart (file/memory).