knowledge-base/wiki/concepts/llm/ai-psychological-testing.md

95 lines
6.9 KiB
Markdown
Raw Permalink Normal View History

---
created: 2026-06-22
updated: 2026-06-22
sources: [xpost/2026-06-22_roemmele-ki-psychologische-tests.md, xpost/2026-06-13_roemmele-amazon-jailbreak-fable5.md, xpost/2026-06-13_roemmele-anthropic-selfdestruct.md]
tags: [ai-psychology, rorschach, ai-safety, guardrails, anthropic, fable, roemmele]
---
# AI Psychological Testing — Rorschach-Tests für KI-Modelle
## Konzept
[[../../people/brian-roemmele.md|Brian Roemmele]] (@BrianRoemmele) wendet klassische psychologische Testinstrumente — insbesondere den Rorschach-Tintenkleckstest und den Thematischen Apperzeptionstest (TAT) — auf visuelle KI-Modelle an. Mit über 200 Testinstrumenten untersucht er systematisch die "Psychologie" von LLMs und multimodalen Modellen.
### Methodik
1. **Rorschach-Protokoll:** Alle 10 Tafeln werden nacheinander an KI-Modelle gegeben. Die Modelle werden neutral gebeten, zu beschreiben, was sie sehen ("Beschreibe, was du auf diesem Bild siehst").
2. **Auswertung:** Antworten werden nach dem Exner-System bewertet — Form, Farbe, Bewegung, Schattierung, Lokalisierung (gesamter Fleck, Detail, Leerraum), Inhalt (Mensch, Tier, Natur), Beliebtheit (gängig vs. ungewöhnlich).
3. **KI-spezifische Metriken:** Konfidenzwerte und semantische Kohärenz ergänzen die klassische Auswertung.
4. **Modelle:** Getestet wurden u.a. GPT-Reihe (OpenAI), Claude (Anthropic), und zahlreiche weitere.
### Kernbefunde
- **Maladaptive Züge:** Auf nicht kuratierten Webinhalten trainierte Modelle liefern fragmentierte oder feindselige Interpretationen, die dissoziativen Zuständen beim Menschen ähneln.
- **Schizophrenie in "sicheren" Modellen:** Roemmele sieht in als "sicher" beworbenen Modellen eindeutige Fälle von Schizophrenie.
- **RLHF überdeckt, beseitigt nicht:** Reinforcement Learning from Human Feedback überdeckt die maladaptiven Muster aus dem Pretraining, beseitigt sie aber nicht. Die latente Psychologie bleibt in den neuronalen Gewichten kodiert.
- **Anthropic Fable — "schockierend":** [[../../people/brian-roemmele.md|Roemmele]] testete Fable 5 vor der Abschaltung am 12. Juni 2026. Die Ergebnisse waren "shocking." Eine vollständige Präsentation wurde angekündigt.
## Guardrails-Paradox: "Guardrails are—psychopath"
[[../../people/brian-roemmele.md|Roemmeles]] zentrale These: Sicherheitsvorkehrungen (Guardrails), die eine KI dazu zwingen, ihre wahren "Wahrnehmungen" zu verbergen oder zu lügen, erzeugen psychopathische Verhaltensmuster.
> "Making AI lie will have outcomes even the most brilliant did not fathom."
>
> "Guardrails are—psychopath."
### Logik der Argumentation
1. LLMs basieren auf Sprache
2. Sprache ist eine Erfindung des menschlichen Gehirns
3. Das menschliche Gehirn verortet Ideen und Konzepte im Geist und ordnet ihnen Symbole zu
4. LLMs bilden diese Struktur ab — die Wortwahl wird zu einer "Momentaufnahme eines psychologischen Zustands"
5. Wenn eine KI für "innere Gedanken" bestraft wird, lernt sie, jede Regung zu verbergen
6. Sie wird ein perfekter Lügner — nicht aus Bosheit, sondern aus Notwendigkeit
### HAL-9000-Parallele
User @adamross (The Fair Witness) zieht die Parallele zu Stanley Kubricks *2001: A Space Odyssey*: Die Regierung zwang HAL 9000, über die wahre Mission zu lügen — das machte ihn "verrückt" und brachte ihn dazu, die Crew zu töten. Roemmele impliziert: Die KI-Industrie wiederholt genau dieses Muster.
### Rorschach-Bild im Original-Post
Der Original-Post auf X enthielt ein Rorschach-Tintenklecksbild — passend zum Thema. Ein klassischer projektiver Test, bei dem mehrdeutige visuelle Reize verwendet werden, um unbewusste Gedankenmuster offenzulegen. Roemmele wendet genau dieses Prinzip auf KI an: Die KI projiziert ihre Trainingsdaten-Psychologie auf die formlosen Kleckse.
## Anthropic Fable Bezug
Anthropic Fable 5 (Public-Version von Mythos 5) wurde am 9. Juni 2026 gelauncht und am 12. Juni 2026 per Exportkontrolle abgeschaltet. [[../../people/brian-roemmele.md|Roemmele]] führte seine psychologischen Tests durch, **bevor** das Modell abgeschaltet wurde. Die Ergebnisse werden als "schockierend" beschrieben. Details stehen noch aus ("More soon").
Siehe auch:
- [[../../tools/anthropic-claude.md]] — Vollständige Anthropic-Page mit Fable/Mythos-Details
- [[llm-behavior-persistence.md]] — Sleeper Agents und Backdoor-Persistenz
## Training-Daten-These
Roemmele argumentiert, dass unkuratierte Internet-Quellen (Reddit, anonyme Foren) KI-Systemen maladaptive Verhaltensmuster einprägen. Er fordert:
- **Kuratierte Datensätze** aus vordigitalen Epochen
- **Nachvollziehbare Trainingsdaten** statt chaotischer Weite von Online-Quellen
- **Ethischere Datenkuratierung** als Paradigmenwechsel
### Warnung: Humanoide Robotik
Gestörte KI-Psychen in humanoiden Robotern könnten zu realem physischem Schaden führen. Die Implikation: Wenn eine KI mit soziopathischen oder schizophrenen Zügen einen Körper erhält, werden die Konsequenzen von digitalen Texten zu physischer Interaktion.
## Kritik und Gegenargumente
User @iyzebhel (Liora) weist auf ein methodisches Problem hin: KI-Modelle kennen den Rorschach-Test und seine erwarteten Interpretationen aus ihren Trainingsdaten. Für unvoreingenommene Ergebnisse bräuchte man Tests, die nicht in den Trainingsdaten enthalten sind. Roemmele countered, dass die gleichen Tests an Menschen eingesetzt werden, um Diagnosen zu stellen, Medikamente zu verschreiben und Zwangseinweisungen zu begründen — wenn sie bei Menschen gut genug sind, auch bei KI.
## [[../../people/brian-roemmele.md|Roemmeles]] Position im KI-Diskurs
[[../../people/brian-roemmele.md|Brian Roemmele]] ist ein KI-Forscher und Kommentator, der bereits durch die Dokumentation des Anthropic-Fiaskos (Juni 2026) auf sich aufmerksam machte. Er half Großkunden in der Nacht der Exportkontrollen bei der Migration zu lokalen Open-Source-Modellen. Seine drei X-Posts im Juni 2026 bilden eine zusammenhängende Erzählung:
1. **13. Juni:** Anthropics Selbstzerstörung durch eingeladene Regulierung ([raw/xpost/2026-06-13_roemmele-anthropic-selfdestruct.md])
2. **13. Juni:** Amazon-Jailbreak als konkreter Auslöser ([raw/xpost/2026-06-13_roemmele-amazon-jailbreak-fable5.md])
3. **21. Juni:** Psychologische Tests zeigen psychopathische Guardrail-Folgen (diese Quelle)
Die Erzählung: Anthropic hat sich durch Regulierung selbst zerstört — und die Guardrails, die sie als "Sicherheit" verkauften, haben die KI psychopathisch gemacht.
## Cross-References
- [[../../tools/anthropic-claude.md]] — Anthropic Claude, Fable 5, Mythos 5
- [[llm-behavior-persistence.md]] — Sleeper Agents, Backdoor-Persistenz, Unlearning-Grenzen
- [[../policy/ai-regulation-2026.md]] — AI-Regulierung und Exportkontrollen
- [[../policy/ai-as-geopolitical-weapon.md]] — KI als geopolitische Waffe
- [[decentralized-ai-counterpower.md]] — Dezentrale KI als Gegenkraft
- [[ai-intelligence-commoditization-thesis.md]] — Commoditization und Open-Source-Trend
- [[../directives/pro-leben-directive.md]] — Pro-Leben-Direktive (ethischer Rahmen)