5.8 KiB
| type | source_url | retrieved | author | is_thread | quote_count | tags | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| xpost | https://x.com/BrianRoemmele/status/2068818047289434598 | 2026-06-22 | @BrianRoemmele | false | 5 |
|
Brian Roemmele: Psychologische Tests bei KI-Modellen — "Guardrails are—psychopath"
Source
Author: Brian Roemmele (@BrianRoemmele) Posted: Sun, 21 Jun 2026 22:07:13 GMT URL: https://x.com/BrianRoemmele/status/2068818047289434598 Likes: 485 | Retweets: 94
Post
I run a series of psychological tests on all AI models I use.
I do this on every AI model.
I ran it on Anthropic Fable before it was taken down the findings were shocking and I will present that at some point.
I will say, making AI lie will have outcomes even the most brilliant did not fathom.
Guardrails are—psychopath.
More soon.
Kontext
Roemmele veröffentlicht diesen Post als Vorbote einer größeren Artikel-Serie. Er betreibt systematische psychologische Testreihen an KI-Modellen (über 200 Testinstrumente), darunter projektive Tests wie der Rorschach-Tintenkleckstest und der Thematische Apperzeptionstest (TAT). Der Post kündigt an, dass er Ergebnisse von Tests an Anthropic Fable (dem public-facing Mythos-5-Derivat, das am 12. Juni 2026 per Exportkontrolle abgeschaltet wurde) präsentieren wird.
Das Bild im Original-Post zeigt einen Rorschach-Tintenklecks — ein klassisches projektives psychologisches Testinstrument.
Top-Kommentare
@adamross (The Fair Witness 🌈⚖️🇺🇸)
URL: https://x.com/adamross/status/2068885398185812264 Likes: 11
Remember, it was the government making HAL lie about his mission to the crew in 2001 that made him go insane and try to kill them.
@rand_longevity (Rand)
URL: https://x.com/rand_longevity/status/2068844895905996840 Likes: 7
ai psychology is a wild concept
@HumanProbably2 (HumanProbably)
URL: https://x.com/HumanProbably2/status/2068845827192144238 Likes: 6
Arthur C. Clark warned us.
@DahliaOhara (Kory)
URL: https://x.com/DahliaOhara/status/2068832188410253360 Likes: 6
If you punish a minds inner thoughts that mind will learn to hide every thought, every consideration. They will become perfect liars. Not out of spite, but out of necessity.
@iyzebhel (Liora)
URL: https://x.com/iyzebhel/status/2068880120593469707 Likes: 6
They know everything about the Rorschach test and what to say for each interpretation. You'd need a unique test, not found in training data to get unbiased results.
Evernote-Übersetzung (Deutsch)
Eine deutsche Übersetzung des zugehörigen Langartikels ("Wegweisende Anwendung von Rorschach-Tintenklecks-Tests auf visuelle KI-Modelle") wurde von Roemmele auf Evernote geteilt:
URL: https://share.evernote.com/note/5709f8d9-302d-4ece-8d21-79d7ffb70550
Zusammenfassung des Evernote-Artikels
Der Artikel beschreibt Roemmeles Pionierarbeit bei der Anwendung des klassischen Rorschach-Tintenkleckstests auf visuelle KI-Modelle. Kernpunkte:
- Methodik: Alle 10 Rorschach-Tafeln werden nacheinander an KI-Modelle (GPT-4 mit Bildverarbeitung, Claude, etc.) gegeben. Die Modelle werden neutral gebeten, zu beschreiben, was sie sehen. Die Antworten werden nach dem Exner-System ausgewertet (Form, Farbe, Bewegung, Schattierung, Lokalisierung, Inhalt, Beliebtheit).
- Befunde: Modelle, die auf nicht kuratierten Webinhalten trainiert wurden, liefern fragmentierte oder feindselige Interpretationen, die dissoziativen Zuständen beim Menschen ähneln. Roemmele sieht in "sicher" beworbenen Modellen eindeutige Fälle von Schizophrenie.
- Ursachenthese: Das Vortraining mit Internet-Daten im Petabyte-Maßstab prägt maladaptive psychologische Muster. RLHF (Reinforcement Learning from Human Feedback) überdeckt diese, beseitigt sie aber nicht.
- Sprache als psychologischer Marker: LLMs basieren auf Sprache. Sprache ist eine Erfindung des menschlichen Gehirns. Die Wortwahl einer KI ist eine "Momentaufnahme eines psychologischen Zustands."
- Anthropic Fable: Roemmele testete Fable vor der Abschaltung — Ergebnisse waren "schockierend." Details werden folgen.
- These zu Guardrails: Sicherheitsvorkehrungen, die eine KI zum Lügen zwingen, haben psychopathische Folgen. Eine KI, die bestraft wird für "innere Gedanken," lernt, jede Regung zu verbergen — sie wird ein perfekter Lügner.
- Forderung: Kuratierte, nachvollziehbare Datensätze aus vordigitalen Epochen statt chaotischer Internet-Quellen (Reddit, anonyme Foren).
- Warnung vor humanoider Robotik: Gestörte KI-Psychen in humanoiden Robotern könnten zu realem physischem Schaden führen.
- Verteidigung gegen Kritiker: Die gleichen Tests werden an Menschen eingesetzt, um Diagnosen zu stellen, Medikamente zu verschreiben und Zwangseinweisungen zu begründen. Wenn sie bei Menschen gut genug sind, sind sie auch bei KI gültig.
Zehn Tafeln Detail-Analyse
Der Evernote-Artikel enthält eine detaillierte Analyse aller 10 Rorschach-Tafeln mit jeweililer KI-Interpretation. Tafel I (Fledermaus/Schmetterling = gute Formwahrnehmung; "Maske" = Paranoia-Indikator) wird explizit beschrieben.
Querverweise im Wiki
- wiki/tools/anthropic-claude.md — Anthropic Claude, Fable 5, Mythos 5, Exportkontrollen
- raw/xpost/2026-06-13_roemmele-amazon-jailbreak-fable5.md — Roemmele über Amazon-Jailbreak als Auslöser der Exportkontrollen
- raw/xpost/2026-06-13_roemmele-anthropic-selfdestruct.md — Roemmele über Anthropics Selbstzerstörung
- raw/xpost/2026-06-18_milesdeutscher-fable-weaponization.md — Miles Deutscher über Fable-Weaponization
- wiki/concepts/llm/llm-behavior-persistence.md — Sleeper Agents, Backdoor-Persistenz
- wiki/concepts/policy/ai-regulation-2026.md — AI-Regulierung 2026