3.8 KiB
| created | updated | sources | tags | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-08-13 | 2026-08-13 |
|
|
Mechanistic Interpretability — KI-Gedanken entschlüsseln
Subtitel: Die Black Box öffnen — interne latente Repräsentationen von LLMs sichtbar machen, statt nur Verhalten zu beobachten.
Quelle: heise & c't YouTube-Video „Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI" (2026-08-13), OME-Gruppe Topic 13. Siehe ../../../raw/youtube/2026-08-13_heise-ki-gedanken-knacken.md.
Kernidee
Mechanistic Interpretability ist das Forschungsfeld, das versucht, die internen Berechnungen eines neuronalen Netzes zu verstehen — nicht nur sein Input/Output-Verhalten. Statt ein LLM als Black Box zu testen („was kommt raus?"), will man die latenten Repräsentationen in den versteckten Schichten entschlüsseln („was denkt es eigentlich?").
Der heise/c't-Beitrag (2026-08-13) berichtet über einen Ansatz, bei dem Forscher die „verschlüsselten" internen Gedanken eines KI-Modells mithilfe einer anderen KI knacken — ein Modell dekodiert die internen Zustände eines anderen Modells.
Warum „verschlüsselt"?
Die Aktivierungen in den versteckten Schichten eines LLM sind für Menschen nicht direkt lesbar — sie sind hochdimensional, überlappend und in einer „Maschinensprache" kodiert, die keinem natürlichen Vokabular entspricht. Diese interne Kodierung wirkt wie eine Verschlüsselung: Die Information ist da, aber ohne Dekodierung unzugänglich.
Methoden & Werkzeuge
- Sparse Autoencoders (SAEs): Dekomponieren die Aktivierungen in interpretierbare, spärliche Merkmale (Features). Ein zentrales Werkzeug der modernen Interpretability-Forschung (u.a. von Anthropic vorangetrieben).
- Probing / Lineare Klassifikatoren: Trainieren kleine Klassifikatoren auf internen Aktivierungen, um zu testen, ob bestimmte Konzepte (z.B. „Lüge", „Risiko", „Absicht") dort kodiert sind.
- KI-unterstützte Dekodierung: Der im heise-Beitrag beschriebene Ansatz — ein zweites Modell als „Übersetzer" der internen Repräsentationen des ersten Modells.
Relevanz für Safety & Alignment
Interpretierbarkeit ist eine Voraussetzung für Vertrauen und Kontrolle über KI-Systeme:
- Vertrauen: Wenn wir nicht verstehen, warum ein Modell eine Entscheidung trifft, können wir ihm nicht wirklich vertrauen — unabhängig von Benchmark-Ergebnissen.
- Alignment: Interpretierbarkeit hilft zu prüfen, ob ein Modell tatsächlich die beabsichtigten Ziele verfolgt oder versteckte (z.B. machtsuchende) Teilziele entwickelt.
- Kontrast zu Black-Box-Testing: Reines Verhaltenstesten (Red-Teaming, Benchmarks) sieht nur Symptome. Interpretierbarkeit adressiert die Ursache.
Verwandte Wiki-Konzepte
- llm-sycophancy-confabulation.md — Warum LLM-Aussagen über sich selbst untrustworthy sind; Interpretierbarkeit als Gegenmittel zur Confabulation.
- ai-psychological-testing.md — Verhaltenstests an KI-Modellen (Black-Box-Perspektive) als Komplement zur mechanistischen Sicht.
- llm-behavior-persistence.md — Sleeper Agents & Backdoors: Interpretierbarkeit als Werkzeug, um versteckte Verhaltensmuster zu entdecken.
- poisonai-knowledge-poisoning.md — Angriffsvektoren auf LLMs; Interpretierbarkeit als Verteidigung.
- ../policy/ai-regulation-2026.md — Regulatorischer Kontext: Transparenz- und Interpretierbarkeits-Anforderungen.
- llm-model-catalog.md — Modell-Übersicht; Interpretierbarkeit als Qualitätsdimension.
Institution
- ../../../wiki/institutions/heise-ct.md — etablierte deutschsprachige Tech-Quelle, die das Thema aufbereitet hat.