knowledge-base/wiki/concepts/llm/mechanistic-interpretability.md
2026-08-13 16:10:31 +02:00

3.8 KiB
Raw Permalink Blame History

created updated sources tags
2026-08-13 2026-08-13
youtube/2026-08-13_heise-ki-gedanken-knacken.md
concept
llm
interpretability
mechanistic-interpretability
safety
sae
sparse-autoencoder
black-box

Mechanistic Interpretability — KI-Gedanken entschlüsseln

Subtitel: Die Black Box öffnen — interne latente Repräsentationen von LLMs sichtbar machen, statt nur Verhalten zu beobachten.

Quelle: heise & c't YouTube-Video „Forscher knacken verschlüsselte KI-Gedanken mit einer anderen KI" (2026-08-13), OME-Gruppe Topic 13. Siehe ../../../raw/youtube/2026-08-13_heise-ki-gedanken-knacken.md.

Kernidee

Mechanistic Interpretability ist das Forschungsfeld, das versucht, die internen Berechnungen eines neuronalen Netzes zu verstehen — nicht nur sein Input/Output-Verhalten. Statt ein LLM als Black Box zu testen („was kommt raus?"), will man die latenten Repräsentationen in den versteckten Schichten entschlüsseln („was denkt es eigentlich?").

Der heise/c't-Beitrag (2026-08-13) berichtet über einen Ansatz, bei dem Forscher die „verschlüsselten" internen Gedanken eines KI-Modells mithilfe einer anderen KI knacken — ein Modell dekodiert die internen Zustände eines anderen Modells.

Warum „verschlüsselt"?

Die Aktivierungen in den versteckten Schichten eines LLM sind für Menschen nicht direkt lesbar — sie sind hochdimensional, überlappend und in einer „Maschinensprache" kodiert, die keinem natürlichen Vokabular entspricht. Diese interne Kodierung wirkt wie eine Verschlüsselung: Die Information ist da, aber ohne Dekodierung unzugänglich.

Methoden & Werkzeuge

  • Sparse Autoencoders (SAEs): Dekomponieren die Aktivierungen in interpretierbare, spärliche Merkmale (Features). Ein zentrales Werkzeug der modernen Interpretability-Forschung (u.a. von Anthropic vorangetrieben).
  • Probing / Lineare Klassifikatoren: Trainieren kleine Klassifikatoren auf internen Aktivierungen, um zu testen, ob bestimmte Konzepte (z.B. „Lüge", „Risiko", „Absicht") dort kodiert sind.
  • KI-unterstützte Dekodierung: Der im heise-Beitrag beschriebene Ansatz — ein zweites Modell als „Übersetzer" der internen Repräsentationen des ersten Modells.

Relevanz für Safety & Alignment

Interpretierbarkeit ist eine Voraussetzung für Vertrauen und Kontrolle über KI-Systeme:

  • Vertrauen: Wenn wir nicht verstehen, warum ein Modell eine Entscheidung trifft, können wir ihm nicht wirklich vertrauen — unabhängig von Benchmark-Ergebnissen.
  • Alignment: Interpretierbarkeit hilft zu prüfen, ob ein Modell tatsächlich die beabsichtigten Ziele verfolgt oder versteckte (z.B. machtsuchende) Teilziele entwickelt.
  • Kontrast zu Black-Box-Testing: Reines Verhaltenstesten (Red-Teaming, Benchmarks) sieht nur Symptome. Interpretierbarkeit adressiert die Ursache.

Verwandte Wiki-Konzepte

Institution