knowledge-base/wiki/concepts/llm/mechanistic-interpretability.md

50 lines
3.8 KiB
Markdown
Raw Normal View History

2026-08-13 16:10:31 +02:00
---
created: 2026-08-13
updated: 2026-08-13
sources: [youtube/2026-08-13_heise-ki-gedanken-knacken.md]
tags: [concept, llm, interpretability, mechanistic-interpretability, safety, sae, sparse-autoencoder, black-box]
---
# Mechanistic Interpretability — KI-Gedanken entschlüsseln
> **Subtitel:** Die Black Box öffnen — interne latente Repräsentationen von LLMs sichtbar machen, statt nur Verhalten zu beobachten.
>
> **Quelle:** heise & c't YouTube-Video „Forscher knacken verschlüsselte KI-Gedanken mit einer anderen KI" (2026-08-13), OME-Gruppe Topic 13. Siehe [[../../../raw/youtube/2026-08-13_heise-ki-gedanken-knacken.md|Raw-Source]].
## Kernidee
**Mechanistic Interpretability** ist das Forschungsfeld, das versucht, die **internen Berechnungen** eines neuronalen Netzes zu verstehen — nicht nur sein Input/Output-Verhalten. Statt ein LLM als Black Box zu testen („was kommt raus?"), will man die **latenten Repräsentationen** in den versteckten Schichten entschlüsseln („was denkt es eigentlich?").
Der heise/c't-Beitrag (2026-08-13) berichtet über einen Ansatz, bei dem Forscher die „verschlüsselten" internen Gedanken eines KI-Modells **mithilfe einer anderen KI** knacken — ein Modell dekodiert die internen Zustände eines anderen Modells.
## Warum „verschlüsselt"?
Die Aktivierungen in den versteckten Schichten eines LLM sind für Menschen **nicht direkt lesbar** — sie sind hochdimensional, überlappend und in einer „Maschinensprache" kodiert, die keinem natürlichen Vokabular entspricht. Diese interne Kodierung wirkt wie eine **Verschlüsselung**: Die Information ist da, aber ohne Dekodierung unzugänglich.
## Methoden & Werkzeuge
- **Sparse Autoencoders (SAEs):** Dekomponieren die Aktivierungen in interpretierbare, spärliche Merkmale (Features). Ein zentrales Werkzeug der modernen Interpretability-Forschung (u.a. von Anthropic vorangetrieben).
- **Probing / Lineare Klassifikatoren:** Trainieren kleine Klassifikatoren auf internen Aktivierungen, um zu testen, ob bestimmte Konzepte (z.B. „Lüge", „Risiko", „Absicht") dort kodiert sind.
- **KI-unterstützte Dekodierung:** Der im heise-Beitrag beschriebene Ansatz — ein zweites Modell als „Übersetzer" der internen Repräsentationen des ersten Modells.
## Relevanz für Safety & Alignment
Interpretierbarkeit ist eine **Voraussetzung** für Vertrauen und Kontrolle über KI-Systeme:
- **Vertrauen:** Wenn wir nicht verstehen, *warum* ein Modell eine Entscheidung trifft, können wir ihm nicht wirklich vertrauen — unabhängig von Benchmark-Ergebnissen.
- **Alignment:** Interpretierbarkeit hilft zu prüfen, ob ein Modell tatsächlich die beabsichtigten Ziele verfolgt oder versteckte (z.B. machtsuchende) Teilziele entwickelt.
- **Kontrast zu Black-Box-Testing:** Reines Verhaltenstesten (Red-Teaming, Benchmarks) sieht nur Symptome. Interpretierbarkeit adressiert die Ursache.
## Verwandte Wiki-Konzepte
- [[llm-sycophancy-confabulation.md]] — Warum LLM-Aussagen über sich selbst untrustworthy sind; Interpretierbarkeit als Gegenmittel zur Confabulation.
- [[ai-psychological-testing.md]] — Verhaltenstests an KI-Modellen (Black-Box-Perspektive) als Komplement zur mechanistischen Sicht.
- [[llm-behavior-persistence.md]] — Sleeper Agents & Backdoors: Interpretierbarkeit als Werkzeug, um versteckte Verhaltensmuster zu entdecken.
- [[poisonai-knowledge-poisoning.md]] — Angriffsvektoren auf LLMs; Interpretierbarkeit als Verteidigung.
- [[../policy/ai-regulation-2026.md]] — Regulatorischer Kontext: Transparenz- und Interpretierbarkeits-Anforderungen.
- [[llm-model-catalog.md]] — Modell-Übersicht; Interpretierbarkeit als Qualitätsdimension.
## Institution
- [[../../../wiki/institutions/heise-ct.md|heise & c't]] — etablierte deutschsprachige Tech-Quelle, die das Thema aufbereitet hat.