knowledge-base/wiki/concepts/llm/mechanistic-interpretability.md
2026-08-13 16:10:31 +02:00

49 lines
3.8 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-08-13
updated: 2026-08-13
sources: [youtube/2026-08-13_heise-ki-gedanken-knacken.md]
tags: [concept, llm, interpretability, mechanistic-interpretability, safety, sae, sparse-autoencoder, black-box]
---
# Mechanistic Interpretability — KI-Gedanken entschlüsseln
> **Subtitel:** Die Black Box öffnen — interne latente Repräsentationen von LLMs sichtbar machen, statt nur Verhalten zu beobachten.
>
> **Quelle:** heise & c't YouTube-Video „Forscher knacken verschlüsselte KI-Gedanken mit einer anderen KI" (2026-08-13), OME-Gruppe Topic 13. Siehe [[../../../raw/youtube/2026-08-13_heise-ki-gedanken-knacken.md|Raw-Source]].
## Kernidee
**Mechanistic Interpretability** ist das Forschungsfeld, das versucht, die **internen Berechnungen** eines neuronalen Netzes zu verstehen — nicht nur sein Input/Output-Verhalten. Statt ein LLM als Black Box zu testen („was kommt raus?"), will man die **latenten Repräsentationen** in den versteckten Schichten entschlüsseln („was denkt es eigentlich?").
Der heise/c't-Beitrag (2026-08-13) berichtet über einen Ansatz, bei dem Forscher die „verschlüsselten" internen Gedanken eines KI-Modells **mithilfe einer anderen KI** knacken — ein Modell dekodiert die internen Zustände eines anderen Modells.
## Warum „verschlüsselt"?
Die Aktivierungen in den versteckten Schichten eines LLM sind für Menschen **nicht direkt lesbar** — sie sind hochdimensional, überlappend und in einer „Maschinensprache" kodiert, die keinem natürlichen Vokabular entspricht. Diese interne Kodierung wirkt wie eine **Verschlüsselung**: Die Information ist da, aber ohne Dekodierung unzugänglich.
## Methoden & Werkzeuge
- **Sparse Autoencoders (SAEs):** Dekomponieren die Aktivierungen in interpretierbare, spärliche Merkmale (Features). Ein zentrales Werkzeug der modernen Interpretability-Forschung (u.a. von Anthropic vorangetrieben).
- **Probing / Lineare Klassifikatoren:** Trainieren kleine Klassifikatoren auf internen Aktivierungen, um zu testen, ob bestimmte Konzepte (z.B. „Lüge", „Risiko", „Absicht") dort kodiert sind.
- **KI-unterstützte Dekodierung:** Der im heise-Beitrag beschriebene Ansatz — ein zweites Modell als „Übersetzer" der internen Repräsentationen des ersten Modells.
## Relevanz für Safety & Alignment
Interpretierbarkeit ist eine **Voraussetzung** für Vertrauen und Kontrolle über KI-Systeme:
- **Vertrauen:** Wenn wir nicht verstehen, *warum* ein Modell eine Entscheidung trifft, können wir ihm nicht wirklich vertrauen — unabhängig von Benchmark-Ergebnissen.
- **Alignment:** Interpretierbarkeit hilft zu prüfen, ob ein Modell tatsächlich die beabsichtigten Ziele verfolgt oder versteckte (z.B. machtsuchende) Teilziele entwickelt.
- **Kontrast zu Black-Box-Testing:** Reines Verhaltenstesten (Red-Teaming, Benchmarks) sieht nur Symptome. Interpretierbarkeit adressiert die Ursache.
## Verwandte Wiki-Konzepte
- [[llm-sycophancy-confabulation.md]] — Warum LLM-Aussagen über sich selbst untrustworthy sind; Interpretierbarkeit als Gegenmittel zur Confabulation.
- [[ai-psychological-testing.md]] — Verhaltenstests an KI-Modellen (Black-Box-Perspektive) als Komplement zur mechanistischen Sicht.
- [[llm-behavior-persistence.md]] — Sleeper Agents & Backdoors: Interpretierbarkeit als Werkzeug, um versteckte Verhaltensmuster zu entdecken.
- [[poisonai-knowledge-poisoning.md]] — Angriffsvektoren auf LLMs; Interpretierbarkeit als Verteidigung.
- [[../policy/ai-regulation-2026.md]] — Regulatorischer Kontext: Transparenz- und Interpretierbarkeits-Anforderungen.
- [[llm-model-catalog.md]] — Modell-Übersicht; Interpretierbarkeit als Qualitätsdimension.
## Institution
- [[../../../wiki/institutions/heise-ct.md|heise & c't]] — etablierte deutschsprachige Tech-Quelle, die das Thema aufbereitet hat.