50 lines
3.8 KiB
Markdown
50 lines
3.8 KiB
Markdown
|
|
---
|
|||
|
|
created: 2026-08-13
|
|||
|
|
updated: 2026-08-13
|
|||
|
|
sources: [youtube/2026-08-13_heise-ki-gedanken-knacken.md]
|
|||
|
|
tags: [concept, llm, interpretability, mechanistic-interpretability, safety, sae, sparse-autoencoder, black-box]
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
# Mechanistic Interpretability — KI-Gedanken entschlüsseln
|
|||
|
|
|
|||
|
|
> **Subtitel:** Die Black Box öffnen — interne latente Repräsentationen von LLMs sichtbar machen, statt nur Verhalten zu beobachten.
|
|||
|
|
>
|
|||
|
|
> **Quelle:** heise & c't YouTube-Video „Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI" (2026-08-13), OME-Gruppe Topic 13. Siehe [[../../../raw/youtube/2026-08-13_heise-ki-gedanken-knacken.md|Raw-Source]].
|
|||
|
|
|
|||
|
|
## Kernidee
|
|||
|
|
|
|||
|
|
**Mechanistic Interpretability** ist das Forschungsfeld, das versucht, die **internen Berechnungen** eines neuronalen Netzes zu verstehen — nicht nur sein Input/Output-Verhalten. Statt ein LLM als Black Box zu testen („was kommt raus?"), will man die **latenten Repräsentationen** in den versteckten Schichten entschlüsseln („was denkt es eigentlich?").
|
|||
|
|
|
|||
|
|
Der heise/c't-Beitrag (2026-08-13) berichtet über einen Ansatz, bei dem Forscher die „verschlüsselten" internen Gedanken eines KI-Modells **mithilfe einer anderen KI** knacken — ein Modell dekodiert die internen Zustände eines anderen Modells.
|
|||
|
|
|
|||
|
|
## Warum „verschlüsselt"?
|
|||
|
|
|
|||
|
|
Die Aktivierungen in den versteckten Schichten eines LLM sind für Menschen **nicht direkt lesbar** — sie sind hochdimensional, überlappend und in einer „Maschinensprache" kodiert, die keinem natürlichen Vokabular entspricht. Diese interne Kodierung wirkt wie eine **Verschlüsselung**: Die Information ist da, aber ohne Dekodierung unzugänglich.
|
|||
|
|
|
|||
|
|
## Methoden & Werkzeuge
|
|||
|
|
|
|||
|
|
- **Sparse Autoencoders (SAEs):** Dekomponieren die Aktivierungen in interpretierbare, spärliche Merkmale (Features). Ein zentrales Werkzeug der modernen Interpretability-Forschung (u.a. von Anthropic vorangetrieben).
|
|||
|
|
- **Probing / Lineare Klassifikatoren:** Trainieren kleine Klassifikatoren auf internen Aktivierungen, um zu testen, ob bestimmte Konzepte (z.B. „Lüge", „Risiko", „Absicht") dort kodiert sind.
|
|||
|
|
- **KI-unterstützte Dekodierung:** Der im heise-Beitrag beschriebene Ansatz — ein zweites Modell als „Übersetzer" der internen Repräsentationen des ersten Modells.
|
|||
|
|
|
|||
|
|
## Relevanz für Safety & Alignment
|
|||
|
|
|
|||
|
|
Interpretierbarkeit ist eine **Voraussetzung** für Vertrauen und Kontrolle über KI-Systeme:
|
|||
|
|
|
|||
|
|
- **Vertrauen:** Wenn wir nicht verstehen, *warum* ein Modell eine Entscheidung trifft, können wir ihm nicht wirklich vertrauen — unabhängig von Benchmark-Ergebnissen.
|
|||
|
|
- **Alignment:** Interpretierbarkeit hilft zu prüfen, ob ein Modell tatsächlich die beabsichtigten Ziele verfolgt oder versteckte (z.B. machtsuchende) Teilziele entwickelt.
|
|||
|
|
- **Kontrast zu Black-Box-Testing:** Reines Verhaltenstesten (Red-Teaming, Benchmarks) sieht nur Symptome. Interpretierbarkeit adressiert die Ursache.
|
|||
|
|
|
|||
|
|
## Verwandte Wiki-Konzepte
|
|||
|
|
|
|||
|
|
- [[llm-sycophancy-confabulation.md]] — Warum LLM-Aussagen über sich selbst untrustworthy sind; Interpretierbarkeit als Gegenmittel zur Confabulation.
|
|||
|
|
- [[ai-psychological-testing.md]] — Verhaltenstests an KI-Modellen (Black-Box-Perspektive) als Komplement zur mechanistischen Sicht.
|
|||
|
|
- [[llm-behavior-persistence.md]] — Sleeper Agents & Backdoors: Interpretierbarkeit als Werkzeug, um versteckte Verhaltensmuster zu entdecken.
|
|||
|
|
- [[poisonai-knowledge-poisoning.md]] — Angriffsvektoren auf LLMs; Interpretierbarkeit als Verteidigung.
|
|||
|
|
- [[../policy/ai-regulation-2026.md]] — Regulatorischer Kontext: Transparenz- und Interpretierbarkeits-Anforderungen.
|
|||
|
|
- [[llm-model-catalog.md]] — Modell-Übersicht; Interpretierbarkeit als Qualitätsdimension.
|
|||
|
|
|
|||
|
|
## Institution
|
|||
|
|
|
|||
|
|
- [[../../../wiki/institutions/heise-ct.md|heise & c't]] — etablierte deutschsprachige Tech-Quelle, die das Thema aufbereitet hat.
|