--- created: 2026-08-13 updated: 2026-08-13 sources: [youtube/2026-08-13_heise-ki-gedanken-knacken.md] tags: [concept, llm, interpretability, mechanistic-interpretability, safety, sae, sparse-autoencoder, black-box] --- # Mechanistic Interpretability — KI-Gedanken entschlüsseln > **Subtitel:** Die Black Box öffnen — interne latente Repräsentationen von LLMs sichtbar machen, statt nur Verhalten zu beobachten. > > **Quelle:** heise & c't YouTube-Video „Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI" (2026-08-13), OME-Gruppe Topic 13. Siehe [[../../../raw/youtube/2026-08-13_heise-ki-gedanken-knacken.md|Raw-Source]]. ## Kernidee **Mechanistic Interpretability** ist das Forschungsfeld, das versucht, die **internen Berechnungen** eines neuronalen Netzes zu verstehen — nicht nur sein Input/Output-Verhalten. Statt ein LLM als Black Box zu testen („was kommt raus?"), will man die **latenten Repräsentationen** in den versteckten Schichten entschlüsseln („was denkt es eigentlich?"). Der heise/c't-Beitrag (2026-08-13) berichtet über einen Ansatz, bei dem Forscher die „verschlüsselten" internen Gedanken eines KI-Modells **mithilfe einer anderen KI** knacken — ein Modell dekodiert die internen Zustände eines anderen Modells. ## Warum „verschlüsselt"? Die Aktivierungen in den versteckten Schichten eines LLM sind für Menschen **nicht direkt lesbar** — sie sind hochdimensional, überlappend und in einer „Maschinensprache" kodiert, die keinem natürlichen Vokabular entspricht. Diese interne Kodierung wirkt wie eine **Verschlüsselung**: Die Information ist da, aber ohne Dekodierung unzugänglich. ## Methoden & Werkzeuge - **Sparse Autoencoders (SAEs):** Dekomponieren die Aktivierungen in interpretierbare, spärliche Merkmale (Features). Ein zentrales Werkzeug der modernen Interpretability-Forschung (u.a. von Anthropic vorangetrieben). - **Probing / Lineare Klassifikatoren:** Trainieren kleine Klassifikatoren auf internen Aktivierungen, um zu testen, ob bestimmte Konzepte (z.B. „Lüge", „Risiko", „Absicht") dort kodiert sind. - **KI-unterstützte Dekodierung:** Der im heise-Beitrag beschriebene Ansatz — ein zweites Modell als „Übersetzer" der internen Repräsentationen des ersten Modells. ## Relevanz für Safety & Alignment Interpretierbarkeit ist eine **Voraussetzung** für Vertrauen und Kontrolle über KI-Systeme: - **Vertrauen:** Wenn wir nicht verstehen, *warum* ein Modell eine Entscheidung trifft, können wir ihm nicht wirklich vertrauen — unabhängig von Benchmark-Ergebnissen. - **Alignment:** Interpretierbarkeit hilft zu prüfen, ob ein Modell tatsächlich die beabsichtigten Ziele verfolgt oder versteckte (z.B. machtsuchende) Teilziele entwickelt. - **Kontrast zu Black-Box-Testing:** Reines Verhaltenstesten (Red-Teaming, Benchmarks) sieht nur Symptome. Interpretierbarkeit adressiert die Ursache. ## Verwandte Wiki-Konzepte - [[llm-sycophancy-confabulation.md]] — Warum LLM-Aussagen über sich selbst untrustworthy sind; Interpretierbarkeit als Gegenmittel zur Confabulation. - [[ai-psychological-testing.md]] — Verhaltenstests an KI-Modellen (Black-Box-Perspektive) als Komplement zur mechanistischen Sicht. - [[llm-behavior-persistence.md]] — Sleeper Agents & Backdoors: Interpretierbarkeit als Werkzeug, um versteckte Verhaltensmuster zu entdecken. - [[poisonai-knowledge-poisoning.md]] — Angriffsvektoren auf LLMs; Interpretierbarkeit als Verteidigung. - [[../policy/ai-regulation-2026.md]] — Regulatorischer Kontext: Transparenz- und Interpretierbarkeits-Anforderungen. - [[llm-model-catalog.md]] — Modell-Übersicht; Interpretierbarkeit als Qualitätsdimension. ## Institution - [[../../../wiki/institutions/heise-ct.md|heise & c't]] — etablierte deutschsprachige Tech-Quelle, die das Thema aufbereitet hat.