--- type: youtube source_url: https://www.youtube.com/watch?v=6YFN2GiGyHg video_id: 6YFN2GiGyHg title: "Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI" channel: "heise & c't" channel_url: https://www.youtube.com/@heise-ct retrieved: 2026-08-13 has_transcript: false tags: [interpretability, mechanistic-interpretability, safety, sae, heise, ct, llm] --- # Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI (heise & c't) ## Metadata - **Video:** https://www.youtube.com/watch?v=6YFN2GiGyHg - **Kanal:** heise & c't (https://www.youtube.com/@heise-ct) - **Quelle:** OME-Gruppe, Topic 13 "News & Infos", 2026-08-13 - **Titel:** "Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI" ## Einordnung - **Thema:** KI-Interpretierbarkeit / **Mechanistic Interpretability** — Forscher entschlüsseln interne, "verschlüsselte" Gedankenprozesse von KI-Modellen (latente Repräsentationen) mithilfe einer **anderen KI**. - **Seriöse Quelle:** heise online / c't — deutschsprachiges Tech-Medium mit etablierter KI-Berichterstattung (u.a. GLM-5.2-Sicherheitsanalyse, Prompt-Caching, PoisonAI/c't 4004). - **Relevanz:** Interpretierbarkeit ist ein Kernfeld der KI-Safety — die Fähigkeit, in die "Black Box" eines Modells zu blicken (z.B. via Sparse Autoencoders / SAEs), statt nur Input/Output zu beobachten. ## Transkript-Status > ⚠️ Transkript/Inhalt NICHT abrufbar: yt-dlp scheitert ohne Cookies (Login/Bot-Schutz). Nur Titel-Metadaten via oEmbed gesichert. Vollständige Video-Inhalte (konkrete Methode, beteiligte Forscher, Ergebnisse) bei Gelegenheit nachziehen (z.B. über eingeloggte Browser-Session oder manuell bereitgestelltes Transkript). ## Relevanz - **Mechanistic Interpretability** als Gegenpol zur reinen Black-Box-Beobachtung: interne latente Repräsentationen entschlüsseln statt nur Verhalten zu testen. - **"KI knackt KI"** — Nutzung eines zweiten Modells zur Dekodierung der internen Zustände eines ersten Modells (verwandt mit SAE-basierten Ansätzen, z.B. Anthropic's Interpretability-Forschung). - Verortung im Safety-Kontext: Interpretierbarkeit als Voraussetzung für Vertrauen, Alignment und Kontrolle ([[../wiki/concepts/policy/ai-regulation-2026.md]], [[../wiki/concepts/llm/llm-sycophancy-confabulation.md]]). - Institution: [[../wiki/institutions/heise-ct.md]] als etablierte deutschsprachige Tech-Quelle.