knowledge-base/raw/youtube/2026-08-13_heise-ki-gedanken-knacken.md
2026-08-13 16:10:31 +02:00

33 lines
2.3 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
type: youtube
source_url: https://www.youtube.com/watch?v=6YFN2GiGyHg
video_id: 6YFN2GiGyHg
title: "Forscher knacken verschlüsselte KI-Gedanken mit einer anderen KI"
channel: "heise & c't"
channel_url: https://www.youtube.com/@heise-ct
retrieved: 2026-08-13
has_transcript: false
tags: [interpretability, mechanistic-interpretability, safety, sae, heise, ct, llm]
---
# Forscher knacken verschlüsselte KI-Gedanken mit einer anderen KI (heise & c't)
## Metadata
- **Video:** https://www.youtube.com/watch?v=6YFN2GiGyHg
- **Kanal:** heise & c't (https://www.youtube.com/@heise-ct)
- **Quelle:** OME-Gruppe, Topic 13 "News & Infos", 2026-08-13
- **Titel:** "Forscher knacken verschlüsselte KI-Gedanken mit einer anderen KI"
## Einordnung
- **Thema:** KI-Interpretierbarkeit / **Mechanistic Interpretability** — Forscher entschlüsseln interne, "verschlüsselte" Gedankenprozesse von KI-Modellen (latente Repräsentationen) mithilfe einer **anderen KI**.
- **Seriöse Quelle:** heise online / c't — deutschsprachiges Tech-Medium mit etablierter KI-Berichterstattung (u.a. GLM-5.2-Sicherheitsanalyse, Prompt-Caching, PoisonAI/c't 4004).
- **Relevanz:** Interpretierbarkeit ist ein Kernfeld der KI-Safety — die Fähigkeit, in die "Black Box" eines Modells zu blicken (z.B. via Sparse Autoencoders / SAEs), statt nur Input/Output zu beobachten.
## Transkript-Status
> ⚠️ Transkript/Inhalt NICHT abrufbar: yt-dlp scheitert ohne Cookies (Login/Bot-Schutz). Nur Titel-Metadaten via oEmbed gesichert. Vollständige Video-Inhalte (konkrete Methode, beteiligte Forscher, Ergebnisse) bei Gelegenheit nachziehen (z.B. über eingeloggte Browser-Session oder manuell bereitgestelltes Transkript).
## Relevanz
- **Mechanistic Interpretability** als Gegenpol zur reinen Black-Box-Beobachtung: interne latente Repräsentationen entschlüsseln statt nur Verhalten zu testen.
- **"KI knackt KI"** — Nutzung eines zweiten Modells zur Dekodierung der internen Zustände eines ersten Modells (verwandt mit SAE-basierten Ansätzen, z.B. Anthropic's Interpretability-Forschung).
- Verortung im Safety-Kontext: Interpretierbarkeit als Voraussetzung für Vertrauen, Alignment und Kontrolle ([[../wiki/concepts/policy/ai-regulation-2026.md]], [[../wiki/concepts/llm/llm-sycophancy-confabulation.md]]).
- Institution: [[../wiki/institutions/heise-ct.md]] als etablierte deutschsprachige Tech-Quelle.