34 lines
2.3 KiB
Markdown
34 lines
2.3 KiB
Markdown
|
|
---
|
|||
|
|
type: youtube
|
|||
|
|
source_url: https://www.youtube.com/watch?v=6YFN2GiGyHg
|
|||
|
|
video_id: 6YFN2GiGyHg
|
|||
|
|
title: "Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI"
|
|||
|
|
channel: "heise & c't"
|
|||
|
|
channel_url: https://www.youtube.com/@heise-ct
|
|||
|
|
retrieved: 2026-08-13
|
|||
|
|
has_transcript: false
|
|||
|
|
tags: [interpretability, mechanistic-interpretability, safety, sae, heise, ct, llm]
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
# Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI (heise & c't)
|
|||
|
|
|
|||
|
|
## Metadata
|
|||
|
|
- **Video:** https://www.youtube.com/watch?v=6YFN2GiGyHg
|
|||
|
|
- **Kanal:** heise & c't (https://www.youtube.com/@heise-ct)
|
|||
|
|
- **Quelle:** OME-Gruppe, Topic 13 "News & Infos", 2026-08-13
|
|||
|
|
- **Titel:** "Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI"
|
|||
|
|
|
|||
|
|
## Einordnung
|
|||
|
|
- **Thema:** KI-Interpretierbarkeit / **Mechanistic Interpretability** — Forscher entschlüsseln interne, "verschlüsselte" Gedankenprozesse von KI-Modellen (latente Repräsentationen) mithilfe einer **anderen KI**.
|
|||
|
|
- **Seriöse Quelle:** heise online / c't — deutschsprachiges Tech-Medium mit etablierter KI-Berichterstattung (u.a. GLM-5.2-Sicherheitsanalyse, Prompt-Caching, PoisonAI/c't 4004).
|
|||
|
|
- **Relevanz:** Interpretierbarkeit ist ein Kernfeld der KI-Safety — die Fähigkeit, in die "Black Box" eines Modells zu blicken (z.B. via Sparse Autoencoders / SAEs), statt nur Input/Output zu beobachten.
|
|||
|
|
|
|||
|
|
## Transkript-Status
|
|||
|
|
> ⚠️ Transkript/Inhalt NICHT abrufbar: yt-dlp scheitert ohne Cookies (Login/Bot-Schutz). Nur Titel-Metadaten via oEmbed gesichert. Vollständige Video-Inhalte (konkrete Methode, beteiligte Forscher, Ergebnisse) bei Gelegenheit nachziehen (z.B. über eingeloggte Browser-Session oder manuell bereitgestelltes Transkript).
|
|||
|
|
|
|||
|
|
## Relevanz
|
|||
|
|
- **Mechanistic Interpretability** als Gegenpol zur reinen Black-Box-Beobachtung: interne latente Repräsentationen entschlüsseln statt nur Verhalten zu testen.
|
|||
|
|
- **"KI knackt KI"** — Nutzung eines zweiten Modells zur Dekodierung der internen Zustände eines ersten Modells (verwandt mit SAE-basierten Ansätzen, z.B. Anthropic's Interpretability-Forschung).
|
|||
|
|
- Verortung im Safety-Kontext: Interpretierbarkeit als Voraussetzung für Vertrauen, Alignment und Kontrolle ([[../wiki/concepts/policy/ai-regulation-2026.md]], [[../wiki/concepts/llm/llm-sycophancy-confabulation.md]]).
|
|||
|
|
- Institution: [[../wiki/institutions/heise-ct.md]] als etablierte deutschsprachige Tech-Quelle.
|