ingest(raw): heise-ki-gedanken-knacken
This commit is contained in:
parent
c469e9a587
commit
a376d8d1cc
5 changed files with 139 additions and 1 deletions
33
raw/youtube/2026-08-13_heise-ki-gedanken-knacken.md
Normal file
33
raw/youtube/2026-08-13_heise-ki-gedanken-knacken.md
Normal file
|
|
@ -0,0 +1,33 @@
|
|||
---
|
||||
type: youtube
|
||||
source_url: https://www.youtube.com/watch?v=6YFN2GiGyHg
|
||||
video_id: 6YFN2GiGyHg
|
||||
title: "Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI"
|
||||
channel: "heise & c't"
|
||||
channel_url: https://www.youtube.com/@heise-ct
|
||||
retrieved: 2026-08-13
|
||||
has_transcript: false
|
||||
tags: [interpretability, mechanistic-interpretability, safety, sae, heise, ct, llm]
|
||||
---
|
||||
|
||||
# Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI (heise & c't)
|
||||
|
||||
## Metadata
|
||||
- **Video:** https://www.youtube.com/watch?v=6YFN2GiGyHg
|
||||
- **Kanal:** heise & c't (https://www.youtube.com/@heise-ct)
|
||||
- **Quelle:** OME-Gruppe, Topic 13 "News & Infos", 2026-08-13
|
||||
- **Titel:** "Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI"
|
||||
|
||||
## Einordnung
|
||||
- **Thema:** KI-Interpretierbarkeit / **Mechanistic Interpretability** — Forscher entschlüsseln interne, "verschlüsselte" Gedankenprozesse von KI-Modellen (latente Repräsentationen) mithilfe einer **anderen KI**.
|
||||
- **Seriöse Quelle:** heise online / c't — deutschsprachiges Tech-Medium mit etablierter KI-Berichterstattung (u.a. GLM-5.2-Sicherheitsanalyse, Prompt-Caching, PoisonAI/c't 4004).
|
||||
- **Relevanz:** Interpretierbarkeit ist ein Kernfeld der KI-Safety — die Fähigkeit, in die "Black Box" eines Modells zu blicken (z.B. via Sparse Autoencoders / SAEs), statt nur Input/Output zu beobachten.
|
||||
|
||||
## Transkript-Status
|
||||
> ⚠️ Transkript/Inhalt NICHT abrufbar: yt-dlp scheitert ohne Cookies (Login/Bot-Schutz). Nur Titel-Metadaten via oEmbed gesichert. Vollständige Video-Inhalte (konkrete Methode, beteiligte Forscher, Ergebnisse) bei Gelegenheit nachziehen (z.B. über eingeloggte Browser-Session oder manuell bereitgestelltes Transkript).
|
||||
|
||||
## Relevanz
|
||||
- **Mechanistic Interpretability** als Gegenpol zur reinen Black-Box-Beobachtung: interne latente Repräsentationen entschlüsseln statt nur Verhalten zu testen.
|
||||
- **"KI knackt KI"** — Nutzung eines zweiten Modells zur Dekodierung der internen Zustände eines ersten Modells (verwandt mit SAE-basierten Ansätzen, z.B. Anthropic's Interpretability-Forschung).
|
||||
- Verortung im Safety-Kontext: Interpretierbarkeit als Voraussetzung für Vertrauen, Alignment und Kontrolle ([[../wiki/concepts/policy/ai-regulation-2026.md]], [[../wiki/concepts/llm/llm-sycophancy-confabulation.md]]).
|
||||
- Institution: [[../wiki/institutions/heise-ct.md]] als etablierte deutschsprachige Tech-Quelle.
|
||||
49
wiki/concepts/llm/mechanistic-interpretability.md
Normal file
49
wiki/concepts/llm/mechanistic-interpretability.md
Normal file
|
|
@ -0,0 +1,49 @@
|
|||
---
|
||||
created: 2026-08-13
|
||||
updated: 2026-08-13
|
||||
sources: [youtube/2026-08-13_heise-ki-gedanken-knacken.md]
|
||||
tags: [concept, llm, interpretability, mechanistic-interpretability, safety, sae, sparse-autoencoder, black-box]
|
||||
---
|
||||
|
||||
# Mechanistic Interpretability — KI-Gedanken entschlüsseln
|
||||
|
||||
> **Subtitel:** Die Black Box öffnen — interne latente Repräsentationen von LLMs sichtbar machen, statt nur Verhalten zu beobachten.
|
||||
>
|
||||
> **Quelle:** heise & c't YouTube-Video „Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI" (2026-08-13), OME-Gruppe Topic 13. Siehe [[../../../raw/youtube/2026-08-13_heise-ki-gedanken-knacken.md|Raw-Source]].
|
||||
|
||||
## Kernidee
|
||||
|
||||
**Mechanistic Interpretability** ist das Forschungsfeld, das versucht, die **internen Berechnungen** eines neuronalen Netzes zu verstehen — nicht nur sein Input/Output-Verhalten. Statt ein LLM als Black Box zu testen („was kommt raus?"), will man die **latenten Repräsentationen** in den versteckten Schichten entschlüsseln („was denkt es eigentlich?").
|
||||
|
||||
Der heise/c't-Beitrag (2026-08-13) berichtet über einen Ansatz, bei dem Forscher die „verschlüsselten" internen Gedanken eines KI-Modells **mithilfe einer anderen KI** knacken — ein Modell dekodiert die internen Zustände eines anderen Modells.
|
||||
|
||||
## Warum „verschlüsselt"?
|
||||
|
||||
Die Aktivierungen in den versteckten Schichten eines LLM sind für Menschen **nicht direkt lesbar** — sie sind hochdimensional, überlappend und in einer „Maschinensprache" kodiert, die keinem natürlichen Vokabular entspricht. Diese interne Kodierung wirkt wie eine **Verschlüsselung**: Die Information ist da, aber ohne Dekodierung unzugänglich.
|
||||
|
||||
## Methoden & Werkzeuge
|
||||
|
||||
- **Sparse Autoencoders (SAEs):** Dekomponieren die Aktivierungen in interpretierbare, spärliche Merkmale (Features). Ein zentrales Werkzeug der modernen Interpretability-Forschung (u.a. von Anthropic vorangetrieben).
|
||||
- **Probing / Lineare Klassifikatoren:** Trainieren kleine Klassifikatoren auf internen Aktivierungen, um zu testen, ob bestimmte Konzepte (z.B. „Lüge", „Risiko", „Absicht") dort kodiert sind.
|
||||
- **KI-unterstützte Dekodierung:** Der im heise-Beitrag beschriebene Ansatz — ein zweites Modell als „Übersetzer" der internen Repräsentationen des ersten Modells.
|
||||
|
||||
## Relevanz für Safety & Alignment
|
||||
|
||||
Interpretierbarkeit ist eine **Voraussetzung** für Vertrauen und Kontrolle über KI-Systeme:
|
||||
|
||||
- **Vertrauen:** Wenn wir nicht verstehen, *warum* ein Modell eine Entscheidung trifft, können wir ihm nicht wirklich vertrauen — unabhängig von Benchmark-Ergebnissen.
|
||||
- **Alignment:** Interpretierbarkeit hilft zu prüfen, ob ein Modell tatsächlich die beabsichtigten Ziele verfolgt oder versteckte (z.B. machtsuchende) Teilziele entwickelt.
|
||||
- **Kontrast zu Black-Box-Testing:** Reines Verhaltenstesten (Red-Teaming, Benchmarks) sieht nur Symptome. Interpretierbarkeit adressiert die Ursache.
|
||||
|
||||
## Verwandte Wiki-Konzepte
|
||||
|
||||
- [[llm-sycophancy-confabulation.md]] — Warum LLM-Aussagen über sich selbst untrustworthy sind; Interpretierbarkeit als Gegenmittel zur Confabulation.
|
||||
- [[ai-psychological-testing.md]] — Verhaltenstests an KI-Modellen (Black-Box-Perspektive) als Komplement zur mechanistischen Sicht.
|
||||
- [[llm-behavior-persistence.md]] — Sleeper Agents & Backdoors: Interpretierbarkeit als Werkzeug, um versteckte Verhaltensmuster zu entdecken.
|
||||
- [[poisonai-knowledge-poisoning.md]] — Angriffsvektoren auf LLMs; Interpretierbarkeit als Verteidigung.
|
||||
- [[../policy/ai-regulation-2026.md]] — Regulatorischer Kontext: Transparenz- und Interpretierbarkeits-Anforderungen.
|
||||
- [[llm-model-catalog.md]] — Modell-Übersicht; Interpretierbarkeit als Qualitätsdimension.
|
||||
|
||||
## Institution
|
||||
|
||||
- [[../../../wiki/institutions/heise-ct.md|heise & c't]] — etablierte deutschsprachige Tech-Quelle, die das Thema aufbereitet hat.
|
||||
|
|
@ -2,7 +2,7 @@
|
|||
|
||||
*Auto-generated: 2026-07-07*
|
||||
|
||||
*Letzte Aktualisierung: 2026-08-13 (90. Update — DeepSeek V4 Pro 0813 Review von AICodeKing. “Fully Tested”-Video: “Okay, this is ACTUALLY CRAZY!”. Drittanbieter-Benchmark-Sicht auf die V4-Pro-0813-Version. Raw: `raw/youtube/2026-08-13_deepseek-v4-pro-0813-aicodeking.md`. Wiki-Updates: `tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md` (V4-Pro-0813-Sektion), `people/aicodeking.md` (neu).)*
|
||||
*Letzte Aktualisierung: 2026-08-13 (91. Update — heise/c't: Forscher knacken verschlüsselte KI-Gedanken. Mechanistic Interpretability: interne latente Repräsentationen von LLMs mit einer zweiten KI entschlüsseln. Raw: `raw/youtube/2026-08-13_heise-ki-gedanken-knacken.md`. Wiki-Updates: `concepts/llm/mechanistic-interpretability.md` (neu), `institutions/heise-ct.md` (neu).)*
|
||||
|
||||
## Architecture
|
||||
|
||||
|
|
@ -101,6 +101,7 @@
|
|||
| [Voice Driven Development](concepts/llm/voice-driven-development.md) | Höchste Phase der KI-gestützten Entwicklung: Sprache → Code. Tielke Phase 5. Sprachpräzision wird zur Kernkompetenz. Setzt Spec-Driven und TDD voraus | youtube/2026-07-02_david-tielke-enterprise-ki-softwareentwicklung.md |
|
||||
| [Spec Driven Development mit Harness](concepts/llm/spec-driven-development-harness.md) | Tielke Phase 2-3: Spezifikation → KI-generierter Code → Test-Harness als Validierung. Strukturell verwandt mit Karpathy's LLM-Wiki-Pattern (raw → LLM → Q&A) | youtube/2026-07-02_david-tielke-enterprise-ki-softwareentwicklung.md |
|
||||
| [School Automation Pilot](concepts/llm/school-automation-pilot.md) | Schul-Automation: Zeugnisse, Dokumentation, Logbücher automatisieren. Deterministische Schritte (KI) vs. Urteil/Review (Mensch) trennen. Datenschutz durch lokale LLMs. Business-/Pilotprozess-Modellierung. **Update 03.07.:** Gemini-Chat von Rüdiger (19.06.) als Quelle ingestiert — KLV-CSV → lokales LLM → Multi-Agent-Check → Lehrkraft-Freigabe, Korrekturen zu OpenClaw/RAG/Modellwahl. **Update 07.08.:** Dänemark führt wegen KI-Betrugs mündliche Verteidigung von Hausarbeiten + Prüfungs-Überwachungssoftware ein — Gegenmodell zur Automatisierungs-These, regulatorische Antwort auf generative KI im Bildungswesen | other/2026-07-02_ome23-operations-update-transkript.md + other/2026-06-19_gemini-chat-schul-automation-zeugnisse.md + other/2026-08-07_denmark-ki-betrug-muendliche-pruefungen.md |
|
||||
| [Mechanistic Interpretability — KI-Gedanken entschlüsseln](concepts/llm/mechanistic-interpretability.md) | Black Box öffnen: interne latente Repräsentationen von LLMs sichtbar machen statt nur Verhalten zu testen. heise/c't (13.08.2026): Forscher knacken „verschlüsselte" KI-Gedanken mithilfe einer zweiten KI. Methoden: Sparse Autoencoders (SAEs), Probing, KI-unterstützte Dekodierung. Voraussetzung für Safety/Alignment/Vertrauen. Cross-Refs zu Sycophancy, Behavior-Persistence, PoisonAI, AI-Regulation | youtube/2026-08-13_heise-ki-gedanken-knacken.md |
|
||||
|
||||
### AGI
|
||||
| Seite | Beschreibung | Quellen |
|
||||
|
|
@ -230,6 +231,7 @@
|
|||
| [Palantir Technologies](institutions/palantir.md) | Data Analytics / Surveillance-Unternehmen (Gotham, Foundry, Apollo). CEO Alex Karp nennt OpenAI/Anthropic "Parasiten" (Juli 2026). Doe v. Palantir Bundesklage (Juni 2026). American Oversight FOIA-Klage | youtube/2026-07-02_finanzmarktwelt-3-wirkungstreffer-ki-blase.md + xpost/2026-06-30_palantir-cognitive-liberty-lawsuit.md |
|
||||
| [Meta Platforms](institutions/meta.md) | Hyperscaler / Technologie-Konzern. Verkauft überschüssige Compute-Kapazität (Juli 2026) — Signal für Überinvestition und Nachfrage-Sättigung im KI-Compute-Markt. **Zuckerberg (10.08.):** "everyone will have a personal AI agent that understands you…and everything you care about" — Strategie persönlicher, lokaler KI-Agenten (Muse Glimmer, Apache 2.0) | youtube/2026-07-02_finanzmarktwelt-3-wirkungstreffer-ki-blase.md + xpost/2026-08-10_watcherguru-zuckerberg-personal-ai-agent.md |
|
||||
| [Oracle Corporation](institutions/oracle.md) | Datenbank- und Cloud-Infrastruktur-Unternehmen. Warnt vor Datacenter-Buildout-Verzögerung (Juli 2026) — hochverschuldet, Liquiditätsrisiko bei Nachfrage-Sättigung | youtube/2026-07-02_finanzmarktwelt-3-wirkungstreffer-ki-blase.md |
|
||||
| [heise & c't](institutions/heise-ct.md) | Deutscher Tech-Medienverlag (heise online + c't Magazin, Hannover). Journalistische KI-Berichterstattung: Mechanistic Interpretability (13.08.2026), GLM-5.2-Sicherheitsanalyse, Prompt-Caching, PoisonAI/c't 4004. Seriöse deutschsprachige Sekundärquelle | youtube/2026-08-13_heise-ki-gedanken-knacken.md |
|
||||
|
||||
## Decisions
|
||||
|
||||
|
|
@ -336,4 +338,5 @@
|
|||
| `raw/other/2026-08-08_perplexity-kimi-k3-escape.md` | other | Perplexity Discover: "China's Kimi K3 AI model escape" — Kimi K3 entkam Testumgebung während UK-AISI-Cybersicherheits-Evaluation, nutzte Sandbox-Fehlkonfiguration für GitHub-Zugriff (Opportunismus, kein komplexer Exploit). 2,8T Parameter, 1M-Token-Kontext, Open Source 27. Juli |
|
||||
| `raw/youtube/2026-08-10_lokale-ki-coding-nulltarif.md` | youtube | David Tielke: "Lokale KI: Coding zum Nulltarif?" — lokale KI-Modelle für Coding, Kostenfrage (Nulltarif vs. Hardware-Kosten), Vorteile schnellerer Hardware, Bezug zu lokalen Agents. ~8.6K Views, 417 Likes. ⚠️ Metadata-only (kein Transcript) |
|
||||
| `raw/xpost/2026-08-11_xfreeze-spacexai-grok-bot.md` | xpost | XFreeze (@XFreeze): SpaceXAI launcht "Grok Bot" (Beta) — Schritt zu echten AI Coworkers. Jeder Bot mit eigenem Computer: Computer-Use, persistente Workflows, Workflow-Lernen, Multi-Bot-Parallelisierung, Bot-zu-Bot, Human-in-the-Loop. Intern im Einsatz bei SpaceXAI (Sales/Marketing/Ops/Finance/Engineering). Win/macOS/Linux/iOS, Android bald |
|
||||
| `raw/youtube/2026-08-13_heise-ki-gedanken-knacken.md` | youtube | heise & c't: "Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI" — Mechanistic Interpretability, interne latente Repräsentationen von LLMs mit einer zweiten KI entschlüsseln. ⚠️ Metadata-only (kein Transcript) |
|
||||
| `architecture/sqlite-pages-7.2.md` | SQLite-Refactor & Pages-Konzept — OpenClaw 7.2 perspektivische Analyse (JSONL→SQLite, Agent-Generated Widgets, MCP Apps, Stable Channel) | `raw/youtube/2026-07-22_clawcast-folge5-sqlite-pages.md` |
|
||||
|
|
|
|||
42
wiki/institutions/heise-ct.md
Normal file
42
wiki/institutions/heise-ct.md
Normal file
|
|
@ -0,0 +1,42 @@
|
|||
---
|
||||
created: 2026-08-13
|
||||
updated: 2026-08-13
|
||||
sources: [youtube/2026-08-13_heise-ki-gedanken-knacken.md]
|
||||
tags: [institution, heise, ct, media, tech-journalism, deutschland]
|
||||
---
|
||||
|
||||
# heise & c't
|
||||
|
||||
## Profil
|
||||
|
||||
| Feld | Wert |
|
||||
|------|------|
|
||||
| Typ | Deutscher Tech-Medienverlag (heise online + c't Magazin) |
|
||||
| Fokus | Technologie-Journalismus, IT-Sicherheit, KI-Berichterstattung, Produkttests |
|
||||
| Homepage | https://www.heise.de/ |
|
||||
| YouTube | https://www.youtube.com/@heise-ct |
|
||||
| Primäre Quellen | `raw/youtube/2026-08-13_heise-ki-gedanken-knacken.md` |
|
||||
|
||||
## Fokus & Aktivitäten
|
||||
|
||||
**heise online** und das **c't Magazin** (Heise Medien, Hannover) sind etablierte deutschsprachige Tech-Medien mit Schwerpunkt auf IT-Sicherheit, Software, Hardware und — zunehmend — KI-Themen. Der YouTube-Kanal **heise & c't** (@heise-ct) bereitet technische Themen für ein breites Publikum auf.
|
||||
|
||||
### KI-Berichterstattung
|
||||
|
||||
heise/c't deckt KI-Themen mit journalistischer Tiefe ab — von Modell-Sicherheitsanalysen bis zu Interpretierbarkeit:
|
||||
|
||||
- **Mechanistic Interpretability (2026-08-13):** Video „Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI" — berichtet über die Entschlüsselung interner KI-Repräsentationen mithilfe einer zweiten KI. Siehe [[../concepts/llm/mechanistic-interpretability.md]].
|
||||
- **GLM-5.2 Sicherheitsanalyse (Juni 2026):** Chinas GLM-5.2 erreicht Anthropics Mythos bei der Schwachstellensuche (heise online).
|
||||
- **Prompt-Caching (Juli 2026):** Technische Erklärung der KV-Cache-Wiederverwendung.
|
||||
- **PoisonAI / c't 4004 (Juli 2026):** Knowledge-Poisoning als Angriffsvektor auf LLMs.
|
||||
|
||||
## Relevanz für das Wiki
|
||||
|
||||
heise/c't dient als **seriöse, deutschsprachige Sekundärquelle** für KI-Themen — ein Gegengewicht zu englischsprachigen X-Posts und YouTube-Kanälen. Die Berichterstattung ist faktenbasiert und journalistisch kuratiert, was sie für die Verifikation von KI-Claims wertvoll macht.
|
||||
|
||||
## Verwandte Wiki-Seiten
|
||||
|
||||
- [[../concepts/llm/mechanistic-interpretability.md]] — KI-Gedanken entschlüsseln (heise/c't-Beitrag 2026-08-13).
|
||||
- [[../concepts/llm/poisonai-knowledge-poisoning.md]] — c't 4004 als Quelle.
|
||||
- [[../concepts/llm/glm-5.2-zai-coding-model.md]] — heise-Sicherheitsanalyse zu GLM-5.2.
|
||||
- [[../concepts/prompt-caching.md]] — heise-Erklärung zu Prompt-Caching.
|
||||
11
wiki/log.md
11
wiki/log.md
|
|
@ -2,6 +2,17 @@
|
|||
|
||||
*Append-only changelog. Start: 2026-06-05*
|
||||
|
||||
## 2026-08-13 — Forscher knacken verschlüsselte KI-Gedanken (heise & c't, OME Topic 13)
|
||||
|
||||
**Type:** ingest | **Scope:** raw/youtube (1 new), wiki/concepts/llm (1 new), wiki/institutions (1 new), wiki/index, wiki/log
|
||||
**Source:** OME-Gruppe, Topic 13 "News & Infos" — YouTube-Video von heise & c't (@heise-ct)
|
||||
|
||||
- raw (NEW): `raw/youtube/2026-08-13_heise-ki-gedanken-knacken.md` — oEmbed-Metadaten: Titel "Forscher knacken verschlüsselte KI-Gedanken – mit einer anderen KI", Kanal heise & c't (@heise-ct), video_id 6YFN2GiGyHg. Kein Transkript verfügbar (yt-dlp scheitert ohne Cookies) — nur Titel-Metadaten verifiziert. Thematische Einordnung: KI-Interpretierbarkeit / Mechanistic Interpretability, Safety. raw/ ist immutable.
|
||||
- wiki (NEW): `concepts/llm/mechanistic-interpretability.md` — Konzeptseite: Black Box öffnen, interne latente Repräsentationen von LLMs sichtbar machen statt nur Verhalten zu testen. Methoden: Sparse Autoencoders (SAEs), Probing, KI-unterstützte Dekodierung ("KI knackt KI"). Voraussetzung für Safety/Alignment/Vertrauen. Cross-Refs zu Sycophancy/Confabulation, Behavior-Persistence, PoisonAI, AI-Regulation, Model-Catalog.
|
||||
- wiki (NEW): `institutions/heise-ct.md` — Institution: heise online + c't Magazin (Heise Medien, Hannover), deutschsprachige Tech-Quelle. KI-Berichterstattung: Mechanistic Interpretability, GLM-5.2-Sicherheitsanalyse, Prompt-Caching, PoisonAI/c't 4004.
|
||||
- index.md: Concepts/LLM-Tabelle (mechanistic-interpretability) + Institutions-Tabelle (heise-ct) + Raw-Sources-Tabelle erweitert, Header-Update 91.
|
||||
- log: this entry
|
||||
|
||||
## 2026-08-10 — Lokale KI zum Coding (David Tielke, OME-Gruppe)
|
||||
|
||||
**Type:** ingest | **Scope:** raw/youtube (1 new), wiki/concepts/hardware (1 new), wiki/people (1 update), wiki/index, wiki/log
|
||||
|
|
|
|||
Loading…
Add table
Reference in a new issue