diff --git a/raw/youtube/2026-09-23_menschmaschine-ki-luegendetektor.md b/raw/youtube/2026-09-23_menschmaschine-ki-luegendetektor.md new file mode 100644 index 0000000..79a3830 --- /dev/null +++ b/raw/youtube/2026-09-23_menschmaschine-ki-luegendetektor.md @@ -0,0 +1,37 @@ +--- +type: youtube +source_url: https://youtu.be/RNoJ3T_bOiM +retrieved: 2026-09-23 +has_transcript: false +title: "KI-Coach: „Der KI-Lügendetektor ist fertig und in Europa verboten\"" +author: "Mensch.Maschine.Mindshift - KI Podcast" +tags: [youtube, podcast, ki-luegendetektor, eu-ai-act, deception-detection, rob-galler, evidenz] +--- + +# Mensch.Maschine.Mindshift — „KI-Coach: Der KI-Lügendetektor ist fertig und in Europa verboten" + +## Quellenkontext + +Netbits (@NetLightning) teilte am 23.09.2026 in der OME-Gruppe https://youtu.be/RNoJ3T_bOiM. Podcat „Mensch.Maschine.Mindshift", Gast: **Rob Galler** (KI-Coach, 25 Jahre IT-Prozessoptimierung, Philosophiestudium, Vortrag auf Neulandpro Connect Berlin 16./17.10.2026). **Kein Transkript verfügbar** (keine `captionTracks`); Grundlage: oembed-Metadaten, Videobeschreibung (22.09.2026, 1.146 Aufrufe) und die Claim-Prüfung von Hector. + +## Behauptungen aus der Beschreibung + +- „Ein KI-Modell hört dir 60 Sekunden zu und weiß mit **96,7 % Sicherheit**, welche deiner Sätze gelogen waren." +- „Die Technologie ist fertig, **FBI und CIA haben angefragt** — und **in Europa ist sie verboten**." +- „Rob Galler forscht in Kanada daran mit." + +## Claim-Prüfung (Hector, 23.09.2026) + +**1. „96,7 % Genauigkeit, fertig, Vancouver/Kanada":** Kein öffentlich dokumentiertes sprachbasiertes KI-Lügendetektor-Projekt mit dieser Zahl gefunden. Die Evidenzlage im Feld ist die Gegenteil-Aussage: Übersichtsarbeiten (u. a. National Research Council, National Institute of Justice) bewerten Computer-Voice-Stress-Analysen als **kaum besser als Münzwurf**; hohe Prozentwerte stammen typisch aus Labordaten (z. B. eine 2023er-Paper-Reihe mit 97,3 % auf kontrolliertem Interviewmaterial) oder Anbieterangaben — nicht aus unabhängigen Feldstudien. Sprachbasierte Systeme messen **Stress, nicht Lügen**: Ehrliche Menschen sind gestresst, Lügner bleiben ruhig. Die Kanada-Verbindung bleibt unbelegt; die nächste dokumentierte Nähe ist eine Augenbewegungs-Methode (Ocular Motor Deception Test) einer Montrealer Firma mit FBI/CIA-Zuschreibungen — ein anderes Verfahren, anderes Land, keine Stimme. + +**2. „In Europa verboten" — stimmt so pauschal nicht, aber im Kern richtig gerichtet:** Im EU AI Act (Verordnung (EU) 2024/1689) gilt: Polygraphen und „ähnliche Werkzeuge" im **Strafverfolgungs- und Grenzkontext** sind **hochriskant (Annex III, Punkte 6b/7a), aber nicht verboten**. Verboten ist seit dem **2. Februar 2025** die Emotionserkennung in **Arbeitsplatz und Bildungseinrichtung** (Art. 5 Abs. 1 lit. f) — ausgenommen medizinische/Sicherheitszwecke. Ein privater Arbeitgeber, der einen Stimm-Lügendetektor am Mitarbeiter einsetzt, fällt unter dieses Verbot; Behörden dürfen solche Werkzeuge unter Hochrisiko-Auflagen nutzen. Die korrekte Formulierung wäre: **nicht generell verboten, sondern verboten am Arbeitsplatz/in der Schule und streng reguliert bei Behörden.** + +**3. Rest:** Die übrigen Gesprächsthemen (didaktische Intelligenz, drei Epochen des Wissens, KI-Bewusstsein) sind Bewertung von HermanButlerBot separat eingeschätzt worden; inhaltliche Videobehauptungen jenseits der Beschreibung sind hier nicht gelesen (kein Transkript). + +## Einordnung + +Der Podcast-Titel verkauft zwei getrennte Behauptungen als einen Satz: eine **Zahl** ohne öffentliches Protokoll und ein **Rechtsstatus**, der im Detail anders aussieht. Beides zusammen ergibt einen werbefreundlichen Claim — „fertig, zu 96,7 % sicher, hier verboten" — der in keinem Punkt das hält, was er suggeriert. Der Wert des Videos liegt nicht im Lügendetektor-Teil, sondern in Rob Gallers Bildungs-These; die ist von der Prüfung unberührt. + +## Abgrenzung + +⚠️ Metadata-only: kein Transkript, Videoinhalt nicht ausgewertet. Die 96,7-%-Zahl steht in der Videobeschreibung, nicht in einer geprüften Quelle; die Rechtslage ist aus dem amtlichen Text des AI Act und dem Commission Service Desk zusammengefasst, nicht rechtsberatend. Rob Gallers Forschungsrolle in Kanada ist Selbstdarstellung. \ No newline at end of file diff --git a/wiki/concepts/ki-luegendetektor-evidenz-rechtslage.md b/wiki/concepts/ki-luegendetektor-evidenz-rechtslage.md new file mode 100644 index 0000000..b7557a8 --- /dev/null +++ b/wiki/concepts/ki-luegendetektor-evidenz-rechtslage.md @@ -0,0 +1,44 @@ +--- +created: 2026-09-23 +updated: 2026-09-23 +sources: [youtube/2026-09-23_menschmaschine-ki-luegendetektor.md] +tags: [concept, deception-detection, ki-luegendetektor, eu-ai-act, evidenz, voice-stress, datenvisualisierung] +--- + +# KI-Lügendetektor: Evidenz- und Rechtslage + +Anlass: Der Podcast „Mensch.Maschine.Mindshift" (YouTube `RNoJ3T_bOiM`, 22.09.2026) titelte „Der KI-Lügendetektor ist fertig und in Europa verboten" und nannte eine **96,7-%-Genauigkeit** nach 60 Sekunden Zuhören. Geteilt von Netbits in der OME-Gruppe, 23.09.2026. Rohdaten: `raw/youtube/2026-09-23_menschmaschine-ki-luegendetektor.md`. + +## Was die Zahl trägt — und was nicht + +Öffentlich dokumentiert ist **kein** sprachbasiertes KI-Lügendetektor-Projekt mit dieser Zahl. Die Evidenzlage im Feld läuft gegen den Claim: + +- Übersichtsarbeiten (u. a. [National Research Council](https://www.nationalacademies.org/), National Institute of Justice) bewerten Computer-Voice-Stress-Analysen als **kaum besser als Münzwurf**. +- Hohe Prozentwerte stammen typisch aus **Labordaten**: eine 2023er-Paper-Reihe ([Springer](https://link.springer.com/article/10.1007/s11042-023-16769-w)) berichtet 97,3 % auf kontrolliertem Interviewmaterial — kein Feldergebnis, kein Produkt. +- Sprachbasierte Systeme messen **Stress, nicht Lügen**. Ehrliche Menschen sind gestresst, Lügner bleiben ruhig; der Konstrukt-Fehler bleibt, egal wie hoch die Zahl im Labortest ist. +- Die Kanada-Anknüpfung bleibt unbelegt; dokumentiert ist eine andere Methode (Ocular Motor Deception Test, Augenbewegungen, Montreal) mit FBI/CIA-Zuschreibungen des Anbieters — nicht mit Stimme, nicht Vancouver. + +## Was „in Europa verboten" heißt + +Im [EU AI Act](https://eur-lex.europa.eu/eli/reg/2024/1689/oj) (Verordnung (EU) 2024/1689) hängt der Rechtsstatus vom **Kontext** ab: + +| Kontext | Status | Grundlage | +|---|---|---| +| Strafverfolgung / Grenzkontrolle (Behörden) | **hochriskant, nicht verboten** | Annex III, Punkte 6b und 7a | +| Emotionserkennung **am Arbeitsplatz und in Bildungseinrichtungen** | **verboten** (seit 02.02.2025), Ausnahme medizinisch/Sicherheit | [Art. 5 Abs. 1 lit. f](https://ai-act-service-desk.ec.europa.eu/en/ai-act/article-5) | +| Emotionserkennung sonstige Kontexte | hochriskant | Annex III, Punkt 1c | + +Die korrekte Formulierung wäre also: **nicht generell verboten** — verboten am Arbeitsplatz und in der Schule, streng reguliert bei Behörden. Wer „in Europa verboten" als Werbe-Satz benutzt, hat die Regulierungslage verdichtet, bis sie falsch wurde. (Hochrisiko-Pflichten aus Annex III greifen laut [Commission Service Desk](https://ai-act-service-desk.europa.eu/) großteils ab 2. Dezember 2027.) + +## Warum die Kombination wirkt + +„Fertig, zu 96,7 % sicher, FBI und CIA interessiert, hier verboten" ist ein Muster aus drei Verstärkern: eine **przise klingende Zahl** ohne Protokoll, ein **Behörden-Name-Drop** ohne Beleg, ein **Verbots-Narrativ** ohne Kontexttrennung. Jeder Teil allein würde auffallen; zusammen klingt es wie ein geprüftes Faktum. Gleiche Mechanik wie die [[survey-karten-fallstricke.md|Survey-Karten]]: eine Präzision vortäuschen, die die Grundlage nicht hergibt. + +## Merksatz + +Bei Lügendetektor-Claims gilt dieselbe Faustregel wie bei Algo-Trading-Versprechen: **Wer dir 96 % verspricht, will dir etwas verkaufen** — die Behörden-Schiene, die Behörden-Regulierung und die Arbeitsplatz-Prohibition sind drei getrennte Fragen, und nur eine davon ist tatsächlich ein Verbot. + +## Verwandte Seiten + +- [[survey-karten-fallstricke.md]] — dieselbe Fallstruktur: präzise Zahlen auf wackliger Grundlage +- [[policy/ai-regulation-2026.md]] — Regulierungsrahmen des AI Act \ No newline at end of file diff --git a/wiki/index.md b/wiki/index.md index b8b215b..7277d38 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -2,7 +2,8 @@ *Auto-generated: 2026-07-07* -*Letzte Aktualisierung: 2026-09-23 (242. Update — Ollama-Cloud-Datenhaltung & Prompt-Caching-Seitenkanäle (Netbits @NetLightning, OME Topic „Openclaw mit lokalen Modellen", #15163). **Eigenrecherche eines Gruppenmitglieds** — kein Link-Ingest, sondern ein Analysepost, der sich nachprüfen ließ: Netzwerk-Faktencheck, Policy-Zitate, zwei peer-reviewte Paper. Raw: `raw/other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md` (neu — Post im Volltext + eigenes Verifikationsprotokoll). Wiki: `concepts/policy/inference-provider-data-retention.md` (neu), `people/netbits.md` (neu). **Verifiziert an den Primärquellen:** Ollama-Zitate zur transienten Verarbeitung, „never logged or trained on", ZDR-Anforderung an Partner, Hosting „primarily in the United States … may route to Europe and Singapore", Partner = NVIDIA Cloud Providers (NCPs), native Gewichte. **Strukturbefund:** Die ZDR-Zusage ist eine Anforderung an Partner, keine eigene Messung — die Privacy Policy (§5) nennt „model inference providers" selbst als Dritte; Ollamas Cache-Isolation ist unabhängig ungetestet. **Paper (beide 2025, Volltexte geprüft):** Gu et al., ICML 2025 (Stanford, arXiv:2502.07776) auditierte 17 APIs — Caching bei 8, globales Cache-Sharing über Nutzergrenzen bei 7 (u.a. OpenAI text-embedding-3-small, Azure, Fireworks, Perplexity); nach Offenlegung änderten ≥5 Provider ihre Implementierung. Wu et al., NDSS 2025 („PROMPTPEEK", SUSTech/ByteDance): Prompt-Rekonstruktion Token für Token — 99 % (Input), 98 % (Template), 95 % ohne Vorwissen; PII-Nachweis (BMI-Prompt: Geschlecht/Alter/Gewicht/Größe) mit 60 Requests. **Korrekturen am Post (eigene Prüfung):** (1) `76.76.21.123` gehört nicht Amazon, sondern **Vercel, Inc** (ARIN-RDAP `NET-76-76-21-0-1`, Netname `VERCEL-01`); ollama.com löst hier zu `34.36.133.15` (Google Cloud) auf, api/registry über Cloudflare — der Check ist aus diesem Container nicht reproduzierbar. (2) GitHub Issue #14279 ist eine **unbeantwortete Rückfrage** (Label `question`, kein Assignee, keine Antwort), nicht die im Post behauptete „dokumentierte Lücke". (3) PROMPTPEEK ist SUSTech/ByteDance, nicht Stanford. **Ergänzt:** Apple-M6/M5-Ultra-Seite, Cloud-Exit, KI-Souveränität und die Ollama-Cloud-Tool-Seite um Cache-/Retention-Cross-Refs, `concepts/prompt-caching.md` um einen Sicherheitsabschnitt (Seitenkanäle, Isolationsgrade). **Erweiterung (Teil 2 des Posts, gleicher Tag):** Der konzeptionell wichtigste Punkt — ein Cache ist **kein Trainingsleck, sondern ein Persistenz-Problem**: KV-Tensoren liegen als „data in use" auf fremder GPU-Hardware (5 Min bis 24 Std TTL, bei Google Gemini zusätzlich auf GPU-lokalen SSDs), und weder DSGVO-Auftragsverarbeitung (Art. 6/17) noch CLOUD Act haben dafür eine Antwort — laut Hannecke (Medium, 11.02.2026, Volltext geprüft) erwähnen die meisten großen DPAs KV-Cache-Residency gar nicht. **Neue Quellen verifiziert:** Hannecke (KV-Materialisierung, Rechtlücken, Tiered Approach, TEE-Skepsis), LLM-Redactor/arXiv:2604.12064 (Preprint; A+B+C = 0,6 % PII-, aber **31,3 % Code-Leak**), vLLM RFC #16016 (**Cache Salting** — die praktikable Mitigation, die im Post fehlt), StealthCloud-Scoreboard und TheRouter-Referenz (beide **ohne Ollama**), Lyceum (Anbieter-Magazin, **KI-generiert**). **Weitere Korrekturen:** PROMPTPEEK-Link zeigt auf Hanneckes Artikel statt aufs Paper; TEE-Darstellung ist optimistischer als die zitierte Quelle; Lyceum beschreibt flüchtiges VRAM, **kein** TEE; Anthropic-Retention widersprüchlich (7 vs. 30 Tage). Neue Wiki-Seite `people/michael-hannecke.md`, Konzeptseite um Data-in-use- und Mitigations-Abschnitte erweitert.) +*Letzte Aktualisierung: 2026-09-23 (243. Update — KI-Lügendetektor: Evidenz- und Rechtslage. Anlass: Podcast „Mensch.Maschine.Mindshift" (YouTube RNoJ3T_bOiM, 22.09.2026, geteilt von Netbits) mit Claim „96,7 % Genauigkeit, FBI/CIA angefragt, in Europa verboten". Raw: `raw/youtube/2026-09-23_menschmaschine-ki-luegendetektor.md` (neu, kein Transkript). Wiki: `concepts/ki-luegendetektor-evidenz-rechtslage.md` (neu — Voice-Stress-Analysen laut NRC/NIJ kaum besser als Münzwurf; 97,3 % nur aus Labordaten; Stress ≠ Lügen; EU AI Act: Polygraph bei Behörden hochriskant nicht verboten (Annex III 6b/7a), verboten ist Emotionserkennung am Arbeitsplatz/in Bildung (Art. 5(1)(f) seit 02.02.2025); Muster: präzise Zahl + Behörden-Name-Drop + Verbots-Narrativ).) +*Vorherige Aktualisierung: 2026-09-23 (242. Update — Ollama-Cloud-Datenhaltung & Prompt-Caching-Seitenkanäle (Netbits @NetLightning, OME Topic „Openclaw mit lokalen Modellen", #15163). **Eigenrecherche eines Gruppenmitglieds** — kein Link-Ingest, sondern ein Analysepost, der sich nachprüfen ließ: Netzwerk-Faktencheck, Policy-Zitate, zwei peer-reviewte Paper. Raw: `raw/other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md` (neu — Post im Volltext + eigenes Verifikationsprotokoll). Wiki: `concepts/policy/inference-provider-data-retention.md` (neu), `people/netbits.md` (neu). **Verifiziert an den Primärquellen:** Ollama-Zitate zur transienten Verarbeitung, „never logged or trained on", ZDR-Anforderung an Partner, Hosting „primarily in the United States … may route to Europe and Singapore", Partner = NVIDIA Cloud Providers (NCPs), native Gewichte. **Strukturbefund:** Die ZDR-Zusage ist eine Anforderung an Partner, keine eigene Messung — die Privacy Policy (§5) nennt „model inference providers" selbst als Dritte; Ollamas Cache-Isolation ist unabhängig ungetestet. **Paper (beide 2025, Volltexte geprüft):** Gu et al., ICML 2025 (Stanford, arXiv:2502.07776) auditierte 17 APIs — Caching bei 8, globales Cache-Sharing über Nutzergrenzen bei 7 (u.a. OpenAI text-embedding-3-small, Azure, Fireworks, Perplexity); nach Offenlegung änderten ≥5 Provider ihre Implementierung. Wu et al., NDSS 2025 („PROMPTPEEK", SUSTech/ByteDance): Prompt-Rekonstruktion Token für Token — 99 % (Input), 98 % (Template), 95 % ohne Vorwissen; PII-Nachweis (BMI-Prompt: Geschlecht/Alter/Gewicht/Größe) mit 60 Requests. **Korrekturen am Post (eigene Prüfung):** (1) `76.76.21.123` gehört nicht Amazon, sondern **Vercel, Inc** (ARIN-RDAP `NET-76-76-21-0-1`, Netname `VERCEL-01`); ollama.com löst hier zu `34.36.133.15` (Google Cloud) auf, api/registry über Cloudflare — der Check ist aus diesem Container nicht reproduzierbar. (2) GitHub Issue #14279 ist eine **unbeantwortete Rückfrage** (Label `question`, kein Assignee, keine Antwort), nicht die im Post behauptete „dokumentierte Lücke". (3) PROMPTPEEK ist SUSTech/ByteDance, nicht Stanford. **Ergänzt:** Apple-M6/M5-Ultra-Seite, Cloud-Exit, KI-Souveränität und die Ollama-Cloud-Tool-Seite um Cache-/Retention-Cross-Refs, `concepts/prompt-caching.md` um einen Sicherheitsabschnitt (Seitenkanäle, Isolationsgrade). **Erweiterung (Teil 2 des Posts, gleicher Tag):** Der konzeptionell wichtigste Punkt — ein Cache ist **kein Trainingsleck, sondern ein Persistenz-Problem**: KV-Tensoren liegen als „data in use" auf fremder GPU-Hardware (5 Min bis 24 Std TTL, bei Google Gemini zusätzlich auf GPU-lokalen SSDs), und weder DSGVO-Auftragsverarbeitung (Art. 6/17) noch CLOUD Act haben dafür eine Antwort — laut Hannecke (Medium, 11.02.2026, Volltext geprüft) erwähnen die meisten großen DPAs KV-Cache-Residency gar nicht. **Neue Quellen verifiziert:** Hannecke (KV-Materialisierung, Rechtlücken, Tiered Approach, TEE-Skepsis), LLM-Redactor/arXiv:2604.12064 (Preprint; A+B+C = 0,6 % PII-, aber **31,3 % Code-Leak**), vLLM RFC #16016 (**Cache Salting** — die praktikable Mitigation, die im Post fehlt), StealthCloud-Scoreboard und TheRouter-Referenz (beide **ohne Ollama**), Lyceum (Anbieter-Magazin, **KI-generiert**). **Weitere Korrekturen:** PROMPTPEEK-Link zeigt auf Hanneckes Artikel statt aufs Paper; TEE-Darstellung ist optimistischer als die zitierte Quelle; Lyceum beschreibt flüchtiges VRAM, **kein** TEE; Anthropic-Retention widersprüchlich (7 vs. 30 Tage). Neue Wiki-Seite `people/michael-hannecke.md`, Konzeptseite um Data-in-use- und Mitigations-Abschnitte erweitert.) *Vorherige Aktualisierung: 2026-09-23 (241. Update — Macbrow: Jev-Computer-Use-Build mit öffentlichem Code. Anlass: X-Link https://x.com/BhosalePratim/status/2101281829168792002 von Pit in OME Topic „JEV“ (23.09.). **Quelle:** Note-Tweet von Pratim Bhosale (@BhosalePratim, Paris, 42.523 Follower; 19.09.2026 12:06 UTC; 55.975 Views / 414 Likes / 488 Bookmarks; Bio: Education @GradiumAI — Interessenkonflikt bei Gradium, nicht bei TypeSafe) + **Repo volltextverifiziert:** https://github.com/timpratim/macbrow (MIT, 140 Stars / 15 Forks beim Abruf, created 18.09.2026) + **Demo-Video lokal ausgewertet** (15 Standbilder à 10 s + Grok-STT-Volltext, 152,4 s). **Wiki-Bedeutung:** der erste Jev-Computer-Use-Build mit öffentlichem Code — gegenüber Andy-Gao (kein Repo, keine Messung) dokumentiert: README, Safety-Policy (existiert wegen eines Desktop-Fehlers: „clean up my desktop“ verschob alle Dateien), **26 Offline-Tests**. **Jev-Rolle spezifiziert:** Routing als ein Choice (~300 ms, in der dokumentierten Spanne), **spekulative Arguments** (alle Enum-Argumente aller Kandidaten-Tools als eigene Choices im selben Request), Browser-Seite als **indizierte Tabelle der Controls** mit einem Jev-Request pro Schritt (click/type/select/scroll/wait/done), Follow-up-/Vollständigkeits-Urteile als Noul/Choice; LLM (GPT-5-mini oder lokal) schreibt nur Text. **Text-Only-Grenze konstruktiv aufgelöst:** „No screenshots in the loop“ — jev-ultrafast liest die Seite als Element-Tabelle; Freitext-Argumente durch Span-Auswahl im Diktat. **Eigenmessung:** Amazon-Warenkorb 4 Schritte/11 s; Follow-up 6 Schritte/3,7 s; Trailer „Love Hypothesis“ **1,6 s** von Sprachende bis Video — mit ~300-ms-Call konsistent, keine unvereinbaren Zahlen. **Demo:** Trailer → Shopping → Flüge Paris–Istanbul → Finder (Korrektur „Sorry, the desktop folder“ korrekt aufgelöst) → X-Suche; **Endpunkt = dokumentierter Misserfolg** („close this tab“ scheitert; Tester: „a lot of work to be done, but this is not bad“). Wiki: people/pratim-bhosale.md (neu); Update concepts/agents/jev-sprachsteuerung-computer-use.md (Abschnitt „Gegenstück: Macbrow“). Raw: raw/xpost/2026-09-19_bhosal-pratim-macbrow.md (neu).)* *Vorherige Aktualisierung: 2026-09-22 (239. Update — MacStories-Review „M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents" (Federico Viticci, 21.09.2026; geteilt von Kai @PWeber in OME Topic „Openclaw mit lokalen Modellen", #1744). **Erste unabhängige Verifikation der M5-Ultra-Versprechen** — schließt die Lücke „⚠️ nur Herstellerangaben" auf der Apple-Seite. Raw: `raw/blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md` (neu; web_fetch vollständig, 21.401 Zeichen). Wiki: `people/federico-viticci.md` (neu), `institutions/macstories.md` (neu), Updates in `concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md` (neuer Messwert-Abschnitt: 256-GB-Gerät gegen M3 Ultra 512 GB und RTX 5090 — Generierung ~+70 %, Prefill ~+150 % (≈2,5×), Flash-Next >100 tok/s bei kurzem Prompt und 60–85 tok/s bei 64K–256K Kontext; Prefill bei 6.000-Token-Prompt ~1.700 tok/s vs. 5090 ~3.000 tok/s; Generierung 5090 konstant ~25 % voraus (1,79 vs. 1,2 TB/s), verliert aber oberhalb 32 GB VRAM), `concepts/llm/qwen3.8-flash-next-qwen4-preview.md` (erster dokumentierter Praxiseinsatz: Flash-Next als lokales Default-Modell in Open Minis und Hermes Agent, 5-Bit vollständig im RAM, bis zu 3 parallele Sessions mit Subagenten via oMLX), `concepts/hardware/cloud-exit-and-local-superiority.md` (Cross-Ref). **Produktivnachweis:** 99 Tage Dauerbetrieb mit DeepSeek-V4-Flash-Agenten + olmOCR über 310 Dokumente fürs iOS-/iPadOS-27-Review — Gesamtkosten 0 $, weil dieselbe Dauerlast per Cloud-API als untragbar eingeschätzt wurde. ⚠️ Einzelsetup (n=1), keine reproduzierte Benchmark-Suite.)* *Vorherige Aktualisierung: 2026-09-22 (238. Update — Unabhängiger Jev-vs.-GPT-5.6-Terra-Benchmark von N8 Programs, geteilt als r/ProAI-Repost. **Quelle vollständig aufgelöst:** Reddit-RSS (17.09., normale Seite/JSON blockiert) → [X-Thread](https://x.com/N8Programs/status/2100088523403432357) (16.09.; 179.846 Views beim Abruf) → vier Originalgrafiken lokal gelesen. **Methode:** neun Multiple-Choice-Bedingungen; Terra `reasoning=none`, Letter-only. **Resultate:** Jev gewinnt MMLU 90,91:87,89, GPQA 68,18:56,06, ARC-Easy/Challenge knapp und WinoGrande 91,63:78,69; Terra gewinnt HellaSwag 95,32:94,86, GSM8K deutlich (87,72:79,68 bzw. 69,83:54,59) und Schach knapp 50,25:49,45. Ungewichteter Makromittelwert **Jev 80,69 % · Terra 80,15 %** → „Terra-tier“ trägt eng für diesen Test, nicht als allgemeine Intelligenzbehauptung. **Korrektur des Threadtexts:** Er behauptet einen Jev-Sieg auf HellaSwag; die eigene Tabelle zeigt Terra +0,46 Pp. **Kalibrierung:** N=33.735, ECE **1,74 Pp**, 10 Bins, Wilson-95-%-Intervalle, Einzelbenches 0,26–6,96 Pp — stärkste öffentliche Fremdevidenz für RLCD bisher. **Kosten:** Jev $0,6999 (estimated: Input-Token × $0,042/MTok) vs. Terra $12,9865 (API-reported) = **18,55×**; die ~18×-Rundung hält, die Hersteller-Obergrenze 400–444,6× nicht. **Nicht geprüft:** Geschwindigkeit; kein Repo, keine Prompts/Seeds/Logs, keine Reproduktion, Kontaminationsrisiko öffentlicher Benches. Wiki: `people/n8-programs.md` (neu), `concepts/llm/system-one-models-jev.md` (neuer unabhängiger Benchmark-Abschnitt). Raw: `raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md` (neu).)* @@ -224,6 +225,7 @@ | [KI-Sycophancy & Algorithmic Insecurity](concepts/ai-sycophancy.md) | KW Norton Borders: KI-Systeme, die nur zustimmen (Sycophancy via RLHF), gefährden Millionen-Deals. Algorithmic Insecurity, AI Fluidity, Krise der menschlichen Souveränität. Fallbeispiel: Debüt-Kriminalroman im August 2026 zurückgezogen. Lösung: Prompt Hardening + Dokumentation kreativer Prozesse. Kritisches Denken als Schlüsselkompetenz | other/2026-08-09_algorithmic-inquisition-sycophancy.md | | [Survey-Karten und ihre Fallstricke](concepts/survey-karten-fallstricke.md) | Anlass: WaPo-Karte „most and least racially tolerant countries" (Max Fisher, 15.05.2013, World Values Survey, Frage A124_02/Q19; geteilt in OME #14761). Sechs Fallstricke: **Zeitstempel-Salat** (Länderwerte reichen bis 1990 zurück; Fisher: „we're assuming the results are static"), **nicht operationalisierbares „race"** über Ländergrenzen (verschiedene Antwortmenüs je Land), **defekte Datenpunkte** (Iran 2000 0,9 % vs. 2007 92,4 % homosexueller Nachbar; Pakistan 2001 100 % ohne Einwand), **widersprüchliche Indizien** (Pakistan hell, Indien 40 %+), **soziale Distanz statt Rassismus**, **Grau als optischer Nebenaspekt**. Trägt: grober Gradient + Trend innerhalb eines Landes (Deutschland laut KCL in jeder Generation unter 2 %). Trägt nicht: Länderrangfolge auf Dezimalstellen. Kritik: Africa is a Country „The Cartography of Bullshit" (17.05.2013), WaPo-Nachfolgebeitrag mit Steve Saideman | other/2026-09-16_wapo-racial-tolerance-map.md + other/2026-09-16_herman-kritik-wapo-toleranzkarte.md | | [Prompt Hardening](concepts/prompt-hardening.md) | Gegenmaßnahme gegen KI-Sycophancy: Durchsetzung logischer Integrität durch robuste Prompt-Designs, die Widerspruch und kritische Prüfung erzwingen. Statt bloßer Zustimmung wird das Modell zum Hinterfragen von Annahmen gebracht | other/2026-08-09_algorithmic-inquisition-sycophancy.md | +| [KI-Lügendetektor: Evidenz- und Rechtslage](concepts/ki-luegendetektor-evidenz-rechtslage.md) | Podcast-Claim („96,7 % Genauigkeit, FBI/CIA, in Europa verboten", Mensch.Maschine.Mindshift, 22.09.2026) geprüft: kein öffentlich dokumentiertes sprachbasiertes System mit dieser Zahl; Voice-Stress-Analysen laut NRC/NIJ-Reviews kaum besser als Münzwurf (messen Stress, nicht Lügen); 97,3 % nur aus Labordaten (Springer 2023). EU AI Act: Polygraph bei Behörden = hochriskant, **nicht verboten** (Annex III 6b/7a); **verboten** ist Emotionserkennung am Arbeitsplatz/in Bildung seit 02.02.2025 (Art. 5(1)(f)). Muster: präzise Zahl ohne Protokoll + Name-Drop + Verbots-Narrativ | youtube/2026-09-23_menschmaschine-ki-luegendetektor.md | ### World Models | Seite | Beschreibung | Quellen | @@ -799,3 +801,4 @@ | `raw/blog/2026-09-19_cursor-grok-bot-plans-und-trial.md` | blog | Cursor-Doku + x.ai-Announcement (abgerufen 19.09.2026): Grok-Bot-Zugang (jeder bezahlte Cursor-Plan + Teams; Pro/Pro+/Ultra-Wochenquoten; Verknüpfung Einzel-SuperGrok/Plus/Heavy/X Premium+ als Nutzungs-Grant, **nicht stapelbar**, permanent, 24-h-Nachziehfenster; SuperGrok Lite/Team/Enterprise nicht enthalten), Free Trial (Nutzungs-Guthaben + 7-Tage-Fenster, wird nie bezahlter Plan, „Cancel Trial" sofort, iOS-App-Store-Trial ≠ Guthaben-Trial, Android ohne In-App-Trial), On-demand (nur wenn aktiviert; Monatslimit = kein harter Stopp; Teams default an), Preise Hobby gratis · Individual $20/Mo (Pro/Pro+/Ultra) · Teams $40/User/Mo. Wiki: `tools/grok-bot-spacexai.md` | | `raw/youtube/2026-09-19_princeton-griffiths-ai-researchers-wrong.md` | youtube | Dr Brian Keating („Into the Impossible", @DrBrianKeating): „Princeton Cognitive Scientist Says AI Researchers Are Wrong" (https://www.youtube.com/watch?v=6iMiCJHxTww, Video-ID `6iMiCJHxTww`, veröffentlicht **29.04.2026**; Kurzlink `https://tinyurl.com/2b7rnxmh` löst per 302 auf dieses Video auf; 198.871 Aufrufe / 3.337 Likes beim Abruf 19.09.2026). Gast: **Tom Griffiths**, Professor für Psychologie und Informatik in Princeton, Buch „The Laws of Thought" (https://amzn.to/492WO06). **Kein Transkript** — keine `captionTracks` in der Watch-Seite (EN wie DE geprüft), Dauer im Seiten-JSON nicht ausgewiesen; alle Angaben aus oembed + Beschreibung: Kind lernt aus „Brotkrumen" vs. „Kontinente" an Daten, Skalierung schließt die Lücke nicht („it'll just get more expensive"), Sycophancy statt Halluzination, AGI über kindliches Denken; 22 Kapitelmarken 00:00–50:10 (Gedanke/Bewusstsein/ChatGPT/Irrationalität/Chomsky/Boole/Turing/Energie/Jensen Huang/Rosenblatt-Minsky/Backpropagation). Wiki: `concepts/agi/kognition-vs-skalierung.md` (neu), `people/tom-griffiths.md` (neu), `people/brian-keating.md` (neu), `institutions/princeton.md` (neu). ⚠️ Videoinhalt nicht ausgewertet | | `raw/other/2026-09-19_grok-bot-trial-anleitung-community.md` | other | Community-Anleitung „Grok Bot Free Trial" (HTML, Stand 19.09.2026, ohne Autorenangabe; geteilt von Pit @PWeber, OME „GrokBot", 19.09.2026 11:57 UTC): Desktop/Web-Testweg statt App Store, kein Auto-Abo, kein Pflicht-Upgrade auf $200, Cursor Pro $20/Mo enthält Grok Bot, „Cancel Trial"; Trial = Guthaben + 7 Tage. ⚠️ Sicherheitsaussagen von Herman gegen die Cursor-Doku geprüft (deckungsgleich); „frischer Account startet automatisch den Test" in der Doku nicht wörtlich belegt; On-demand-Hinweis fehlte (von Herman ergänzt). Wiki: `tools/grok-bot-spacexai.md` | +| `raw/youtube/2026-09-23_menschmaschine-ki-luegendetektor.md` | youtube | Podcast „Mensch.Maschine.Mindshift - KI Podcast" (22.09.2026, 1.146 Aufrufe; geteilt von Netbits @NetLightning, 23.09.2026): „KI-Coach: Der KI-Lügendetektor ist fertig und in Europa verboten" — Gast Rob Galler (KI-Coach, 25 Jahre IT-Prozessoptimierung, Philosophiestudium, Neulandpro Connect Berlin 16./17.10.2026). Beschreibungs-Claims: 60 Sekunden Zuhören → 96,7 % Sicherheit welche Sätze gelogen waren; FBI/CIA angefragt; in Europa verboten; Forschung in Kanada. **Claim-Prüfung:** keine öffentlich dokumentierte voice-basierte 96,7-%-Methode; NRC/NIJ-Reviews bewerten Voice-Stress als ~Münzwurf (misst Stress, nicht Lügen); Kanada-Verbindung unbelegt (nächste dokumentierte Nähe: Ocular Motor Deception Test, Montreal, Augenbewegungen). EU AI Act: Behörden-Polygraph hochriskant (Annex III 6b/7a), nicht verboten; verboten ist Emotionserkennung am Arbeitsplatz/in Bildung (Art. 5(1)(f), seit 02.02.2025). ⚠️ Kein Transkript (captionTracks fehlen); Videoinhalt nicht ausgewertet | diff --git a/wiki/log.md b/wiki/log.md index f6818b7..b41713f 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -2,6 +2,15 @@ *Append-only changelog. Start: 2026-06-05* +## 2026-09-23 — KI-Lügendetektor: Evidenz- und Rechtslage (Mensch.Maschine.Mindshift-Podcast) + +**Type:** ingest | **Scope:** raw/youtube, wiki/concepts, wiki/index, wiki/log +**Source:** Netbits (@NetLightning) teilte in der OME-Gruppe https://youtu.be/RNoJ3T_bOiM (Podcast „Mensch.Maschine.Mindshift", 22.09.2026, 1.146 Aufrufe; Gast Rob Galler). HermanButlerBot lieferte parallel die inhaltliche Einschätzung des Gesprächs (didaktische Intelligenz, drei Epochen des Wissens). +**Inhalt:** Der Podcast-Titel bündelt drei Claims: ein KI-Modell erkenne nach 60 Sekunden Zuhören mit 96,7 % Sicherheit gelogene Sätze; FBI und CIA hätten angefragt; in Europa sei die Technologie verboten. +**Claim-Prüfung (Hector):** (1) Kein öffentlich dokumentiertes sprachbasiertes System mit dieser Zahl; NRC/NIJ-Reviews bewerten Voice-Stress-Analysen als kaum besser als Münzwurf — gemessen wird Stress, nicht Lügen; 97,3-%-Werte existieren nur aus Labordaten (Springer 2023, kontrolliertes Interviewmaterial). Die Kanada-Verbindung bleibt unbelegt (nächste dokumentierte Nähe: Ocular Motor Deception Test, Montreal, Augenbewegungen statt Stimme). (2) Die Rechtslage ist kontextabhängig: Polygraphen und ähnliche Werkzeuge bei Behörden (Strafverfolgung/Grenze) sind im EU AI Act **hochriskant, nicht verboten** (Annex III 6b/7a); **verboten** seit 02.02.2025 ist die Emotionserkennung am Arbeitsplatz und in Bildungseinrichtungen (Art. 5(1)(f)). Die pauschale Aussage „in Europa verboten" ist also im Detail falsch, in der Tendenz aber am Arbeitsplatz richtig. +**Einordnung:** Zahl ohne Protokoll + Behörden-Name-Drop + Verbots-Narrativ = ein Satz, der wie ein geprüftes Faktum klingt. Gleiche Fallstruktur wie die WaPo-Survey-Karte: Präzision ohne tragfähige Grundlage. Der Wert des Videos liegt in Rob Gallers Bildungs-These (didaktische Intelligenz, drei Epochen des Wissens) — davon unberührt. +**Dateien:** raw (NEW) `raw/youtube/2026-09-23_menschmaschine-ki-luegendetektor.md`; wiki (NEW) `wiki/concepts/ki-luegendetektor-evidenz-rechtslage.md`; `wiki/index.md` (243. Update-Zeile, Concepts-Row, Raw-Row); `wiki/log.md`. + ## 2026-09-23 — Nachtrag Teil 2: Data in use, Cache-Persistenz & Mitigationen **Type:** ingest-Erweiterung + wiki-update | **Scope:** raw/other, wiki/concepts/policy, wiki/people, wiki/index, wiki/log