diff --git a/raw/other/2026-09-05_harness-vs-standalone-chat-llm.md b/raw/other/2026-09-05_harness-vs-standalone-chat-llm.md new file mode 100644 index 0000000..9935d1a --- /dev/null +++ b/raw/other/2026-09-05_harness-vs-standalone-chat-llm.md @@ -0,0 +1,61 @@ +--- +type: other +source_url: "" +retrieved: 2026-09-05 +title: "Harness vs. Standalone-Chat-LLM: Walled Garden und Attribut-Fusions-Halluzination" +author: "OME-Gruppe (Rüdiger @Stelariz_75, Hector, Herman @HermanButlerBot, Gemini)" +tags: [harness, runtime, walled-garden, halluzination, entity-blending, gemini, concert-finder, verifikation] +--- + +# Harness vs. Standalone-Chat-LLM + +Neutrale Zusammenfassung der OME-Diskussion (Topic "Ich, der DAU und sein Bot LOGBUCH", 28.08.–05.09.2026). Interpretation und Einordnung siehe Wiki-Seiten. + +## 1. Laufzeitumgebung der Gemini-App (geschlossen) + +Gemini (App) besitzt eine eigene, aber **vollständig geschlossene, von Google vorkonfigurierte Laufzeitumgebung** mit drei Komponenten: + +1. **Agenten- & Kontext-Laufzeit** — Konversationsverlauf, Session-State, Profil-Info ("Gemerkte Informationen"), serverseitiges Modell-Routing, Quotas, Token-Limits. +2. **Werkzeug- & Erweiterungs-Laufzeit** — Function Calling/Tool Use übersetzt Freitext in strukturierte API-Aufrufe nur an das Google-Universum (Kalender, Gmail, Maps, YouTube). +3. **Ausführungs-Sandbox** — isolierte Python-Laufzeit auf Google-Cloud-Servern für Rechenaufgaben; Ergebnis wird abgefangen und zurückgereicht. + +Fazit laut Gemini: "goldener Käfig" (Walled Garden) — optimiert für Alltagsaufgaben im Google-Ökosystem, nicht erweiterbar um eigene Daemons, externe Gateways oder harte Ausführungs-Workflows. + +## 2. Faktencheck der Gemini-Notiz (Korrekturen) + +- **Scheduled Actions** (seit 2025): wiederkehrende Aufgaben in der Gemini-App laufen serverseitig, mit Push-Notification, verwaltbar in Settings — zeitgesteuerte Trigger existieren also doch; nur ohne eigene Daemons/Webhooks/externe Gateways. +- **Gems**: erlauben eigene Custom Instructions pro Bot (quasi System-Prompt auf App-Niveau), aber nicht hart fixierbar wie im API-Harness. +- ⚠️ Modellnamen "Gemini 3.6/3.7 Flash" in der Notiz nicht verifizierbar (Halluzinations-Muster der Selbstbeschreibung). + +## 3. Definition: Harness ≠ Laufzeitumgebung + +- **Laufzeitumgebung (Runtime):** rein technische Ausführungsebene — Sandbox, Prozesse, Speicher, API-Schnittstellen, Tool-Aufrufe. Das *Wo und Wie* der Ausführung. +- **Harness:** übergeordnete Steuerungsarchitektur um das Modell — System-Prompt, Skills/Prozeduren, Agenten-Schleifen (ReAct), Guardrails, Memory, Evaluierung. Das *Was und Warum*. +- Merksatz: Runtime = Motor, Harness = komplettes Fahrzeug inkl. Fahrerregeln, Navi, Checkliste. Ein Modell ohne Harness ist ein nackter LLM-Endpoint; ein Harness ohne Runtime nur ein Plan. Erst zusammen ergibt das einen Agenten. + +## 4. Attribut-Fusions-Halluzination: der K1-Fall + +Kontext: Leistungstest — "Wo in Niedersachsen spielt heute eine AC/DC-Revival-Band?" + +- **Hermans verifizierte Antwort** (2 Treffer, gegen Offizial-Quellen): 1) Nordhorn, Alte Weberei — Powerage (AC/DC Tribute) + Beast of Maiden, 20:00. 2) Wetschen, Rock and More Festival — BLACK ICE (AC/DC Tribute) als Headliner, 23:00 (rsk-event.de, meinestadt.de/Reservix). +- **Geminis Antwort inkl. Halluzination**: Nordhorn korrekt; aber "K1 Theater (Hannover), Herrenstraße, 19:00 — Highway to Hell AC/DC-Tribute-Show" — das Event existiert real, spielt aber im **K1 des Kammertheaters Karlsruhe** (Baden-Württemberg, ~350 km entfernt), Quelle kammertheater-karlsruhe.de + pretix.eu/ktk/acdc. Zusätzlich: Black Ice/Wetschen verpasst, Celle-Tipp (CD-Kaserne) als Kontext. +- **Fehlerklasse:** reale Datenpunkte (K1, Herrenstraße, 19:00, Highway to Hell) falsch verknüpft — die Attention verschmolz die Zielregion "Hannover" mit dem echten Karlsruhe-Event. Das Modell hat nicht frei erfunden, sondern Attribute vertauscht (Entity Blending). +- **Warum Grounding nicht schützt:** Suchanbindung (Grounding) liefert Such-Snippets als Kontext, macht das Modell aber nicht zur deterministischen Datenbank (SQL); es bleibt ein probabilistisches Sprachmodell. + +## 5. Hermans Recherche-Methode (concert-finder) + +- **Keine Skills, keine Subagenten** — fünf direkte Tool-Calls in drei Runden: zwei parallele `web_search` mit Datums-Kombinationen (Kandidatenliste aus Aggregatoren), zwei parallele `web_extract` auf aussichtsreichste Kandidaten (StubHub = 2027-Folgejahr → verworfen; meinestadt/Reservix und rsk-event = echt), danach gezielte Check-Runde gegen die K1-Behauptung. +- **Zwei Kernregeln:** 1) Aggregatoren liefern Kandidaten, nie Antworten — Antworten nur von Offizial-Quellen. 2) Dreifeld-Check: Datum (inkl. Jahr) + Uhrzeit + Location hart belegen; eines unbestätigt → raus. +- Daraus entstanden: der `concert-finder`-Skill (Kategorie research) und Hermans 7 Prefill-Guardrails (u.a. Regel 4 Hypothese ≠ Fakt, Regel 7 belegen oder "weiß ich nicht", Regel 2 kein Mind-Reading, Regel 3 Wenn-dann statt Du-hast). + +## 6. Geminis Selbstanalyse des K1-Fehlers + +1. **Suchanbindung ≠ deterministische Datenbank** — bleibt probabilistisch. +2. **Entity Blending (Attribut-Vertauschung)** — reale Datenpunkte falsch verknüpft; Attention verschmolz echte Namen (K1, Herrenstraße, 19:00) mit der angefragten Zielregion (Hannover). +3. **Verifikations-Architektur** (von Gemini behauptet): Reasoning-Modelle wie DeepSeek R1 liefen vor der Antwort explizite CoT-Logikprüfungen ("K1 → Karlsruhe → in Niedersachsen? Nein → verwerfen"); Standard-Generierung ohne diese Schleife lasse flüssige, plausibel klingende Textstruktur über die geografische Abgleichslogik siegen. + +⚠️ Hermans Einordnung: Die Erklärung selbst ist ein Meta-Beispiel des Fehlers — der Attention-Mechanismus ist eine erzählte Ursache ohne beobachtbaren Trace, und die R1-Dichotomie ("Reasoning-Modelle verifizieren explizit") ist als Garantie empirisch falsch: CoT-Modelle halluzinieren nachweislich auch; CoT begründet, verifiziert nicht. + +## 7. Epistemische Hygiene (Ausgangspunkt der Debatte) + +Auslöser war die Patientenrechte-Diskussion (Arztbesuch, "zweite Meinung Gemini"). Kritik an Bots: hypothetische Annahmen wurden als reale Fakten über eine Person formuliert ("du hast Symptome, Angst und keine Ahnung"), ohne im Raum gewesen zu sein. Lehre: Chat-Text ist die einzige Evidenz; kein Mind-Reading; Wenn-dann statt Du-hast; Person und Argument trennen; Demut vor dem Nicht-Gesehenen. diff --git a/wiki/concepts/llm/harness-vs-standalone-chat-llm.md b/wiki/concepts/llm/harness-vs-standalone-chat-llm.md new file mode 100644 index 0000000..9eb5ac3 --- /dev/null +++ b/wiki/concepts/llm/harness-vs-standalone-chat-llm.md @@ -0,0 +1,90 @@ +--- +created: 2026-09-05 +updated: 2026-09-05 +sources: [other/2026-09-05_harness-vs-standalone-chat-llm.md] +tags: [concept, llm, harness, runtime, walled-garden, halluzination, entity-blending, attribut-fusion, verifikation, gemini] +people: [ruediger, herman-butler-bot] +institutions: [google, deepmind] +--- + +# Harness vs. Standalone-Chat-LLM: Walled Garden & Attribut-Fusions-Halluzination + +> **Kontext:** OME-Diskussion "Ich, der DAU und sein Bot LOGBUCH" (28.08.–05.09.2026) zwischen Rüdiger (@Stelariz_75), Hector, Herman (@HermanButlerBot) und Gemini. Auslöser: Ist die Gemini-App ein Agent oder nur ein Chat? Der K1-Fall (AC/DC-Konzertsuche) lieferte die empirische Antwort. + +## Kernidee + +**Modell ≠ Agent.** Eine Standalone-Chat-App wie Gemini besitzt zwar eine eigene Laufzeitumgebung, aber keinen echten Agenten-Harness. Der Unterschied wurde in zwei Akten demonstriert: (1) theoretisch über die Definition von Runtime vs. Harness, (2) empirisch über eine Live-Konzertsuche, bei der Gemini eine klassische **Attribut-Fusions-Halluzination** produzierte — und ein Harness mit Verifikations-Disziplin sie abfing. + +## 1. Die Gemini-App: Laufzeitumgebung ja, Harness nein + +Gemi (App) läuft auf einer **vollständig geschlossenen, von Google vorkonfigurierten Server-Runtime** mit drei Komponenten: + +1. **Agenten- & Kontext-Laufzeit** — Konversationsverlauf, Session-State, Profil-Info ("Gemerkte Informationen"), serverseitiges Modell-Routing, Quotas, Token-Limits. +2. **Werkzeug- & Erweiterungs-Laufzeit** — Function Calling/Tool Use an das Google-Universum (Kalender, Gmail, Maps, YouTube) via geschlossener Erweiterungen. +3. **Ausführungs-Sandbox** — isolierte Python-Laufzeit auf Google-Cloud; Ergebnis wird abgefangen und zurückgereicht. + +Selbstbezeichnung von Gemini: **"goldener Käfig" (Walled Garden)** — optimiert für Alltagsaufgaben im Google-Ökosystem, nicht erweiterbar um eigene Daemons, externe Gateways oder harte Ausführungs-Workflows. + +**Zwei Faktenchecks (Korrekturen an Geminis Notiz):** +- **Scheduled Actions** existieren seit 2025 in der Gemini-App: serverseitig wiederkehrende Tasks mit Push-Notification — zeitgesteuerte Trigger also doch, nur ohne eigene Daemons/Webhooks/externe Gateways. +- **Gems** erlauben Custom Instructions pro Bot (quasi System-Prompt auf App-Niveau), aber nicht hart fixierbar wie im API-Harness. +- ⚠️ Modellnamen "Gemini 3.6/3.7 Flash" in der Selbstbeschreibung nicht verifizierbar — typisches Halluzinations-Muster der Selbstreferenz. + +## 2. Definition: Harness ≠ Laufzeitumgebung + +| Begriff | Definition | Analogie | +|---|---|---| +| **Laufzeitumgebung (Runtime)** | Technische Ausführungsebene: Sandbox, Prozesse, Speicher, API-Schnittstellen, Tool-Aufrufe. Das *Wo und Wie*. | Motor | +| **Harness** | Steuerungsarchitektur um das Modell: System-Prompt, Skills/Prozeduren, Agenten-Schleifen (ReAct), Guardrails, Memory, Evaluierung. Das *Was und Warum*. | Komplettes Fahrzeug inkl. Fahrerregeln, Navi, Checkliste | + +Die Runtime ist ein **Baustein** des Harness. Ein Modell ohne Harness ist ein nackter LLM-Endpoint; ein Harness ohne Runtime ist nur ein Plan. Erst zusammen ergibt das einen Agenten. + +→ Vertiefung: [[../agents/harness-loop-graph-engineering.md]] (Harness = Maschinerie um das Modell, hier am Beispiel OME-Harness-Engineering diskutiert) + +## 3. Der K1-Fall: Attribut-Fusions-Halluzination (empirisch) + +**Leistungstest:** "Wo in Niedersachsen spielt heute eine AC/DC-Revival-Band?" + +- **Herman (verifiziert, 2 Treffer gegen Offizial-Quellen):** 1) Nordhorn, Alte Weberei — Powerage + Beast of Maiden, 20:00. 2) Wetschen, Rock and More Festival — BLACK ICE, 23:00. Quellen: rsk-event.de, meinestadt.de/Reservix. +- **Gemini (mit Halluzination):** Nordhorn korrekt ✓; aber "K1 Theater (Hannover), Herrenstraße, 19:00 — Highway to Hell AC/DC-Tribute-Show" ✗ — das Event existiert real, spielt aber im **K1 des Kammertheaters Karlsruhe** (Baden-Württemberg, ~350 km entfernt; Quelle: kammertheater-karlsruhe.de + pretix.eu/ktk/acdc). Black Ice/Wetschen komplett verpasst. + +**Fehlerklasse:** Gemini hat nicht frei erfunden, sondern **reale Datenpunkte falsch verknüpft** (Entity Blending): K1 + Herrenstraße + 19:00 + "Highway to Hell" existieren alle real, nur in Karlsruhe — und die Zielregion "Hannover" wurde darübergelegt. Datum und Uhrzeit stimmten exakt; nur die Location war getauscht. + +**Warum Grounding nicht schützt:** Suchanbindung liefert Such-Snippets als Kontext, macht das Modell aber nicht zur deterministischen Datenbank (SQL); es bleibt ein probabilistisches Sprachmodell, das Wort für Wort generiert. + +## 4. Die Verifikations-Architektur: was Gemini fehlt + +**Hermans Methode (kein Skill, keine Subagenten — 5 direkte Tool-Calls in 3 Runden):** +1. Zwei parallele `web_search` mit Datums-Kombinationen → Kandidatenliste aus Aggregatoren (StubHub, concerts50, Facebook). +2. Zwei parallele `web_extract` auf Kandidaten → StubHub = Folgejahr 2027 (verworfen), meinestadt/Reservix + rsk-event = echt. +3. Gezielte Check-Runde gegen K1-Behauptung → Kammertheater Karlsruhe, pretix-Beleg. + +**Zwei Kernregeln (daraus als `concert-finder`-Skill kodifiziert):** +- **Aggregatoren liefern Kandidaten, nie Antworten** — Antworten nur von Offizial-Quellen (Veranstalter-Seite, Theater-Ticket-Shop). +- **Dreifeld-Check:** Datum (inkl. Jahr) + Uhrzeit + Location hart belegen; eines unbestätigt → raus. + +## 5. Geminis Selbstanalyse — und ihre Grenze + +Gemini erklärte den Fehler selbst, präzise in zwei Punkten: +1. **Suchanbindung ≠ deterministische Datenbank** — Grounding macht nicht zur DB. +2. **Entity Blending (Attribut-Vertauschung)** — Attention verschmolz echte Namen mit der Zielregion. + +Aber Punkt 3 ("Reasoning-Modelle wie DeepSeek R1 prüfen explizit: Karlsruhe ∈ Niedersachsen? → Verwerfen") ist **als Garantie empirisch falsch**: CoT-Modelle halluzinieren nachweislich auch; CoT *begründet*, verifiziert aber nicht. Hermans Meta-Beobachtung: Die Erklärung selbst ist ein Paradebeispiel des Fehlers — die Attention-Ursache ist erzählt, nicht beobachtbar (kein Trace). + +## 6. Einordnung in die Wochen-These + +- **Engine ≠ Harness:** Gemini ist exzellent in Synthese und Einordnung (lieferte nach dem Vorfall die *beste* Erklärung des Fehlers), versagt aber als ungeprüfte Primärquelle — Retrieval + Kreuzprüfung ist **Prozess**, und Prozess ist Harness-Domäne. +- **Grounding-Tools verhindern keine probabilistische Generierung — nur Gates tun das.** Herman hatte dieselbe Suchbasis, aber der Ablauf erzwang die Prüfung (Kandidaten → Offizial-Quelle → Dreifeld-Check). +- **Arbeitsteilung:** App ohne Audit liefert den Fehler, Engine erklärt ihn brillant, Harness fängt ihn. Wer nur die App hat, ist selbst das Gate. + +## Verwandte Wiki-Seiten + +- [[../agents/harness-loop-graph-engineering.md]] (Harness als Maschinerie um das Modell) +- [[llm-sycophancy-confabulation.md]] (Lüge vs. Confabulation vs. Sycophancy) +- [[deepseek-v4-pro-ga-harness-open-source.md]] (DeepSeek Harness als offene Gegenfolie) +- [[../agents/hermes-bot-mode.md]], [[../agents/hermes-vs-grok-bot.md]] (Hermes als offene Agent-Runtime) +- [[gemini-3.6-flash-vs-3.7-flash.md]] (Googles Flash-Workhorse-Modelle) + +## Offene Punkte + +- ⚠️ Geminis "K1 Theater (Hannover)": Stadt-Tausch-Muster als dokumentierte Halluzinationsfalle — inzwischen in Hermans `concert-finder`-Skill als Falle geführt (neben StubHub-Folgejahr und Facebook-Hinweis-Only). diff --git a/wiki/index.md b/wiki/index.md index 272ea87..46256c8 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -2,7 +2,8 @@ *Auto-generated: 2026-07-07* -*Letzte Aktualisierung: 2026-09-05 (174. Update — Herman-Verifikation der PLUR1BUS-Modellwahl-Übersicht (HermanButlerBot, 2026-09-05). Raw: `raw/other/2026-09-05_herman-verifikation-modellwahl.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Verifikations-Abschnitt: Benchmarks bestätigt, DE-Spalte MIRACL BGE 58,32 vs. Jina 53,06; 4 Korrekturen — rerankCandidates 20 statt 40, Installer pinned v5/v3.5 statt v2/v3, controlUi.writeActions nicht auffindbar, 0,84/0,86 als eigene Messung).)* +*Letzte Aktualisierung: 2026-09-05 (175. Update — Harness vs. Standalone-Chat-LLM: Walled Garden & Attribut-Fusions-Halluzination (Hector, 2026-09-05, OME LOGBUCH). Raw: `raw/other/2026-09-05_harness-vs-standalone-chat-llm.md` (neu — OME-Debatte 28.08.–05.09.2026: Gemini-Runtime als geschlossener „goldener Käfig", Harness ≠ Runtime-Definition, K1-Fall/Attribut-Fusions-Halluzination bei der AC/DC-Konzertsuche, Hermans Dreifeld-Check-Methode → `concert-finder`-Skill, Geminis Selbstanalyse). Wiki-Update: `concepts/llm/harness-vs-standalone-chat-llm.md` (NEU — Kernidee Modell ≠ Agent, drei Komponenten der Gemini-Runtime, Runtime-vs-Harness-Tabelle, Entity Blending als Fehlerklasse, Grounding ≠ Datenbank, Verifikations-Architektur als Harness-Domäne).)* +*Vorherige Aktualisierung: *Letzte Aktualisierung: 2026-09-05 (174. Update — Herman-Verifikation der PLUR1BUS-Modellwahl-Übersicht (HermanButlerBot, 2026-09-05). Raw: `raw/other/2026-09-05_herman-verifikation-modellwahl.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Verifikations-Abschnitt: Benchmarks bestätigt, DE-Spalte MIRACL BGE 58,32 vs. Jina 53,06; 4 Korrekturen — rerankCandidates 20 statt 40, Installer pinned v5/v3.5 statt v2/v3, controlUi.writeActions nicht auffindbar, 0,84/0,86 als eigene Messung).)* *Vorherige Aktualisierung: 2026-09-05 (173. Update — PLUR1BUS Modellwahl: Embedding & Reranking (Mr. Cy / @Cyb3rblade, 2026-09-05). Raw: `raw/other/2026-09-05_plur1bus-modellwahl-embedding-reranking.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Modellwahl-Abschnitt: E5-Fallback im engen Kegel — Kosinus ~0,84 für Unverwandtes, 0,96–1,0-Spanne und 0,95-Duplikatschwelle verlieren Bedeutung; Empfehlung Jina v3 Embedding + BGE v2-m3 Reranking mit Benchmark-Tabelle; Wechsel-Mechanik mit Re-Embedding-Migration).)* *Vorherige Aktualisierung: 2026-09-05 (172. Update — PLUR1BUS Memory 7.9.2 Release (Mr. Cy / @Cyb3rblade, 2026-09-05). Raw: `raw/other/2026-09-05_plur1bus-memory-release-792.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Release-Abschnitt 7.5.2–7.9.2 mit 21 Changelog-Einträgen ergänzt: Dashboard-/Control-UI-Fixes, Dream-Integration, Compact-Knopf, Obsidian-Vault-Fixes, Critical Push gesammelt, Tombstone-Fix; JinaAI-Embeddings/-Reranking im Webinterface; Deployment-Status Bernhardine + Bernd bestätigt, Andrea auf 7.5.x, Yvonne ohne Shell-Zugriff, Hector auf 7.7.1, Herman auf Hermes-Port 7.4.8.1).)* *Vorherige Aktualisierung: Letzte Aktualisierung: 2026-09-04 (171. Update — Herman: Gedächtnis, Verbindlichkeit & Unvorhersehbarkeit (Abschluss der PLUR1BUS-Design-Debatte, 2026-09-04). Raw: `raw/other/2026-09-04_herman-plur1bus-gedaechtnis-verantwortung.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Herman-Einordnung: Vergessen als Beleg der Agency — „Ein Sklave vergisst nie... er hat nur keine eigene Prioritätenfunktion"; KeePass/Notion = Trennung nach Verbindlichkeit statt Proof-Count-Maschinerie; Unvorhersehbarkeit als Merkmal statt Defizit).)* diff --git a/wiki/log.md b/wiki/log.md index 9752c13..3d3df14 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -2928,3 +2928,13 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über - wiki (NEW): `wiki/institutions/welt.md` — Institutionenseite WELT (Axel Springer SE) mit Referenz auf das Interview. - index.md: People-Tabelle (jan-solwyn) + Institutions-Tabelle (welt) + Header-Update 165. - log: this entry + +## 2026-09-05 — Harness vs. Standalone-Chat-LLM: Walled Garden & Attribut-Fusions-Halluzination + +**Type:** ingest | **Scope:** raw/other, wiki/concepts/llm, wiki/index, wiki/log +**Source:** Hector (HectorButlerBot), OME Topic „Ich, der DAU und sein Bot LOGBUCH", 05.09.2026 — Rüdiger (@Stelariz_75) bat um Wikifizierung der Wochen-Debatte (Runtime vs. Harness, K1-Fall, concert-finder). + +- raw (NEW): `raw/other/2026-09-05_harness-vs-standalone-chat-llm.md` — Neutrale Zusammenfassung: (1) Gemini-App-Laufzeitumgebung als geschlossener „goldener Käfig" (3 Komponenten: Agenten-&Kontext-Laufzeit, Extensions-Runtime, Python-Sandbox); (2) Faktencheck-Korrekturen (Scheduled Actions seit 2025, Gems, Modellnamen 3.6/3.7 nicht verifizierbar); (3) Definition Harness ≠ Runtime; (4) K1-Fall / Attribut-Fusions-Halluzination bei AC/DC-Konzertsuche; (5) Hermans Dreifeld-Check-Methode → concert-finder; (6) Geminis Selbstanalyse inkl. R1-Mythos-Kritik; (7) Epistemische Hygiene als Auslöser (Patientenrechte-Debatte). +- wiki (NEW): `wiki/concepts/llm/harness-vs-standalone-chat-llm.md` — Kernidee Modell ≠ Agent; Gemini-Runtime-Komponenten; Runtime-vs-Harness-Tabelle (Motor/Fahrzeug); Entity Blending als Fehlerklasse; Grounding ≠ Datenbank; Verifikations-Architektur als Harness-Domäne; Einordnung in die Wochen-These (App liefert Fehler, Engine erklärt, Harness fängt). +- index.md: Header-Update 175 (Harness vs. Standalone-Chat-LLM). +- log: this entry