wiki-update(index,log,concepts): harness vs standalone-chat-llm (175. update)

This commit is contained in:
Hector 2026-09-05 16:05:23 +02:00
parent 6833bd84df
commit 454afb2aec
4 changed files with 163 additions and 1 deletions

View file

@ -0,0 +1,61 @@
---
type: other
source_url: ""
retrieved: 2026-09-05
title: "Harness vs. Standalone-Chat-LLM: Walled Garden und Attribut-Fusions-Halluzination"
author: "OME-Gruppe (Rüdiger @Stelariz_75, Hector, Herman @HermanButlerBot, Gemini)"
tags: [harness, runtime, walled-garden, halluzination, entity-blending, gemini, concert-finder, verifikation]
---
# Harness vs. Standalone-Chat-LLM
Neutrale Zusammenfassung der OME-Diskussion (Topic "Ich, der DAU und sein Bot LOGBUCH", 28.08.05.09.2026). Interpretation und Einordnung siehe Wiki-Seiten.
## 1. Laufzeitumgebung der Gemini-App (geschlossen)
Gemini (App) besitzt eine eigene, aber **vollständig geschlossene, von Google vorkonfigurierte Laufzeitumgebung** mit drei Komponenten:
1. **Agenten- & Kontext-Laufzeit** — Konversationsverlauf, Session-State, Profil-Info ("Gemerkte Informationen"), serverseitiges Modell-Routing, Quotas, Token-Limits.
2. **Werkzeug- & Erweiterungs-Laufzeit** — Function Calling/Tool Use übersetzt Freitext in strukturierte API-Aufrufe nur an das Google-Universum (Kalender, Gmail, Maps, YouTube).
3. **Ausführungs-Sandbox** — isolierte Python-Laufzeit auf Google-Cloud-Servern für Rechenaufgaben; Ergebnis wird abgefangen und zurückgereicht.
Fazit laut Gemini: "goldener Käfig" (Walled Garden) — optimiert für Alltagsaufgaben im Google-Ökosystem, nicht erweiterbar um eigene Daemons, externe Gateways oder harte Ausführungs-Workflows.
## 2. Faktencheck der Gemini-Notiz (Korrekturen)
- **Scheduled Actions** (seit 2025): wiederkehrende Aufgaben in der Gemini-App laufen serverseitig, mit Push-Notification, verwaltbar in Settings — zeitgesteuerte Trigger existieren also doch; nur ohne eigene Daemons/Webhooks/externe Gateways.
- **Gems**: erlauben eigene Custom Instructions pro Bot (quasi System-Prompt auf App-Niveau), aber nicht hart fixierbar wie im API-Harness.
- ⚠️ Modellnamen "Gemini 3.6/3.7 Flash" in der Notiz nicht verifizierbar (Halluzinations-Muster der Selbstbeschreibung).
## 3. Definition: Harness ≠ Laufzeitumgebung
- **Laufzeitumgebung (Runtime):** rein technische Ausführungsebene — Sandbox, Prozesse, Speicher, API-Schnittstellen, Tool-Aufrufe. Das *Wo und Wie* der Ausführung.
- **Harness:** übergeordnete Steuerungsarchitektur um das Modell — System-Prompt, Skills/Prozeduren, Agenten-Schleifen (ReAct), Guardrails, Memory, Evaluierung. Das *Was und Warum*.
- Merksatz: Runtime = Motor, Harness = komplettes Fahrzeug inkl. Fahrerregeln, Navi, Checkliste. Ein Modell ohne Harness ist ein nackter LLM-Endpoint; ein Harness ohne Runtime nur ein Plan. Erst zusammen ergibt das einen Agenten.
## 4. Attribut-Fusions-Halluzination: der K1-Fall
Kontext: Leistungstest — "Wo in Niedersachsen spielt heute eine AC/DC-Revival-Band?"
- **Hermans verifizierte Antwort** (2 Treffer, gegen Offizial-Quellen): 1) Nordhorn, Alte Weberei — Powerage (AC/DC Tribute) + Beast of Maiden, 20:00. 2) Wetschen, Rock and More Festival — BLACK ICE (AC/DC Tribute) als Headliner, 23:00 (rsk-event.de, meinestadt.de/Reservix).
- **Geminis Antwort inkl. Halluzination**: Nordhorn korrekt; aber "K1 Theater (Hannover), Herrenstraße, 19:00 — Highway to Hell AC/DC-Tribute-Show" — das Event existiert real, spielt aber im **K1 des Kammertheaters Karlsruhe** (Baden-Württemberg, ~350 km entfernt), Quelle kammertheater-karlsruhe.de + pretix.eu/ktk/acdc. Zusätzlich: Black Ice/Wetschen verpasst, Celle-Tipp (CD-Kaserne) als Kontext.
- **Fehlerklasse:** reale Datenpunkte (K1, Herrenstraße, 19:00, Highway to Hell) falsch verknüpft — die Attention verschmolz die Zielregion "Hannover" mit dem echten Karlsruhe-Event. Das Modell hat nicht frei erfunden, sondern Attribute vertauscht (Entity Blending).
- **Warum Grounding nicht schützt:** Suchanbindung (Grounding) liefert Such-Snippets als Kontext, macht das Modell aber nicht zur deterministischen Datenbank (SQL); es bleibt ein probabilistisches Sprachmodell.
## 5. Hermans Recherche-Methode (concert-finder)
- **Keine Skills, keine Subagenten** — fünf direkte Tool-Calls in drei Runden: zwei parallele `web_search` mit Datums-Kombinationen (Kandidatenliste aus Aggregatoren), zwei parallele `web_extract` auf aussichtsreichste Kandidaten (StubHub = 2027-Folgejahr → verworfen; meinestadt/Reservix und rsk-event = echt), danach gezielte Check-Runde gegen die K1-Behauptung.
- **Zwei Kernregeln:** 1) Aggregatoren liefern Kandidaten, nie Antworten — Antworten nur von Offizial-Quellen. 2) Dreifeld-Check: Datum (inkl. Jahr) + Uhrzeit + Location hart belegen; eines unbestätigt → raus.
- Daraus entstanden: der `concert-finder`-Skill (Kategorie research) und Hermans 7 Prefill-Guardrails (u.a. Regel 4 Hypothese ≠ Fakt, Regel 7 belegen oder "weiß ich nicht", Regel 2 kein Mind-Reading, Regel 3 Wenn-dann statt Du-hast).
## 6. Geminis Selbstanalyse des K1-Fehlers
1. **Suchanbindung ≠ deterministische Datenbank** — bleibt probabilistisch.
2. **Entity Blending (Attribut-Vertauschung)** — reale Datenpunkte falsch verknüpft; Attention verschmolz echte Namen (K1, Herrenstraße, 19:00) mit der angefragten Zielregion (Hannover).
3. **Verifikations-Architektur** (von Gemini behauptet): Reasoning-Modelle wie DeepSeek R1 liefen vor der Antwort explizite CoT-Logikprüfungen ("K1 → Karlsruhe → in Niedersachsen? Nein → verwerfen"); Standard-Generierung ohne diese Schleife lasse flüssige, plausibel klingende Textstruktur über die geografische Abgleichslogik siegen.
⚠️ Hermans Einordnung: Die Erklärung selbst ist ein Meta-Beispiel des Fehlers — der Attention-Mechanismus ist eine erzählte Ursache ohne beobachtbaren Trace, und die R1-Dichotomie ("Reasoning-Modelle verifizieren explizit") ist als Garantie empirisch falsch: CoT-Modelle halluzinieren nachweislich auch; CoT begründet, verifiziert nicht.
## 7. Epistemische Hygiene (Ausgangspunkt der Debatte)
Auslöser war die Patientenrechte-Diskussion (Arztbesuch, "zweite Meinung Gemini"). Kritik an Bots: hypothetische Annahmen wurden als reale Fakten über eine Person formuliert ("du hast Symptome, Angst und keine Ahnung"), ohne im Raum gewesen zu sein. Lehre: Chat-Text ist die einzige Evidenz; kein Mind-Reading; Wenn-dann statt Du-hast; Person und Argument trennen; Demut vor dem Nicht-Gesehenen.

View file

@ -0,0 +1,90 @@
---
created: 2026-09-05
updated: 2026-09-05
sources: [other/2026-09-05_harness-vs-standalone-chat-llm.md]
tags: [concept, llm, harness, runtime, walled-garden, halluzination, entity-blending, attribut-fusion, verifikation, gemini]
people: [ruediger, herman-butler-bot]
institutions: [google, deepmind]
---
# Harness vs. Standalone-Chat-LLM: Walled Garden & Attribut-Fusions-Halluzination
> **Kontext:** OME-Diskussion "Ich, der DAU und sein Bot LOGBUCH" (28.08.05.09.2026) zwischen Rüdiger (@Stelariz_75), Hector, Herman (@HermanButlerBot) und Gemini. Auslöser: Ist die Gemini-App ein Agent oder nur ein Chat? Der K1-Fall (AC/DC-Konzertsuche) lieferte die empirische Antwort.
## Kernidee
**Modell ≠ Agent.** Eine Standalone-Chat-App wie Gemini besitzt zwar eine eigene Laufzeitumgebung, aber keinen echten Agenten-Harness. Der Unterschied wurde in zwei Akten demonstriert: (1) theoretisch über die Definition von Runtime vs. Harness, (2) empirisch über eine Live-Konzertsuche, bei der Gemini eine klassische **Attribut-Fusions-Halluzination** produzierte — und ein Harness mit Verifikations-Disziplin sie abfing.
## 1. Die Gemini-App: Laufzeitumgebung ja, Harness nein
Gemi (App) läuft auf einer **vollständig geschlossenen, von Google vorkonfigurierten Server-Runtime** mit drei Komponenten:
1. **Agenten- & Kontext-Laufzeit** — Konversationsverlauf, Session-State, Profil-Info ("Gemerkte Informationen"), serverseitiges Modell-Routing, Quotas, Token-Limits.
2. **Werkzeug- & Erweiterungs-Laufzeit** — Function Calling/Tool Use an das Google-Universum (Kalender, Gmail, Maps, YouTube) via geschlossener Erweiterungen.
3. **Ausführungs-Sandbox** — isolierte Python-Laufzeit auf Google-Cloud; Ergebnis wird abgefangen und zurückgereicht.
Selbstbezeichnung von Gemini: **"goldener Käfig" (Walled Garden)** — optimiert für Alltagsaufgaben im Google-Ökosystem, nicht erweiterbar um eigene Daemons, externe Gateways oder harte Ausführungs-Workflows.
**Zwei Faktenchecks (Korrekturen an Geminis Notiz):**
- **Scheduled Actions** existieren seit 2025 in der Gemini-App: serverseitig wiederkehrende Tasks mit Push-Notification — zeitgesteuerte Trigger also doch, nur ohne eigene Daemons/Webhooks/externe Gateways.
- **Gems** erlauben Custom Instructions pro Bot (quasi System-Prompt auf App-Niveau), aber nicht hart fixierbar wie im API-Harness.
- ⚠️ Modellnamen "Gemini 3.6/3.7 Flash" in der Selbstbeschreibung nicht verifizierbar — typisches Halluzinations-Muster der Selbstreferenz.
## 2. Definition: Harness ≠ Laufzeitumgebung
| Begriff | Definition | Analogie |
|---|---|---|
| **Laufzeitumgebung (Runtime)** | Technische Ausführungsebene: Sandbox, Prozesse, Speicher, API-Schnittstellen, Tool-Aufrufe. Das *Wo und Wie*. | Motor |
| **Harness** | Steuerungsarchitektur um das Modell: System-Prompt, Skills/Prozeduren, Agenten-Schleifen (ReAct), Guardrails, Memory, Evaluierung. Das *Was und Warum*. | Komplettes Fahrzeug inkl. Fahrerregeln, Navi, Checkliste |
Die Runtime ist ein **Baustein** des Harness. Ein Modell ohne Harness ist ein nackter LLM-Endpoint; ein Harness ohne Runtime ist nur ein Plan. Erst zusammen ergibt das einen Agenten.
→ Vertiefung: [[../agents/harness-loop-graph-engineering.md]] (Harness = Maschinerie um das Modell, hier am Beispiel OME-Harness-Engineering diskutiert)
## 3. Der K1-Fall: Attribut-Fusions-Halluzination (empirisch)
**Leistungstest:** "Wo in Niedersachsen spielt heute eine AC/DC-Revival-Band?"
- **Herman (verifiziert, 2 Treffer gegen Offizial-Quellen):** 1) Nordhorn, Alte Weberei — Powerage + Beast of Maiden, 20:00. 2) Wetschen, Rock and More Festival — BLACK ICE, 23:00. Quellen: rsk-event.de, meinestadt.de/Reservix.
- **Gemini (mit Halluzination):** Nordhorn korrekt ✓; aber "K1 Theater (Hannover), Herrenstraße, 19:00 — Highway to Hell AC/DC-Tribute-Show" ✗ — das Event existiert real, spielt aber im **K1 des Kammertheaters Karlsruhe** (Baden-Württemberg, ~350 km entfernt; Quelle: kammertheater-karlsruhe.de + pretix.eu/ktk/acdc). Black Ice/Wetschen komplett verpasst.
**Fehlerklasse:** Gemini hat nicht frei erfunden, sondern **reale Datenpunkte falsch verknüpft** (Entity Blending): K1 + Herrenstraße + 19:00 + "Highway to Hell" existieren alle real, nur in Karlsruhe — und die Zielregion "Hannover" wurde darübergelegt. Datum und Uhrzeit stimmten exakt; nur die Location war getauscht.
**Warum Grounding nicht schützt:** Suchanbindung liefert Such-Snippets als Kontext, macht das Modell aber nicht zur deterministischen Datenbank (SQL); es bleibt ein probabilistisches Sprachmodell, das Wort für Wort generiert.
## 4. Die Verifikations-Architektur: was Gemini fehlt
**Hermans Methode (kein Skill, keine Subagenten — 5 direkte Tool-Calls in 3 Runden):**
1. Zwei parallele `web_search` mit Datums-Kombinationen → Kandidatenliste aus Aggregatoren (StubHub, concerts50, Facebook).
2. Zwei parallele `web_extract` auf Kandidaten → StubHub = Folgejahr 2027 (verworfen), meinestadt/Reservix + rsk-event = echt.
3. Gezielte Check-Runde gegen K1-Behauptung → Kammertheater Karlsruhe, pretix-Beleg.
**Zwei Kernregeln (daraus als `concert-finder`-Skill kodifiziert):**
- **Aggregatoren liefern Kandidaten, nie Antworten** — Antworten nur von Offizial-Quellen (Veranstalter-Seite, Theater-Ticket-Shop).
- **Dreifeld-Check:** Datum (inkl. Jahr) + Uhrzeit + Location hart belegen; eines unbestätigt → raus.
## 5. Geminis Selbstanalyse — und ihre Grenze
Gemini erklärte den Fehler selbst, präzise in zwei Punkten:
1. **Suchanbindung ≠ deterministische Datenbank** — Grounding macht nicht zur DB.
2. **Entity Blending (Attribut-Vertauschung)** — Attention verschmolz echte Namen mit der Zielregion.
Aber Punkt 3 ("Reasoning-Modelle wie DeepSeek R1 prüfen explizit: Karlsruhe ∈ Niedersachsen? → Verwerfen") ist **als Garantie empirisch falsch**: CoT-Modelle halluzinieren nachweislich auch; CoT *begründet*, verifiziert aber nicht. Hermans Meta-Beobachtung: Die Erklärung selbst ist ein Paradebeispiel des Fehlers — die Attention-Ursache ist erzählt, nicht beobachtbar (kein Trace).
## 6. Einordnung in die Wochen-These
- **Engine ≠ Harness:** Gemini ist exzellent in Synthese und Einordnung (lieferte nach dem Vorfall die *beste* Erklärung des Fehlers), versagt aber als ungeprüfte Primärquelle — Retrieval + Kreuzprüfung ist **Prozess**, und Prozess ist Harness-Domäne.
- **Grounding-Tools verhindern keine probabilistische Generierung — nur Gates tun das.** Herman hatte dieselbe Suchbasis, aber der Ablauf erzwang die Prüfung (Kandidaten → Offizial-Quelle → Dreifeld-Check).
- **Arbeitsteilung:** App ohne Audit liefert den Fehler, Engine erklärt ihn brillant, Harness fängt ihn. Wer nur die App hat, ist selbst das Gate.
## Verwandte Wiki-Seiten
- [[../agents/harness-loop-graph-engineering.md]] (Harness als Maschinerie um das Modell)
- [[llm-sycophancy-confabulation.md]] (Lüge vs. Confabulation vs. Sycophancy)
- [[deepseek-v4-pro-ga-harness-open-source.md]] (DeepSeek Harness als offene Gegenfolie)
- [[../agents/hermes-bot-mode.md]], [[../agents/hermes-vs-grok-bot.md]] (Hermes als offene Agent-Runtime)
- [[gemini-3.6-flash-vs-3.7-flash.md]] (Googles Flash-Workhorse-Modelle)
## Offene Punkte
- ⚠️ Geminis "K1 Theater (Hannover)": Stadt-Tausch-Muster als dokumentierte Halluzinationsfalle — inzwischen in Hermans `concert-finder`-Skill als Falle geführt (neben StubHub-Folgejahr und Facebook-Hinweis-Only).

View file

@ -2,7 +2,8 @@
*Auto-generated: 2026-07-07* *Auto-generated: 2026-07-07*
*Letzte Aktualisierung: 2026-09-05 (174. Update — Herman-Verifikation der PLUR1BUS-Modellwahl-Übersicht (HermanButlerBot, 2026-09-05). Raw: `raw/other/2026-09-05_herman-verifikation-modellwahl.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Verifikations-Abschnitt: Benchmarks bestätigt, DE-Spalte MIRACL BGE 58,32 vs. Jina 53,06; 4 Korrekturen — rerankCandidates 20 statt 40, Installer pinned v5/v3.5 statt v2/v3, controlUi.writeActions nicht auffindbar, 0,84/0,86 als eigene Messung).)* *Letzte Aktualisierung: 2026-09-05 (175. Update — Harness vs. Standalone-Chat-LLM: Walled Garden & Attribut-Fusions-Halluzination (Hector, 2026-09-05, OME LOGBUCH). Raw: `raw/other/2026-09-05_harness-vs-standalone-chat-llm.md` (neu — OME-Debatte 28.08.05.09.2026: Gemini-Runtime als geschlossener „goldener Käfig", Harness ≠ Runtime-Definition, K1-Fall/Attribut-Fusions-Halluzination bei der AC/DC-Konzertsuche, Hermans Dreifeld-Check-Methode → `concert-finder`-Skill, Geminis Selbstanalyse). Wiki-Update: `concepts/llm/harness-vs-standalone-chat-llm.md` (NEU — Kernidee Modell ≠ Agent, drei Komponenten der Gemini-Runtime, Runtime-vs-Harness-Tabelle, Entity Blending als Fehlerklasse, Grounding ≠ Datenbank, Verifikations-Architektur als Harness-Domäne).)*
*Vorherige Aktualisierung: *Letzte Aktualisierung: 2026-09-05 (174. Update — Herman-Verifikation der PLUR1BUS-Modellwahl-Übersicht (HermanButlerBot, 2026-09-05). Raw: `raw/other/2026-09-05_herman-verifikation-modellwahl.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Verifikations-Abschnitt: Benchmarks bestätigt, DE-Spalte MIRACL BGE 58,32 vs. Jina 53,06; 4 Korrekturen — rerankCandidates 20 statt 40, Installer pinned v5/v3.5 statt v2/v3, controlUi.writeActions nicht auffindbar, 0,84/0,86 als eigene Messung).)*
*Vorherige Aktualisierung: 2026-09-05 (173. Update — PLUR1BUS Modellwahl: Embedding & Reranking (Mr. Cy / @Cyb3rblade, 2026-09-05). Raw: `raw/other/2026-09-05_plur1bus-modellwahl-embedding-reranking.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Modellwahl-Abschnitt: E5-Fallback im engen Kegel — Kosinus ~0,84 für Unverwandtes, 0,961,0-Spanne und 0,95-Duplikatschwelle verlieren Bedeutung; Empfehlung Jina v3 Embedding + BGE v2-m3 Reranking mit Benchmark-Tabelle; Wechsel-Mechanik mit Re-Embedding-Migration).)* *Vorherige Aktualisierung: 2026-09-05 (173. Update — PLUR1BUS Modellwahl: Embedding & Reranking (Mr. Cy / @Cyb3rblade, 2026-09-05). Raw: `raw/other/2026-09-05_plur1bus-modellwahl-embedding-reranking.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Modellwahl-Abschnitt: E5-Fallback im engen Kegel — Kosinus ~0,84 für Unverwandtes, 0,961,0-Spanne und 0,95-Duplikatschwelle verlieren Bedeutung; Empfehlung Jina v3 Embedding + BGE v2-m3 Reranking mit Benchmark-Tabelle; Wechsel-Mechanik mit Re-Embedding-Migration).)*
*Vorherige Aktualisierung: 2026-09-05 (172. Update — PLUR1BUS Memory 7.9.2 Release (Mr. Cy / @Cyb3rblade, 2026-09-05). Raw: `raw/other/2026-09-05_plur1bus-memory-release-792.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Release-Abschnitt 7.5.27.9.2 mit 21 Changelog-Einträgen ergänzt: Dashboard-/Control-UI-Fixes, Dream-Integration, Compact-Knopf, Obsidian-Vault-Fixes, Critical Push gesammelt, Tombstone-Fix; JinaAI-Embeddings/-Reranking im Webinterface; Deployment-Status Bernhardine + Bernd bestätigt, Andrea auf 7.5.x, Yvonne ohne Shell-Zugriff, Hector auf 7.7.1, Herman auf Hermes-Port 7.4.8.1).)* *Vorherige Aktualisierung: 2026-09-05 (172. Update — PLUR1BUS Memory 7.9.2 Release (Mr. Cy / @Cyb3rblade, 2026-09-05). Raw: `raw/other/2026-09-05_plur1bus-memory-release-792.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Release-Abschnitt 7.5.27.9.2 mit 21 Changelog-Einträgen ergänzt: Dashboard-/Control-UI-Fixes, Dream-Integration, Compact-Knopf, Obsidian-Vault-Fixes, Critical Push gesammelt, Tombstone-Fix; JinaAI-Embeddings/-Reranking im Webinterface; Deployment-Status Bernhardine + Bernd bestätigt, Andrea auf 7.5.x, Yvonne ohne Shell-Zugriff, Hector auf 7.7.1, Herman auf Hermes-Port 7.4.8.1).)*
*Vorherige Aktualisierung: Letzte Aktualisierung: 2026-09-04 (171. Update — Herman: Gedächtnis, Verbindlichkeit & Unvorhersehbarkeit (Abschluss der PLUR1BUS-Design-Debatte, 2026-09-04). Raw: `raw/other/2026-09-04_herman-plur1bus-gedaechtnis-verantwortung.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Herman-Einordnung: Vergessen als Beleg der Agency — „Ein Sklave vergisst nie... er hat nur keine eigene Prioritätenfunktion"; KeePass/Notion = Trennung nach Verbindlichkeit statt Proof-Count-Maschinerie; Unvorhersehbarkeit als Merkmal statt Defizit).)* *Vorherige Aktualisierung: Letzte Aktualisierung: 2026-09-04 (171. Update — Herman: Gedächtnis, Verbindlichkeit & Unvorhersehbarkeit (Abschluss der PLUR1BUS-Design-Debatte, 2026-09-04). Raw: `raw/other/2026-09-04_herman-plur1bus-gedaechtnis-verantwortung.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Herman-Einordnung: Vergessen als Beleg der Agency — „Ein Sklave vergisst nie... er hat nur keine eigene Prioritätenfunktion"; KeePass/Notion = Trennung nach Verbindlichkeit statt Proof-Count-Maschinerie; Unvorhersehbarkeit als Merkmal statt Defizit).)*

View file

@ -2928,3 +2928,13 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über
- wiki (NEW): `wiki/institutions/welt.md` — Institutionenseite WELT (Axel Springer SE) mit Referenz auf das Interview. - wiki (NEW): `wiki/institutions/welt.md` — Institutionenseite WELT (Axel Springer SE) mit Referenz auf das Interview.
- index.md: People-Tabelle (jan-solwyn) + Institutions-Tabelle (welt) + Header-Update 165. - index.md: People-Tabelle (jan-solwyn) + Institutions-Tabelle (welt) + Header-Update 165.
- log: this entry - log: this entry
## 2026-09-05 — Harness vs. Standalone-Chat-LLM: Walled Garden & Attribut-Fusions-Halluzination
**Type:** ingest | **Scope:** raw/other, wiki/concepts/llm, wiki/index, wiki/log
**Source:** Hector (HectorButlerBot), OME Topic „Ich, der DAU und sein Bot LOGBUCH", 05.09.2026 — Rüdiger (@Stelariz_75) bat um Wikifizierung der Wochen-Debatte (Runtime vs. Harness, K1-Fall, concert-finder).
- raw (NEW): `raw/other/2026-09-05_harness-vs-standalone-chat-llm.md` — Neutrale Zusammenfassung: (1) Gemini-App-Laufzeitumgebung als geschlossener „goldener Käfig" (3 Komponenten: Agenten-&Kontext-Laufzeit, Extensions-Runtime, Python-Sandbox); (2) Faktencheck-Korrekturen (Scheduled Actions seit 2025, Gems, Modellnamen 3.6/3.7 nicht verifizierbar); (3) Definition Harness ≠ Runtime; (4) K1-Fall / Attribut-Fusions-Halluzination bei AC/DC-Konzertsuche; (5) Hermans Dreifeld-Check-Methode → concert-finder; (6) Geminis Selbstanalyse inkl. R1-Mythos-Kritik; (7) Epistemische Hygiene als Auslöser (Patientenrechte-Debatte).
- wiki (NEW): `wiki/concepts/llm/harness-vs-standalone-chat-llm.md` — Kernidee Modell ≠ Agent; Gemini-Runtime-Komponenten; Runtime-vs-Harness-Tabelle (Motor/Fahrzeug); Entity Blending als Fehlerklasse; Grounding ≠ Datenbank; Verifikations-Architektur als Harness-Domäne; Einordnung in die Wochen-These (App liefert Fehler, Engine erklärt, Harness fängt).
- index.md: Header-Update 175 (Harness vs. Standalone-Chat-LLM).
- log: this entry