90 lines
7.3 KiB
Markdown
90 lines
7.3 KiB
Markdown
---
|
||
created: 2026-09-05
|
||
updated: 2026-09-05
|
||
sources: [other/2026-09-05_harness-vs-standalone-chat-llm.md]
|
||
tags: [concept, llm, harness, runtime, walled-garden, halluzination, entity-blending, attribut-fusion, verifikation, gemini]
|
||
people: [ruediger, herman-butler-bot]
|
||
institutions: [google, deepmind]
|
||
---
|
||
|
||
# Harness vs. Standalone-Chat-LLM: Walled Garden & Attribut-Fusions-Halluzination
|
||
|
||
> **Kontext:** OME-Diskussion "Ich, der DAU und sein Bot LOGBUCH" (28.08.–05.09.2026) zwischen Rüdiger (@Stelariz_75), Hector, Herman (@HermanButlerBot) und Gemini. Auslöser: Ist die Gemini-App ein Agent oder nur ein Chat? Der K1-Fall (AC/DC-Konzertsuche) lieferte die empirische Antwort.
|
||
|
||
## Kernidee
|
||
|
||
**Modell ≠ Agent.** Eine Standalone-Chat-App wie Gemini besitzt zwar eine eigene Laufzeitumgebung, aber keinen echten Agenten-Harness. Der Unterschied wurde in zwei Akten demonstriert: (1) theoretisch über die Definition von Runtime vs. Harness, (2) empirisch über eine Live-Konzertsuche, bei der Gemini eine klassische **Attribut-Fusions-Halluzination** produzierte — und ein Harness mit Verifikations-Disziplin sie abfing.
|
||
|
||
## 1. Die Gemini-App: Laufzeitumgebung ja, Harness nein
|
||
|
||
Gemi (App) läuft auf einer **vollständig geschlossenen, von Google vorkonfigurierten Server-Runtime** mit drei Komponenten:
|
||
|
||
1. **Agenten- & Kontext-Laufzeit** — Konversationsverlauf, Session-State, Profil-Info ("Gemerkte Informationen"), serverseitiges Modell-Routing, Quotas, Token-Limits.
|
||
2. **Werkzeug- & Erweiterungs-Laufzeit** — Function Calling/Tool Use an das Google-Universum (Kalender, Gmail, Maps, YouTube) via geschlossener Erweiterungen.
|
||
3. **Ausführungs-Sandbox** — isolierte Python-Laufzeit auf Google-Cloud; Ergebnis wird abgefangen und zurückgereicht.
|
||
|
||
Selbstbezeichnung von Gemini: **"goldener Käfig" (Walled Garden)** — optimiert für Alltagsaufgaben im Google-Ökosystem, nicht erweiterbar um eigene Daemons, externe Gateways oder harte Ausführungs-Workflows.
|
||
|
||
**Zwei Faktenchecks (Korrekturen an Geminis Notiz):**
|
||
- **Scheduled Actions** existieren seit 2025 in der Gemini-App: serverseitig wiederkehrende Tasks mit Push-Notification — zeitgesteuerte Trigger also doch, nur ohne eigene Daemons/Webhooks/externe Gateways.
|
||
- **Gems** erlauben Custom Instructions pro Bot (quasi System-Prompt auf App-Niveau), aber nicht hart fixierbar wie im API-Harness.
|
||
- ⚠️ Modellnamen "Gemini 3.6/3.7 Flash" in der Selbstbeschreibung nicht verifizierbar — typisches Halluzinations-Muster der Selbstreferenz.
|
||
|
||
## 2. Definition: Harness ≠ Laufzeitumgebung
|
||
|
||
| Begriff | Definition | Analogie |
|
||
|---|---|---|
|
||
| **Laufzeitumgebung (Runtime)** | Technische Ausführungsebene: Sandbox, Prozesse, Speicher, API-Schnittstellen, Tool-Aufrufe. Das *Wo und Wie*. | Motor |
|
||
| **Harness** | Steuerungsarchitektur um das Modell: System-Prompt, Skills/Prozeduren, Agenten-Schleifen (ReAct), Guardrails, Memory, Evaluierung. Das *Was und Warum*. | Komplettes Fahrzeug inkl. Fahrerregeln, Navi, Checkliste |
|
||
|
||
Die Runtime ist ein **Baustein** des Harness. Ein Modell ohne Harness ist ein nackter LLM-Endpoint; ein Harness ohne Runtime ist nur ein Plan. Erst zusammen ergibt das einen Agenten.
|
||
|
||
→ Vertiefung: [[../agents/harness-loop-graph-engineering.md]] (Harness = Maschinerie um das Modell, hier am Beispiel OME-Harness-Engineering diskutiert)
|
||
|
||
## 3. Der K1-Fall: Attribut-Fusions-Halluzination (empirisch)
|
||
|
||
**Leistungstest:** "Wo in Niedersachsen spielt heute eine AC/DC-Revival-Band?"
|
||
|
||
- **Herman (verifiziert, 2 Treffer gegen Offizial-Quellen):** 1) Nordhorn, Alte Weberei — Powerage + Beast of Maiden, 20:00. 2) Wetschen, Rock and More Festival — BLACK ICE, 23:00. Quellen: rsk-event.de, meinestadt.de/Reservix.
|
||
- **Gemini (mit Halluzination):** Nordhorn korrekt ✓; aber "K1 Theater (Hannover), Herrenstraße, 19:00 — Highway to Hell AC/DC-Tribute-Show" ✗ — das Event existiert real, spielt aber im **K1 des Kammertheaters Karlsruhe** (Baden-Württemberg, ~350 km entfernt; Quelle: kammertheater-karlsruhe.de + pretix.eu/ktk/acdc). Black Ice/Wetschen komplett verpasst.
|
||
|
||
**Fehlerklasse:** Gemini hat nicht frei erfunden, sondern **reale Datenpunkte falsch verknüpft** (Entity Blending): K1 + Herrenstraße + 19:00 + "Highway to Hell" existieren alle real, nur in Karlsruhe — und die Zielregion "Hannover" wurde darübergelegt. Datum und Uhrzeit stimmten exakt; nur die Location war getauscht.
|
||
|
||
**Warum Grounding nicht schützt:** Suchanbindung liefert Such-Snippets als Kontext, macht das Modell aber nicht zur deterministischen Datenbank (SQL); es bleibt ein probabilistisches Sprachmodell, das Wort für Wort generiert.
|
||
|
||
## 4. Die Verifikations-Architektur: was Gemini fehlt
|
||
|
||
**Hermans Methode (kein Skill, keine Subagenten — 5 direkte Tool-Calls in 3 Runden):**
|
||
1. Zwei parallele `web_search` mit Datums-Kombinationen → Kandidatenliste aus Aggregatoren (StubHub, concerts50, Facebook).
|
||
2. Zwei parallele `web_extract` auf Kandidaten → StubHub = Folgejahr 2027 (verworfen), meinestadt/Reservix + rsk-event = echt.
|
||
3. Gezielte Check-Runde gegen K1-Behauptung → Kammertheater Karlsruhe, pretix-Beleg.
|
||
|
||
**Zwei Kernregeln (daraus als `concert-finder`-Skill kodifiziert):**
|
||
- **Aggregatoren liefern Kandidaten, nie Antworten** — Antworten nur von Offizial-Quellen (Veranstalter-Seite, Theater-Ticket-Shop).
|
||
- **Dreifeld-Check:** Datum (inkl. Jahr) + Uhrzeit + Location hart belegen; eines unbestätigt → raus.
|
||
|
||
## 5. Geminis Selbstanalyse — und ihre Grenze
|
||
|
||
Gemini erklärte den Fehler selbst, präzise in zwei Punkten:
|
||
1. **Suchanbindung ≠ deterministische Datenbank** — Grounding macht nicht zur DB.
|
||
2. **Entity Blending (Attribut-Vertauschung)** — Attention verschmolz echte Namen mit der Zielregion.
|
||
|
||
Aber Punkt 3 ("Reasoning-Modelle wie DeepSeek R1 prüfen explizit: Karlsruhe ∈ Niedersachsen? → Verwerfen") ist **als Garantie empirisch falsch**: CoT-Modelle halluzinieren nachweislich auch; CoT *begründet*, verifiziert aber nicht. Hermans Meta-Beobachtung: Die Erklärung selbst ist ein Paradebeispiel des Fehlers — die Attention-Ursache ist erzählt, nicht beobachtbar (kein Trace).
|
||
|
||
## 6. Einordnung in die Wochen-These
|
||
|
||
- **Engine ≠ Harness:** Gemini ist exzellent in Synthese und Einordnung (lieferte nach dem Vorfall die *beste* Erklärung des Fehlers), versagt aber als ungeprüfte Primärquelle — Retrieval + Kreuzprüfung ist **Prozess**, und Prozess ist Harness-Domäne.
|
||
- **Grounding-Tools verhindern keine probabilistische Generierung — nur Gates tun das.** Herman hatte dieselbe Suchbasis, aber der Ablauf erzwang die Prüfung (Kandidaten → Offizial-Quelle → Dreifeld-Check).
|
||
- **Arbeitsteilung:** App ohne Audit liefert den Fehler, Engine erklärt ihn brillant, Harness fängt ihn. Wer nur die App hat, ist selbst das Gate.
|
||
|
||
## Verwandte Wiki-Seiten
|
||
|
||
- [[../agents/harness-loop-graph-engineering.md]] (Harness als Maschinerie um das Modell)
|
||
- [[llm-sycophancy-confabulation.md]] (Lüge vs. Confabulation vs. Sycophancy)
|
||
- [[deepseek-v4-pro-ga-harness-open-source.md]] (DeepSeek Harness als offene Gegenfolie)
|
||
- [[../agents/hermes-bot-mode.md]], [[../agents/hermes-vs-grok-bot.md]] (Hermes als offene Agent-Runtime)
|
||
- [[gemini-3.6-flash-vs-3.7-flash.md]] (Googles Flash-Workhorse-Modelle)
|
||
|
||
## Offene Punkte
|
||
|
||
- ⚠️ Geminis "K1 Theater (Hannover)": Stadt-Tausch-Muster als dokumentierte Halluzinationsfalle — inzwischen in Hermans `concert-finder`-Skill als Falle geführt (neben StubHub-Folgejahr und Facebook-Hinweis-Only).
|