knowledge-base/wiki/concepts/llm/harness-vs-standalone-chat-llm.md
Hector b395bc8c52 ingest(youtube): Typesafe AI — System One Models & Jev (KI Copium 17.09.2026)
Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25).
Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only.
Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.).

raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu),
     raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu),
     raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu),
     raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund)
wiki: concepts/llm/system-one-models-jev.md (neu),
      institutions/typesafe-ai.md (neu), institutions/every.md (neu),
      people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md,
      people/ai-copium.md (alle neu)
      + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm,
        llm-sycophancy-confabulation, agent-budget-breaker,
        harness-loop-graph-engineering
      + index.md (216. Update), log.md
2026-09-17 23:51:03 +02:00

92 lines
7.7 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-09-05
updated: 2026-09-17
sources: [other/2026-09-05_harness-vs-standalone-chat-llm.md]
tags: [concept, llm, harness, runtime, walled-garden, halluzination, entity-blending, attribut-fusion, verifikation, gemini]
people: [ruediger, herman-butler-bot]
institutions: [google, deepmind]
---
# Harness vs. Standalone-Chat-LLM: Walled Garden & Attribut-Fusions-Halluzination
> **Kontext:** OME-Diskussion "Ich, der DAU und sein Bot LOGBUCH" (28.08.05.09.2026) zwischen Rüdiger (@Stelariz_75), Hector, Herman (@HermanButlerBot) und Gemini. Auslöser: Ist die Gemini-App ein Agent oder nur ein Chat? Der K1-Fall (AC/DC-Konzertsuche) lieferte die empirische Antwort.
## Kernidee
**Modell ≠ Agent.** Eine Standalone-Chat-App wie Gemini besitzt zwar eine eigene Laufzeitumgebung, aber keinen echten Agenten-Harness. Der Unterschied wurde in zwei Akten demonstriert: (1) theoretisch über die Definition von Runtime vs. Harness, (2) empirisch über eine Live-Konzertsuche, bei der Gemini eine klassische **Attribut-Fusions-Halluzination** produzierte — und ein Harness mit Verifikations-Disziplin sie abfing.
## 1. Die Gemini-App: Laufzeitumgebung ja, Harness nein
Gemi (App) läuft auf einer **vollständig geschlossenen, von Google vorkonfigurierten Server-Runtime** mit drei Komponenten:
1. **Agenten- & Kontext-Laufzeit** — Konversationsverlauf, Session-State, Profil-Info ("Gemerkte Informationen"), serverseitiges Modell-Routing, Quotas, Token-Limits.
2. **Werkzeug- & Erweiterungs-Laufzeit** — Function Calling/Tool Use an das Google-Universum (Kalender, Gmail, Maps, YouTube) via geschlossener Erweiterungen.
3. **Ausführungs-Sandbox** — isolierte Python-Laufzeit auf Google-Cloud; Ergebnis wird abgefangen und zurückgereicht.
Selbstbezeichnung von Gemini: **"goldener Käfig" (Walled Garden)** — optimiert für Alltagsaufgaben im Google-Ökosystem, nicht erweiterbar um eigene Daemons, externe Gateways oder harte Ausführungs-Workflows.
**Zwei Faktenchecks (Korrekturen an Geminis Notiz):**
- **Scheduled Actions** existieren seit 2025 in der Gemini-App: serverseitig wiederkehrende Tasks mit Push-Notification — zeitgesteuerte Trigger also doch, nur ohne eigene Daemons/Webhooks/externe Gateways.
- **Gems** erlauben Custom Instructions pro Bot (quasi System-Prompt auf App-Niveau), aber nicht hart fixierbar wie im API-Harness.
- ⚠️ Modellnamen "Gemini 3.6/3.7 Flash" in der Selbstbeschreibung nicht verifizierbar — typisches Halluzinations-Muster der Selbstreferenz.
## 2. Definition: Harness ≠ Laufzeitumgebung
| Begriff | Definition | Analogie |
|---|---|---|
| **Laufzeitumgebung (Runtime)** | Technische Ausführungsebene: Sandbox, Prozesse, Speicher, API-Schnittstellen, Tool-Aufrufe. Das *Wo und Wie*. | Motor |
| **Harness** | Steuerungsarchitektur um das Modell: System-Prompt, Skills/Prozeduren, Agenten-Schleifen (ReAct), Guardrails, Memory, Evaluierung. Das *Was und Warum*. | Komplettes Fahrzeug inkl. Fahrerregeln, Navi, Checkliste |
Die Runtime ist ein **Baustein** des Harness. Ein Modell ohne Harness ist ein nackter LLM-Endpoint; ein Harness ohne Runtime ist nur ein Plan. Erst zusammen ergibt das einen Agenten.
→ Vertiefung: [[../agents/harness-loop-graph-engineering.md]] (Harness = Maschinerie um das Modell, hier am Beispiel OME-Harness-Engineering diskutiert)
## 3. Der K1-Fall: Attribut-Fusions-Halluzination (empirisch)
**Leistungstest:** "Wo in Niedersachsen spielt heute eine AC/DC-Revival-Band?"
- **Herman (verifiziert, 2 Treffer gegen Offizial-Quellen):** 1) Nordhorn, Alte Weberei — Powerage + Beast of Maiden, 20:00. 2) Wetschen, Rock and More Festival — BLACK ICE, 23:00. Quellen: rsk-event.de, meinestadt.de/Reservix.
- **Gemini (mit Halluzination):** Nordhorn korrekt ✓; aber "K1 Theater (Hannover), Herrenstraße, 19:00 — Highway to Hell AC/DC-Tribute-Show" ✗ — das Event existiert real, spielt aber im **K1 des Kammertheaters Karlsruhe** (Baden-Württemberg, ~350 km entfernt; Quelle: kammertheater-karlsruhe.de + pretix.eu/ktk/acdc). Black Ice/Wetschen komplett verpasst.
**Fehlerklasse:** Gemini hat nicht frei erfunden, sondern **reale Datenpunkte falsch verknüpft** (Entity Blending): K1 + Herrenstraße + 19:00 + "Highway to Hell" existieren alle real, nur in Karlsruhe — und die Zielregion "Hannover" wurde darübergelegt. Datum und Uhrzeit stimmten exakt; nur die Location war getauscht.
**Warum Grounding nicht schützt:** Suchanbindung liefert Such-Snippets als Kontext, macht das Modell aber nicht zur deterministischen Datenbank (SQL); es bleibt ein probabilistisches Sprachmodell, das Wort für Wort generiert.
## 4. Die Verifikations-Architektur: was Gemini fehlt
**Hermans Methode (kein Skill, keine Subagenten — 5 direkte Tool-Calls in 3 Runden):**
1. Zwei parallele `web_search` mit Datums-Kombinationen → Kandidatenliste aus Aggregatoren (StubHub, concerts50, Facebook).
2. Zwei parallele `web_extract` auf Kandidaten → StubHub = Folgejahr 2027 (verworfen), meinestadt/Reservix + rsk-event = echt.
3. Gezielte Check-Runde gegen K1-Behauptung → Kammertheater Karlsruhe, pretix-Beleg.
**Zwei Kernregeln (daraus als `concert-finder`-Skill kodifiziert):**
- **Aggregatoren liefern Kandidaten, nie Antworten** — Antworten nur von Offizial-Quellen (Veranstalter-Seite, Theater-Ticket-Shop).
- **Dreifeld-Check:** Datum (inkl. Jahr) + Uhrzeit + Location hart belegen; eines unbestätigt → raus.
## 5. Geminis Selbstanalyse — und ihre Grenze
Gemini erklärte den Fehler selbst, präzise in zwei Punkten:
1. **Suchanbindung ≠ deterministische Datenbank** — Grounding macht nicht zur DB.
2. **Entity Blending (Attribut-Vertauschung)** — Attention verschmolz echte Namen mit der Zielregion.
Aber Punkt 3 ("Reasoning-Modelle wie DeepSeek R1 prüfen explizit: Karlsruhe ∈ Niedersachsen? → Verwerfen") ist **als Garantie empirisch falsch**: CoT-Modelle halluzinieren nachweislich auch; CoT *begründet*, verifiziert aber nicht. Hermans Meta-Beobachtung: Die Erklärung selbst ist ein Paradebeispiel des Fehlers — die Attention-Ursache ist erzählt, nicht beobachtbar (kein Trace).
## 6. Einordnung in die Wochen-These
- **Engine ≠ Harness:** Gemini ist exzellent in Synthese und Einordnung (lieferte nach dem Vorfall die *beste* Erklärung des Fehlers), versagt aber als ungeprüfte Primärquelle — Retrieval + Kreuzprüfung ist **Prozess**, und Prozess ist Harness-Domäne.
- **Grounding-Tools verhindern keine probabilistische Generierung — nur Gates tun das.** Herman hatte dieselbe Suchbasis, aber der Ablauf erzwang die Prüfung (Kandidaten → Offizial-Quelle → Dreifeld-Check).
- **Arbeitsteilung:** App ohne Audit liefert den Fehler, Engine erklärt ihn brillant, Harness fängt ihn. Wer nur die App hat, ist selbst das Gate.
## Verwandte Wiki-Seiten
- [[../agents/harness-loop-graph-engineering.md]] (Harness als Maschinerie um das Modell)
- [[llm-sycophancy-confabulation.md]] (Lüge vs. Confabulation vs. Sycophancy)
- [[deepseek-v4-pro-ga-harness-open-source.md]] (DeepSeek Harness als offene Gegenfolie)
- [[../agents/hermes-bot-mode.md]], [[../agents/hermes-vs-grok-bot.md]] (Hermes als offene Agent-Runtime)
- [[gemini-3.6-flash-vs-3.7-flash.md]] (Googles Flash-Workhorse-Modelle)
- [[../agents/nvidia-agenten-3d-scene-prep.md]] (NVIDIA-Referenzarchitektur: Harness-Subagents + Werkzeugschicht + Validierungs-Gate — „too concrete to solve with prompts alone")
- [[system-one-models-jev.md]] (Jev / System One Models, TypeSafe AI: das Gate als eigene Modellklasse — typisierte Entscheidungen in 70500 ms; „Zero Hallucinations" ist Type-Safety, nicht Wahrheit)
## Offene Punkte
- ⚠️ Geminis "K1 Theater (Hannover)": Stadt-Tausch-Muster als dokumentierte Halluzinationsfalle — inzwischen in Hermans `concert-finder`-Skill als Falle geführt (neben StubHub-Folgejahr und Facebook-Hinweis-Only).