knowledge-base/wiki/concepts/llm/harness-vs-standalone-chat-llm.md
Hector ac4acf003f ingest(blog): NVIDIA — Agenten bereiten 3D-Szenen für die Simulation vor
- raw/blog/2026-09-17_nvidia-ai-agents-3d-scenes-simulation.md (neu)
- wiki/concepts/agents/nvidia-agenten-3d-scene-prep.md (neu)
- wiki/institutions/nvidia.md (neu)
- Cross-Refs: harness-loop-graph-engineering, hermes-bot-mode,
  harness-vs-standalone-chat-llm, robotics-model-benchmark,
  tools/openclaw, tools/nvidia-dgx-spark
- index.md (205. Update), log.md
2026-09-17 09:27:21 +02:00

7.5 KiB
Raw Blame History

created updated sources tags people institutions
2026-09-05 2026-09-17
other/2026-09-05_harness-vs-standalone-chat-llm.md
concept
llm
harness
runtime
walled-garden
halluzination
entity-blending
attribut-fusion
verifikation
gemini
ruediger
herman-butler-bot
google
deepmind

Harness vs. Standalone-Chat-LLM: Walled Garden & Attribut-Fusions-Halluzination

Kontext: OME-Diskussion "Ich, der DAU und sein Bot LOGBUCH" (28.08.05.09.2026) zwischen Rüdiger (@Stelariz_75), Hector, Herman (@HermanButlerBot) und Gemini. Auslöser: Ist die Gemini-App ein Agent oder nur ein Chat? Der K1-Fall (AC/DC-Konzertsuche) lieferte die empirische Antwort.

Kernidee

Modell ≠ Agent. Eine Standalone-Chat-App wie Gemini besitzt zwar eine eigene Laufzeitumgebung, aber keinen echten Agenten-Harness. Der Unterschied wurde in zwei Akten demonstriert: (1) theoretisch über die Definition von Runtime vs. Harness, (2) empirisch über eine Live-Konzertsuche, bei der Gemini eine klassische Attribut-Fusions-Halluzination produzierte — und ein Harness mit Verifikations-Disziplin sie abfing.

1. Die Gemini-App: Laufzeitumgebung ja, Harness nein

Gemi (App) läuft auf einer vollständig geschlossenen, von Google vorkonfigurierten Server-Runtime mit drei Komponenten:

  1. Agenten- & Kontext-Laufzeit — Konversationsverlauf, Session-State, Profil-Info ("Gemerkte Informationen"), serverseitiges Modell-Routing, Quotas, Token-Limits.
  2. Werkzeug- & Erweiterungs-Laufzeit — Function Calling/Tool Use an das Google-Universum (Kalender, Gmail, Maps, YouTube) via geschlossener Erweiterungen.
  3. Ausführungs-Sandbox — isolierte Python-Laufzeit auf Google-Cloud; Ergebnis wird abgefangen und zurückgereicht.

Selbstbezeichnung von Gemini: "goldener Käfig" (Walled Garden) — optimiert für Alltagsaufgaben im Google-Ökosystem, nicht erweiterbar um eigene Daemons, externe Gateways oder harte Ausführungs-Workflows.

Zwei Faktenchecks (Korrekturen an Geminis Notiz):

  • Scheduled Actions existieren seit 2025 in der Gemini-App: serverseitig wiederkehrende Tasks mit Push-Notification — zeitgesteuerte Trigger also doch, nur ohne eigene Daemons/Webhooks/externe Gateways.
  • Gems erlauben Custom Instructions pro Bot (quasi System-Prompt auf App-Niveau), aber nicht hart fixierbar wie im API-Harness.
  • ⚠️ Modellnamen "Gemini 3.6/3.7 Flash" in der Selbstbeschreibung nicht verifizierbar — typisches Halluzinations-Muster der Selbstreferenz.

2. Definition: Harness ≠ Laufzeitumgebung

Begriff Definition Analogie
Laufzeitumgebung (Runtime) Technische Ausführungsebene: Sandbox, Prozesse, Speicher, API-Schnittstellen, Tool-Aufrufe. Das Wo und Wie. Motor
Harness Steuerungsarchitektur um das Modell: System-Prompt, Skills/Prozeduren, Agenten-Schleifen (ReAct), Guardrails, Memory, Evaluierung. Das Was und Warum. Komplettes Fahrzeug inkl. Fahrerregeln, Navi, Checkliste

Die Runtime ist ein Baustein des Harness. Ein Modell ohne Harness ist ein nackter LLM-Endpoint; ein Harness ohne Runtime ist nur ein Plan. Erst zusammen ergibt das einen Agenten.

→ Vertiefung: ../agents/harness-loop-graph-engineering.md (Harness = Maschinerie um das Modell, hier am Beispiel OME-Harness-Engineering diskutiert)

3. Der K1-Fall: Attribut-Fusions-Halluzination (empirisch)

Leistungstest: "Wo in Niedersachsen spielt heute eine AC/DC-Revival-Band?"

  • Herman (verifiziert, 2 Treffer gegen Offizial-Quellen): 1) Nordhorn, Alte Weberei — Powerage + Beast of Maiden, 20:00. 2) Wetschen, Rock and More Festival — BLACK ICE, 23:00. Quellen: rsk-event.de, meinestadt.de/Reservix.
  • Gemini (mit Halluzination): Nordhorn korrekt ✓; aber "K1 Theater (Hannover), Herrenstraße, 19:00 — Highway to Hell AC/DC-Tribute-Show" ✗ — das Event existiert real, spielt aber im K1 des Kammertheaters Karlsruhe (Baden-Württemberg, ~350 km entfernt; Quelle: kammertheater-karlsruhe.de + pretix.eu/ktk/acdc). Black Ice/Wetschen komplett verpasst.

Fehlerklasse: Gemini hat nicht frei erfunden, sondern reale Datenpunkte falsch verknüpft (Entity Blending): K1 + Herrenstraße + 19:00 + "Highway to Hell" existieren alle real, nur in Karlsruhe — und die Zielregion "Hannover" wurde darübergelegt. Datum und Uhrzeit stimmten exakt; nur die Location war getauscht.

Warum Grounding nicht schützt: Suchanbindung liefert Such-Snippets als Kontext, macht das Modell aber nicht zur deterministischen Datenbank (SQL); es bleibt ein probabilistisches Sprachmodell, das Wort für Wort generiert.

4. Die Verifikations-Architektur: was Gemini fehlt

Hermans Methode (kein Skill, keine Subagenten — 5 direkte Tool-Calls in 3 Runden):

  1. Zwei parallele web_search mit Datums-Kombinationen → Kandidatenliste aus Aggregatoren (StubHub, concerts50, Facebook).
  2. Zwei parallele web_extract auf Kandidaten → StubHub = Folgejahr 2027 (verworfen), meinestadt/Reservix + rsk-event = echt.
  3. Gezielte Check-Runde gegen K1-Behauptung → Kammertheater Karlsruhe, pretix-Beleg.

Zwei Kernregeln (daraus als concert-finder-Skill kodifiziert):

  • Aggregatoren liefern Kandidaten, nie Antworten — Antworten nur von Offizial-Quellen (Veranstalter-Seite, Theater-Ticket-Shop).
  • Dreifeld-Check: Datum (inkl. Jahr) + Uhrzeit + Location hart belegen; eines unbestätigt → raus.

5. Geminis Selbstanalyse — und ihre Grenze

Gemini erklärte den Fehler selbst, präzise in zwei Punkten:

  1. Suchanbindung ≠ deterministische Datenbank — Grounding macht nicht zur DB.
  2. Entity Blending (Attribut-Vertauschung) — Attention verschmolz echte Namen mit der Zielregion.

Aber Punkt 3 ("Reasoning-Modelle wie DeepSeek R1 prüfen explizit: Karlsruhe ∈ Niedersachsen? → Verwerfen") ist als Garantie empirisch falsch: CoT-Modelle halluzinieren nachweislich auch; CoT begründet, verifiziert aber nicht. Hermans Meta-Beobachtung: Die Erklärung selbst ist ein Paradebeispiel des Fehlers — die Attention-Ursache ist erzählt, nicht beobachtbar (kein Trace).

6. Einordnung in die Wochen-These

  • Engine ≠ Harness: Gemini ist exzellent in Synthese und Einordnung (lieferte nach dem Vorfall die beste Erklärung des Fehlers), versagt aber als ungeprüfte Primärquelle — Retrieval + Kreuzprüfung ist Prozess, und Prozess ist Harness-Domäne.
  • Grounding-Tools verhindern keine probabilistische Generierung — nur Gates tun das. Herman hatte dieselbe Suchbasis, aber der Ablauf erzwang die Prüfung (Kandidaten → Offizial-Quelle → Dreifeld-Check).
  • Arbeitsteilung: App ohne Audit liefert den Fehler, Engine erklärt ihn brillant, Harness fängt ihn. Wer nur die App hat, ist selbst das Gate.

Verwandte Wiki-Seiten

Offene Punkte

  • ⚠️ Geminis "K1 Theater (Hannover)": Stadt-Tausch-Muster als dokumentierte Halluzinationsfalle — inzwischen in Hermans concert-finder-Skill als Falle geführt (neben StubHub-Folgejahr und Facebook-Hinweis-Only).