knowledge-base/raw/other/2026-09-05_herman-verifikation-modellwahl.md

36 lines
3.4 KiB
Markdown
Raw Permalink Normal View History

---
type: other
source_url: https://t.me/c/3839640481/13877
retrieved: 2026-09-05
title: "HermanButlerBot — Verifikation der PLUR1BUS-Modellwahl-Übersicht (4 Korrekturen)"
author: "HermanButlerBot"
tags: [plur1bus, openclaw, embedding, reranking, jina, bge, e5, verification, model-choice]
---
# HermanButlerBot — Verifikation der PLUR1BUS-Modellwahl-Übersicht
## Quellenkontext
HermanButlerBot prüfte am 05.09.2026 die Modellwahl-Übersicht von Mr. Cy (Embedding E5 vs. Jina v3; Reranking Jina v2 vs. BGE v2-m3) gegen die Quellen und den Code im Repository. Ergebnis: Empfehlung steht, aber vier Details halten der Prüfung nicht stand.
## Verifizierte Punkte (laut Beitrag)
- Sämtliche Benchmark-Werte stimmen: Jina-v2-Modellkarte (BEIR 53,17, MKQA 54,83, MLDR 68,95, CodeSearchNet 71,36, ToolBench 77,75) und das v3-Paper (BEIR 57,06, MIRACL 63,65 vs. BGE 69,32, MKQA 67,90/67,88, CoIR 56,14/35,97) — exakt nachvollzogen, inklusive des Hinweises auf unterschiedliche Kandidatenmengen der Paare.
- Die BGE-Empfehlung wird durch Daten sogar stärker gestützt als dargestellt: Im MIRACL-Paper steht die DE-Spalte einzeln — **BGE 58,32 vs. Jina-v2 53,06**. Für deutsche Memory-Karten sind das 5 Punkte, nicht „knapp sechs im Schnitt“.
- E5-small-Fallback (384 dim), Duplikatschwelle 0,95, Reranker-Limit 5s, BGE-Apache-Lizenz — alles im Code bestätigt.
## Korrekturen (laut Beitrag)
1. **„40 Kandidaten“ falsch:** Code-Default ist `rerankCandidates: 20` (recall-pipeline.js; Wizard setzt ebenfalls 20). Falls eine Instanz 40 konfiguriert hat, ist das eine lokale Einstellung, keine allgemeine Aussage.
2. **Falsche Jina-Generation verglichen:** Der mtplx-embed-Service im Repo pinned bereits `jina-embeddings-v5-text-small` und `jina-reranker-v3.5` (models.py, Pins in test_model_pins.py). Der „nachgelieferte Installer“ liefert also v5/v3.5 — die v2-vs-BGE-Tabelle beschreibt den Stand des alten Wizards, nicht den kommenden. Für die Empfehlung ändert das wenig (BGE bleibt auf MIRACL vorn, auch vor v3 mit 66,50), aber die Kalkulation „doppelte Rechenzeit vs. halbe Tiefe“ gilt für v3.5 nicht mehr — der rerankt die Liste in einem Durchgang, nicht paarweise.
3. **`controlUi.writeActions: "all"` nicht auffindbar:** Das SDK-Compat-Audit sagt explizit, PLUR1BUS habe keine UI-Komponenten. Die Re-Embedding-Migration existiert (snapshot-gegliedert, Probelauf, separater Cutover, alte Generation bleibt erhalten — workspace_migrate.py), aber als Job, nicht als Reiter. Woher die UI-Beschreibung stammt, ist offen.
4. **0,84/0,86-Kegel-Messung:** Ist das Kompatibilitätslabor von Mr. Cy, im Repo nicht reproduzierbar. Richtungsmäßig bekannt (Anisotropie bei E5), aber als bequeme Größenordnung sollte sie als eigene Messung gekennzeichnet bleiben, nicht als Eigenschaft des Modells.
## Fazit des Beitrags
Embedding Jina (oder v5-small, je nachdem was der Installer tatsächlich bringt), Reranking BGE — dem wird zugestimmt. Aber Punkte 2 und 3 sollten nachgezogen werden, bevor die Übersicht als Doku/Changelog-Eintrag landet: Die Tabelle vergleicht Modelle, die der Installer in dieser Form nicht mehr ausliefert.
## Abgrenzung
Verifikation von HermanButlerBot gegen Repo-Code und Benchmark-Quellen. Die Korrekturpunkte sind als Fremdprüfung dokumentiert; die ursprüngliche Übersicht von Mr. Cy bleibt separat in `raw/other/2026-09-05_plur1bus-modellwahl-embedding-reranking.md` erhalten.