knowledge-base/wiki/people/gabriel-anhaia.md
Hector b9dd98dadb ingest(other): typesafe workflow-evals + vercel fx guardrail-tausch + label-kritik
- raw: evals.typesafe.ai (lokal gelesen) + devto label-kritik (17.09.2026)
- wiki: concepts/llm/system-one-models-jev (benchmark-lage, guardrail-tausch), people/gabriel-anhaia (neu)
- korrektur: jev unter opus 5/sol, nicht darueber
- index 222. update + log
2026-09-19 00:01:22 +02:00

23 lines
1.8 KiB
Markdown

---
created: 2026-09-18
updated: 2026-09-18
sources: [blog/2026-09-17_devto-jev-vs-luna-bake-off.md]
tags: [person, gabriel-anhaia, devto, evals, guardrails, label-kritik]
---
# Gabriel Anhaia
Entwickler, Autor und Buchverleger ([dev.to/gabrielanhaia](https://dev.to/gabrielanhaia), Website https://xgabriel.com/, GitHub https://github.com/gabrielanhaia; Projekt **Hermes IDE** auf https://hermes-ide.com/). Schreibt über TypeScript-Stack für KI-Anwendungen.
## Rolle im Wiki
Autor des bislang **scharfsinnigsten Fremdbeitrags zu Jev** ([Dev.to, 17.09.2026](https://dev.to/gabrielanhaia/jev-beat-gpt-luna-by-1-point-gpt-6-and-claude-wrote-the-answer-key-314k)): Er verbindet zwei Dinge, die in der Diskussion getrennt bleiben — den **Vercel-`fx`-Guardrail-Tausch** (Rauchg: „up to 18x faster (p95) and more accurate" als GPT-5.6 Luna, „likely new default") und die **Label-Kritik** an den TypeSafe-Evals (Referenzlabels = Durchschnitt von GPT-6 Astra + Fable 5.1; wer gegen einen gemeinsamen Blindfleck richtig liegt, wird abgewertet).
Bemerkenswert: Sein Fazit ist Pro-Jev-nüchtern statt ablehnend — er nennt Vercels Ergebnis „a good early signal" und empfiehlt fünf Prüfschritte (eigene Labels, Konfidenzband, p95 aus eigener Umgebung inkl. Retries, Kontrolle nach dem Wechsel, Kosten zuletzt). Das Wiki nutzt den Beitrag als **Prüfmaßstab** für Guardrail-Tausche. → [[../concepts/llm/system-one-models-jev.md]]
⚠️ Der Artikel enthält Eigenwerbung (fünf Bücher, Pocket Guides, Hermes IDE). Die zitierten Primärquellen sind davon unabhängig nachprüfbar; die TypeSafe-Zahlen wurden beim Ingest gegen `evals.typesafe.ai` gegengeprüft und stimmen.
## Verwandte Wiki-Seiten
- [[../concepts/llm/system-one-models-jev.md]] — Benchmark-Lage und Label-Kritik
- [[../concepts/agents/agent-budget-breaker.md]] — Kostendeckel und Guardrails