- raw: evals.typesafe.ai (lokal gelesen) + devto label-kritik (17.09.2026) - wiki: concepts/llm/system-one-models-jev (benchmark-lage, guardrail-tausch), people/gabriel-anhaia (neu) - korrektur: jev unter opus 5/sol, nicht darueber - index 222. update + log
1.8 KiB
| created | updated | sources | tags | |||||||
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-09-18 | 2026-09-18 |
|
|
Gabriel Anhaia
Entwickler, Autor und Buchverleger (dev.to/gabrielanhaia, Website https://xgabriel.com/, GitHub https://github.com/gabrielanhaia; Projekt Hermes IDE auf https://hermes-ide.com/). Schreibt über TypeScript-Stack für KI-Anwendungen.
Rolle im Wiki
Autor des bislang scharfsinnigsten Fremdbeitrags zu Jev (Dev.to, 17.09.2026): Er verbindet zwei Dinge, die in der Diskussion getrennt bleiben — den Vercel-fx-Guardrail-Tausch (Rauchg: „up to 18x faster (p95) and more accurate" als GPT-5.6 Luna, „likely new default") und die Label-Kritik an den TypeSafe-Evals (Referenzlabels = Durchschnitt von GPT-6 Astra + Fable 5.1; wer gegen einen gemeinsamen Blindfleck richtig liegt, wird abgewertet).
Bemerkenswert: Sein Fazit ist Pro-Jev-nüchtern statt ablehnend — er nennt Vercels Ergebnis „a good early signal" und empfiehlt fünf Prüfschritte (eigene Labels, Konfidenzband, p95 aus eigener Umgebung inkl. Retries, Kontrolle nach dem Wechsel, Kosten zuletzt). Das Wiki nutzt den Beitrag als Prüfmaßstab für Guardrail-Tausche. → ../concepts/llm/system-one-models-jev.md
⚠️ Der Artikel enthält Eigenwerbung (fünf Bücher, Pocket Guides, Hermes IDE). Die zitierten Primärquellen sind davon unabhängig nachprüfbar; die TypeSafe-Zahlen wurden beim Ingest gegen evals.typesafe.ai gegengeprüft und stimmen.
Verwandte Wiki-Seiten
- ../concepts/llm/system-one-models-jev.md — Benchmark-Lage und Label-Kritik
- ../concepts/agents/agent-budget-breaker.md — Kostendeckel und Guardrails