3 KiB
| created | updated | sources | tags | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-09-22 | 2026-09-22 |
|
|
N8 Programs
N8 Programs (@N8Programs, GitHub N8python) beschreibt sich als Student der angewandten Mathematik und Statistik an der Johns Hopkins University sowie der In-Context-Learning-Forschung am Intelligence Amplification Lab. Ein bürgerlicher Name ist im ausgewerteten Profil nicht angegeben.
Jev-vs.-Terra-Benchmark (16.09.2026)
N8 Programs veröffentlichte den ersten breiteren, quantitativ dokumentierten Fremdvergleich von TypeSafes Jev gegen GPT-5.6 Terra: neun Multiple-Choice-Bedingungen, Terra mit reasoning=none und Letter-only-Ausgabe, dazu Kosten- und Kalibrierungsdiagramme. Ein Reddit-Repost am 17.09. wurde am 22.09. von Pit Weber geteilt.
Der Vergleich stützt eine enge Terra-Tier-Aussage: Über die neun heterogenen Bedingungen liegt der ungewichtete Makromittelwert fast gleichauf (Jev 80,69 %, Terra 80,15 %). Dahinter stecken verschiedene Profile:
- Jev vorn: MMLU (+3,02 Pp), GPQA Diamond (+12,12), ARC-Easy (+0,51), ARC-Challenge (+0,85), WinoGrande (+12,94).
- Terra vorn: HellaSwag (+0,46), GSM8K mit 4 Optionen (+8,04), GSM8K mit 10 Optionen (+15,24), Schach (+0,80).
- Der Threadtext sagt, Jev übertreffe Terra auch auf HellaSwag; die eigene Tabelle zeigt das Gegenteil (94,86 % vs. 95,32 %).
Das Kalibrierungsbild ist die stärkste öffentliche Fremdevidenz für TypeSafes RLCD-These: N = 33.735, ECE 1,74 Prozentpunkte, 10 gleich breite Bins, Wilson-95-%-Intervalle; Einzel-Benches laut Autor 0,26–6,96 pp. Der Gesamtlauf kostete laut Grafik $0,6999 geschätzt für Jev gegenüber $12,9865 API-gemeldet für Terra — 18,55×, also trägt die Rundung „~18ד.
Grenzen
- Kein öffentliches Eval-Repository, keine Prompts, Seeds, Beispieldateien oder Run-Logs; die Benchmarks wurden hier nicht reproduziert.
- Jev-Kosten sind aus aufgezeichneten Input-Token × $0,042/MTok geschätzt; Terra-Kosten API-gemeldet. Der Vergleich ist plausibel, aber nicht symmetrisch instrumentiert.
reasoning=noneisoliert sinnvoll die System-1-Frage, misst aber nicht Terras übliche maximale Produktleistung.- Öffentliche Standardbenchmarks können Trainingskontamination enthalten. Der Autor nimmt Übertragbarkeit an und verweist nur auf die Anbieteraussage, öffentliche Benches nicht zu priorisieren.
- Geschwindigkeit wurde nicht gemessen. Der Test bestätigt weder 70–500 ms noch die 193,6×-Herstellerzahl.
- 18,55× Kostenvorteil ist erheblich, bestätigt aber nicht die Hersteller-Obergrenze von 400–444,6×.
Verwandte Wiki-Seiten
- ../concepts/llm/system-one-models-jev.md — Modell, Anbieter-Evals und unabhängige Prüfungen
- gabriel-anhaia.md — Kritik an den anbietererzeugten Referenzlabels
- mike-taylor.md — früher Jev-Einzeltest bei Every
- ../institutions/typesafe-ai.md — Anbieter