knowledge-base/wiki/people/n8-programs.md

39 lines
3 KiB
Markdown
Raw Normal View History

---
created: 2026-09-22
updated: 2026-09-22
sources: [other/2026-09-17_reddit-n8-jev-terra-benchmark.md]
tags: [person, n8-programs, n8python, johns-hopkins, benchmarks, jev, calibration]
---
# N8 Programs
**N8 Programs** ([@N8Programs](https://x.com/N8Programs), GitHub [N8python](https://github.com/N8python)) beschreibt sich als Student der angewandten Mathematik und Statistik an der [Johns Hopkins University](https://www.jhu.edu/) sowie der In-Context-Learning-Forschung am Intelligence Amplification Lab. Ein bürgerlicher Name ist im ausgewerteten Profil nicht angegeben.
## Jev-vs.-Terra-Benchmark (16.09.2026)
N8 Programs veröffentlichte den ersten breiteren, quantitativ dokumentierten Fremdvergleich von TypeSafes Jev gegen GPT-5.6 Terra: neun Multiple-Choice-Bedingungen, Terra mit `reasoning=none` und Letter-only-Ausgabe, dazu Kosten- und Kalibrierungsdiagramme. Ein Reddit-Repost am 17.09. wurde am 22.09. von Pit Weber geteilt.
Der Vergleich stützt eine **enge** Terra-Tier-Aussage: Über die neun heterogenen Bedingungen liegt der ungewichtete Makromittelwert fast gleichauf (**Jev 80,69 %, Terra 80,15 %**). Dahinter stecken verschiedene Profile:
- Jev vorn: MMLU (+3,02 Pp), GPQA Diamond (+12,12), ARC-Easy (+0,51), ARC-Challenge (+0,85), WinoGrande (+12,94).
- Terra vorn: HellaSwag (+0,46), GSM8K mit 4 Optionen (+8,04), GSM8K mit 10 Optionen (+15,24), Schach (+0,80).
- Der Threadtext sagt, Jev übertreffe Terra auch auf HellaSwag; **die eigene Tabelle zeigt das Gegenteil** (94,86 % vs. 95,32 %).
Das Kalibrierungsbild ist die stärkste öffentliche Fremdevidenz für TypeSafes RLCD-These: **N = 33.735, ECE 1,74 Prozentpunkte**, 10 gleich breite Bins, Wilson-95-%-Intervalle; Einzel-Benches laut Autor 0,266,96 pp. Der Gesamtlauf kostete laut Grafik **$0,6999 geschätzt für Jev** gegenüber **$12,9865 API-gemeldet für Terra** — **18,55×**, also trägt die Rundung „~18ד.
## Grenzen
- Kein öffentliches Eval-Repository, keine Prompts, Seeds, Beispieldateien oder Run-Logs; die Benchmarks wurden hier **nicht reproduziert**.
- Jev-Kosten sind aus aufgezeichneten Input-Token × $0,042/MTok geschätzt; Terra-Kosten API-gemeldet. Der Vergleich ist plausibel, aber nicht symmetrisch instrumentiert.
- `reasoning=none` isoliert sinnvoll die System-1-Frage, misst aber nicht Terras übliche maximale Produktleistung.
- Öffentliche Standardbenchmarks können Trainingskontamination enthalten. Der Autor nimmt Übertragbarkeit an und verweist nur auf die Anbieteraussage, öffentliche Benches nicht zu priorisieren.
- Geschwindigkeit wurde **nicht** gemessen. Der Test bestätigt weder 70500 ms noch die 193,6×-Herstellerzahl.
- 18,55× Kostenvorteil ist erheblich, bestätigt aber nicht die Hersteller-Obergrenze von 400444,6×.
## Verwandte Wiki-Seiten
- [[../concepts/llm/system-one-models-jev.md]] — Modell, Anbieter-Evals und unabhängige Prüfungen
- [[gabriel-anhaia.md]] — Kritik an den anbietererzeugten Referenzlabels
- [[mike-taylor.md]] — früher Jev-Einzeltest bei Every
- [[../institutions/typesafe-ai.md]] — Anbieter