knowledge-base/wiki/people/n8-programs.md

38 lines
3 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-09-22
updated: 2026-09-22
sources: [other/2026-09-17_reddit-n8-jev-terra-benchmark.md]
tags: [person, n8-programs, n8python, johns-hopkins, benchmarks, jev, calibration]
---
# N8 Programs
**N8 Programs** ([@N8Programs](https://x.com/N8Programs), GitHub [N8python](https://github.com/N8python)) beschreibt sich als Student der angewandten Mathematik und Statistik an der [Johns Hopkins University](https://www.jhu.edu/) sowie der In-Context-Learning-Forschung am Intelligence Amplification Lab. Ein bürgerlicher Name ist im ausgewerteten Profil nicht angegeben.
## Jev-vs.-Terra-Benchmark (16.09.2026)
N8 Programs veröffentlichte den ersten breiteren, quantitativ dokumentierten Fremdvergleich von TypeSafes Jev gegen GPT-5.6 Terra: neun Multiple-Choice-Bedingungen, Terra mit `reasoning=none` und Letter-only-Ausgabe, dazu Kosten- und Kalibrierungsdiagramme. Ein Reddit-Repost am 17.09. wurde am 22.09. von Pit Weber geteilt.
Der Vergleich stützt eine **enge** Terra-Tier-Aussage: Über die neun heterogenen Bedingungen liegt der ungewichtete Makromittelwert fast gleichauf (**Jev 80,69 %, Terra 80,15 %**). Dahinter stecken verschiedene Profile:
- Jev vorn: MMLU (+3,02 Pp), GPQA Diamond (+12,12), ARC-Easy (+0,51), ARC-Challenge (+0,85), WinoGrande (+12,94).
- Terra vorn: HellaSwag (+0,46), GSM8K mit 4 Optionen (+8,04), GSM8K mit 10 Optionen (+15,24), Schach (+0,80).
- Der Threadtext sagt, Jev übertreffe Terra auch auf HellaSwag; **die eigene Tabelle zeigt das Gegenteil** (94,86 % vs. 95,32 %).
Das Kalibrierungsbild ist die stärkste öffentliche Fremdevidenz für TypeSafes RLCD-These: **N = 33.735, ECE 1,74 Prozentpunkte**, 10 gleich breite Bins, Wilson-95-%-Intervalle; Einzel-Benches laut Autor 0,266,96 pp. Der Gesamtlauf kostete laut Grafik **$0,6999 geschätzt für Jev** gegenüber **$12,9865 API-gemeldet für Terra** — **18,55×**, also trägt die Rundung „~18ד.
## Grenzen
- Kein öffentliches Eval-Repository, keine Prompts, Seeds, Beispieldateien oder Run-Logs; die Benchmarks wurden hier **nicht reproduziert**.
- Jev-Kosten sind aus aufgezeichneten Input-Token × $0,042/MTok geschätzt; Terra-Kosten API-gemeldet. Der Vergleich ist plausibel, aber nicht symmetrisch instrumentiert.
- `reasoning=none` isoliert sinnvoll die System-1-Frage, misst aber nicht Terras übliche maximale Produktleistung.
- Öffentliche Standardbenchmarks können Trainingskontamination enthalten. Der Autor nimmt Übertragbarkeit an und verweist nur auf die Anbieteraussage, öffentliche Benches nicht zu priorisieren.
- Geschwindigkeit wurde **nicht** gemessen. Der Test bestätigt weder 70500 ms noch die 193,6×-Herstellerzahl.
- 18,55× Kostenvorteil ist erheblich, bestätigt aber nicht die Hersteller-Obergrenze von 400444,6×.
## Verwandte Wiki-Seiten
- [[../concepts/llm/system-one-models-jev.md]] — Modell, Anbieter-Evals und unabhängige Prüfungen
- [[gabriel-anhaia.md]] — Kritik an den anbietererzeugten Referenzlabels
- [[mike-taylor.md]] — früher Jev-Einzeltest bei Every
- [[../institutions/typesafe-ai.md]] — Anbieter