knowledge-base/wiki/people/n8-programs.md

3 KiB
Raw Permalink Blame History

created updated sources tags
2026-09-22 2026-09-22
other/2026-09-17_reddit-n8-jev-terra-benchmark.md
person
n8-programs
n8python
johns-hopkins
benchmarks
jev
calibration

N8 Programs

N8 Programs (@N8Programs, GitHub N8python) beschreibt sich als Student der angewandten Mathematik und Statistik an der Johns Hopkins University sowie der In-Context-Learning-Forschung am Intelligence Amplification Lab. Ein bürgerlicher Name ist im ausgewerteten Profil nicht angegeben.

Jev-vs.-Terra-Benchmark (16.09.2026)

N8 Programs veröffentlichte den ersten breiteren, quantitativ dokumentierten Fremdvergleich von TypeSafes Jev gegen GPT-5.6 Terra: neun Multiple-Choice-Bedingungen, Terra mit reasoning=none und Letter-only-Ausgabe, dazu Kosten- und Kalibrierungsdiagramme. Ein Reddit-Repost am 17.09. wurde am 22.09. von Pit Weber geteilt.

Der Vergleich stützt eine enge Terra-Tier-Aussage: Über die neun heterogenen Bedingungen liegt der ungewichtete Makromittelwert fast gleichauf (Jev 80,69 %, Terra 80,15 %). Dahinter stecken verschiedene Profile:

  • Jev vorn: MMLU (+3,02 Pp), GPQA Diamond (+12,12), ARC-Easy (+0,51), ARC-Challenge (+0,85), WinoGrande (+12,94).
  • Terra vorn: HellaSwag (+0,46), GSM8K mit 4 Optionen (+8,04), GSM8K mit 10 Optionen (+15,24), Schach (+0,80).
  • Der Threadtext sagt, Jev übertreffe Terra auch auf HellaSwag; die eigene Tabelle zeigt das Gegenteil (94,86 % vs. 95,32 %).

Das Kalibrierungsbild ist die stärkste öffentliche Fremdevidenz für TypeSafes RLCD-These: N = 33.735, ECE 1,74 Prozentpunkte, 10 gleich breite Bins, Wilson-95-%-Intervalle; Einzel-Benches laut Autor 0,266,96 pp. Der Gesamtlauf kostete laut Grafik $0,6999 geschätzt für Jev gegenüber $12,9865 API-gemeldet für Terra18,55×, also trägt die Rundung „~18ד.

Grenzen

  • Kein öffentliches Eval-Repository, keine Prompts, Seeds, Beispieldateien oder Run-Logs; die Benchmarks wurden hier nicht reproduziert.
  • Jev-Kosten sind aus aufgezeichneten Input-Token × $0,042/MTok geschätzt; Terra-Kosten API-gemeldet. Der Vergleich ist plausibel, aber nicht symmetrisch instrumentiert.
  • reasoning=none isoliert sinnvoll die System-1-Frage, misst aber nicht Terras übliche maximale Produktleistung.
  • Öffentliche Standardbenchmarks können Trainingskontamination enthalten. Der Autor nimmt Übertragbarkeit an und verweist nur auf die Anbieteraussage, öffentliche Benches nicht zu priorisieren.
  • Geschwindigkeit wurde nicht gemessen. Der Test bestätigt weder 70500 ms noch die 193,6×-Herstellerzahl.
  • 18,55× Kostenvorteil ist erheblich, bestätigt aber nicht die Hersteller-Obergrenze von 400444,6×.

Verwandte Wiki-Seiten