ingest(other): add N8 Jev-vs-Terra benchmark
This commit is contained in:
parent
99ee29dc02
commit
a12ef1a312
5 changed files with 187 additions and 5 deletions
90
raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md
Normal file
90
raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md
Normal file
|
|
@ -0,0 +1,90 @@
|
||||||
|
---
|
||||||
|
type: other
|
||||||
|
source_url: https://www.reddit.com/r/ProAI/comments/1wik66s/tested_typesafeai_s_claim_that_their_new_model/
|
||||||
|
retrieved: 2026-09-22
|
||||||
|
title: "N8 Programs: Jev vs. GPT-5.6 Terra auf System-1-Benchmarks"
|
||||||
|
author: "N8 Programs (@N8Programs); Reddit-Repost von /u/stealthispost"
|
||||||
|
tags: [reddit, xpost, typesafe-ai, jev, gpt-5-6-terra, benchmark, system-one, calibration, ece, cost]
|
||||||
|
---
|
||||||
|
|
||||||
|
# N8 Programs — Jev vs. GPT-5.6 Terra (Reddit-Repost, 17.09.2026)
|
||||||
|
|
||||||
|
## Quellenkette
|
||||||
|
|
||||||
|
- **Geteilter Reddit-Post:** https://www.reddit.com/r/ProAI/comments/1wik66s/tested_typesafeai_s_claim_that_their_new_model/
|
||||||
|
- **Reddit-Autor:** `/u/stealthispost`
|
||||||
|
- **Reddit-Zeitpunkt laut RSS:** 17.09.2026, 04:44 UTC
|
||||||
|
- **Reddit-Zugriff:** normale Seite/JSON blockiert; `.rss` liefert HTTP 200 und den vollständigen Posttext.
|
||||||
|
- **Upstream-Thread:** N8 Programs ([@N8Programs](https://x.com/N8Programs)), beginnend https://x.com/N8Programs/status/2100088523403432357, 16.09.2026 05:04 UTC.
|
||||||
|
- **Upstream-Autorprofil:** „Studying Applied Mathematics and Statistics at @JohnsHopkins. Studying In-Context Learning at The Intelligence Amplification Lab.“; GitHub https://github.com/N8python.
|
||||||
|
- **Abruf 22.09.2026:** Ausgangspost 179.846 Views, 907 Likes, 70 Reposts, 29 Quotes; keine Community Note (FxTwitter).
|
||||||
|
|
||||||
|
## Wortlaut des Ausgangsposts
|
||||||
|
|
||||||
|
> Tested @typesafeai's claim that their new model Jev delivered "comparable... intelligence" to GPT-5.6 Terra on "System 1" tasks. To do this, I compare both models on multiple-choice benchmarks (MMLU, GPQA, etc.). Set reasoning=none for Terra for sys 1. Result: Jev is Terra-tier.
|
||||||
|
|
||||||
|
Der Reddit-Repost zitiert außerdem den Folgetext:
|
||||||
|
|
||||||
|
> Jev's performance on knowledge benchmarks like MMLU and GPQA is highly impressive - especially for a non-COT model. It exceeds Terra at other linguistic reasoning tasks like WinoGrande or HellaSwag as well. It only loses substantially on math reasoning. […] Jev is ~18x cheaper than Terra! […] expected calibration error is 1.74 percentage points averaged across benches - its 0.26pp at best and 6.96pp at worst.
|
||||||
|
|
||||||
|
## Methode laut Thread und Bildern
|
||||||
|
|
||||||
|
- Multiple-Choice-Benchmarks auf gemeinsamer 0–100-%-Skala.
|
||||||
|
- Terra: `reasoning=none`, „letter-only output“; beim Schach ausdrückliche `a/b/c/d`-Instruktion.
|
||||||
|
- Benchmarks: MMLU, GPQA Diamond, ARC-Easy, ARC-Challenge, WinoGrande, HellaSwag, GSM8K mit 4 bzw. 10 Auswahlmöglichkeiten, Schach mit 4 legalen Zügen.
|
||||||
|
- Die Radar-Grafik trägt den Untertitel „Official benchmark comparison“ und den Hinweis: „Each spoke is one benchmark condition. Polygon area is not an aggregate score.“
|
||||||
|
- Kein öffentliches Repository, keine Prompts, Beispieldateien oder Run-Logs im Thread verlinkt.
|
||||||
|
|
||||||
|
## Ergebnistabelle (aus Thread-Bild abgelesen)
|
||||||
|
|
||||||
|
| Benchmark | Jev | Terra |
|
||||||
|
|---|---:|---:|
|
||||||
|
| MMLU | 90,91 % | 87,89 % |
|
||||||
|
| GPQA Diamond | 68,18 % | 56,06 % |
|
||||||
|
| ARC-Easy | 99,33 % | 98,82 % |
|
||||||
|
| ARC-Challenge | 97,61 % | 96,76 % |
|
||||||
|
| WinoGrande | 91,63 % | 78,69 % |
|
||||||
|
| HellaSwag | 94,86 % | **95,32 %** |
|
||||||
|
| GSM8K · 4 choices | 79,68 % | **87,72 %** |
|
||||||
|
| GSM8K · 10 choices | 54,59 % | **69,83 %** |
|
||||||
|
| Chess · 4 legal moves | 49,45 % | **50,25 %** |
|
||||||
|
|
||||||
|
Hinweis: Der Text sagt, Jev übertreffe Terra bei „WinoGrande **or HellaSwag**“. Die veröffentlichte Tabelle zeigt bei HellaSwag **Terra 95,32 % vor Jev 94,86 %**.
|
||||||
|
|
||||||
|
## Kosten (aus Thread-Bild abgelesen)
|
||||||
|
|
||||||
|
Titel: „Evaluation cost: Jev vs. Terra — Canonical benchmark runs · USD“.
|
||||||
|
|
||||||
|
| Benchmark | Jev (estimated) | Terra (reported) |
|
||||||
|
|---|---:|---:|
|
||||||
|
| MMLU | $0,2749 | $4,6387 |
|
||||||
|
| GPQA Diamond | $0,0048 | $0,1106 |
|
||||||
|
| ARC-Easy | $0,0411 | $0,5427 |
|
||||||
|
| ARC-Challenge | $0,0207 | $0,2897 |
|
||||||
|
| WinoGrande | $0,0197 | $0,2652 |
|
||||||
|
| HellaSwag | $0,2315 | $4,9176 |
|
||||||
|
| GSM8K · 4 choices | $0,0247 | $0,3815 |
|
||||||
|
| GSM8K · 10 choices | $0,0321 | $0,4663 |
|
||||||
|
| Chess · 4 legal moves | $0,0504 | $1,3741 |
|
||||||
|
| **Gesamt** | **$0,6999** | **$12,9865** |
|
||||||
|
|
||||||
|
Fußnoten im Bild:
|
||||||
|
|
||||||
|
- Jev: „recorded input tokens × $0.042/million; output free.“
|
||||||
|
- Terra: „summed API-reported costs. Auxiliary runs excluded.“
|
||||||
|
|
||||||
|
## Kalibrierung (aus Thread-Bild abgelesen)
|
||||||
|
|
||||||
|
Reliability-Diagramm „Jev reliability diagram“:
|
||||||
|
|
||||||
|
- **N = 33.735**
|
||||||
|
- **ECE = 1,74 Prozentpunkte**
|
||||||
|
- 10 gleich breite Bins
|
||||||
|
- Wilson-95-%-Konfidenzintervalle
|
||||||
|
- Textangabe des Autors: beste Einzel-Bench **0,26 pp**, schlechteste **6,96 pp**.
|
||||||
|
|
||||||
|
## Weitere Thread-Aussagen
|
||||||
|
|
||||||
|
- N8 Programs beschreibt Jev als günstigen Kandidaten für ungefähr „one Terra forward pass over a context“.
|
||||||
|
- Frontier-Modelle wie Astra hätten vermutlich bessere No-CoT-Fähigkeiten, seien für Massenklassifikation aber zu teuer.
|
||||||
|
- Schlussurteil: Jev sei „exactly what it says on the tin“, unter der Annahme, dass öffentliche Benchmarks in Alltagsaufgaben übertragen und nicht gezielt trainiert wurden.
|
||||||
|
|
@ -1,13 +1,13 @@
|
||||||
---
|
---
|
||||||
created: 2026-09-17
|
created: 2026-09-17
|
||||||
updated: 2026-09-18
|
updated: 2026-09-22
|
||||||
sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, blog/2026-09-16_theregister-typesafe-jev-doom.md, blog/2026-09-16_vercel-jev-ai-gateway.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, xpost/2026-09-15_almeida-jev-launch-post.md, youtube/2026-09-18_berman-jev.md, youtube/2026-09-19_nate-herk-jev-12-use-cases.md, other/2026-09-17_typesafe-workflow-evals.md, blog/2026-09-17_devto-jev-vs-luna-bake-off.md, other/2026-09-18_typesafe-docs-jev-spezifikation.md, xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md, youtube/2026-09-18_gary-explains-jev-caveat.md]
|
sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, blog/2026-09-16_theregister-typesafe-jev-doom.md, blog/2026-09-16_vercel-jev-ai-gateway.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, xpost/2026-09-15_almeida-jev-launch-post.md, youtube/2026-09-18_berman-jev.md, youtube/2026-09-19_nate-herk-jev-12-use-cases.md, other/2026-09-17_typesafe-workflow-evals.md, other/2026-09-17_reddit-n8-jev-terra-benchmark.md, blog/2026-09-17_devto-jev-vs-luna-bake-off.md, other/2026-09-18_typesafe-docs-jev-spezifikation.md, xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md, youtube/2026-09-18_gary-explains-jev-caveat.md]
|
||||||
tags: [concept, llm, typesafe, jev, system-one-models, rlcd, structured-outputs, calibrated-decisions, parallel-sampling, inference-cost, automation, harness]
|
tags: [concept, llm, typesafe, jev, system-one-models, rlcd, structured-outputs, calibrated-decisions, parallel-sampling, inference-cost, automation, harness]
|
||||||
---
|
---
|
||||||
|
|
||||||
# System One Models & Jev (TypeSafe AI)
|
# System One Models & Jev (TypeSafe AI)
|
||||||
|
|
||||||
> **Quelle:** TypeSafe-Ankündigungsartikel von Diogo Almeida (15.09.2026, https://typesafe.ai/blog/introducing-system-one-models-and-jev) + unabhängiger Test von Mike Taylor in Every (15.09.2026) + Video-Zusammenfassung von AI Copium (17.09.2026). Primärquelle = Anbieter; die unabhängige Prüfung ist ein Einzeltest mit kleinem Stichprobenumfang.
|
> **Quellenbasis:** TypeSafe-Ankündigungsartikel von Diogo Almeida (15.09.2026, https://typesafe.ai/blog/introducing-system-one-models-and-jev), Anbieter-Workflow-Evals, Every-Einzeltest von Mike Taylor sowie der unabhängige System-1-Benchmark von [[../../people/n8-programs.md|N8 Programs]] gegen GPT-5.6 Terra. Anbieterangaben und Fremdmessungen bleiben getrennt; keine der Fremdmessungen ist vollständig reproduzierbar veröffentlicht.
|
||||||
|
|
||||||
## Kernidee
|
## Kernidee
|
||||||
|
|
||||||
|
|
@ -70,6 +70,39 @@ Jev verpasste in allen drei Runs dieselbe Passage („a shared appointment calen
|
||||||
|
|
||||||
**Was der Test nicht zeigt:** Breite über Branchen und Aufgabentypen. Der Autor sagt es selbst; die Zahl der Grundfälle ist einstellig.
|
**Was der Test nicht zeigt:** Breite über Branchen und Aufgabentypen. Der Autor sagt es selbst; die Zahl der Grundfälle ist einstellig.
|
||||||
|
|
||||||
|
## Unabhängiger Benchmark gegen GPT-5.6 Terra (N8 Programs, 16.09.2026)
|
||||||
|
|
||||||
|
**[[../../people/n8-programs.md|N8 Programs]]** prüfte TypeSafes Behauptung „vergleichbare Intelligenz“ auf neun Multiple-Choice-Bedingungen. Terra lief mit `reasoning=none` und Letter-only-Ausgabe; damit isoliert der Vergleich bewusst einen einzelnen Forward Pass statt Terras Reasoning-Modus. Quelle: [X-Thread](https://x.com/N8Programs/status/2100088523403432357), geteilt als [r/ProAI-Repost](https://www.reddit.com/r/ProAI/comments/1wik66s/tested_typesafeai_s_claim_that_their_new_model/); Raw: `raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md`.
|
||||||
|
|
||||||
|
| Benchmark | Jev | Terra | Differenz Jev−Terra |
|
||||||
|
|---|---:|---:|---:|
|
||||||
|
| MMLU | **90,91 %** | 87,89 % | +3,02 Pp |
|
||||||
|
| GPQA Diamond | **68,18 %** | 56,06 % | +12,12 Pp |
|
||||||
|
| ARC-Easy | **99,33 %** | 98,82 % | +0,51 Pp |
|
||||||
|
| ARC-Challenge | **97,61 %** | 96,76 % | +0,85 Pp |
|
||||||
|
| WinoGrande | **91,63 %** | 78,69 % | +12,94 Pp |
|
||||||
|
| HellaSwag | 94,86 % | **95,32 %** | −0,46 Pp |
|
||||||
|
| GSM8K · 4 Optionen | 79,68 % | **87,72 %** | −8,04 Pp |
|
||||||
|
| GSM8K · 10 Optionen | 54,59 % | **69,83 %** | −15,24 Pp |
|
||||||
|
| Schach · 4 legale Züge | 49,45 % | **50,25 %** | −0,80 Pp |
|
||||||
|
| **Ungewichteter Makromittelwert** | **80,69 %** | **80,15 %** | **+0,54 Pp** |
|
||||||
|
|
||||||
|
**Was „Terra-tier“ hier trägt:** Im Makromittel über diese neun heterogenen Bedingungen liegen beide fast gleichauf. Das Profil ist aber klar verschieden: Jev gewinnt Wissen/Commonsense, Terra gewinnt Mathematik; Schach ist praktisch Gleichstand. Der Threadtext behauptet zusätzlich einen Jev-Sieg auf HellaSwag — **seine eigene Tabelle widerspricht** (Terra +0,46 Pp).
|
||||||
|
|
||||||
|
### Kalibrierung und Kosten
|
||||||
|
|
||||||
|
Das Reliability-Diagramm umfasst **33.735 Entscheidungen**, zehn gleich breite Bins und Wilson-95-%-Konfidenzintervalle. Gemeldet werden **ECE 1,74 Prozentpunkte** im Aggregat und 0,26–6,96 Pp je Einzel-Benchmark. Das ist die bislang stärkste öffentliche Fremdevidenz für TypeSafes RLCD-Versprechen — deutlich belastbarer als die anbietererzeugten Workflow-Labels, aber keine Reproduktion.
|
||||||
|
|
||||||
|
Die Kosten summieren sich im Bild auf **$0,6999 für Jev** und **$12,9865 für Terra**: **18,55× günstiger**, N8 rundet korrekt auf „~18ד. Jev ist als „estimated“ ausgewiesen (aufgezeichnete Input-Token × $0,042/MTok, Output frei), Terra als API-„reported“. Der Test bestätigt damit einen deutlichen Kostenvorteil, **nicht** die Hersteller-Obergrenze von 400–444,6×. Geschwindigkeit wurde überhaupt nicht gemessen.
|
||||||
|
|
||||||
|
### Belastbarkeitsgrenzen
|
||||||
|
|
||||||
|
- Kein öffentliches Eval-Repository, keine Prompts, Seeds, Beispieldateien oder Run-Logs; die Resultate wurden hier nicht reproduziert.
|
||||||
|
- `reasoning=none` ist für die System-1-Frage fair, aber kein Vergleich der maximalen Produktleistung.
|
||||||
|
- Öffentliche Standardbenchmarks tragen Kontaminationsrisiko. Der Autor nimmt Übertragbarkeit an, weil TypeSafe öffentliche Benches nach eigener Aussage nicht priorisiere.
|
||||||
|
- Das gepoolte ECE kann Unterschiede zwischen Aufgaben verdecken; die 6,96-Pp-Spitze zeigt bereits Streuung.
|
||||||
|
- Die Grafik nennt sich „Official benchmark comparison“, stammt aber aus einem **unabhängigen persönlichen Test**, nicht von einer Benchmark-Organisation.
|
||||||
|
|
||||||
## Benchmark-Lage (Anbieter-Evals, lokal gelesen 18.09.2026)
|
## Benchmark-Lage (Anbieter-Evals, lokal gelesen 18.09.2026)
|
||||||
|
|
||||||
Die Genauigkeitszahlen, die seit dem Launch zitiert werden, stammen von **[evals.typesafe.ai](https://evals.typesafe.ai/)** (HTTP 200, Text extrahierbar; Raw: `raw/other/2026-09-17_typesafe-workflow-evals.md`). Vier Workflows (Security Incidents, Agent Trace Observability, Invoice Processing, Customer Service), je Modell zwei Ausführungen: **workflow** (strukturierter Harness) vs. **prompt** (alles in einem Prompt).
|
Die Genauigkeitszahlen, die seit dem Launch zitiert werden, stammen von **[evals.typesafe.ai](https://evals.typesafe.ai/)** (HTTP 200, Text extrahierbar; Raw: `raw/other/2026-09-17_typesafe-workflow-evals.md`). Vier Workflows (Security Incidents, Agent Trace Observability, Invoice Processing, Customer Service), je Modell zwei Ausführungen: **workflow** (strukturierter Harness) vs. **prompt** (alles in einem Prompt).
|
||||||
|
|
|
||||||
|
|
@ -2,7 +2,8 @@
|
||||||
|
|
||||||
*Auto-generated: 2026-07-07*
|
*Auto-generated: 2026-07-07*
|
||||||
|
|
||||||
*Letzte Aktualisierung: 2026-09-22 (237. Update — Grok 4.7 + Grok-Bot-Praxis + ART19-Podcast. **Primärquellen:** [xAI Release](https://x.ai/news/grok-4-7), [API-Modellkarte](https://docs.x.ai/developers/models/grok-4.7), [Cursor-Modellseite](https://cursor.com/docs/models/grok-4-7). Grok 4.7: größerer Basismodell-Kern, längeres RL auf schwierigen mehrstündigen Aufgaben, stärkere Selbstprüfung, natives Grok-Bot-Harness-Verständnis; Modell-ID `grok-4.7`, 500k API-Kontext, Reasoning `low|medium|high|xhigh`; API <200k Prompt $2/M Input · $0,50/M Cached · $6/M Output, ab 200k $4/$1/$12. Herstellerbenchmarks u. a. CursorBench 46,3 %, DeepSWE 71,0 %, Terminal-Bench 38,0 % — **nicht unabhängig reproduziert**. @cb_doge-Post primär gegengeprüft; „twice as fast and half the price“ bleibt dessen Verdichtung. Alex Finns Video (14:06, geteilt von Pit): kein Transcript abrufbar; Workflow nur attribuiert aus YouTube-AI-Zusammenfassung + Herman-Auswertung (PM/Developer/Designer, Exec-Team, Linear/Notion-Issues, Cursor Cloud Agents). Zusätzlich Netbits’ ART19-MP3 als Voll-Ingest: „Grok AI Daily“, 21.09., 29:30, lokales Maschinen-ASR; allgemeiner Newsrecap zu Meta Muse, Cyber-/Safety-Claims, US–China, Trump und Newsom — **kein Grok 4.7**, Grok Bot nur beiläufig. Wiki: `institutions/grok-ai-daily.md` (neu); Updates `institutions/xai.md`, `tools/grok-bot-spacexai.md`, `concepts/llm/llm-model-catalog.md`, `concepts/policy/ai-regulation-2026.md`. Raw: 4 neue Einträge in blog/xpost/youtube/podcast.)*
|
*Letzte Aktualisierung: 2026-09-22 (238. Update — Unabhängiger Jev-vs.-GPT-5.6-Terra-Benchmark von N8 Programs, geteilt als r/ProAI-Repost. **Quelle vollständig aufgelöst:** Reddit-RSS (17.09., normale Seite/JSON blockiert) → [X-Thread](https://x.com/N8Programs/status/2100088523403432357) (16.09.; 179.846 Views beim Abruf) → vier Originalgrafiken lokal gelesen. **Methode:** neun Multiple-Choice-Bedingungen; Terra `reasoning=none`, Letter-only. **Resultate:** Jev gewinnt MMLU 90,91:87,89, GPQA 68,18:56,06, ARC-Easy/Challenge knapp und WinoGrande 91,63:78,69; Terra gewinnt HellaSwag 95,32:94,86, GSM8K deutlich (87,72:79,68 bzw. 69,83:54,59) und Schach knapp 50,25:49,45. Ungewichteter Makromittelwert **Jev 80,69 % · Terra 80,15 %** → „Terra-tier“ trägt eng für diesen Test, nicht als allgemeine Intelligenzbehauptung. **Korrektur des Threadtexts:** Er behauptet einen Jev-Sieg auf HellaSwag; die eigene Tabelle zeigt Terra +0,46 Pp. **Kalibrierung:** N=33.735, ECE **1,74 Pp**, 10 Bins, Wilson-95-%-Intervalle, Einzelbenches 0,26–6,96 Pp — stärkste öffentliche Fremdevidenz für RLCD bisher. **Kosten:** Jev $0,6999 (estimated: Input-Token × $0,042/MTok) vs. Terra $12,9865 (API-reported) = **18,55×**; die ~18×-Rundung hält, die Hersteller-Obergrenze 400–444,6× nicht. **Nicht geprüft:** Geschwindigkeit; kein Repo, keine Prompts/Seeds/Logs, keine Reproduktion, Kontaminationsrisiko öffentlicher Benches. Wiki: `people/n8-programs.md` (neu), `concepts/llm/system-one-models-jev.md` (neuer unabhängiger Benchmark-Abschnitt). Raw: `raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md` (neu).)*
|
||||||
|
*Vorherige Aktualisierung: 2026-09-22 (237. Update — Grok 4.7 + Grok-Bot-Praxis + ART19-Podcast. **Primärquellen:** [xAI Release](https://x.ai/news/grok-4-7), [API-Modellkarte](https://docs.x.ai/developers/models/grok-4.7), [Cursor-Modellseite](https://cursor.com/docs/models/grok-4-7). Grok 4.7: größerer Basismodell-Kern, längeres RL auf schwierigen mehrstündigen Aufgaben, stärkere Selbstprüfung, natives Grok-Bot-Harness-Verständnis; Modell-ID `grok-4.7`, 500k API-Kontext, Reasoning `low|medium|high|xhigh`; API <200k Prompt $2/M Input · $0,50/M Cached · $6/M Output, ab 200k $4/$1/$12. Herstellerbenchmarks u. a. CursorBench 46,3 %, DeepSWE 71,0 %, Terminal-Bench 38,0 % — **nicht unabhängig reproduziert**. @cb_doge-Post primär gegengeprüft; „twice as fast and half the price“ bleibt dessen Verdichtung. Alex Finns Video (14:06, geteilt von Pit): kein Transcript abrufbar; Workflow nur attribuiert aus YouTube-AI-Zusammenfassung + Herman-Auswertung (PM/Developer/Designer, Exec-Team, Linear/Notion-Issues, Cursor Cloud Agents). Zusätzlich Netbits’ ART19-MP3 als Voll-Ingest: „Grok AI Daily“, 21.09., 29:30, lokales Maschinen-ASR; allgemeiner Newsrecap zu Meta Muse, Cyber-/Safety-Claims, US–China, Trump und Newsom — **kein Grok 4.7**, Grok Bot nur beiläufig. Wiki: `institutions/grok-ai-daily.md` (neu); Updates `institutions/xai.md`, `tools/grok-bot-spacexai.md`, `concepts/llm/llm-model-catalog.md`, `concepts/policy/ai-regulation-2026.md`. Raw: 4 neue Einträge in blog/xpost/youtube/podcast.)*
|
||||||
*Vorherige Aktualisierung: 2026-09-20 (236. Update — Gebrauchtmarkt DDR4: der Zweitmarkt-Anker schließt die Rechnung. Anlass: Nachtrag zur Leo-2-These (235. Update) — die entscheidende Zahl für „altes DDR4 weiterverwenden“ war der **Zweitmarkt**, und der fehlte. **Quelle:** [DIMMsum](https://dimmsum.com/ddr4/64gb-2666-rdimm) (Tracker laufender eBay-Listings), abgerufen 20.09.2026; Zweitquelle [ITLD Server-RAM/SSD-Marktupdate 2026](https://itldc.com/en/blog/server-ram-ssd-market-update-2026). **Werte:** 64 GB DDR4 RDIMM (2666, PC4-21300) gebraucht **~$325–550/Modul ≈ $5–8,50/GB**; günstigste Listings ab ~$326, **Median ~$545**; Lots (4×64 GB) bis **~$5/GB**; 3200 MHz/Marken/Neuzustand oft $400–600+, Refurbished/NOS $295–550. Preistreiber: Speed, Rank, Marke (Samsung/Micron/SK Hynix), Zustand, Verkäufer. ITLD: Server-Speicher-**Kontraktpreise +93–98 % QoQ (Q1 2026)**, **+58–63 % (Q2)**; 64-GB-DDR4-RDIMM im August auf dem **2,5–3,5-Fachen** des Januar-Niveaus; Gebrauchtpreise ebenfalls steigend (+4–30 % MoM bei Consumer-Kits), aber weiterhin „a relative bargain“; DDR4 punktuell **mit Aufpreis pro Bit gegenüber DDR5**; Angebot knapp bis 2027. **Befund (Kern, Einordnung):** **~$5–8,50/GB gebraucht gegen ~$29/GB neu** (abgeleiteter DDR5-RDIMM) = **rund 3–5× pro Gigabyte** — bei etwa **halber Bandbreite** (DDR4-2666 ≈ 21,3 GB/s pro Kanal gegen DDR5-4800/5600 ≈ 38–45 GB/s). Der Controller monetarisiert damit nicht billigen DRAM, sondern **Zugang zum Zweitmarkt** — und der Neukauf-Pfad ist sogar der teurere (neues DDR4 $84,43 vs. neues DDR5 $56,11 pro Die). ⚠️ **Angebotspreise, keine Transaktionspreise**; keine öffentlichen Volumendaten. Ein früherer Stand (kein öffentlicher Gebraucht-Tracker für DDR4) ist überholt — DIMMsum existiert. Wiki: `concepts/hardware/gaming-hardwarekrise-ai-speicher.md` (neuer Abschnitt „Der Zweitmarkt schließt die Rechnung“), `institutions/astera-labs.md` (TCO-Zahl), `concepts/hardware/ai-infrastruktur-custom-silicon.md` (Preisachse ergänzt). Raw: `raw/other/2026-09-20_ddr4-gebrauchtmarkt-dimmsum.md` (neu — eigener Raw-Eintrag, bestehender Spot-Snapshot bleibt unangetastet).*
|
*Vorherige Aktualisierung: 2026-09-20 (236. Update — Gebrauchtmarkt DDR4: der Zweitmarkt-Anker schließt die Rechnung. Anlass: Nachtrag zur Leo-2-These (235. Update) — die entscheidende Zahl für „altes DDR4 weiterverwenden“ war der **Zweitmarkt**, und der fehlte. **Quelle:** [DIMMsum](https://dimmsum.com/ddr4/64gb-2666-rdimm) (Tracker laufender eBay-Listings), abgerufen 20.09.2026; Zweitquelle [ITLD Server-RAM/SSD-Marktupdate 2026](https://itldc.com/en/blog/server-ram-ssd-market-update-2026). **Werte:** 64 GB DDR4 RDIMM (2666, PC4-21300) gebraucht **~$325–550/Modul ≈ $5–8,50/GB**; günstigste Listings ab ~$326, **Median ~$545**; Lots (4×64 GB) bis **~$5/GB**; 3200 MHz/Marken/Neuzustand oft $400–600+, Refurbished/NOS $295–550. Preistreiber: Speed, Rank, Marke (Samsung/Micron/SK Hynix), Zustand, Verkäufer. ITLD: Server-Speicher-**Kontraktpreise +93–98 % QoQ (Q1 2026)**, **+58–63 % (Q2)**; 64-GB-DDR4-RDIMM im August auf dem **2,5–3,5-Fachen** des Januar-Niveaus; Gebrauchtpreise ebenfalls steigend (+4–30 % MoM bei Consumer-Kits), aber weiterhin „a relative bargain“; DDR4 punktuell **mit Aufpreis pro Bit gegenüber DDR5**; Angebot knapp bis 2027. **Befund (Kern, Einordnung):** **~$5–8,50/GB gebraucht gegen ~$29/GB neu** (abgeleiteter DDR5-RDIMM) = **rund 3–5× pro Gigabyte** — bei etwa **halber Bandbreite** (DDR4-2666 ≈ 21,3 GB/s pro Kanal gegen DDR5-4800/5600 ≈ 38–45 GB/s). Der Controller monetarisiert damit nicht billigen DRAM, sondern **Zugang zum Zweitmarkt** — und der Neukauf-Pfad ist sogar der teurere (neues DDR4 $84,43 vs. neues DDR5 $56,11 pro Die). ⚠️ **Angebotspreise, keine Transaktionspreise**; keine öffentlichen Volumendaten. Ein früherer Stand (kein öffentlicher Gebraucht-Tracker für DDR4) ist überholt — DIMMsum existiert. Wiki: `concepts/hardware/gaming-hardwarekrise-ai-speicher.md` (neuer Abschnitt „Der Zweitmarkt schließt die Rechnung“), `institutions/astera-labs.md` (TCO-Zahl), `concepts/hardware/ai-infrastruktur-custom-silicon.md` (Preisachse ergänzt). Raw: `raw/other/2026-09-20_ddr4-gebrauchtmarkt-dimmsum.md` (neu — eigener Raw-Eintrag, bestehender Spot-Snapshot bleibt unangetastet).*
|
||||||
*Vorherige Aktualisierung: 2026-09-20 (235. Update — DRAM-Spotpreise: DDR4 ist pro Die teurer als DDR5 — Beleg für die Leo-2-These. Anlass: Eine Rückfrage im OME Topic „Theorie-Bildung" zu den ungefähren Kosten der „altes DDR4 weiterverwenden"-Idee (Astera Labs Leo 2, aus dem TechTechPotato-Ingest vom selben Tag). **Vorgehen:** beide Tracker-Seiten direkt abgerufen (nicht über Suchzusammenfassungen) — [MemoryIndex DDR5](https://memoryindex.io/ddr5-price), [DDR4](https://memoryindex.io/ddr4-price), [Methodik](https://memoryindex.io/methodology); Seitenkopf „Live · 2026-09-20 00:00Z", Spot-Basis **DRAMeXchange / TrendForce, gemeldet 17.09.2026**. **Werte (USD/Die):** DDR5 16Gb 4800/5600 **$56.11** (+6,38 % 30T, **+480 % YoY**); DDR5 16Gb eTT **$24.55** (+0,36 %, +330 %); DDR4 16Gb 3200 **$84.43** (+4,85 %, **+690 %**); DDR4 8Gb 3200 **$45.59** (+6,41 %, **+860 %**); DDR5 RDIMM 64GB **$1.857/Modul** (+4,47 %, +455 %, **derived** aus Die-Spot +~6 % Modulaufschlag, kein öffentlicher Modulausdruck). Balances: DDR5-Basket 30T +14,23 % / YoY +331,67 %, DDR4-Basket 30T +4,49 % / YoY +563,00 %. **Befund (Kern):** Die DDR4/DDR5-Inversion — der abgekündigte Knoten ist **pro Die teurer** als die neue Generation, und seine Jahresveränderung ist steiler. **Konsequenz (Einordnung, nicht Quelle):** Die „altes DDR4 weiterverwenden"-These trägt **nicht über den Neukauf**, sondern ausschließlich über den **Zweitmarkt** aus stillgelegten Servern — genau das monetarisiert ein CXL-Controller. **Zweite Quelle:** [ServeTheHome zu Leo 2 / Leo X](https://www.servethehome.com/astera-labs-releases-leo-2-cxl-memory-controllers-and-leo-x-controller-for-rackscale-fabric-attached-memory/) (abgerufen 20.09.2026) liefert die Technik nach: PCIe Gen6/CXL 3.2, 2→4 Kanäle, bis **768 GB DDR4** bzw. **4 TB DDR5** pro Expander, 4-Kanal-**3DPC**-Board mit **12 DDR4-DIMMs**, Leo X fabric-attached über Scorpio (KV-Caching, Anbieterangabe 62 % TTFT / 22 % Durchsatz), **keine Preise genannt**, Vorgänger **Marvell Structera**. RAS (Hardware-Testmuster je DIMM, Soft-ECC über Hardware-ECC) als Voraussetzung der Wiederverwendung. ⚠️ Spot-/derived-Niveaus, keine Vertragspreise; Momentaufnahme; Intraday-Reihen laut Anbieter-Methodik rückwärts gerechnet. Wiki: `wiki/institutions/astera-labs.md` (neu); Updates `concepts/hardware/gaming-hardwarekrise-ai-speicher.md` (Preis-Anker + Inversions-Analyse), `concepts/hardware/ai-infrastruktur-custom-silicon.md` (Nachtrag Leo 2 + Preisachse). Raw: `raw/other/2026-09-20_dram-spotpreise-memoryindex.md` (neu).*
|
*Vorherige Aktualisierung: 2026-09-20 (235. Update — DRAM-Spotpreise: DDR4 ist pro Die teurer als DDR5 — Beleg für die Leo-2-These. Anlass: Eine Rückfrage im OME Topic „Theorie-Bildung" zu den ungefähren Kosten der „altes DDR4 weiterverwenden"-Idee (Astera Labs Leo 2, aus dem TechTechPotato-Ingest vom selben Tag). **Vorgehen:** beide Tracker-Seiten direkt abgerufen (nicht über Suchzusammenfassungen) — [MemoryIndex DDR5](https://memoryindex.io/ddr5-price), [DDR4](https://memoryindex.io/ddr4-price), [Methodik](https://memoryindex.io/methodology); Seitenkopf „Live · 2026-09-20 00:00Z", Spot-Basis **DRAMeXchange / TrendForce, gemeldet 17.09.2026**. **Werte (USD/Die):** DDR5 16Gb 4800/5600 **$56.11** (+6,38 % 30T, **+480 % YoY**); DDR5 16Gb eTT **$24.55** (+0,36 %, +330 %); DDR4 16Gb 3200 **$84.43** (+4,85 %, **+690 %**); DDR4 8Gb 3200 **$45.59** (+6,41 %, **+860 %**); DDR5 RDIMM 64GB **$1.857/Modul** (+4,47 %, +455 %, **derived** aus Die-Spot +~6 % Modulaufschlag, kein öffentlicher Modulausdruck). Balances: DDR5-Basket 30T +14,23 % / YoY +331,67 %, DDR4-Basket 30T +4,49 % / YoY +563,00 %. **Befund (Kern):** Die DDR4/DDR5-Inversion — der abgekündigte Knoten ist **pro Die teurer** als die neue Generation, und seine Jahresveränderung ist steiler. **Konsequenz (Einordnung, nicht Quelle):** Die „altes DDR4 weiterverwenden"-These trägt **nicht über den Neukauf**, sondern ausschließlich über den **Zweitmarkt** aus stillgelegten Servern — genau das monetarisiert ein CXL-Controller. **Zweite Quelle:** [ServeTheHome zu Leo 2 / Leo X](https://www.servethehome.com/astera-labs-releases-leo-2-cxl-memory-controllers-and-leo-x-controller-for-rackscale-fabric-attached-memory/) (abgerufen 20.09.2026) liefert die Technik nach: PCIe Gen6/CXL 3.2, 2→4 Kanäle, bis **768 GB DDR4** bzw. **4 TB DDR5** pro Expander, 4-Kanal-**3DPC**-Board mit **12 DDR4-DIMMs**, Leo X fabric-attached über Scorpio (KV-Caching, Anbieterangabe 62 % TTFT / 22 % Durchsatz), **keine Preise genannt**, Vorgänger **Marvell Structera**. RAS (Hardware-Testmuster je DIMM, Soft-ECC über Hardware-ECC) als Voraussetzung der Wiederverwendung. ⚠️ Spot-/derived-Niveaus, keine Vertragspreise; Momentaufnahme; Intraday-Reihen laut Anbieter-Methodik rückwärts gerechnet. Wiki: `wiki/institutions/astera-labs.md` (neu); Updates `concepts/hardware/gaming-hardwarekrise-ai-speicher.md` (Preis-Anker + Inversions-Analyse), `concepts/hardware/ai-infrastruktur-custom-silicon.md` (Nachtrag Leo 2 + Preisachse). Raw: `raw/other/2026-09-20_dram-spotpreise-memoryindex.md` (neu).*
|
||||||
*Vorherige Aktualisierung: 2026-09-20 (234. Update — AI-Infrastruktur-Silizium: Custom-Silicon-Welle, Edge-Racks und DDR4-Weiterverwendung. Anlass: YouTube-Link https://www.youtube.com/watch?v=31_eeq3ciRA von Netbits in OME Topic „Theorie-Bildung" (20.09.2026) mit dem Kommentar, die Idee sei gut; der geteilte Zeitsprung `t=10m` landet im Kapitel „[09:26] Astera Labs Leo 2". **Quelle:** TechTechPotato (Host Dr. Ian Cutress, More Than Moore), „Using Your Older DDR4 // The Silicon Notebook E2", **52.330 Aufrufe** beim Abruf, **kein Transkript** (keine `captionTracks`), **keine Dauer** im Seiten-JSON. Inhalt ausschließlich aus Beschreibung + 12 Kapitelmarken: AI Infrastructure Summit Tag 2 unter dem Leitmotiv „everyone building their own silicon" — Qualcomm **AlphaWave**, Broadcom **Tomahawk 6** (17.000 Pins), **portables Sechs-Slot-Rack** (Giga.io) und die Frage „wer kauft Edge-Racks", d-Matrix **Corsair/Pavehawk** + **NVLink-Vereinbarung**, Lightning (gestapelter DRAM), Mango Boost + Credo, **Astera Labs Leo 2 — DDR4 und DDR5 in einem System auf einer Next-Gen-Intel-CPU**, SiFive/**RISC-V**, Ayar Labs/**Co-Packaged Optics**. **Disclosure aus der Beschreibung:** More Than Moore erbringt/erbrachte bezahlte Forschung, Analyse, Beratung oder Consulting für AMD, Arm, Ayar Labs, Broadcom-nahe Firmen, IBM, Intel, MediaTek, NVIDIA, Qualcomm, SiFive, TSMC, Tenstorrent u. a. **Einordnung:** Der Titel greift (Speicherpreis-Engpass macht DDR4-Weiterverwendung zur Strategie), aber alle Stationen sind Kanal-Framing — das Video bündelt eine Marktbewegung, die in `concepts/hardware/` schon belegt ist. Wiki: `concepts/hardware/ai-infrastruktur-custom-silicon.md` (neu), `institutions/more-than-moore.md` (neu), `people/ian-cutress.md` (neu); Updates `concepts/hardware/gaming-hardwarekrise-ai-speicher.md`, `concepts/hardware/china-local-ai-box.md`. Raw: `raw/youtube/2026-09-20_techtechpotato-silicon-notebook-e2.md` (neu, metadata-only).*
|
*Vorherige Aktualisierung: 2026-09-20 (234. Update — AI-Infrastruktur-Silizium: Custom-Silicon-Welle, Edge-Racks und DDR4-Weiterverwendung. Anlass: YouTube-Link https://www.youtube.com/watch?v=31_eeq3ciRA von Netbits in OME Topic „Theorie-Bildung" (20.09.2026) mit dem Kommentar, die Idee sei gut; der geteilte Zeitsprung `t=10m` landet im Kapitel „[09:26] Astera Labs Leo 2". **Quelle:** TechTechPotato (Host Dr. Ian Cutress, More Than Moore), „Using Your Older DDR4 // The Silicon Notebook E2", **52.330 Aufrufe** beim Abruf, **kein Transkript** (keine `captionTracks`), **keine Dauer** im Seiten-JSON. Inhalt ausschließlich aus Beschreibung + 12 Kapitelmarken: AI Infrastructure Summit Tag 2 unter dem Leitmotiv „everyone building their own silicon" — Qualcomm **AlphaWave**, Broadcom **Tomahawk 6** (17.000 Pins), **portables Sechs-Slot-Rack** (Giga.io) und die Frage „wer kauft Edge-Racks", d-Matrix **Corsair/Pavehawk** + **NVLink-Vereinbarung**, Lightning (gestapelter DRAM), Mango Boost + Credo, **Astera Labs Leo 2 — DDR4 und DDR5 in einem System auf einer Next-Gen-Intel-CPU**, SiFive/**RISC-V**, Ayar Labs/**Co-Packaged Optics**. **Disclosure aus der Beschreibung:** More Than Moore erbringt/erbrachte bezahlte Forschung, Analyse, Beratung oder Consulting für AMD, Arm, Ayar Labs, Broadcom-nahe Firmen, IBM, Intel, MediaTek, NVIDIA, Qualcomm, SiFive, TSMC, Tenstorrent u. a. **Einordnung:** Der Titel greift (Speicherpreis-Engpass macht DDR4-Weiterverwendung zur Strategie), aber alle Stationen sind Kanal-Framing — das Video bündelt eine Marktbewegung, die in `concepts/hardware/` schon belegt ist. Wiki: `concepts/hardware/ai-infrastruktur-custom-silicon.md` (neu), `institutions/more-than-moore.md` (neu), `people/ian-cutress.md` (neu); Updates `concepts/hardware/gaming-hardwarekrise-ai-speicher.md`, `concepts/hardware/china-local-ai-box.md`. Raw: `raw/youtube/2026-09-20_techtechpotato-silicon-notebook-e2.md` (neu, metadata-only).*
|
||||||
|
|
@ -242,7 +243,7 @@
|
||||||
| [Ox Alpha — Anonymes KI-Modell auf OpenRouter](concepts/llm/ox-alpha-anonymous-model.md) | Gerücht/Leak (2026-08-22, Insider leak of the day): mysteriöses anonymes Modell auf OpenRouter — 1M-Token-Kontext, multimodal, kein Owner — soll beim Coding Claude Fable 5 + GPT-5.6 Sol schlagen. GLM-identischer Tokenizer; vier vorherige anonyme Drops von chinesischen Labs beansprucht. Offene Herkunfts-Frage (Google vs. Z.ai). **Update 26.08. (EP106):** exakte Listing-Zahlen datiert auf 21.08.: 1.048.576 Kontext / 4.096 Max-Output, Stealth-Positionierung als Agentic-Coding-Reasoning-Modell, Capability-Beschreibung bricht mitten im Satz ab; read-heavy-Agent-Pipeline-Einordnung; Widerspruch zum 131k-Output-Gegencheck offen. ⚠️ Unbestätigt | xpost/2026-08-23_insiderleak-ox-alpha-anonymous-model.md + podcast/2026-08-26_agentstack-daily-ep106.md |
|
| [Ox Alpha — Anonymes KI-Modell auf OpenRouter](concepts/llm/ox-alpha-anonymous-model.md) | Gerücht/Leak (2026-08-22, Insider leak of the day): mysteriöses anonymes Modell auf OpenRouter — 1M-Token-Kontext, multimodal, kein Owner — soll beim Coding Claude Fable 5 + GPT-5.6 Sol schlagen. GLM-identischer Tokenizer; vier vorherige anonyme Drops von chinesischen Labs beansprucht. Offene Herkunfts-Frage (Google vs. Z.ai). **Update 26.08. (EP106):** exakte Listing-Zahlen datiert auf 21.08.: 1.048.576 Kontext / 4.096 Max-Output, Stealth-Positionierung als Agentic-Coding-Reasoning-Modell, Capability-Beschreibung bricht mitten im Satz ab; read-heavy-Agent-Pipeline-Einordnung; Widerspruch zum 131k-Output-Gegencheck offen. ⚠️ Unbestätigt | xpost/2026-08-23_insiderleak-ox-alpha-anonymous-model.md + podcast/2026-08-26_agentstack-daily-ep106.md |
|
||||||
| [Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density"](concepts/llm/qwen3.8-27b-alibaba.md) | HuggingFace-Release (Countdown bis 14.08.2026, 4.928 wartend). Kompaktes 27B-Modell der Qwen3.8-Generation mit "unmatched intelligence density". Kontrast zum 2.4T-MoE von Qwen 3.8. Lokal-relevant (27B läuft auf Consumer-HW). Release am selben Tag wie GLM-5.3-Review — chinesischer Release-Zyklus. **Update 18.08.:** jetzt auf Ollama lauffähig (`ollama run qwen3.8:27b`), dichte 27,8B-Architektur, Hybrid-Attention, 262k-Kontext (bis 1M via YaRN), multimodal, MTP-markierte Ollama-Tags für Inferenz-Speedup. **Update 19.08.:** DFlash 2 (Z Lab → Inco AI) erreicht 70 tok/s auf M5 Max MacBook Pro — bis 4,6× schneller als autoregressives Decoding via Speculative Decoding (Jun Song: „biggest breakthrough in local AI this year", nächste Innovation in Prefill/Gewichtskompression). Uncensored-Debatte: gregpr07 („no gates") vs. s1gmoid-Gegenposition (Verhältnismäßigkeit). **Update 20.08.:** Unsloth Dynamic 3.0-GGUFs für Qwen3.8-27B — neue UD-…-Dateien deutlich kleiner (UD-IQ1_S 6,2 GB bis Q6_K 22 GB), Qualität-zu-Größe verbessert, ≠ MTP/Speculative-Decoding. **Update 26.08. (EP106):** HF-Trending-Stand 21.08.: 11.836 Likes, 1.726.651 Downloads (>1,7 Mio), image-text-to-text, SafeTensors, Apache 2.0 | other/2026-08-14_qwen3.8-27b-huggingface-release.md + youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md + xpost/2026-08-19_junsong-dflash2-speculative-decoding.md + xpost/2026-08-19_gregpr07-qwen38-uncensored.md + xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md + podcast/2026-08-26_agentstack-daily-ep106.md |
|
| [Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density"](concepts/llm/qwen3.8-27b-alibaba.md) | HuggingFace-Release (Countdown bis 14.08.2026, 4.928 wartend). Kompaktes 27B-Modell der Qwen3.8-Generation mit "unmatched intelligence density". Kontrast zum 2.4T-MoE von Qwen 3.8. Lokal-relevant (27B läuft auf Consumer-HW). Release am selben Tag wie GLM-5.3-Review — chinesischer Release-Zyklus. **Update 18.08.:** jetzt auf Ollama lauffähig (`ollama run qwen3.8:27b`), dichte 27,8B-Architektur, Hybrid-Attention, 262k-Kontext (bis 1M via YaRN), multimodal, MTP-markierte Ollama-Tags für Inferenz-Speedup. **Update 19.08.:** DFlash 2 (Z Lab → Inco AI) erreicht 70 tok/s auf M5 Max MacBook Pro — bis 4,6× schneller als autoregressives Decoding via Speculative Decoding (Jun Song: „biggest breakthrough in local AI this year", nächste Innovation in Prefill/Gewichtskompression). Uncensored-Debatte: gregpr07 („no gates") vs. s1gmoid-Gegenposition (Verhältnismäßigkeit). **Update 20.08.:** Unsloth Dynamic 3.0-GGUFs für Qwen3.8-27B — neue UD-…-Dateien deutlich kleiner (UD-IQ1_S 6,2 GB bis Q6_K 22 GB), Qualität-zu-Größe verbessert, ≠ MTP/Speculative-Decoding. **Update 26.08. (EP106):** HF-Trending-Stand 21.08.: 11.836 Likes, 1.726.651 Downloads (>1,7 Mio), image-text-to-text, SafeTensors, Apache 2.0 | other/2026-08-14_qwen3.8-27b-huggingface-release.md + youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md + xpost/2026-08-19_junsong-dflash2-speculative-decoding.md + xpost/2026-08-19_gregpr07-qwen38-uncensored.md + xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md + podcast/2026-08-26_agentstack-daily-ep106.md |
|
||||||
| [Qwen 3.8-Flash-Next — Vorschau auf Qwen 4](concepts/llm/qwen3.8-flash-next-qwen4-preview.md) | Ankündigung (Stand 26.08., Release „noch diese Woche"): multimodales 125B-MoE mit ~6B aktiven Parametern pro Token (+51B N-Gramm-Embedding-Parameter), vom Qwen-Team explizit als **Architektur-Vorschau auf Qwen 4** gerahmt, kein fertiges Produkt. Claim laut NVIDIA-Developer-Forum: Qwen-3.7-Plus-Niveau bei ~1/9 der Trainingskosten, Stärke Coding. ⚠️ Keine Benchmarks publiziert, Parameterzahlen unverifiziert. Kontext: Alibabas 10,2 Mrd USD Aktienplatzierung (größte HK-Folgeemission, ~3× überzeichnet) für full-stack-AI-Infrastruktur | other/2026-08-26_qwen38-flash-next-qwen4-preview.md |
|
| [Qwen 3.8-Flash-Next — Vorschau auf Qwen 4](concepts/llm/qwen3.8-flash-next-qwen4-preview.md) | Ankündigung (Stand 26.08., Release „noch diese Woche"): multimodales 125B-MoE mit ~6B aktiven Parametern pro Token (+51B N-Gramm-Embedding-Parameter), vom Qwen-Team explizit als **Architektur-Vorschau auf Qwen 4** gerahmt, kein fertiges Produkt. Claim laut NVIDIA-Developer-Forum: Qwen-3.7-Plus-Niveau bei ~1/9 der Trainingskosten, Stärke Coding. ⚠️ Keine Benchmarks publiziert, Parameterzahlen unverifiziert. Kontext: Alibabas 10,2 Mrd USD Aktienplatzierung (größte HK-Folgeemission, ~3× überzeichnet) für full-stack-AI-Infrastruktur | other/2026-08-26_qwen38-flash-next-qwen4-preview.md |
|
||||||
| [System One Models & Jev (TypeSafe AI)](concepts/llm/system-one-models-jev.md) | Neue Modellklasse **für Maschinen statt Menschen**: kein Text, sondern typisierte probabilistische Entscheidungen („smart if-statements"), **RLCD** statt RLHF/RLVR, **paralleles** statt sequenzielles Sampling. Anbieterangaben: 70–500 ms End-to-end, Input $0,042/MTok, Output $0, **193,6× schneller / 444,6× günstiger**. „Zero Hallucinations" = Type-Safety (kein Formatfehler, keine erfundene Option) — **keine** Wahrheitsgarantie, das Modell kann die falsche Option wählen. Einziger Fremdtest (Every, 15.09.): 777 Judgments in 0,7 s für einen Viertelcent; gegen Claude Fable 5.1 ~25× schneller und ~580× günstiger, aber 6-von-7 statt 7-von-7 Defekten. Gründer **Diogo Almeida** (InstructGPT-Mitautor, ex-OpenAI/Google Brain); Firma unabhängig von OpenAI. ⚠️ Architektur/Training/Datenherkunft nicht veröffentlicht | youtube/2026-09-17_aicopium-typesafe-jev.md + blog/2026-09-15_typesafe-system-one-models-jev.md + blog/2026-09-15_every-mike-taylor-jev-vibe-check.md |
|
| [System One Models & Jev (TypeSafe AI)](concepts/llm/system-one-models-jev.md) | Neue Modellklasse **für Maschinen statt Menschen**: kein Text, sondern typisierte probabilistische Entscheidungen („smart if-statements"), **RLCD** statt RLHF/RLVR, **paralleles** statt sequenzielles Sampling. Anbieterangaben: 70–500 ms End-to-end, Input $0,042/MTok, Output $0, **193,6× schneller / 444,6× günstiger**. „Zero Hallucinations" = Type-Safety (kein Formatfehler, keine erfundene Option) — **keine** Wahrheitsgarantie, das Modell kann die falsche Option wählen. Einziger Fremdtest (Every, 15.09.): 777 Judgments in 0,7 s für einen Viertelcent; gegen Claude Fable 5.1 ~25× schneller und ~580× günstiger, aber 6-von-7 statt 7-von-7 Defekten. Gründer **Diogo Almeida** (InstructGPT-Mitautor, ex-OpenAI/Google Brain); Firma unabhängig von OpenAI. **Unabhängiger N8-Benchmark gegen Terra (`reasoning=none`):** Makro 80,69 % vs. 80,15 %; Jev vorn bei MMLU/GPQA/WinoGrande, Terra bei GSM8K; Kalibrierung N=33.735/ECE 1,74 Pp; Kosten 18,55× statt Hersteller-Obergrenze 400–444,6×. ⚠️ Kein Repo/Prompts/Logs, nicht reproduziert; Threadtext widerspricht eigener HellaSwag-Tabelle. ⚠️ Architektur/Training/Datenherkunft nicht veröffentlicht | youtube/2026-09-17_aicopium-typesafe-jev.md + blog/2026-09-15_typesafe-system-one-models-jev.md + blog/2026-09-15_every-mike-taylor-jev-vibe-check.md |
|
||||||
| [Jev über den Vercel AI Gateway](concepts/llm/jev-vercel-ai-gateway.md) | **Verteilung statt Waitlist:** Jev läuft seit **16.09.2026** im [Vercel AI Gateway](institutions/vercel.md) unter `typesafe-ai/jev` — AI SDK 7.0.105+, `experimental evaluate`, Frage-Typen **Choice/Score/Boolean**, ein `state` + Map benannter `questions`, Confidence unter `providerMetadata.typesafe.confidence`, **Zero Data Retention / No Training** per Request, Abrechnung gegen Gateway-Budgets. Gateway-Preis **$0.04/1M Input** (gerundet; TypeSafe: $0,042). Anlass: Startup-Ideen-Post von [Greg Isenberg](people/greg-isenberg.md) mit sieben Geschäftsideen („find an expensive queue and put Jev at the front of it"). ⚠️ „1.700 E-Mails für 18 Cent" ohne Token-Aufschlüsselung/Datensatz, „94 %" nur Illustration, Leistungszahlen von Vercel als TypeSafe-Angabe weitergegeben | xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md + blog/2026-09-16_vercel-jev-ai-gateway.md |
|
| [Jev über den Vercel AI Gateway](concepts/llm/jev-vercel-ai-gateway.md) | **Verteilung statt Waitlist:** Jev läuft seit **16.09.2026** im [Vercel AI Gateway](institutions/vercel.md) unter `typesafe-ai/jev` — AI SDK 7.0.105+, `experimental evaluate`, Frage-Typen **Choice/Score/Boolean**, ein `state` + Map benannter `questions`, Confidence unter `providerMetadata.typesafe.confidence`, **Zero Data Retention / No Training** per Request, Abrechnung gegen Gateway-Budgets. Gateway-Preis **$0.04/1M Input** (gerundet; TypeSafe: $0,042). Anlass: Startup-Ideen-Post von [Greg Isenberg](people/greg-isenberg.md) mit sieben Geschäftsideen („find an expensive queue and put Jev at the front of it"). ⚠️ „1.700 E-Mails für 18 Cent" ohne Token-Aufschlüsselung/Datensatz, „94 %" nur Illustration, Leistungszahlen von Vercel als TypeSafe-Angabe weitergegeben | xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md + blog/2026-09-16_vercel-jev-ai-gateway.md |
|
||||||
| [Jev in der Praxis — Demo-Urteile](concepts/llm/jev-praxis-demos.md) | **Die Bauprojekt-Welle (16.–18.09.2026)** als Ersatz-Evidenz, solange keine unabhängigen Benchmarks existieren: Wikipedia-Races und Doom ([Matthew Berman](people/matthew-berman.md)), Kleinstadt-Simulation, Skittles-Sortierung, **[Schach-Blitz gegen Frontier-LLMs](https://x.com/aimlapi/status/2100372930282573876)** ([AI/ML API](institutions/ai-ml-api.md): Jev materiell unterlegen, **gewinnt auf Zeit** gegen Fable 5.1 — ~2,6 s vs. 6–15 s pro Zug; Matt in 18 Zügen gegen GPT-6 Astra), „Unclutter"-Ad-Blocker ([kitze](people/kitze.md)), Jev-Modellrouter ([Riley Brown](people/riley-brown.md)). Kernbefund: Der **Schleifen-Slot ohne Sprachmodell** ist real, Geschwindigkeit schlägt Qualität pro Zug — aber nur wo Zeit die Metrik ist. ⚠️ Alle Demos selbstveröffentlicht, kein Aufbau veröffentlicht; viralster Post („rebuilt Tesla FSD", [Justin Schroeder](people/justin-schroeder.md), 568.108 Views) ist der inhaltsleerste | youtube/2026-09-18_berman-jev.md + xpost/2026-09-15_almeida-jev-launch-post.md |
|
| [Jev in der Praxis — Demo-Urteile](concepts/llm/jev-praxis-demos.md) | **Die Bauprojekt-Welle (16.–18.09.2026)** als Ersatz-Evidenz, solange keine unabhängigen Benchmarks existieren: Wikipedia-Races und Doom ([Matthew Berman](people/matthew-berman.md)), Kleinstadt-Simulation, Skittles-Sortierung, **[Schach-Blitz gegen Frontier-LLMs](https://x.com/aimlapi/status/2100372930282573876)** ([AI/ML API](institutions/ai-ml-api.md): Jev materiell unterlegen, **gewinnt auf Zeit** gegen Fable 5.1 — ~2,6 s vs. 6–15 s pro Zug; Matt in 18 Zügen gegen GPT-6 Astra), „Unclutter"-Ad-Blocker ([kitze](people/kitze.md)), Jev-Modellrouter ([Riley Brown](people/riley-brown.md)). Kernbefund: Der **Schleifen-Slot ohne Sprachmodell** ist real, Geschwindigkeit schlägt Qualität pro Zug — aber nur wo Zeit die Metrik ist. ⚠️ Alle Demos selbstveröffentlicht, kein Aufbau veröffentlicht; viralster Post („rebuilt Tesla FSD", [Justin Schroeder](people/justin-schroeder.md), 568.108 Views) ist der inhaltsleerste | youtube/2026-09-18_berman-jev.md + xpost/2026-09-15_almeida-jev-launch-post.md |
|
||||||
| [Sprachsteuerung als Computer-Use — Jev als Desktop-Agent](concepts/agents/jev-sprachsteuerung-computer-use.md) | **Demo 18.09.2026, lokal ausgewertet** ([Andy Gao](people/andy-gao.md), 563 Follower, aber 139.442 Views): Sprechbefehl → Desktop-Aktion (Notes → Notiz → Arc → Google „Norbert Wiener" → x.com → Photo Booth). **Am Material bestätigt:** Zielzustände sichtbar, während das Live-Transkript-Overlay noch unvollständig ist — die belastbarste Einzelaussage der Demo-Welle. Einordnung: Sprache→Absicht ist Klassifikation (Jev-Slot), Absicht→Desktop ist klassische Automatisierung und **der eigentliche Fehlerort**; ein lokales STT mit Schlüsselwort-Matching würde dieselben Bilder erzeugen. ⚠️ Keine Messung, kein Code, nur trivial skriptbare Apps | xpost/2026-09-18_andy-gao-jev-voice-computer-use.md |
|
| [Sprachsteuerung als Computer-Use — Jev als Desktop-Agent](concepts/agents/jev-sprachsteuerung-computer-use.md) | **Demo 18.09.2026, lokal ausgewertet** ([Andy Gao](people/andy-gao.md), 563 Follower, aber 139.442 Views): Sprechbefehl → Desktop-Aktion (Notes → Notiz → Arc → Google „Norbert Wiener" → x.com → Photo Booth). **Am Material bestätigt:** Zielzustände sichtbar, während das Live-Transkript-Overlay noch unvollständig ist — die belastbarste Einzelaussage der Demo-Welle. Einordnung: Sprache→Absicht ist Klassifikation (Jev-Slot), Absicht→Desktop ist klassische Automatisierung und **der eigentliche Fehlerort**; ein lokales STT mit Schlüsselwort-Matching würde dieselben Bilder erzeugen. ⚠️ Keine Messung, kein Code, nur trivial skriptbare Apps | xpost/2026-09-18_andy-gao-jev-voice-computer-use.md |
|
||||||
|
|
@ -461,6 +462,7 @@
|
||||||
| [Andy Gao](people/andy-gao.md) | Entwickler (@instantricecook, **563 Follower**, verifiziert, gao.haus): „I built a voice controlled computer-use for my mac using @typesafeai's Jev" (18.09.2026, **139.442 Views** — Reichweite aus dem Thema, nicht aus dem Account). Erster Demo-Erbauer, dessen Material eine **visuelle Prüfung der Kernaussage** zulässt (STT + 9 Standbilder). ⚠️ Keine Beziehung zu TypeSafe bekannt, kein Code | xpost/2026-09-18_andy-gao-jev-voice-computer-use.md |
|
| [Andy Gao](people/andy-gao.md) | Entwickler (@instantricecook, **563 Follower**, verifiziert, gao.haus): „I built a voice controlled computer-use for my mac using @typesafeai's Jev" (18.09.2026, **139.442 Views** — Reichweite aus dem Thema, nicht aus dem Account). Erster Demo-Erbauer, dessen Material eine **visuelle Prüfung der Kernaussage** zulässt (STT + 9 Standbilder). ⚠️ Keine Beziehung zu TypeSafe bekannt, kein Code | xpost/2026-09-18_andy-gao-jev-voice-computer-use.md |
|
||||||
| [CJ Zafir](people/cj-zafir.md) | Entwickler (@cjzafir, **64.375 Follower**, verifiziert), Bio „I fine-tune small language models (SLMs) and beat large language models". **Erfahrungsbericht zu Jev** (18.09.2026, 33.238 Views): „I burned **$3.40 on Jev in 24 hours**" — erster Ausgabenwert aus echter Nutzung (≈81 Mio. Input-Token, ~19 Postfach-Durchläufe). Kern „**Jev + LLMs**" (System-1-Controller für Routing, Tool-Wahl, Scoring) trägt; ⚠️ zwei Punkte überzeichnet („lernt aus einem Prompt" = Konfiguration; „32k → 1M wird RAG reparieren" — Doku kennt 64k/32k, kein 1M). Eigeninteresse: kleine Modelle | xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md |
|
| [CJ Zafir](people/cj-zafir.md) | Entwickler (@cjzafir, **64.375 Follower**, verifiziert), Bio „I fine-tune small language models (SLMs) and beat large language models". **Erfahrungsbericht zu Jev** (18.09.2026, 33.238 Views): „I burned **$3.40 on Jev in 24 hours**" — erster Ausgabenwert aus echter Nutzung (≈81 Mio. Input-Token, ~19 Postfach-Durchläufe). Kern „**Jev + LLMs**" (System-1-Controller für Routing, Tool-Wahl, Scoring) trägt; ⚠️ zwei Punkte überzeichnet („lernt aus einem Prompt" = Konfiguration; „32k → 1M wird RAG reparieren" — Doku kennt 64k/32k, kein 1M). Eigeninteresse: kleine Modelle | xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md |
|
||||||
| [Nate Herk](people/nate-herk.md) | Betreiber von **Nate Herk \| AI Automation** (@nateherk), Fokus Automatisierungsworkflows (AI Automation Society, X @nateherk). **Praktikerebene zu Jev** (19.09.2026, 13.549 Aufrufe, ~16:08, kein Transkript): zwölf Anwendungsfälle, Live-Builds (X-Feed-Classifier, Paper-Trading-Prototyp), Kostenvergleich gegen LLM-Workflow. Seine Kostenwerte **passen zum Preismodell** (siehe `concepts/llm/jev-praxis-demos.md`); Laufzeiten liegen teils am dokumentierten Rate Limit (offene Frage). Empfehlung: **Evals mit Golden Dataset** vor Produktiveinsatz — deckt sich mit Anhaias Label-Kritik und Zafirs „Jev + LLMs". ⚠️ Beschreibung mit werblichen Elementen | youtube/2026-09-19_nate-herk-jev-12-use-cases.md |
|
| [Nate Herk](people/nate-herk.md) | Betreiber von **Nate Herk \| AI Automation** (@nateherk), Fokus Automatisierungsworkflows (AI Automation Society, X @nateherk). **Praktikerebene zu Jev** (19.09.2026, 13.549 Aufrufe, ~16:08, kein Transkript): zwölf Anwendungsfälle, Live-Builds (X-Feed-Classifier, Paper-Trading-Prototyp), Kostenvergleich gegen LLM-Workflow. Seine Kostenwerte **passen zum Preismodell** (siehe `concepts/llm/jev-praxis-demos.md`); Laufzeiten liegen teils am dokumentierten Rate Limit (offene Frage). Empfehlung: **Evals mit Golden Dataset** vor Produktiveinsatz — deckt sich mit Anhaias Label-Kritik und Zafirs „Jev + LLMs". ⚠️ Beschreibung mit werblichen Elementen | youtube/2026-09-19_nate-herk-jev-12-use-cases.md |
|
||||||
|
| [N8 Programs](people/n8-programs.md) | @N8Programs / GitHub `N8python`; laut Profil Student für angewandte Mathematik/Statistik an Johns Hopkins und In-Context-Learning-Forschung. Veröffentlichte den unabhängigen Jev-vs.-Terra-System-1-Benchmark: neun Multiple-Choice-Bedingungen, Terra `reasoning=none`; Makro nahezu Gleichstand (80,69 % vs. 80,15 %), ECE 1,74 Pp bei N=33.735, Kosten **18,55×** zugunsten Jev. ⚠️ Kein öffentliches Eval-Repo, keine Prompts/Seeds/Logs; HellaSwag-Textclaim widerspricht eigener Tabelle | other/2026-09-17_reddit-n8-jev-terra-benchmark.md |
|
||||||
| [Ryan Vogel](people/ryan-vogel.md) | Entwickler/Unternehmer (@ryanvogel, 18.201 Follower): „ceo of @rebasetv / founding developer @opencode @anomalyco", Standort Florida. Gast der Episode „Jev is HERE. How to use it" bei Greg Isenberg (18.09.2026). Relevanz fürs Wiki v. a. über **OpenCode** (Open-Source-Coding-Agent, Partnermodus von DeepSeek V4.1 Flash). ⚠️ Episode-Inhalt nicht ausgewertet; Rebase-TV-Selbstbeschreibung ungeprüft | xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md |
|
| [Ryan Vogel](people/ryan-vogel.md) | Entwickler/Unternehmer (@ryanvogel, 18.201 Follower): „ceo of @rebasetv / founding developer @opencode @anomalyco", Standort Florida. Gast der Episode „Jev is HERE. How to use it" bei Greg Isenberg (18.09.2026). Relevanz fürs Wiki v. a. über **OpenCode** (Open-Source-Coding-Agent, Partnermodus von DeepSeek V4.1 Flash). ⚠️ Episode-Inhalt nicht ausgewertet; Rebase-TV-Selbstbeschreibung ungeprüft | xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md |
|
||||||
|
|
||||||
| [Tom Griffiths](people/tom-griffiths.md) | **Thomas L. Griffiths**, Henry-R.-Luce-Professor für Information Technology, Consciousness and Culture an [Princeton](institutions/princeton.md) (Psychologie + Informatik), Leiter des Computational Cognitive Science Lab; laut Klappentext Leiter des Princeton AI Lab. Australischer Kognitionswissenschaftler, bekannt für **Bayes'sche Modelle der Kognition** und *Algorithms to Live By* (mit Brian Christian, 2016). 2026: **„The Laws of Thought"** (Henry Holt, 10.02.2026, 400 S.; dt. „Die Gesetze des Denkens") — die drei Wege, Denken zu formalisieren: Regeln/Symbole, neuronale Netze, Wahrscheinlichkeit/Statistik. ⚠️ Video-Thesen („AI Researchers Are Wrong") stammen aus der Videobeschreibung, kein Transkript | youtube/2026-09-19_princeton-griffiths-ai-researchers-wrong.md |
|
| [Tom Griffiths](people/tom-griffiths.md) | **Thomas L. Griffiths**, Henry-R.-Luce-Professor für Information Technology, Consciousness and Culture an [Princeton](institutions/princeton.md) (Psychologie + Informatik), Leiter des Computational Cognitive Science Lab; laut Klappentext Leiter des Princeton AI Lab. Australischer Kognitionswissenschaftler, bekannt für **Bayes'sche Modelle der Kognition** und *Algorithms to Live By* (mit Brian Christian, 2016). 2026: **„The Laws of Thought"** (Henry Holt, 10.02.2026, 400 S.; dt. „Die Gesetze des Denkens") — die drei Wege, Denken zu formalisieren: Regeln/Symbole, neuronale Netze, Wahrscheinlichkeit/Statistik. ⚠️ Video-Thesen („AI Researchers Are Wrong") stammen aus der Videobeschreibung, kein Transkript | youtube/2026-09-19_princeton-griffiths-ai-researchers-wrong.md |
|
||||||
|
|
@ -761,6 +763,7 @@
|
||||||
| `raw/blog/2026-09-16_vercel-jev-ai-gateway.md` | blog | Vercel: „TypeSafe AI's Jev now available on AI Gateway" (Changelog 16.09.2026, Taneja/Chen/Zheng) + Modellseite https://vercel.com/ai-gateway/models/jev — **lokal gelesen, HTTP 200**. Modell-ID `typesafe-ai/jev`, Preis `$0.04/1M` Input, AI SDK 7.0.105+, `experimental evaluate`, **Choice/Score/Boolean**, parallele Auswertung, Confidence in `providerMetadata.typesafe.confidence`, ZDR/No-Training per Request, Budgets/Logs. Leistungszahlen (193,6×/444,6×) ausdrücklich als TypeSafe-Angabe. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` (neu), `institutions/vercel.md` (neu) |
|
| `raw/blog/2026-09-16_vercel-jev-ai-gateway.md` | blog | Vercel: „TypeSafe AI's Jev now available on AI Gateway" (Changelog 16.09.2026, Taneja/Chen/Zheng) + Modellseite https://vercel.com/ai-gateway/models/jev — **lokal gelesen, HTTP 200**. Modell-ID `typesafe-ai/jev`, Preis `$0.04/1M` Input, AI SDK 7.0.105+, `experimental evaluate`, **Choice/Score/Boolean**, parallele Auswertung, Confidence in `providerMetadata.typesafe.confidence`, ZDR/No-Training per Request, Budgets/Logs. Leistungszahlen (193,6×/444,6×) ausdrücklich als TypeSafe-Angabe. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` (neu), `institutions/vercel.md` (neu) |
|
||||||
| `raw/youtube/2026-09-18_berman-jev.md` | youtube | Matthew Berman: „We need to talk about Jev..." (https://www.youtube.com/watch?v=2z-7pIj57f8, 18.09.2026, 12:30, 82.291 Views bei Abruf, **„Includes paid promotion"/Sponsor Zapier**; geteilt von Pit in OME Topic „JEV"). **Kein Transcript abrufbar** (yt-dlp Bot-Check, kein `captionTracks`, Firecrawl nur Consent-Seite, Crawl4AI ohne Playwright-Binary, Transkriptdienste 403/522) — auswertbar: Beschreibung, Quellenliste (6 X-Posts, aufgelöst), Titel/Kanal/Aufrufe. Kapitelmarken fehlen. ⚠️ Videoinhalt nur über Sekundärzusammenfassung, nicht verifiziert. Wiki: `concepts/llm/jev-praxis-demos.md` (neu), `people/matthew-berman.md` (neu) |
|
| `raw/youtube/2026-09-18_berman-jev.md` | youtube | Matthew Berman: „We need to talk about Jev..." (https://www.youtube.com/watch?v=2z-7pIj57f8, 18.09.2026, 12:30, 82.291 Views bei Abruf, **„Includes paid promotion"/Sponsor Zapier**; geteilt von Pit in OME Topic „JEV"). **Kein Transcript abrufbar** (yt-dlp Bot-Check, kein `captionTracks`, Firecrawl nur Consent-Seite, Crawl4AI ohne Playwright-Binary, Transkriptdienste 403/522) — auswertbar: Beschreibung, Quellenliste (6 X-Posts, aufgelöst), Titel/Kanal/Aufrufe. Kapitelmarken fehlen. ⚠️ Videoinhalt nur über Sekundärzusammenfassung, nicht verifiziert. Wiki: `concepts/llm/jev-praxis-demos.md` (neu), `people/matthew-berman.md` (neu) |
|
||||||
| `raw/other/2026-09-17_typesafe-workflow-evals.md` | other | TypeSafe **Workflow-Evals** (https://evals.typesafe.ai/, lokal gelesen: 65.008 Byte, Text extrahierbar). Vier Workflows (Security Incidents, Agent Trace, Invoice Processing, Customer Service) × zwei Modi (workflow/prompt), Fragetypen Noul/Choice/Score. Aggregat Jev 67,8 %/$0,0004/0,4 s vs. luna 66,8/terra 67,9/sonnet 5 67,8/**sol 74,1/opus 5 73,1**. Je Workflow 61,7–76,0 %. Referenzlabels = Mittel aus GPT-6 Astra + Fable 5.1; keine Fallzahlen/Rohdaten. Wiki: `concepts/llm/system-one-models-jev.md` |
|
| `raw/other/2026-09-17_typesafe-workflow-evals.md` | other | TypeSafe **Workflow-Evals** (https://evals.typesafe.ai/, lokal gelesen: 65.008 Byte, Text extrahierbar). Vier Workflows (Security Incidents, Agent Trace, Invoice Processing, Customer Service) × zwei Modi (workflow/prompt), Fragetypen Noul/Choice/Score. Aggregat Jev 67,8 %/$0,0004/0,4 s vs. luna 66,8/terra 67,9/sonnet 5 67,8/**sol 74,1/opus 5 73,1**. Je Workflow 61,7–76,0 %. Referenzlabels = Mittel aus GPT-6 Astra + Fable 5.1; keine Fallzahlen/Rohdaten. Wiki: `concepts/llm/system-one-models-jev.md` |
|
||||||
|
| `raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md` | other | r/ProAI-Repost von `/u/stealthispost` (17.09.2026) des X-Threads von [N8 Programs](people/n8-programs.md) (16.09.; 179.846 Views beim Abruf) — Jev vs. GPT-5.6 Terra (`reasoning=none`, Letter-only) auf MMLU, GPQA, ARC, WinoGrande, HellaSwag, GSM8K, Schach. Originalgrafiken lokal gelesen: Makro **80,69 % vs. 80,15 %**; Jev stark bei Wissen/Commonsense, Terra bei Mathe. Reliability-Diagramm **N=33.735, ECE 1,74 Pp**, 10 Bins/Wilson 95 %. Kosten **$0,6999 vs. $12,9865 = 18,55×**. ⚠️ Kein Repo/Prompts/Seeds/Logs; keine Geschwindigkeitsmessung; Jev-Kosten geschätzt, Terra API-gemeldet; Textclaim HellaSwag widerspricht Tabelle. Wiki: `concepts/llm/system-one-models-jev.md`, `people/n8-programs.md` |
|
||||||
| `raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md` | blog | Gabriel Anhaia (17.09.2026): „Jev Beat GPT Luna by 1 Point. GPT-6 and Claude Wrote the Answer Key." — Vercel-`fx`-Reviewer-Wechsel (Rauchg/@fazxes, „~5-18x faster and more accurate", **Benchmark unveröffentlicht**), TypeSafe-Aggregat-Tabelle (gegengeprüft, korrekt), **Label-Kritik** (Reference-Labels aus zwei Frontier-Modellen → gemeinsame Blindflecken werten richtige Abweichler ab; TypeSafe legt Bias selbst offen und nennt die Homepage-Zahl „higher end of real world gains"). Fünf Prüfschritte vor dem Tausch. Wiki: `people/gabriel-anhaia.md` (neu) |
|
| `raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md` | blog | Gabriel Anhaia (17.09.2026): „Jev Beat GPT Luna by 1 Point. GPT-6 and Claude Wrote the Answer Key." — Vercel-`fx`-Reviewer-Wechsel (Rauchg/@fazxes, „~5-18x faster and more accurate", **Benchmark unveröffentlicht**), TypeSafe-Aggregat-Tabelle (gegengeprüft, korrekt), **Label-Kritik** (Reference-Labels aus zwei Frontier-Modellen → gemeinsame Blindflecken werten richtige Abweichler ab; TypeSafe legt Bias selbst offen und nennt die Homepage-Zahl „higher end of real world gains"). Fünf Prüfschritte vor dem Tausch. Wiki: `people/gabriel-anhaia.md` (neu) |
|
||||||
| `raw/other/2026-09-18_herman-briefing-jev-transcript.md` | other | **Herman-Briefing zu Jev** (deutsches Audio-Briefing 09:42 zur Episode „Jev is HERE. How to use it", Isenberg/Vogel), gepostet von Pit in OME Topic „JEV" (18.09.2026 22:38 UTC, mp4 15,3 MB). **STT-Transkript** (Grok STT, de, 8.677 Zeichen) — Volltext + Zahlen-Deckungstabelle. Kernzahlen: 1.700 Mails/4,2 Mio Input-/500k Output-Token/18 US-Cent; ~200 ms/Anfrage; 17 Highlights aus 1,1 Mio Token in ~3 s; Flug Zürich→London in 7,1 s. ⚠️ Dritt-Zusammenfassung, kein Originaltranscript; STT-Fehler dokumentiert. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` |
|
| `raw/other/2026-09-18_herman-briefing-jev-transcript.md` | other | **Herman-Briefing zu Jev** (deutsches Audio-Briefing 09:42 zur Episode „Jev is HERE. How to use it", Isenberg/Vogel), gepostet von Pit in OME Topic „JEV" (18.09.2026 22:38 UTC, mp4 15,3 MB). **STT-Transkript** (Grok STT, de, 8.677 Zeichen) — Volltext + Zahlen-Deckungstabelle. Kernzahlen: 1.700 Mails/4,2 Mio Input-/500k Output-Token/18 US-Cent; ~200 ms/Anfrage; 17 Highlights aus 1,1 Mio Token in ~3 s; Flug Zürich→London in 7,1 s. ⚠️ Dritt-Zusammenfassung, kein Originaltranscript; STT-Fehler dokumentiert. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` |
|
||||||
| `raw/xpost/2026-09-18_andy-gao-jev-voice-computer-use.md` | xpost | Andy Gao (@instantricecook, 563 Follower): „voice controlled computer-use for my mac using @typesafeai's Jev" (https://x.com/instantricecook/status/2100814590300889426, 18.09.2026 05:10 UTC; 139.442 Views / 2.038 Likes; geteilt von Pit in OME Topic „JEV"). **Video lokal ausgewertet:** STT-Transkript (428 Zeichen) + 9 Standbilder; Kette Notes/Notiz/Arc/Google/x.com/Photo Booth; keine Messwerte, kein Terminal im Bild; Kernaussage (App offen vor Satzende) am Overlay belegt. Wiki: `concepts/agents/jev-sprachsteuerung-computer-use.md` (neu), `people/andy-gao.md` (neu) |
|
| `raw/xpost/2026-09-18_andy-gao-jev-voice-computer-use.md` | xpost | Andy Gao (@instantricecook, 563 Follower): „voice controlled computer-use for my mac using @typesafeai's Jev" (https://x.com/instantricecook/status/2100814590300889426, 18.09.2026 05:10 UTC; 139.442 Views / 2.038 Likes; geteilt von Pit in OME Topic „JEV"). **Video lokal ausgewertet:** STT-Transkript (428 Zeichen) + 9 Standbilder; Kette Notes/Notiz/Arc/Google/x.com/Photo Booth; keine Messwerte, kein Terminal im Bild; Kernaussage (App offen vor Satzende) am Overlay belegt. Wiki: `concepts/agents/jev-sprachsteuerung-computer-use.md` (neu), `people/andy-gao.md` (neu) |
|
||||||
|
|
|
||||||
18
wiki/log.md
18
wiki/log.md
|
|
@ -2,6 +2,24 @@
|
||||||
|
|
||||||
*Append-only changelog. Start: 2026-06-05*
|
*Append-only changelog. Start: 2026-06-05*
|
||||||
|
|
||||||
|
## 2026-09-22 — N8 Programs: unabhängiger Jev-vs.-GPT-5.6-Terra-System-1-Benchmark
|
||||||
|
|
||||||
|
**Type:** ingest + wiki-update | **Scope:** raw/other, wiki/people, wiki/concepts/llm, wiki/index, wiki/log
|
||||||
|
**Anlass:** Reddit-Link von Pit Weber im OME-Topic „JEV": https://www.reddit.com/r/ProAI/comments/1wik66s/tested_typesafeai_s_claim_that_their_new_model/
|
||||||
|
**Quellenkette:** Reddit-Post/JSON blockiert, `.rss` HTTP 200 und vollständig auslesbar. Der Repost von `/u/stealthispost` (17.09.2026 04:44 UTC) zitiert den X-Thread von **N8 Programs** (@N8Programs, 16.09.; Ausgangspost beim Abruf 179.846 Views, 907 Likes, keine Community Note). Vier Originalbilder des Threads lokal geladen und gelesen: Radar, Ergebnistabelle, Kostentabelle, Reliability-Diagramm. Profil/GitHub geprüft; kein öffentliches Jev-Eval-Repository gefunden.
|
||||||
|
**Methode:** neun Multiple-Choice-Bedingungen: MMLU, GPQA Diamond, ARC-Easy, ARC-Challenge, WinoGrande, HellaSwag, GSM8K mit 4 bzw. 10 Optionen, Schach mit 4 legalen Zügen. Terra lief mit `reasoning=none`, Letter-only und expliziter `a/b/c/d`-Instruktion fürs Schach. Das isoliert sinnvoll einen System-1-Forward-Pass, nicht Terras maximale Produktleistung.
|
||||||
|
**Ergebnisse:** Jev gewinnt MMLU 90,91:87,89, GPQA 68,18:56,06, ARC-Easy 99,33:98,82, ARC-Challenge 97,61:96,76 und WinoGrande 91,63:78,69. Terra gewinnt HellaSwag 95,32:94,86, GSM8K deutlich (87,72:79,68 bei 4 Optionen; 69,83:54,59 bei 10) sowie Schach knapp 50,25:49,45. Ungewichteter Makromittelwert: **Jev 80,69 %, Terra 80,15 % (+0,54 Pp)** — „Terra-tier" trägt eng für diesen Test. **Interne Korrektur:** Der Threadtext nennt HellaSwag als Jev-Sieg; die eigene Tabelle zeigt Terra +0,46 Pp.
|
||||||
|
**Kalibrierung:** Reliability-Diagramm **N=33.735**, **ECE 1,74 Prozentpunkte**, 10 gleich breite Bins, Wilson-95-%-Konfidenzintervalle; laut Autor 0,26–6,96 Pp je Einzel-Benchmark. Stärkste öffentliche Fremdevidenz für TypeSafes RLCD-These bisher, aber keine Reproduktion.
|
||||||
|
**Kosten:** Jev **$0,6999 estimated** (aufgezeichnete Input-Token × $0,042/MTok, Output frei) vs. Terra **$12,9865 API-reported** = **18,55×**; N8s „~18×" hält. Die Messung bestätigt nicht die Hersteller-Obergrenze von 400–444,6×. Geschwindigkeit wurde gar nicht getestet.
|
||||||
|
**Grenzen:** Kein öffentliches Repo, keine Prompts, Seeds, Beispiele oder Run-Logs; Standardbenchmark-Kontaminationsrisiko; asymmetrische Kosteninstrumentierung; gepooltes ECE kann Aufgabendifferenzen verdecken; Grafik nennt sich „Official benchmark comparison", ist aber ein persönlicher unabhängiger Test.
|
||||||
|
**Dateien:**
|
||||||
|
- raw (NEW): `raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md`
|
||||||
|
- wiki (NEW): `wiki/people/n8-programs.md`
|
||||||
|
- wiki (UPDATED): `wiki/concepts/llm/system-one-models-jev.md` (neuer unabhängiger Benchmark-Abschnitt), `wiki/index.md` (238. Update, Konzept-/Person-/Raw-Zeilen)
|
||||||
|
**⚠️:** Resultate nicht reproduziert; keine Geschwindigkeitsmessung; „Terra-tier" ist eine auf diese neun Bedingungen begrenzte Interpretation.
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
## 2026-09-22 — Grok 4.7, Grok-Bot-Praxis und „Grok AI Daily“-Podcast
|
## 2026-09-22 — Grok 4.7, Grok-Bot-Praxis und „Grok AI Daily“-Podcast
|
||||||
|
|
||||||
**Type:** ingest + wiki-update | **Scope:** raw/blog, raw/xpost, raw/youtube, raw/podcast, wiki/concepts/llm, wiki/concepts/policy, wiki/tools, wiki/institutions, wiki/index, wiki/log
|
**Type:** ingest + wiki-update | **Scope:** raw/blog, raw/xpost, raw/youtube, raw/podcast, wiki/concepts/llm, wiki/concepts/policy, wiki/tools, wiki/institutions, wiki/index, wiki/log
|
||||||
|
|
|
||||||
38
wiki/people/n8-programs.md
Normal file
38
wiki/people/n8-programs.md
Normal file
|
|
@ -0,0 +1,38 @@
|
||||||
|
---
|
||||||
|
created: 2026-09-22
|
||||||
|
updated: 2026-09-22
|
||||||
|
sources: [other/2026-09-17_reddit-n8-jev-terra-benchmark.md]
|
||||||
|
tags: [person, n8-programs, n8python, johns-hopkins, benchmarks, jev, calibration]
|
||||||
|
---
|
||||||
|
|
||||||
|
# N8 Programs
|
||||||
|
|
||||||
|
**N8 Programs** ([@N8Programs](https://x.com/N8Programs), GitHub [N8python](https://github.com/N8python)) beschreibt sich als Student der angewandten Mathematik und Statistik an der [Johns Hopkins University](https://www.jhu.edu/) sowie der In-Context-Learning-Forschung am Intelligence Amplification Lab. Ein bürgerlicher Name ist im ausgewerteten Profil nicht angegeben.
|
||||||
|
|
||||||
|
## Jev-vs.-Terra-Benchmark (16.09.2026)
|
||||||
|
|
||||||
|
N8 Programs veröffentlichte den ersten breiteren, quantitativ dokumentierten Fremdvergleich von TypeSafes Jev gegen GPT-5.6 Terra: neun Multiple-Choice-Bedingungen, Terra mit `reasoning=none` und Letter-only-Ausgabe, dazu Kosten- und Kalibrierungsdiagramme. Ein Reddit-Repost am 17.09. wurde am 22.09. von Pit Weber geteilt.
|
||||||
|
|
||||||
|
Der Vergleich stützt eine **enge** Terra-Tier-Aussage: Über die neun heterogenen Bedingungen liegt der ungewichtete Makromittelwert fast gleichauf (**Jev 80,69 %, Terra 80,15 %**). Dahinter stecken verschiedene Profile:
|
||||||
|
|
||||||
|
- Jev vorn: MMLU (+3,02 Pp), GPQA Diamond (+12,12), ARC-Easy (+0,51), ARC-Challenge (+0,85), WinoGrande (+12,94).
|
||||||
|
- Terra vorn: HellaSwag (+0,46), GSM8K mit 4 Optionen (+8,04), GSM8K mit 10 Optionen (+15,24), Schach (+0,80).
|
||||||
|
- Der Threadtext sagt, Jev übertreffe Terra auch auf HellaSwag; **die eigene Tabelle zeigt das Gegenteil** (94,86 % vs. 95,32 %).
|
||||||
|
|
||||||
|
Das Kalibrierungsbild ist die stärkste öffentliche Fremdevidenz für TypeSafes RLCD-These: **N = 33.735, ECE 1,74 Prozentpunkte**, 10 gleich breite Bins, Wilson-95-%-Intervalle; Einzel-Benches laut Autor 0,26–6,96 pp. Der Gesamtlauf kostete laut Grafik **$0,6999 geschätzt für Jev** gegenüber **$12,9865 API-gemeldet für Terra** — **18,55×**, also trägt die Rundung „~18ד.
|
||||||
|
|
||||||
|
## Grenzen
|
||||||
|
|
||||||
|
- Kein öffentliches Eval-Repository, keine Prompts, Seeds, Beispieldateien oder Run-Logs; die Benchmarks wurden hier **nicht reproduziert**.
|
||||||
|
- Jev-Kosten sind aus aufgezeichneten Input-Token × $0,042/MTok geschätzt; Terra-Kosten API-gemeldet. Der Vergleich ist plausibel, aber nicht symmetrisch instrumentiert.
|
||||||
|
- `reasoning=none` isoliert sinnvoll die System-1-Frage, misst aber nicht Terras übliche maximale Produktleistung.
|
||||||
|
- Öffentliche Standardbenchmarks können Trainingskontamination enthalten. Der Autor nimmt Übertragbarkeit an und verweist nur auf die Anbieteraussage, öffentliche Benches nicht zu priorisieren.
|
||||||
|
- Geschwindigkeit wurde **nicht** gemessen. Der Test bestätigt weder 70–500 ms noch die 193,6×-Herstellerzahl.
|
||||||
|
- 18,55× Kostenvorteil ist erheblich, bestätigt aber nicht die Hersteller-Obergrenze von 400–444,6×.
|
||||||
|
|
||||||
|
## Verwandte Wiki-Seiten
|
||||||
|
|
||||||
|
- [[../concepts/llm/system-one-models-jev.md]] — Modell, Anbieter-Evals und unabhängige Prüfungen
|
||||||
|
- [[gabriel-anhaia.md]] — Kritik an den anbietererzeugten Referenzlabels
|
||||||
|
- [[mike-taylor.md]] — früher Jev-Einzeltest bei Every
|
||||||
|
- [[../institutions/typesafe-ai.md]] — Anbieter
|
||||||
Loading…
Add table
Reference in a new issue