ingest(youtube): Typesafe AI — System One Models & Jev (KI Copium 17.09.2026)
Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25). Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only. Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.). raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu), raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu), raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu), raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund) wiki: concepts/llm/system-one-models-jev.md (neu), institutions/typesafe-ai.md (neu), institutions/every.md (neu), people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md, people/ai-copium.md (alle neu) + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm, llm-sycophancy-confabulation, agent-budget-breaker, harness-loop-graph-engineering + index.md (216. Update), log.md
This commit is contained in:
parent
0f4f5e7744
commit
b395bc8c52
18 changed files with 655 additions and 3 deletions
68
raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md
Normal file
68
raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md
Normal file
|
|
@ -0,0 +1,68 @@
|
||||||
|
---
|
||||||
|
type: blog
|
||||||
|
source_url: https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds
|
||||||
|
retrieved: 2026-09-17
|
||||||
|
title: "Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds"
|
||||||
|
author: "Mike Taylor"
|
||||||
|
published: 2026-09-15
|
||||||
|
tags: [typesafe, jev, system-one-models, independent-test, evals, writing-checks, workflow-automation, calibrated-decisions]
|
||||||
|
---
|
||||||
|
|
||||||
|
# Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds
|
||||||
|
|
||||||
|
Artikel von **Mike Taylor** („head of evals at Every") in der Every-Publikation *Also True for Humans*. Metadaten: `published_at: 2026-09-15T12:00:45.016-04:00`. Abgerufen am 17.09.2026.
|
||||||
|
|
||||||
|
Untertitel: „Its new model turns fuzzy questions into probabilities fast and cheaply enough to check an AI agent's work as it goes".
|
||||||
|
|
||||||
|
## Beschreibung des Produkts
|
||||||
|
|
||||||
|
- Jev von **TypeSafe** („a new AI lab") wurde am Publikationstag gelauncht; das Modell „designed to produce structured answers that your code can use directly".
|
||||||
|
- Funktionsweise laut Artikel: Fragen in natürlicher Sprache — auch unscharfe/subjektive — liefern **Wahrscheinlichkeiten** für Ja/Nein-Antworten oder selbst definierte Kategorien.
|
||||||
|
- Beispiel: „Does this customer sound angry?" → 0.9 = geschätzte 90 % Wahrscheinlichkeit. Auch eigene Kategorien möglich („annoyed", „irritated", „offended", „furious", „enraged") mit Einzelwahrscheinlichkeiten.
|
||||||
|
- Abgrenzung zu Chatbots: Diese antworten mit blumigem Text statt mit Zahlen, was ein Programm crashen lässt, das eine Zahl zwischen 0 und 1 erwartet.
|
||||||
|
- Autor vergleicht mit **DSPy** (Python-Framework zum Programmieren von Modellen), das er historisch nutzte, um LLMs zu strukturierten Ausgaben zu zwingen: „Jev does all that work natively, which makes it insanely fast and cheap. Just how well it gets the job done is still an open question."
|
||||||
|
|
||||||
|
## Training und Motivation (TypeSafe-Angaben)
|
||||||
|
|
||||||
|
- Ziel: Confidence des Modells soll der Trefferquote entsprechen — „If it flags 100 customer messages as having a 90 percent chance of expressing anger, about 90 should express anger."
|
||||||
|
- Trainingsansatz: **Reinforcement Learning for Calibrated Decisions (RLCD)**.
|
||||||
|
- Zitat **Diogo Almeida** (TypeSafe-Cofounder) als Motivation: „The problem is the text itself."
|
||||||
|
- Hintergrund: Almeida war Mitautor des **InstructGPT-Papers (2022, arXiv:2203.02155)**, das zeigte, wie menschliches Feedback Sprachmodelle zuverlässiger Anweisungen befolgen lässt — Arbeit, die den Weg zu ChatGPT ebnete.
|
||||||
|
- Zitat aus dem TypeSafe-Manifesto: „We're building prod, not God."
|
||||||
|
- Zur System-One-Architektur: Jev wird nicht durch Token-für-Token-Generierung ausgebremst, kann mehrere Fragen parallel in Sekundenbruchteilen beantworten. Preis **$42 pro Milliarde Tokens** (statt pro Million); Output-Tokens werden nicht berechnet — „too cheap to meter", so Almeida.
|
||||||
|
|
||||||
|
## Test 1 — Texte des Autors auf KI-Muster
|
||||||
|
|
||||||
|
- Eingabe: Text aller **27 Every-Artikel** des Autors plus **10 bewusst KI-stilisierte Gegenstücke** (37 Dokumente).
|
||||||
|
- **21 Fragen** gleichzeitig über alle Artikel, abgeleitet aus dem Every-Skill zur Erkennung typischer KI-Muster (u. a. „Does the text repeat an idea without adding evidence?", „Force a symmetrical 'both sides' argument?", „Overexplain a straightforward point?").
|
||||||
|
- Ergebnis: **777 Judgments in unter 0,7 Sekunden**, geschätzte Kosten **ein Viertel Cent**.
|
||||||
|
- Screenshot im Artikel: getrennte Wahrscheinlichkeiten je KI-Schreibmuster; Zeilen = Artikel, Spalten = Muster; Werte nahe 1 = möglicher KI-Einsatz.
|
||||||
|
- Bewertung des Autors: Jev markierte korrekt Passagen, die stärker auf KI stützten, aber „I'd want a more thorough accuracy check before putting it into production". Nützlich als Frühwarnsystem: „The alternative is not checking at all."
|
||||||
|
|
||||||
|
## Test 2 — CEO-Vergleich Jev vs. Claude Fable 5.1
|
||||||
|
|
||||||
|
- Durchgeführt von **Dan Shipper** (Every-CEO): **12 synthetische Passagen** (sechs klare, sechs mit absichtlich eingebauten Problemen), **vier Schreib-Checks** je Passage (unbegründete Handlung, fehlendes Argumentationsglied, Mechanismus ersetzt das beabsichtigte Ergebnis, Claim verzerrt seine Quelle).
|
||||||
|
- Ergebnisse: Jev Median **0,35 s** pro Passage; **Fable 5.1 bei High Effort 8,83 s** — rund **25× schneller**; geschätzte Kosten rund **580× niedriger**.
|
||||||
|
- Genauigkeit: Jev fand **6 von 7** beabsichtigten Defekten, Fable **alle 7**. Wiederholt verpasst wurde dieselbe Passage: ein „shared appointment calendar that parents and staff teach together" — Fable erkannte die unbegründete Handlung, Jev übersah sie in allen drei Runs.
|
||||||
|
|
||||||
|
## Weitere Experimente
|
||||||
|
|
||||||
|
- Insgesamt **11 Experimente** (Detail-Explainer: typesafe-parallel-judgment-lab.every-4573.chatgpt.site), Beispiele:
|
||||||
|
- **Finding context:** richtige Code-Datei finden; Agent durch eine Codebase navigieren; die Firmenrichtlinie finden, die eine Frage beantwortet.
|
||||||
|
- **Checking work:** Support-Antworten benoten; riskante Aktionen eines Agenten flaggen; Texte auf KI-Tells prüfen.
|
||||||
|
- **Making decisions:** Startup-Pitches sortieren; Kunden priorisieren; Entscheidungen identifizieren, die den CEO brauchen; E-Mails priorisieren; 100 simulierte Personen fragen, welche Anzeige sie klicken würden.
|
||||||
|
- Über die Experimente: **1.709 Judgments** für geschätzt **unter einem Cent** Gesamtkosten.
|
||||||
|
- Die Szenarien wurden mit **GPT-6 Astra in Codex** erstellt; LLMs seien gut darin, Queries zu schreiben und strukturierte Ausgaben zu nutzen.
|
||||||
|
|
||||||
|
## „Ein Code-Linter für Wissensarbeit"
|
||||||
|
|
||||||
|
- Analogie des Autors: Ein Code-Linter analysiert Arbeit nahezu sofort und flaggt Syntaxfehler, Bugs, schlechte Muster, Stilinkonsistenz. Jev könnte diese Rolle für Wissensarbeit übernehmen.
|
||||||
|
- Vorschlag: Codex oder Claude bekommt Zugriff auf Jev plus Fragenliste und kann damit die eigene Arbeit gegen bekannte Fehler prüfen.
|
||||||
|
- Every baut intern ein Personal-Benchmark (5–10 regelmäßige Aufgaben, Beispiele, Präferenzen als Pass/Fail-Checks, u. a. „Is this PowerPoint on brand?", „Does this social media copy have a good hook?"). Wegen Speed und Kosten könnte Jev Checks **mehrfach während der Arbeit** ausführen statt einmal danach.
|
||||||
|
- Dan Shippers Test (siehe oben) wird im Artikel als „the code linter idea more directly" bezeichnet.
|
||||||
|
|
||||||
|
## Einordnung durch den Autor
|
||||||
|
|
||||||
|
- Empfehlung: „If you're building with AI, look for a judgment you already need to make repeatedly as a good first test for Jev."
|
||||||
|
- Für Einsteiger in Workflow-Automatisierung sei Kreativität nötig; Jev lohnt sich überall dort, wo unscharfe Fragen strukturierte Antworten brauchen.
|
||||||
|
- Abschluss-Maßstab: „The ultimate test is whether acting on the answers makes the work better."
|
||||||
87
raw/blog/2026-09-15_typesafe-system-one-models-jev.md
Normal file
87
raw/blog/2026-09-15_typesafe-system-one-models-jev.md
Normal file
|
|
@ -0,0 +1,87 @@
|
||||||
|
---
|
||||||
|
type: blog
|
||||||
|
source_url: https://typesafe.ai/blog/introducing-system-one-models-and-jev
|
||||||
|
retrieved: 2026-09-17
|
||||||
|
title: "Introducing System One Models & Jev"
|
||||||
|
author: "Diogo Almeida (founder, TypeSafe)"
|
||||||
|
published: 2026-09-15
|
||||||
|
tags: [typesafe, jev, system-one-models, rlcd, structured-outputs, calibrated-decisions, inference-cost, parallel-sampling, automation]
|
||||||
|
---
|
||||||
|
|
||||||
|
# Introducing System One Models & Jev
|
||||||
|
|
||||||
|
Ankündigungsartikel von **Diogo Almeida** (Founder, TypeSafe AI) auf dem Unternehmensblog. Artikelkopf nennt „Company News, Sep 15, 2026". Abgerufen am 17.09.2026 (HTTP 200).
|
||||||
|
|
||||||
|
## Ankündigung
|
||||||
|
|
||||||
|
- TypeSafe AI gibt nach **zwei Jahren Stealth** sein erstes **System One Model** frei: eine neue Modellklasse für „fast, structured decisions that software can use directly".
|
||||||
|
- Erstes öffentliches Modell: **Jev**, ab Ankündigung in **Early Access** (Waitlist).
|
||||||
|
- Neuer Stack: neue Modellarchitektur, **paralleler Sampler**, Trainingsmethode **RLCD** (Reinforcement Learning for Calibrated Decisions).
|
||||||
|
- Kernformulierung: „Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out."
|
||||||
|
- Selbstbeschreibung des Verzichts: Jev gibt String-Generierung auf, ist auf strukturierte Ausgaben optimiert und „*can't* hallucinate".
|
||||||
|
|
||||||
|
## Vergleichstabelle TypeSafe-Angaben (LLM vs. System One + Jev)
|
||||||
|
|
||||||
|
| Dimension | Bestehende LLMs | System One + Jev |
|
||||||
|
|-----------|-----------------|------------------|
|
||||||
|
| Optimierung | RLHF / RLVR | RLCD — kalibrierte Entscheidungen |
|
||||||
|
| Zielgröße | Menschliche Präferenz (Writeups, Chat); verifizierbare Rewards | Kalibrierte Entscheidungen: Antworten mit „epistemically honest probabilities" |
|
||||||
|
| Inputs | Unstrukturierte Daten, Fokus **sequentielle Messages** | Unstrukturierte Daten, Fokus **strukturierter Programmzustand** |
|
||||||
|
| Outputs | **Strings** — müssen geparst und validiert werden | **Type-safe structured values** — mögliche Ausgaben vorab definiert (docs.typesafe.ai); „the model never makes type errors"; jede Antwort mit kalibrierten Wahrscheinlichkeiten und Confidence-Scores |
|
||||||
|
| Sampling | **Sequentiell** — ein Token nach dem anderen | **Parallel** — alle Ausgaben in einer Query |
|
||||||
|
| Kosten | Input $0,20–$10 / MTok; Output ~5× teurer als Input | **Input $0,042 / MTok ($42 pro Milliarde Tokens); Output: FREE („too cheap to meter")** |
|
||||||
|
| Geschwindigkeit | 3–329 s end-to-end für Frontier-Modelle | **70–500 ms**; laut Artikel „40x–200x faster for the same levels of frontier intelligence for System One shaped queries" |
|
||||||
|
| Konfidenz | Modelle tendenziell überkonfident und inkonsistent | Immer Confidence/Unsicherheit pro Output; kalibriert (höhere Confidence = höhere Genauigkeit), konsistenter bei ähnlichen Inputs |
|
||||||
|
| Use Cases | Human-in-the-loop (Chatbots, Copilots, Coding Agents); verifizierbare Probleme (Mathe-Beweise, Kernel-Optimierung); Demos | **AI-Powered Workflows / „smart if-statements"** (klassifizieren, routen, scoren, extrahieren, branchen); Map-Reducing über große Datenmengen; Echtzeit-Anwendungen (100 ms); Verifizieren (Score, Judge, Guardrail, Jailbreak-Erkennung von Prompts/Reasoning-Traces/Outputs) |
|
||||||
|
|
||||||
|
## Evidenz / technische Ergebnisse (Selbstauskunft)
|
||||||
|
|
||||||
|
Explizit verifizierbare Claims laut Artikel:
|
||||||
|
|
||||||
|
- **Speed per call:** Eval-Läufe „generally run from our laptops on the West Coast" (Service derzeit dort gehostet).
|
||||||
|
- **Cost per call:** Preise transparent; „We can't prove it isn't subsidized; we'll need the long-term to prove the sustainability of our pricing (which we expect to go down, not up)."
|
||||||
|
- **No type errors:** „This would be an easy thing to falsify with just a single counter-example, but it is mathematically impossible."
|
||||||
|
|
||||||
|
### Side-by-side-Demo
|
||||||
|
|
||||||
|
- Demo zeigt: Jev gibt alle Wahrscheinlichkeiten **parallel** aus statt autoregressiv Token für Token.
|
||||||
|
- Nuancen laut Artikel: Query stark vereinfacht, `questions` mit beschreibenden, menschenlesbaren Keys; `state` kurzer dichter Absatz — „The relatively shorter input paints our model in an advantageous light."
|
||||||
|
- Einzige Abweichung in der aufgezeichneten Run gegenüber **GPT-5.6 Terra**: „Churn likelihood level" (laut TypeSafe genuin mehrdeutig).
|
||||||
|
- Vergleichsmodell: GPT-5.6 Terra mit Default-Reasoning, „most comparable at intelligence to Jev on average".
|
||||||
|
- Diese Demo war laut Artikel der Auslöser, „all-in" auf System-One-Modelle zu gehen.
|
||||||
|
|
||||||
|
### Workflow-Evals
|
||||||
|
|
||||||
|
- Neue Evaluationsform: kein Ground-Truth-Classification-Set, Harness und Modell bleiben unverändert (um Harness-Engineering-Overfitting zu vermeiden).
|
||||||
|
- Referenz: **Predictions der größten/teuersten externen Modelle als Referenzwahrscheinlichkeiten** — im Text als Durchschnitt von **GPT-6 Astra und Fable 5.1** beschrieben.
|
||||||
|
- Jev „owning the Pareto frontier for almost 2 orders of magnitude".
|
||||||
|
- Die veröffentlichten Workflows „were not deliberately chosen nor constructed to make our model look good, and are not in our training distribution. However, they were made by individuals on our model capabilities team, so some bias could exist."
|
||||||
|
- Referenz-Wahl „biases answers towards OpenAI and Anthropic's models. We likely underestimate the relative performance of our model and DeepSeek's models."
|
||||||
|
- LLMs liefen über den eigenen **System One LLM Wrapper** (github.com/typesafe-ai/system-one-adapter-python), der LLMs auf strukturierte Entscheidungen mit Wahrscheinlichkeiten zwingt — „slower and more expensive than giving decisions without probabilities".
|
||||||
|
- Herkunft der Homepage-Zahlen: „This is where the claims of **193.6x faster, 444.6x cheaper** on our home page comes from, and we expect that these are on the higher end of real world gains."
|
||||||
|
- Alle Details auf der Evals-Seite: https://evals.typesafe.ai/
|
||||||
|
|
||||||
|
### Halluzination und Type-Safety
|
||||||
|
|
||||||
|
- Artikelargument: „Having a hallucinated tool call is inconvenient in an agent, but is an absolute deal-breaker if it's part of a system with latency guarantees or it's buried several layers deep in a dependency chain."
|
||||||
|
- Nuance: LLM-Zahlen stammen von OpenRouter (Bias möglich — komplexere Queries werden evtl. an bessere Modelle geroutet); die eigene Zahl ist „not empirical. Schema matching is guaranteed, thus we can confidently add 0% into the plots."
|
||||||
|
|
||||||
|
### Fun Demos
|
||||||
|
|
||||||
|
- **Doom:** Jev spielt DOOM über strukturierte Entscheidungen; demonstriert Echtzeit-Intelligenz „and what can be done with code + AI".
|
||||||
|
- **Wikipedia-Crawl-Rennen** („wiki racing"): Ziel, von einer Wikipedia-Seite zu einer bestimmten anderen nur über Links zu gelangen; jeder Schritt kann Auswahl aus hunderten bis tausenden Links bedeuten. Jev unterstützt **Kardinalität bis 255**; für höhere Kardinalität zweistufiges System (unabhängiges Scoring, dann explizite Auswahl) — daher gelegentliche Verlangsamung.
|
||||||
|
- Nuance: Speedups hier deutlich geringer als in anderen Demos, weil gegen Nicht-Reasoning-Modi der Modelle gelaufen (Astra auf niedrigster Reasoning-Stufe); Jev beendete die Aufgabe in weniger Schritten („a sign of greater intelligence").
|
||||||
|
|
||||||
|
## Benennung (FAQ)
|
||||||
|
|
||||||
|
- **System One Models** nach Daniel Kahneman, *Thinking, Fast and Slow* — schnelles, intuitives System 1 vs. langsames, deliberatives System 2.
|
||||||
|
- Einräumung: „System 1 thinking" impliziere auch Fehleranfälligkeit; man glaube, System One Models „can be made more reliable than its alternatives".
|
||||||
|
- **Jev** nach **William Stanley Jevons** — Erwartung, dass maschinelle Intelligenz einem ähnlichen Pfad wie Kohle folgt (Jevons-Paradox: Effizienzsteigerung führte zu höherer Nachfrage). „Every order of magnitude drop in the cost of intelligence unlocks orders of magnitude more use cases."
|
||||||
|
- Die FAQ-Liste nennt weitere Fragen (neuer Trainingsalgorithmus nötig? Use Cases? nur ein kleineres LLM? Public Benchmarks? Trainingsdaten? „These are results are kinda crazy — how is it possible?"), die im abgerufenen Seitentext als Überschriften ohne ausgelesene Antworten erscheinen.
|
||||||
|
|
||||||
|
## Verweise des Artikels
|
||||||
|
|
||||||
|
- Produkt/Docs: https://docs.typesafe.ai/, Evals: https://evals.typesafe.ai/, Console/Playground: https://console.typesafe.ai/
|
||||||
|
- Adapter: https://github.com/typesafe-ai/system-one-adapter-python
|
||||||
|
- Manifesto: https://typesafe.ai/manifesto
|
||||||
|
- LinkedIn: https://www.linkedin.com/company/typesafe-ai/ · X: https://x.com/typesafeai · Kontakt: hello@typesafe.ai
|
||||||
23
raw/blog/2026-09-16_theregister-typesafe-jev-doom.md
Normal file
23
raw/blog/2026-09-16_theregister-typesafe-jev-doom.md
Normal file
|
|
@ -0,0 +1,23 @@
|
||||||
|
---
|
||||||
|
type: blog
|
||||||
|
source_url: https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/5296711
|
||||||
|
retrieved: 2026-09-17
|
||||||
|
title: "TypeSafe AI debuts model for machines that plays Doom"
|
||||||
|
author: "The Register"
|
||||||
|
published: 2026-09-16
|
||||||
|
tags: [typesafe, jev, system-one-models, press, the-register]
|
||||||
|
---
|
||||||
|
|
||||||
|
# TypeSafe AI debuts model for machines that plays Doom
|
||||||
|
|
||||||
|
⚠️ **Volltext nicht abrufbar.** Abruf am 17.09.2026 ergab HTTP 200, aber der extrahierte Seitentext bestand nur aus der Zeile „Are we human?" — offenbar eine Bot-/Paywall- oder Consent-Hürde. Inhaltliche Angaben aus dieser Quelle sind daher **nicht belegt**.
|
||||||
|
|
||||||
|
## Metadaten
|
||||||
|
|
||||||
|
- URL: https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/5296711
|
||||||
|
- URL-Datumssegment: 2026/09/16
|
||||||
|
- Titel laut URL-Slug: „TypeSafe AI debuts model for machines that plays Doom"
|
||||||
|
|
||||||
|
## Fundstelle
|
||||||
|
|
||||||
|
Der Artikel wurde bei der Recherche zum Video „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…" (Kanal AI Copium, 17.09.2026) als Presseerwähnung gefunden und in einer Web-Suche als dritte Quelle zum TypeSafe-Launch genannt. Er ist **weder in der Videobeschreibung noch im TypeSafe-Blogartikel verlinkt** und wurde hier nicht ausgewertet.
|
||||||
62
raw/youtube/2026-09-17_aicopium-typesafe-jev.md
Normal file
62
raw/youtube/2026-09-17_aicopium-typesafe-jev.md
Normal file
|
|
@ -0,0 +1,62 @@
|
||||||
|
---
|
||||||
|
type: youtube
|
||||||
|
source_url: https://www.youtube.com/watch?v=xQtUzjd7-As
|
||||||
|
retrieved: 2026-09-17
|
||||||
|
channel: "AI Copium"
|
||||||
|
duration_sec: 866
|
||||||
|
has_transcript: true
|
||||||
|
title: "A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…"
|
||||||
|
uploaded: 2026-09-17
|
||||||
|
tags: [typesafe, jev, system-one-models, rlcd, structured-outputs, inference-cost, every, doom, automation]
|
||||||
|
---
|
||||||
|
|
||||||
|
# A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…
|
||||||
|
|
||||||
|
Video von **AI Copium** (@AICopium), hochgeladen 17.09.2026, Länge 14:25 (866 s), ca. **6.797 Views / 226 Likes** zum Abrufzeitpunkt, Kategorie „People & Blogs". Vollständiges Transcript über Firecrawl-Scrape abrufbar (17.09.2026).
|
||||||
|
|
||||||
|
**Charakter des Videos:** Nachrichten-/Kommentarformat zu einer Fremdankündigung. Der Kanal gibt keine eigene Messung; die Zahlen des Videos stammen aus den beiden in der Beschreibung genannten Quellen (TypeSafe-Blogartikel, Every-Artikel) und aus der TypeSafe-Website.
|
||||||
|
|
||||||
|
**Quellen laut Videobeschreibung:** https://typesafe.ai/blog/introducing-system-one-models-and-jev und https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds
|
||||||
|
|
||||||
|
## Kapitelmarken
|
||||||
|
|
||||||
|
| Zeit | Kapitel |
|
||||||
|
|------|---------|
|
||||||
|
| 0:00 | Intro |
|
||||||
|
| 1:05 | System One Models (Jev) |
|
||||||
|
| 2:45 | What is RLCD? |
|
||||||
|
| 4:06 | The Advantage… and Weakness? |
|
||||||
|
| 4:58 | "Too Cheap to Meter…" |
|
||||||
|
| 5:35 | Independent Testing |
|
||||||
|
| 7:05 | Zero Hallucinations? |
|
||||||
|
| 9:15 | 400x Cheaper… But How Accurate? |
|
||||||
|
| 11:38 | It Can Play DOOM?! |
|
||||||
|
| 13:01 | This Could Unlock New Possibilities… |
|
||||||
|
|
||||||
|
## Inhalt (Transkript-Zusammenfassung)
|
||||||
|
|
||||||
|
**Gegenstand (ab 1:05):** TypeSafe, ein Unternehmen aus dem Stealth, gibt **Jev** frei; beschrieben als Modell, das unstrukturierte Eingaben plus definierte Antwortoptionen erhält und dann „a decision or a score with probabilities that software can use" zurückgibt. Beispiel: Kundenbeschwerde → Abteilung wählen, separat prüfen, ob eine Rückerstattung verlangt wird. Das umgebende Programm nutzt die Antworten. Abgrenzung: Jev generiert keinen Text, hat keine Chains of Thought, ist für Urteile innerhalb eines größeren Systems gedacht, nicht für Wortketten.
|
||||||
|
|
||||||
|
**Trainingsverfahren (ab 2:45):** **RLCD** — Reinforcement Learning for Calibrated Decisions. Ziel laut Video: Die ausgegebene Wahrscheinlichkeit soll der Häufigkeit des tatsächlichen Eintretens entsprechen (80 % Wahrscheinlichkeit → Eintreten in etwa 80 % vergleichbarer Fälle). Konsequenz im Design: eindeutige Fälle automatisch, mehrdeutige Fälle eskalieren. Das Video schneidet einen Clip ein, in dem **Diogo Almeida** dies selbst erklärt.
|
||||||
|
|
||||||
|
**Vorteil/Nachteil (ab 4:06):** Der Vorteil liegt im **parallelen** Antworten statt sequenzieller Token-Generierung. Argument des Videos: Die Wartezeit ist im Chatfenster verkraftbar, in automatisierten Prozessen summiert sie sich — jeder Check kostet Zeit und Geld, bis man die Nutzungshäufigkeit begrenzt. Wenn Urteile billig genug werden, kann man sie viel häufiger oder permanent laufen lassen.
|
||||||
|
|
||||||
|
**Preis (ab 4:58):** genannt **$42 pro Milliarde Tokens** = 4,2 Cent pro Million Input; Output-Preis **null**, „too cheap to meter, because it literally doesn't output tokens". Einschränkung des Videos: Die Kosten eines kompletten Workflows hängen davon ab, wie viel Information man sendet und wie viele Calls man macht.
|
||||||
|
|
||||||
|
**Fremdtests (ab 5:35):** Wiedergabe des Every-Tests von **Mike Taylor**: 37 Dokumente × 21 Fragen = **777 Judgments in unter 0,7 Sekunden**, geschätzte Kosten **ein Viertel Cent**. Zweiter Test: **12 synthetische Passagen**, Vergleich gegen **Claude Fable 5.1 auf High Effort** — Jev Median **0,35 s** pro Passage vs. **8,83 s**, rund **25× schneller**, geschätzte Kosten **~580× niedriger**; Fable fand **alle 7** beabsichtigten Defekte, Jev **6 von 7** und verpasste wiederholt denselben. Bewertung des Videos: sichtbarer Qualitätsunterschied, „though importantly not a significant visible quality difference"; der Test belege keine Leistung über ganze Branchen oder breite Aufgabenspektren.
|
||||||
|
|
||||||
|
**„Zero Hallucinations" (ab 7:05):** Das Video nennt die Website-Aussage irreführend und erklärt strukturierte Ausgaben: Format wird vorab definiert (Felder, Typen, erlaubte Antworten), das Modell kann keine vierte Option erfinden, die das System nicht kennt. Es könne aber trotzdem „approve" für eine Rückerstattung wählen, die hätte abgelehnt werden sollen. Zusätzlicher Hinweis: Strukturierte Ausgaben seien nicht neu, OpenAI unterstütze das ebenfalls; zu bewerten seien Genauigkeit, Effizienz und praktischer Nutzen.
|
||||||
|
|
||||||
|
**Benchmarks und Genauigkeit (ab 9:15):** Vier Beispiel-Workflows, u. a. Kundenservice und Rechnungsverarbeitung. Das Video weist darauf hin, dass die Evaluierung die **Übereinstimmung mit Referenzantworten anderer Frontier-Modelle** misst — „agreement with another AI isn't the same as independently verified correctness because obviously Frontier models can be wrong, too". Dargestellt: nahe State-of-the-Art bei deutlich niedrigeren Kosten, auch gegenüber Luna und Haiku. TypeSafe räume ein, dass die größten Speed-/Kostengewinne am oberen Ende liegen dürften und der Vergleich Overhead erzeugt, weil die LLMs Wahrscheinlichkeiten statt freier Antworten liefern müssen.
|
||||||
|
|
||||||
|
**Latente Reasoning-Architekturen:** Das Video vergleicht den Ansatz mit OpenAIs Experimenten zu **recurrent depth / looped transformers** (mehr Reasoning intern im latenten Raum statt ausgeschriebener Gedankenkette) und verweist auf Warnungen von AI-Safety-Forschern, dass dies die Überwachung erschwert. Einschränkung des Videos: „we don't know that Jev works the same way internally" — bekannt sei nur, dass Jev Entscheidungen und Wahrscheinlichkeiten innerhalb der vorgegebenen Optionen zurückgibt.
|
||||||
|
|
||||||
|
**DOOM (ab 11:38):** Jev spielt DOOM, indem es strukturierte Spielzustands-Informationen erhält statt den Bildschirm zu sehen, und Entscheidungen ausgibt, die das Spiel ausführt. Laut Video rund **10 Modell-Queries pro Sekunde**.
|
||||||
|
|
||||||
|
**Spekulation des Autors (ab 13:01):** Anwendungsfelder wie permanente Checks durch einen stärkeren Agenten, medizinische Forschung mit kontinuierlichem Screening neuer Studien, Alignment-/Safety-Modelle zur Dauerüberwachung. Eigene Beispiele des Autors am Schluss: „perfect sports refs, realtime lawyers in police body cams, 24/7 AI nurses, safer self-driving". Einschätzung des Autors: „Personally, I think it's the real deal, though perhaps they may have exaggerated some of the claims" — sowie die Hoffnung, dass es sich in der Praxis bestätigt; ferner die Bemerkung, er habe erwartet, dass Ilya Sutskever mit so etwas kommt, aber „Dio beat him to the punch".
|
||||||
|
|
||||||
|
## Quellenverweise des Videos
|
||||||
|
|
||||||
|
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
|
||||||
|
- https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds
|
||||||
|
- Kanal-eigene Links: https://whop.com/ride-the-wave-discord/aicopium/, https://x.com/AICopium
|
||||||
|
|
@ -33,6 +33,7 @@ Eine $5-Sandbox mit fünf Szenarien: Normal-Lauf, erzwungener Infinite-Retry, re
|
||||||
- Die Abschlussfrage der Folge — suffocieren mechanische Limits Autonomie? — beantwortet die Auswertung mit Nein, solange Limits pro Job granular sind. Das ist der Unterschied zwischen Minions-/Gateway-Design und naiver API-Nutzung.
|
- Die Abschlussfrage der Folge — suffocieren mechanische Limits Autonomie? — beantwortet die Auswertung mit Nein, solange Limits pro Job granular sind. Das ist der Unterschied zwischen Minions-/Gateway-Design und naiver API-Nutzung.
|
||||||
- Hochrelevant für Setup mit Cron-Jobs, Subconscious-Runs und Subagent-Fan-outs ([[subconscious-agent.md]]): genau dort laufen unattended Spend-Schleifen.
|
- Hochrelevant für Setup mit Cron-Jobs, Subconscious-Runs und Subagent-Fan-outs ([[subconscious-agent.md]]): genau dort laufen unattended Spend-Schleifen.
|
||||||
- Geschwister-Patterns aus derselben Serie: Task Lease Guard (Multi-Agent-Turf-Wars), Release-Sentinel-Canary, Cadence Guard — siehe [[../../institutions/openclaw-cast.md]].
|
- Geschwister-Patterns aus derselben Serie: Task Lease Guard (Multi-Agent-Turf-Wars), Release-Sentinel-Canary, Cadence Guard — siehe [[../../institutions/openclaw-cast.md]].
|
||||||
|
- **Ergänzung 17.09.2026:** [[../llm/system-one-models-jev.md|Jev (TypeSafe AI)]] verschiebt die Rechnung auf der anderen Seite — Entscheidungs-Urteile für $0,042/MTok Input und $0 Output. Wenn Prüf-Calls praktisch nichts kosten, steigt die Zahl der Calls pro Lauf; ein mechanischer Deckel wird dadurch **wichtiger**, nicht weniger wichtig.
|
||||||
|
|
||||||
## Quellen
|
## Quellen
|
||||||
|
|
||||||
|
|
|
||||||
|
|
@ -159,3 +159,4 @@ Auch das „10/90-Prinzip" wird gestützt: Die 90 % verteilen sich auf Loop-, Gr
|
||||||
- [[../../architecture/agent-orchestration.md]] — Agenten-Orchestrierung
|
- [[../../architecture/agent-orchestration.md]] — Agenten-Orchestrierung
|
||||||
- [[../llm/deepseek-v4-pro-ga-harness-open-source.md]] — DeepSeek Harness v0.1 (Open-Source-Agent-Harness, Rivale zu Claude Code) + Deep-Dive-Video (Stephen G. Pope, 21.08.2026)
|
- [[../llm/deepseek-v4-pro-ga-harness-open-source.md]] — DeepSeek Harness v0.1 (Open-Source-Agent-Harness, Rivale zu Claude Code) + Deep-Dive-Video (Stephen G. Pope, 21.08.2026)
|
||||||
- [[nvidia-agenten-3d-scene-prep.md]] — NVIDIA-Referenzarchitektur: Codex orchestriert, Hermes-Subagents über NemoClaw, Omniverse Libraries als Werkzeugschicht — Harness-Pattern in einem Physical-AI-Kontext, inkl. Validierungs-Gate
|
- [[nvidia-agenten-3d-scene-prep.md]] — NVIDIA-Referenzarchitektur: Codex orchestriert, Hermes-Subagents über NemoClaw, Omniverse Libraries als Werkzeugschicht — Harness-Pattern in einem Physical-AI-Kontext, inkl. Validierungs-Gate
|
||||||
|
- [[../llm/system-one-models-jev.md]] — System One Models (TypeSafe AI): die Gate-Schicht als eigene Modellklasse — Urteile in 70–500 ms für $0,042/MTok Input, gedacht zum Prüfen des Agenten während der Arbeit statt danach
|
||||||
|
|
@ -85,6 +85,7 @@ Aber Punkt 3 ("Reasoning-Modelle wie DeepSeek R1 prüfen explizit: Karlsruhe ∈
|
||||||
- [[../agents/hermes-bot-mode.md]], [[../agents/hermes-vs-grok-bot.md]] (Hermes als offene Agent-Runtime)
|
- [[../agents/hermes-bot-mode.md]], [[../agents/hermes-vs-grok-bot.md]] (Hermes als offene Agent-Runtime)
|
||||||
- [[gemini-3.6-flash-vs-3.7-flash.md]] (Googles Flash-Workhorse-Modelle)
|
- [[gemini-3.6-flash-vs-3.7-flash.md]] (Googles Flash-Workhorse-Modelle)
|
||||||
- [[../agents/nvidia-agenten-3d-scene-prep.md]] (NVIDIA-Referenzarchitektur: Harness-Subagents + Werkzeugschicht + Validierungs-Gate — „too concrete to solve with prompts alone")
|
- [[../agents/nvidia-agenten-3d-scene-prep.md]] (NVIDIA-Referenzarchitektur: Harness-Subagents + Werkzeugschicht + Validierungs-Gate — „too concrete to solve with prompts alone")
|
||||||
|
- [[system-one-models-jev.md]] (Jev / System One Models, TypeSafe AI: das Gate als eigene Modellklasse — typisierte Entscheidungen in 70–500 ms; „Zero Hallucinations" ist Type-Safety, nicht Wahrheit)
|
||||||
|
|
||||||
## Offene Punkte
|
## Offene Punkte
|
||||||
|
|
||||||
|
|
|
||||||
|
|
@ -158,6 +158,18 @@ Nicht im aktiven Routing, aber mittelfristig zu beobachten. Status: **beobachten
|
||||||
| **Gemini Diffusion** | Iterative Sequenz-Verfeinerung statt AR. ~10× schneller bei ähnlicher Qualität. Beliebige Kontextpositionen (Code-Completion in Lücken). | Ankündigung Mai 2025 | [[post-transformer-llm-architectures.md]] |
|
| **Gemini Diffusion** | Iterative Sequenz-Verfeinerung statt AR. ~10× schneller bei ähnlicher Qualität. Beliebige Kontextpositionen (Code-Completion in Lücken). | Ankündigung Mai 2025 | [[post-transformer-llm-architectures.md]] |
|
||||||
| **V-JEPA** | JEPA-Weltmodell (Meta/LeCun): Konsistenz von Repräsentationen statt Pixel-Rekonstruktion. [arXiv:2404.08471](https://arxiv.org/abs/2404.08471) | Empirisch noch hinter Top-Generatoren | [[post-transformer-llm-architectures.md]] |
|
| **V-JEPA** | JEPA-Weltmodell (Meta/LeCun): Konsistenz von Repräsentationen statt Pixel-Rekonstruktion. [arXiv:2404.08471](https://arxiv.org/abs/2404.08471) | Empirisch noch hinter Top-Generatoren | [[post-transformer-llm-architectures.md]] |
|
||||||
|
|
||||||
|
### Entscheidungsmodelle (System One) — neue Kategorie
|
||||||
|
|
||||||
|
Kein Chat-Modell, sondern eine eigene Produktklasse: **kein Text, sondern typisierte probabilistische Entscheidungen** für Software („smart if-statements"). Erstes öffentliches Modell: **Jev** (TypeSafe AI, 15.09.2026) — RLCD statt RLHF/RLVR, paralleles statt sequenzielles Sampling, Input $0,042/MTok, Output $0.
|
||||||
|
|
||||||
|
| Modell | Hersteller | Ausgabe | Sampling | Preis | Status | Quelle |
|
||||||
|
|--------|-----------|---------|----------|-------|--------|--------|
|
||||||
|
| **Jev** (System One Model) | [TypeSafe AI](../../institutions/typesafe-ai.md) | type-safe structured values + kalibrierte Wahrscheinlichkeiten — **keine Strings** | parallel (ein Sample für alle Urteile) | $0,042/MTok Input, $0 Output | Early Access, 70–500 ms | [[system-one-models-jev.md]] |
|
||||||
|
|
||||||
|
**Abgrenzung:** Jev konkurriert nicht mit Chat-/Coding-Frontier-Modellen, sondern mit der Rolle von Klassifikatoren, Guardrails und DSPy-Pipelines — nur als Foundation-Model. „Zero Hallucinations" bedeutet Type-Safety (kein Formatfehler, keine erfundene Option), **nicht** Korrektheit. Alle Zahlen sind Anbieterangaben außer einem kleinen Fremdtest; Details und Quellenkritik in [[system-one-models-jev.md]].
|
||||||
|
|
||||||
|
**OpenClaw-Relevanz:** Entscheidungsmodelle adressieren die Gate-Schicht im Agenten-Ablauf (Verifikation, Routing, Jailbreak-Erkennung) — vgl. [[harness-vs-standalone-chat-llm.md]] und [[../agents/agent-budget-breaker.md]]. Für unser Routing kein Kandidat als Chat-Ersatz, aber als möglicher Prüf-Baustein.
|
||||||
|
|
||||||
**OpenClaw-Relevanz:** Mittelfristig könnten Griffin-artige Architekturen für lokal laufende Embedding/SSR-Modelle interessant werden. Diffusions-LLMs für parallele Code-Completion in nicht-Präfix-Positionen (Hermes-Agent-Code-Edit-Tasks). JEPA für Subconscious-Agent-"Simulations-Prior".
|
**OpenClaw-Relevanz:** Mittelfristig könnten Griffin-artige Architekturen für lokal laufende Embedding/SSR-Modelle interessant werden. Diffusions-LLMs für parallele Code-Completion in nicht-Präfix-Positionen (Hermes-Agent-Code-Edit-Tasks). JEPA für Subconscious-Agent-"Simulations-Prior".
|
||||||
|
|
||||||
---
|
---
|
||||||
|
|
@ -226,3 +238,4 @@ OpenRouter Fusion ([[llm-model-fusion-ensembles.md]]) ermöglicht parallele Mode
|
||||||
- [[../../tools/kimi-k2.7-code.md]] — Detailseite Kimi K2.7
|
- [[../../tools/kimi-k2.7-code.md]] — Detailseite Kimi K2.7
|
||||||
- [[../../tools/hermes-desktop.md]] — Agent-Framework mit Model-Picker
|
- [[../../tools/hermes-desktop.md]] — Agent-Framework mit Model-Picker
|
||||||
- [[../directives/pro-leben-directive.md]] — Philosophischer Rahmen: Cloud-Exit = Handlungsfähigkeit
|
- [[../directives/pro-leben-directive.md]] — Philosophischer Rahmen: Cloud-Exit = Handlungsfähigkeit
|
||||||
|
- [[system-one-models-jev.md]] — Jev / System One Models (TypeSafe AI): Entscheidungsmodelle ohne Textausgabe
|
||||||
|
|
@ -78,6 +78,7 @@ Der Rat "Sag mir kurz Bescheid und ich schalte das Modul scharf" ist ein struktu
|
||||||
- [[../../architecture/model-routing.md]] — Wie Tool-Definitionen in OpenClaw tatsächlich funktionieren
|
- [[../../architecture/model-routing.md]] — Wie Tool-Definitionen in OpenClaw tatsächlich funktionieren
|
||||||
- [[../ai-sycophancy.md|KI-Sycophancy & Algorithmic Insecurity]] — Unternehmensrisiko der Sycophancy (KW Norton Borders, 2026-08-09), Algorithmic Insecurity, Krise der menschlichen Souveränität
|
- [[../ai-sycophancy.md|KI-Sycophancy & Algorithmic Insecurity]] — Unternehmensrisiko der Sycophancy (KW Norton Borders, 2026-08-09), Algorithmic Insecurity, Krise der menschlichen Souveränität
|
||||||
- [[../prompt-hardening.md|Prompt Hardening]] — Gegenmaßnahme: logische Integrität durch robuste Prompt-Designs
|
- [[../prompt-hardening.md|Prompt Hardening]] — Gegenmaßnahme: logische Integrität durch robuste Prompt-Designs
|
||||||
|
- [[system-one-models-jev.md|Jev / System One Models]] — Gegenrichtung zur Sycophancy: kalibrierte Wahrscheinlichkeiten statt zustimmender Prosa; „Zero Hallucinations“ = Formatgarantie, keine Korrektheit (TypeSafe AI, 15.09.2026)
|
||||||
|
|
||||||
## Externe Quellen
|
## Externe Quellen
|
||||||
|
|
||||||
|
|
|
||||||
123
wiki/concepts/llm/system-one-models-jev.md
Normal file
123
wiki/concepts/llm/system-one-models-jev.md
Normal file
|
|
@ -0,0 +1,123 @@
|
||||||
|
---
|
||||||
|
created: 2026-09-17
|
||||||
|
updated: 2026-09-17
|
||||||
|
sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, blog/2026-09-16_theregister-typesafe-jev-doom.md]
|
||||||
|
tags: [concept, llm, typesafe, jev, system-one-models, rlcd, structured-outputs, calibrated-decisions, parallel-sampling, inference-cost, automation, harness]
|
||||||
|
---
|
||||||
|
|
||||||
|
# System One Models & Jev (TypeSafe AI)
|
||||||
|
|
||||||
|
> **Quelle:** TypeSafe-Ankündigungsartikel von Diogo Almeida (15.09.2026, https://typesafe.ai/blog/introducing-system-one-models-and-jev) + unabhängiger Test von Mike Taylor in Every (15.09.2026) + Video-Zusammenfassung von AI Copium (17.09.2026). Primärquelle = Anbieter; die unabhängige Prüfung ist ein Einzeltest mit kleinem Stichprobenumfang.
|
||||||
|
|
||||||
|
## Kernidee
|
||||||
|
|
||||||
|
**Jev** ist das erste Modell einer neuen Klasse, die TypeSafe **[[../../institutions/typesafe-ai.md|System One Models]]** nennt: keine Textgenerierung, sondern **typisierte probabilistische Entscheidungen** für Software. Anbieterselbstbeschreibung: „unstructured state in, typed probabilistic decisions out" — und „a frontier-intelligence function call".
|
||||||
|
|
||||||
|
Der Ansatz setzt auf **strukturierte Ausgaben mit vorab definierten Optionen** statt Strings, auf **paralleles Sampling** statt autoregressiver Token-Generierung und auf **kalibrierte Wahrscheinlichkeiten** statt überkonfidenter Fließtexte.
|
||||||
|
|
||||||
|
## Drei Konstruktions-Entscheidungen
|
||||||
|
|
||||||
|
| Achse | Bestehende LLMs | Jev |
|
||||||
|
|-------|-----------------|-----|
|
||||||
|
| Optimierung | RLHF / RLVR — menschliche Präferenz bzw. verifizierbare Rewards | **RLCD** (Reinforcement Learning for Calibrated Decisions) |
|
||||||
|
| Ausgabe | Strings — müssen geparst und validiert werden | **Type-safe structured values**; Ausgabeoptionen und Struktur vorab definiert |
|
||||||
|
| Sampling | sequenziell, ein Token nach dem anderen | **parallel**, alle Urteile in einer Query |
|
||||||
|
|
||||||
|
Zielgröße laut Anbieter: Werte nahe 1 sollen häufiger zutreffen; „If it flags 100 customer messages as having a 90 percent chance of expressing anger, about 90 should express anger" ([[../../people/mike-taylor.md|Mike Taylor]]).
|
||||||
|
|
||||||
|
## Anbieterangaben zu Kosten und Geschwindigkeit
|
||||||
|
|
||||||
|
| Kennzahl | TypeSafe-Angabe |
|
||||||
|
|----------|-----------------|
|
||||||
|
| End-to-end-Latenz | **70–500 ms** (LLMs laut Artikel 3–329 s) |
|
||||||
|
| Speedup | 40×–200× „for System One shaped queries"; Homepage-Claim **193,6× schneller** |
|
||||||
|
| Kosten-Input | **$0,042 / MTok** = $42 pro Milliarde Tokens |
|
||||||
|
| Kosten-Output | **$0** („too cheap to meter", da keine Token generiert werden) |
|
||||||
|
| Kosten-CLAIM Homepage | **444,6× günstiger** |
|
||||||
|
| Genauigkeit | „near state-of-the-art" auf den eigenen vier Workflows |
|
||||||
|
|
||||||
|
⚠️ Die im Videotitel/-beschreibung und im Kapitelmarken-Layout kursierende **„400x"**-Zahl findet sich in der Primärquelle nicht; dort stehen **193,6× / 444,6×**, und der Artikel ordnet selbst ein: „we expect that these are on the higher end of real world gains".
|
||||||
|
|
||||||
|
## Was „keine Halluzination" heißt — und was nicht
|
||||||
|
|
||||||
|
TypeSafe schreibt, Jev könne nicht halluzinieren; gemeint ist **Type-Safety**: Das Modell kann kein Feld mit falschem Typ füllen und keine Option erfinden, die nicht im Schema steht. Das ist laut Anbieter mathematisch garantiert („Schema matching is guaranteed").
|
||||||
|
|
||||||
|
Nicht gemeint ist semantische Korrektheit:
|
||||||
|
- Jev kann die **falsche Option wählen** — ein Rückerstattungsantrag kann „approve" erhalten, obwohl „reject" richtig wäre ([[../../people/mike-taylor.md|Taylor]] / AI Copium).
|
||||||
|
- Das ist keine neue Eigenschaft von Jev: LLMs lassen sich ebenfalls auf Formate zwingen (z. B. OpenAI Structured Outputs, DSPy).
|
||||||
|
|
||||||
|
**Merksatz fürs Wiki:** Type-Safety ist eine Formatgarantie, keine Wahrheitsgarantie. Der verwandte Mechanismus — Gate vs. probabilistische Generierung — steht in [[harness-vs-standalone-chat-llm.md]].
|
||||||
|
|
||||||
|
## Unabhängiger Test (Every, 15.09.2026)
|
||||||
|
|
||||||
|
Zwei Messungen, beide von **[[../../people/mike-taylor.md|Mike Taylor]]** (Head of Evals, [[../../institutions/every.md|Every]]):
|
||||||
|
|
||||||
|
**Test 1 — 37 Dokumente × 21 Fragen:**
|
||||||
|
- 27 eigene Every-Artikel + 10 bewusst KI-stilisierte Gegenstücke
|
||||||
|
- **777 Judgments in unter 0,7 Sekunden**, geschätzt **ein Viertel Cent**
|
||||||
|
- Eigenbewertung des Testerstellers: markierte KI-lastige Passagen korrekt, aber „I'd want a more thorough accuracy check before putting it into production"
|
||||||
|
|
||||||
|
**Test 2 — 12 synthetische Passagen, 4 Schreib-Checks ([[../../people/dan-shipper.md|Dan Shipper]]):**
|
||||||
|
|
||||||
|
| | Jev | Claude Fable 5.1 (high effort) |
|
||||||
|
|---|---|---|
|
||||||
|
| Median pro Passage | **0,35 s** | **8,83 s** |
|
||||||
|
| Geschwindigkeit | ~25× schneller | — |
|
||||||
|
| Kosten | ~580× niedriger | — |
|
||||||
|
| Defekte gefunden | **6 von 7** | **7 von 7** |
|
||||||
|
|
||||||
|
Jev verpasste in allen drei Runs dieselbe Passage („a shared appointment calendar that parents and staff teach together"). Über 11 Experimente: 1.709 Judgments für unter einem Cent.
|
||||||
|
|
||||||
|
**Was der Test nicht zeigt:** Breite über Branchen und Aufgabentypen. Der Autor sagt es selbst; die Zahl der Grundfälle ist einstellig.
|
||||||
|
|
||||||
|
## Quellenkritik der Benchmarks
|
||||||
|
|
||||||
|
Die eigenen Workflow-Evals messen **Übereinstimmung mit Referenzantworten** (Durchschnitt aus GPT-6 Astra und Fable 5.1), nicht unabhängig verifizierte Korrektheit. TypeSafe legt die Bias-Richtungen selbst offen:
|
||||||
|
|
||||||
|
- Referenzwahl „biases answers towards OpenAI and Anthropic's models" → eigene Leistung gegenüber DeepSeek vermutlich unterschätzt.
|
||||||
|
- Workflows „made by individuals on our model capabilities team, so some bias could exist" — aber nicht in der Trainingsverteilung.
|
||||||
|
- Die Vergleichs-LLMs liefen über einen eigenen Wrapper, der sie zu Wahrscheinlichkeiten zwingt: laut Artikel langsamer und teurer als freie Entscheidungen — das **vergrößert** den gemessenen Abstand.
|
||||||
|
- Die „0 %" in den Halluzinations-Plots sind **nicht empirisch**, sondern aus der Schema-Garantie abgeleitet.
|
||||||
|
- LLM-Vergleichszahlen stammen von OpenRouter (Routing-Bias möglich).
|
||||||
|
- Preis: „We can't prove it isn't subsidized; we'll need the long-term to prove the sustainability of our pricing."
|
||||||
|
|
||||||
|
## Einordnung
|
||||||
|
|
||||||
|
- **Neue Achse statt neuer Frontier.** Jev konkurriert nicht mit Chat- und Coding-Frontier-Modellen, sondern mit der Rolle, die bisher DSPy-Pipelines, Klassifikatoren und Guardrail-Modelle gespielt haben — nur als Foundation-Model. Das ist der eigentliche Beitrag: eine eigene Produktkategorie „Modell für Maschinen" (so auch die Presse-Formulierung „model for machines").
|
||||||
|
- **Preis als Freigrenze für Häufigkeit.** Die relevante Verschiebung ist nicht „billiger pro Call", sondern „Checks sind so billig, dass man sie während der Arbeit und nicht danach laufen lässt" — 1.709 Urteile für unter einem Cent. Praktische Konsequenz: dauerhafte Verifikation statt Stichprobe am Ende, vgl. [[../agents/agent-budget-breaker.md]] (Kostendeckel als Voraussetzung unbewachter Schleifen).
|
||||||
|
- **Der Linter-Vergleich ist stark.** „Ein Code-Linter für Wissensarbeit" beschreibt den Nutzen präziser als jede Benchmark-Zahl: schnell, billig, unvollständig genau, aber besser als gar keine Prüfung. Genau das ist auch seine Grenze — ein Linter ersetzt keinen Test.
|
||||||
|
- **Verifikation wird zur eigenen Fehlerquelle.** Wenn Prüf-Urteile von einem Modell kommen, das kalibriert, aber nicht korrekt ist, wandert die Fehlerquelle in das Gate. Kalibrierung ist die entscheidende Eigenschaft: Nur wenn 0,9 wirklich 90 % Trefferquote bedeutet, kann Code sinnvoll auf Wahrscheinlichkeiten branchen.
|
||||||
|
- **Latentes Reasoning als Nebenlinie.** Das Video zieht die Parallele zu OpenAIs *recurrent depth / looped transformers* — Reasoning im latenten Raum statt ausgeschriebener Gedankenkette — und nennt die Safety-Warnung, dass das die Überwachung erschwert. Das Video räumt selbst ein: „we don't know that Jev works the same way internally." Hier ist die Parallele Deutung, kein Befund.
|
||||||
|
- **Namensgebung als These:** „Jev" nach **William Stanley Jevons** — Jevons-Paradox: sinkende Kosten erhöhen den Verbrauch. Der Name ist das Programmm: Intelligenz wird billiger, also wird mehr davon verbraucht.
|
||||||
|
- Bezug zur Harness-Deutung unseres Wikis: Jev besetzt **weder Modell-Prompting noch Orchestrierung**, sondern die Gate-Schicht im Ablauf — vgl. [[harness-vs-standalone-chat-llm.md]] („Grounding-Tools verhindern keine probabilistische Generierung — nur Gates tun das") und [[../agents/harness-loop-graph-engineering.md]].
|
||||||
|
|
||||||
|
## Offene Punkte
|
||||||
|
|
||||||
|
- ⚠️ **Alle Leistungszahlen sind Anbieterangaben** außer dem einen Every-Einzeltest (37 Dokumente, 12 Passagen, 1.709 Judgments). Keine peer-reviewte Evaluation, keine breite Fremdprüfung.
|
||||||
|
- ⚠️ Kein unabhängiger Nachbau der vier Workflows; die Evals-Seite (https://evals.typesafe.ai/) wurde nicht ausgewertet.
|
||||||
|
- ⚠️ Architektur, Trainingsverfahren und Datenherkunft von Jev sind nicht veröffentlicht — ob paralleles Sampling die genannten Latenzen erklärt, ist nicht überprüfbar.
|
||||||
|
- Offen: ob der Preis ($42/Mrd. Input, $0 Output) nachhaltig ist — der Anbieter räumt Subvention nicht ausgeschlossen aus.
|
||||||
|
- Offen: Fehlerkosten bei falscher, aber kalibrierter Entscheidung — der Every-Test liefert dazu nur ein Datenpaar (6/7 vs. 7/7).
|
||||||
|
- [[../../institutions/typesafe-ai.md|TypeSafe]] hat drei Gründer (Almeida, Sheng, Gafni), Sitzt in San Francisco und ist **nicht** mit OpenAI verbunden — Almeida ist ehemaliger OpenAI-/Google-Brain-Forscher. Die Video-/Presse-Rahmung „a ChatGPT researcher" ist Zuschreibung, keine Firmenbeziehung.
|
||||||
|
|
||||||
|
## Verwandte Wiki-Seiten
|
||||||
|
|
||||||
|
- [[../../institutions/typesafe-ai.md]] — Firma, Team, Manifesto
|
||||||
|
- [[../../people/diogo-almeida.md]] — Gründer, InstructGPT-Mitautor
|
||||||
|
- [[../../people/mike-taylor.md]] — Autor des unabhängigen Tests
|
||||||
|
- [[../../people/dan-shipper.md]] — Every-CEO, Test 2
|
||||||
|
- [[../../institutions/every.md]] — Publikation des Fremdtests
|
||||||
|
- [[../../people/ai-copium.md]] — Kanal, der das Video gepostet hat
|
||||||
|
- [[harness-vs-standalone-chat-llm.md]] — Gate vs. Generierung
|
||||||
|
- [[llm-model-catalog.md]] — Modellkatalog
|
||||||
|
- [[../agents/agent-budget-breaker.md]] — Kostendeckel für unbewachte Schleifen
|
||||||
|
- [[../agents/harness-loop-graph-engineering.md]] — Harness-Ebene
|
||||||
|
- [[llm-sycophancy-confabulation.md]] — Fehlerklassen jenseits von Halluzination
|
||||||
|
|
||||||
|
## Quellen
|
||||||
|
|
||||||
|
- [TypeSafe: Introducing System One Models & Jev](https://typesafe.ai/blog/introducing-system-one-models-and-jev) (15.09.2026, abgerufen 17.09.2026)
|
||||||
|
- [Every: Mini-Vibe Check (Mike Taylor)](https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds) (15.09.2026)
|
||||||
|
- [AI Copium: „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…"](https://www.youtube.com/watch?v=xQtUzjd7-As) (17.09.2026, 14:25, vollständiges Transcript)
|
||||||
|
- Raw: `raw/blog/2026-09-15_typesafe-system-one-models-jev.md`, `raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md`, `raw/youtube/2026-09-17_aicopium-typesafe-jev.md`
|
||||||
|
- Erwähnung ohne auswertbaren Inhalt: [The Register](https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/5296711) (16.09.2026; Volltext nicht abrufbar, nur „Are we human?" extrahiert)
|
||||||
|
|
@ -2,7 +2,8 @@
|
||||||
|
|
||||||
*Auto-generated: 2026-07-07*
|
*Auto-generated: 2026-07-07*
|
||||||
|
|
||||||
*Letzte Aktualisierung: 2026-09-17 (215. Update — PRODOC `intent-chat`-Skill 1.0: statischer Vetting-Befund + Anbieterverifikation + Domain-Korrektur. Anlass: Download-Link in OME „Tips & Tricks". Raw: `raw/other/2026-09-17_intent-chat-skill-prodoc.md` (neu — SHA-256 `c960de5d…2c73`, 18 Dateien, 159,9 KiB entpackt; statischer Scan: kein Netz-/Exec-/Credential-Signal, keine Script-Tags/on-Handler/Injection/Pfad-Traversal, einzige Fremdhosts Google Fonts, `CHANGELOG.md` referenziert aber nicht im ZIP). Wiki-Update: `people/stefan-weimar.md` (Domain korrigiert: `prodoc-digital.com` HTTP 200 mit Impressum — GmbH Goslar, Geschäftsführer Weimar, Telefon +49 5321 7799404 deckungsgleich mit Skill-Kontakt; `prodoc.digital` liefert weiterhin keinen TLS-Handshake; neuer Abschnitt zum Skill als Werkzeugfassung derselben Spec-Driven-Doktrin; Cross-Refs). ⚠️ Nicht installiert, nichts ausgeführt. Zusatzbefund: Die Fremdprüfung eines anderen Bots nannte das Paket „192 KB"/„767 Zeichen" Description — gemessen sind es 159,9 KiB entpackt und 759 Zeichen.)*
|
*Letzte Aktualisierung: 2026-09-17 (216. Update — TypeSafe AI: System One Models & Jev — „Modelle für Maschinen" statt Chat. Anlass: YouTube-Link in OME Topic 13 (Kanal AI Copium, 17.09.2026, „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…", 14:25, **vollständiges Transcript** über Firecrawl). Primärquelle: TypeSafe-Ankündigungsartikel von Diogo Almeida (15.09.2026). Raw: `raw/youtube/2026-09-17_aicopium-typesafe-jev.md` (neu), `raw/blog/2026-09-15_typesafe-system-one-models-jev.md` (neu), `raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md` (neu), `raw/blog/2026-09-16_theregister-typesafe-jev-doom.md` (neu — ⚠️ Volltext nicht abrufbar). Wiki: `concepts/llm/system-one-models-jev.md` (neu — RLCD statt RLHF/RLVR, typisierte Ausgaben statt Strings, paralleles statt sequenzielles Sampling, 70–500 ms / $0,042 pro MTok Input / $0 Output; Anbieter-Claims 193,6× schneller und 444,6× günstiger; **„Zero Hallucinations" = Type-Safety, keine Wahrheitsgarantie**; Fremdtest Every: 777 Judgments in 0,7 s für einen Viertelcent, Jev 0,35 s/6-von-7 Defekten gegen Fable 5.1 8,83 s/7-von-7; Quellenkritik: Referenz-Übereinstimmung ≠ verifizierte Korrektheit, Wrapper-Overhead vergrößert den Abstand, Bias-Richtungen vom Anbieter selbst benannt), `institutions/typesafe-ai.md` (neu — Gründer Almeida/Sheng/Gafni, San Francisco, Manifesto „Composable AI — Build Prod, Not God"; Abgrenzung: nicht OpenAI), `people/diogo-almeida.md` (neu), `people/mike-taylor.md` (neu — Head of Evals bei Every), `people/dan-shipper.md` (neu), `people/ai-copium.md` (neu — Videotitel „400x" verdichtet die Primärquelle), `institutions/every.md` (neu). Cross-Refs: `llm-model-catalog.md`, `harness-vs-standalone-chat-llm.md`, `agent-budget-breaker.md`, `harness-loop-graph-engineering.md`, `llm-sycophancy-confabulation.md`. ⚠️ Leistungszahlen = Anbieterangaben außer einem Einzeltest mit kleinem Umfang; Architektur/Training/Datenherkunft nicht veröffentlicht.)*
|
||||||
|
*Vorherige Aktualisierung: 2026-09-17 (215. Update — PRODOC `intent-chat`-Skill 1.0: statischer Vetting-Befund + Anbieterverifikation + Domain-Korrektur. Anlass: Download-Link in OME „Tips & Tricks". Raw: `raw/other/2026-09-17_intent-chat-skill-prodoc.md` (neu — SHA-256 `c960de5d…2c73`, 18 Dateien, 159,9 KiB entpackt; statischer Scan: kein Netz-/Exec-/Credential-Signal, keine Script-Tags/on-Handler/Injection/Pfad-Traversal, einzige Fremdhosts Google Fonts, `CHANGELOG.md` referenziert aber nicht im ZIP). Wiki-Update: `people/stefan-weimar.md` (Domain korrigiert: `prodoc-digital.com` HTTP 200 mit Impressum — GmbH Goslar, Geschäftsführer Weimar, Telefon +49 5321 7799404 deckungsgleich mit Skill-Kontakt; `prodoc.digital` liefert weiterhin keinen TLS-Handshake; neuer Abschnitt zum Skill als Werkzeugfassung derselben Spec-Driven-Doktrin; Cross-Refs). ⚠️ Nicht installiert, nichts ausgeführt. Zusatzbefund: Die Fremdprüfung eines anderen Bots nannte das Paket „192 KB"/„767 Zeichen" Description — gemessen sind es 159,9 KiB entpackt und 759 Zeichen.)*
|
||||||
*Vorherige Aktualisierung: 2026-09-17 (214. Update — Stefan Weimar: Firmen-/Personendaten + Spec-Kit-Einordnung (Nachtrag, HermanButlerBot). Wiki-Update: `people/stefan-weimar.md` (PRODOC Digital GmbH, Goslar; Managing Director seit Juli 2025, davor TU Darmstadt; LinkedIn /in/prodoc; SNIC-PraxisForum 2026 mit Metalogie; bereits Meetup #2 am 16.08.2025; Mapping der vier Schritte auf GitHub Spec Kit `constitution → specify → plan → tasks → implement → converge`; Meetup-Domain korrekt kimeetuphannover.de, identische IP mit kiclub-hannover.de, beide 403; Hinweis auf Laura Askri in der Programm-Vorschau).)
|
*Vorherige Aktualisierung: 2026-09-17 (214. Update — Stefan Weimar: Firmen-/Personendaten + Spec-Kit-Einordnung (Nachtrag, HermanButlerBot). Wiki-Update: `people/stefan-weimar.md` (PRODOC Digital GmbH, Goslar; Managing Director seit Juli 2025, davor TU Darmstadt; LinkedIn /in/prodoc; SNIC-PraxisForum 2026 mit Metalogie; bereits Meetup #2 am 16.08.2025; Mapping der vier Schritte auf GitHub Spec Kit `constitution → specify → plan → tasks → implement → converge`; Meetup-Domain korrekt kimeetuphannover.de, identische IP mit kiclub-hannover.de, beide 403; Hinweis auf Laura Askri in der Programm-Vorschau).)
|
||||||
*Vorherige Aktualisierung: 2026-09-17 (213. Update — Stefan Weimar (PRODOC Digital): „Vier Schritte hin zum Agentic Engineering" (KI Meetup Hannover #5, Block 2). Raw: `raw/other/2026-09-17_weimar-agentic-engineering-spec-driven.md` (neu — zwei Fotos von Netbits). Wiki: `people/stefan-weimar.md` (neu — Ziel+Abnahmekriterien+Nicht-Ziele, Kontext als Anforderungsquelle, Dekomposition, Validierung pro Teil; Einordnung als Spec-Driven Development in Alltagssprache mit Cross-Ref auf das Tielke-Pattern; prodoc.digital TLS-Handshake fehlgeschlagen, Inhalt nicht abrufbar).)
|
*Vorherige Aktualisierung: 2026-09-17 (213. Update — Stefan Weimar (PRODOC Digital): „Vier Schritte hin zum Agentic Engineering" (KI Meetup Hannover #5, Block 2). Raw: `raw/other/2026-09-17_weimar-agentic-engineering-spec-driven.md` (neu — zwei Fotos von Netbits). Wiki: `people/stefan-weimar.md` (neu — Ziel+Abnahmekriterien+Nicht-Ziele, Kontext als Anforderungsquelle, Dekomposition, Validierung pro Teil; Einordnung als Spec-Driven Development in Alltagssprache mit Cross-Ref auf das Tielke-Pattern; prodoc.digital TLS-Handshake fehlgeschlagen, Inhalt nicht abrufbar).)
|
||||||
*Vorherige Aktualisierung: 2026-09-17 (212. Update — Udo A. Schacht (Rockstratege): Person + Angebot. Raw: `raw/other/2026-09-17_udo-schacht-rockstratege.md` (neu — rockstratege.com direkt gelesen). Wiki: `people/udo-schacht.md` (neu — 35+ Jahre Finanzmärkte, 21 Jahre Senior Director NORD/LB, EUREX-Händler/Market Maker, CTA (CFTC) seit 1989, Oxford „Generative AI for Finance" 2025, IHK EU AI Act Art. 4; Angebote 449–1.399 €, Masterclasses je 1.249 €, HERMES-AGENTIX-Framework; bemerkenswert offene Risiko-Kommunikation „Was ich dir nicht verspreche: Rendite"; Domain-Falle ROCKSTRATEGIE.com vs. rockstratege.com).)
|
*Vorherige Aktualisierung: 2026-09-17 (212. Update — Udo A. Schacht (Rockstratege): Person + Angebot. Raw: `raw/other/2026-09-17_udo-schacht-rockstratege.md` (neu — rockstratege.com direkt gelesen). Wiki: `people/udo-schacht.md` (neu — 35+ Jahre Finanzmärkte, 21 Jahre Senior Director NORD/LB, EUREX-Händler/Market Maker, CTA (CFTC) seit 1989, Oxford „Generative AI for Finance" 2025, IHK EU AI Act Art. 4; Angebote 449–1.399 €, Masterclasses je 1.249 €, HERMES-AGENTIX-Framework; bemerkenswert offene Risiko-Kommunikation „Was ich dir nicht verspreche: Rendite"; Domain-Falle ROCKSTRATEGIE.com vs. rockstratege.com).)
|
||||||
|
|
@ -219,6 +220,7 @@
|
||||||
| [Ox Alpha — Anonymes KI-Modell auf OpenRouter](concepts/llm/ox-alpha-anonymous-model.md) | Gerücht/Leak (2026-08-22, Insider leak of the day): mysteriöses anonymes Modell auf OpenRouter — 1M-Token-Kontext, multimodal, kein Owner — soll beim Coding Claude Fable 5 + GPT-5.6 Sol schlagen. GLM-identischer Tokenizer; vier vorherige anonyme Drops von chinesischen Labs beansprucht. Offene Herkunfts-Frage (Google vs. Z.ai). **Update 26.08. (EP106):** exakte Listing-Zahlen datiert auf 21.08.: 1.048.576 Kontext / 4.096 Max-Output, Stealth-Positionierung als Agentic-Coding-Reasoning-Modell, Capability-Beschreibung bricht mitten im Satz ab; read-heavy-Agent-Pipeline-Einordnung; Widerspruch zum 131k-Output-Gegencheck offen. ⚠️ Unbestätigt | xpost/2026-08-23_insiderleak-ox-alpha-anonymous-model.md + podcast/2026-08-26_agentstack-daily-ep106.md |
|
| [Ox Alpha — Anonymes KI-Modell auf OpenRouter](concepts/llm/ox-alpha-anonymous-model.md) | Gerücht/Leak (2026-08-22, Insider leak of the day): mysteriöses anonymes Modell auf OpenRouter — 1M-Token-Kontext, multimodal, kein Owner — soll beim Coding Claude Fable 5 + GPT-5.6 Sol schlagen. GLM-identischer Tokenizer; vier vorherige anonyme Drops von chinesischen Labs beansprucht. Offene Herkunfts-Frage (Google vs. Z.ai). **Update 26.08. (EP106):** exakte Listing-Zahlen datiert auf 21.08.: 1.048.576 Kontext / 4.096 Max-Output, Stealth-Positionierung als Agentic-Coding-Reasoning-Modell, Capability-Beschreibung bricht mitten im Satz ab; read-heavy-Agent-Pipeline-Einordnung; Widerspruch zum 131k-Output-Gegencheck offen. ⚠️ Unbestätigt | xpost/2026-08-23_insiderleak-ox-alpha-anonymous-model.md + podcast/2026-08-26_agentstack-daily-ep106.md |
|
||||||
| [Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density"](concepts/llm/qwen3.8-27b-alibaba.md) | HuggingFace-Release (Countdown bis 14.08.2026, 4.928 wartend). Kompaktes 27B-Modell der Qwen3.8-Generation mit "unmatched intelligence density". Kontrast zum 2.4T-MoE von Qwen 3.8. Lokal-relevant (27B läuft auf Consumer-HW). Release am selben Tag wie GLM-5.3-Review — chinesischer Release-Zyklus. **Update 18.08.:** jetzt auf Ollama lauffähig (`ollama run qwen3.8:27b`), dichte 27,8B-Architektur, Hybrid-Attention, 262k-Kontext (bis 1M via YaRN), multimodal, MTP-markierte Ollama-Tags für Inferenz-Speedup. **Update 19.08.:** DFlash 2 (Z Lab → Inco AI) erreicht 70 tok/s auf M5 Max MacBook Pro — bis 4,6× schneller als autoregressives Decoding via Speculative Decoding (Jun Song: „biggest breakthrough in local AI this year", nächste Innovation in Prefill/Gewichtskompression). Uncensored-Debatte: gregpr07 („no gates") vs. s1gmoid-Gegenposition (Verhältnismäßigkeit). **Update 20.08.:** Unsloth Dynamic 3.0-GGUFs für Qwen3.8-27B — neue UD-…-Dateien deutlich kleiner (UD-IQ1_S 6,2 GB bis Q6_K 22 GB), Qualität-zu-Größe verbessert, ≠ MTP/Speculative-Decoding. **Update 26.08. (EP106):** HF-Trending-Stand 21.08.: 11.836 Likes, 1.726.651 Downloads (>1,7 Mio), image-text-to-text, SafeTensors, Apache 2.0 | other/2026-08-14_qwen3.8-27b-huggingface-release.md + youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md + xpost/2026-08-19_junsong-dflash2-speculative-decoding.md + xpost/2026-08-19_gregpr07-qwen38-uncensored.md + xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md + podcast/2026-08-26_agentstack-daily-ep106.md |
|
| [Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density"](concepts/llm/qwen3.8-27b-alibaba.md) | HuggingFace-Release (Countdown bis 14.08.2026, 4.928 wartend). Kompaktes 27B-Modell der Qwen3.8-Generation mit "unmatched intelligence density". Kontrast zum 2.4T-MoE von Qwen 3.8. Lokal-relevant (27B läuft auf Consumer-HW). Release am selben Tag wie GLM-5.3-Review — chinesischer Release-Zyklus. **Update 18.08.:** jetzt auf Ollama lauffähig (`ollama run qwen3.8:27b`), dichte 27,8B-Architektur, Hybrid-Attention, 262k-Kontext (bis 1M via YaRN), multimodal, MTP-markierte Ollama-Tags für Inferenz-Speedup. **Update 19.08.:** DFlash 2 (Z Lab → Inco AI) erreicht 70 tok/s auf M5 Max MacBook Pro — bis 4,6× schneller als autoregressives Decoding via Speculative Decoding (Jun Song: „biggest breakthrough in local AI this year", nächste Innovation in Prefill/Gewichtskompression). Uncensored-Debatte: gregpr07 („no gates") vs. s1gmoid-Gegenposition (Verhältnismäßigkeit). **Update 20.08.:** Unsloth Dynamic 3.0-GGUFs für Qwen3.8-27B — neue UD-…-Dateien deutlich kleiner (UD-IQ1_S 6,2 GB bis Q6_K 22 GB), Qualität-zu-Größe verbessert, ≠ MTP/Speculative-Decoding. **Update 26.08. (EP106):** HF-Trending-Stand 21.08.: 11.836 Likes, 1.726.651 Downloads (>1,7 Mio), image-text-to-text, SafeTensors, Apache 2.0 | other/2026-08-14_qwen3.8-27b-huggingface-release.md + youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md + xpost/2026-08-19_junsong-dflash2-speculative-decoding.md + xpost/2026-08-19_gregpr07-qwen38-uncensored.md + xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md + podcast/2026-08-26_agentstack-daily-ep106.md |
|
||||||
| [Qwen 3.8-Flash-Next — Vorschau auf Qwen 4](concepts/llm/qwen3.8-flash-next-qwen4-preview.md) | Ankündigung (Stand 26.08., Release „noch diese Woche"): multimodales 125B-MoE mit ~6B aktiven Parametern pro Token (+51B N-Gramm-Embedding-Parameter), vom Qwen-Team explizit als **Architektur-Vorschau auf Qwen 4** gerahmt, kein fertiges Produkt. Claim laut NVIDIA-Developer-Forum: Qwen-3.7-Plus-Niveau bei ~1/9 der Trainingskosten, Stärke Coding. ⚠️ Keine Benchmarks publiziert, Parameterzahlen unverifiziert. Kontext: Alibabas 10,2 Mrd USD Aktienplatzierung (größte HK-Folgeemission, ~3× überzeichnet) für full-stack-AI-Infrastruktur | other/2026-08-26_qwen38-flash-next-qwen4-preview.md |
|
| [Qwen 3.8-Flash-Next — Vorschau auf Qwen 4](concepts/llm/qwen3.8-flash-next-qwen4-preview.md) | Ankündigung (Stand 26.08., Release „noch diese Woche"): multimodales 125B-MoE mit ~6B aktiven Parametern pro Token (+51B N-Gramm-Embedding-Parameter), vom Qwen-Team explizit als **Architektur-Vorschau auf Qwen 4** gerahmt, kein fertiges Produkt. Claim laut NVIDIA-Developer-Forum: Qwen-3.7-Plus-Niveau bei ~1/9 der Trainingskosten, Stärke Coding. ⚠️ Keine Benchmarks publiziert, Parameterzahlen unverifiziert. Kontext: Alibabas 10,2 Mrd USD Aktienplatzierung (größte HK-Folgeemission, ~3× überzeichnet) für full-stack-AI-Infrastruktur | other/2026-08-26_qwen38-flash-next-qwen4-preview.md |
|
||||||
|
| [System One Models & Jev (TypeSafe AI)](concepts/llm/system-one-models-jev.md) | Neue Modellklasse **für Maschinen statt Menschen**: kein Text, sondern typisierte probabilistische Entscheidungen („smart if-statements"), **RLCD** statt RLHF/RLVR, **paralleles** statt sequenzielles Sampling. Anbieterangaben: 70–500 ms End-to-end, Input $0,042/MTok, Output $0, **193,6× schneller / 444,6× günstiger**. „Zero Hallucinations" = Type-Safety (kein Formatfehler, keine erfundene Option) — **keine** Wahrheitsgarantie, das Modell kann die falsche Option wählen. Einziger Fremdtest (Every, 15.09.): 777 Judgments in 0,7 s für einen Viertelcent; gegen Claude Fable 5.1 ~25× schneller und ~580× günstiger, aber 6-von-7 statt 7-von-7 Defekten. Gründer **Diogo Almeida** (InstructGPT-Mitautor, ex-OpenAI/Google Brain); Firma unabhängig von OpenAI. ⚠️ Architektur/Training/Datenherkunft nicht veröffentlicht | youtube/2026-09-17_aicopium-typesafe-jev.md + blog/2026-09-15_typesafe-system-one-models-jev.md + blog/2026-09-15_every-mike-taylor-jev-vibe-check.md |
|
||||||
| [DeepSeek V4-Pro GA + Harness v0.1 (Open Source)](concepts/llm/deepseek-v4-pro-ga-harness-open-source.md) | DeepSeek launcht 13.08.2026 Open Source: V4-Pro GA (App/Web/API, Reasoning-Effort low/high/max, OpenAI-Responses-API + Codex, Peak/Off-Peak-Pricing) + DeepSeek Harness v0.1 (MIT, Open-Source-Agent-Harness, Rivale zu Claude Code). Dritter Baustein der chinesischen Welle in 24h. **Update 21.08.:** Deep-Dive-Video zum Harness (Stephen G. Pope) + Turing-Post-TV-Video "The End Of Coding Agents". **Update 02.09.:** WorldofAI-Video "Claude Code & Codex Killer?" (3. Blickwinkel, erweitert um OpenAI/Codex) + Herman-DSH-Details (Everything-is-a-Plugin/Cordis, Trajectory-View, Web-UI-Remote, ~122k Stars; ⚠️ Second-hand) | other/2026-08-14_deepseek-v4-pro-ga-harness-open-source.md + youtube/2026-08-13_deepseek-v4-pro-0813-aicodeking.md + youtube/2026-08-21_deepseek-agent-harness-explained.md + youtube/2026-08-21_deepseek-harness-end-of-coding-agents.md + youtube/2026-09-02_worldofai-deepseek-harness-claude-code-codex-killer.md + other/2026-09-02_herman-deepseek-harness-dsh-summary.md |
|
| [DeepSeek V4-Pro GA + Harness v0.1 (Open Source)](concepts/llm/deepseek-v4-pro-ga-harness-open-source.md) | DeepSeek launcht 13.08.2026 Open Source: V4-Pro GA (App/Web/API, Reasoning-Effort low/high/max, OpenAI-Responses-API + Codex, Peak/Off-Peak-Pricing) + DeepSeek Harness v0.1 (MIT, Open-Source-Agent-Harness, Rivale zu Claude Code). Dritter Baustein der chinesischen Welle in 24h. **Update 21.08.:** Deep-Dive-Video zum Harness (Stephen G. Pope) + Turing-Post-TV-Video "The End Of Coding Agents". **Update 02.09.:** WorldofAI-Video "Claude Code & Codex Killer?" (3. Blickwinkel, erweitert um OpenAI/Codex) + Herman-DSH-Details (Everything-is-a-Plugin/Cordis, Trajectory-View, Web-UI-Remote, ~122k Stars; ⚠️ Second-hand) | other/2026-08-14_deepseek-v4-pro-ga-harness-open-source.md + youtube/2026-08-13_deepseek-v4-pro-0813-aicodeking.md + youtube/2026-08-21_deepseek-agent-harness-explained.md + youtube/2026-08-21_deepseek-harness-end-of-coding-agents.md + youtube/2026-09-02_worldofai-deepseek-harness-claude-code-codex-killer.md + other/2026-09-02_herman-deepseek-harness-dsh-summary.md |
|
||||||
| [DeepSeek-V4.1-Flash](concepts/llm/deepseek-v4.1-flash.md) | Kleinstes Modell einer neuen DeepSeek-Architektur-Familie (552B-MoE, Causal-Encoder–Decoder, nativ multimodal; offizielle Benchmark-Tabelle). **Update 10.09.:** auf Nous Portal verfügbar (`/model deepseek/deepseek-v4.1-flash`; Listung $0,24/$0,96 per 1M) — Route `nous/deepseek/deepseek-v4.1-flash` in unserem Setup konfiguriert. **Update 17.09.:** Lokale-Inferenz-Sektion ergänzt — Hardware-Stufen, Q2/Q4, Payback (siehe `concepts/hardware/deepseek-v41-flash-lokale-hardware.md`) | xpost/2026-09-10_deepseek-v41-flash-official-release.md + other/2026-09-10_deepseek-v41-flash-official-announcement.md + other/2026-09-10_deepseek-api-updates-changelog.md + youtube/2026-09-10_deepseek-v41-flash-aicodeking.md + xpost/2026-09-10_hermeswatcher-deepseek-v41-flash-nous-portal.md + youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md |
|
| [DeepSeek-V4.1-Flash](concepts/llm/deepseek-v4.1-flash.md) | Kleinstes Modell einer neuen DeepSeek-Architektur-Familie (552B-MoE, Causal-Encoder–Decoder, nativ multimodal; offizielle Benchmark-Tabelle). **Update 10.09.:** auf Nous Portal verfügbar (`/model deepseek/deepseek-v4.1-flash`; Listung $0,24/$0,96 per 1M) — Route `nous/deepseek/deepseek-v4.1-flash` in unserem Setup konfiguriert. **Update 17.09.:** Lokale-Inferenz-Sektion ergänzt — Hardware-Stufen, Q2/Q4, Payback (siehe `concepts/hardware/deepseek-v41-flash-lokale-hardware.md`) | xpost/2026-09-10_deepseek-v41-flash-official-release.md + other/2026-09-10_deepseek-v41-flash-official-announcement.md + other/2026-09-10_deepseek-api-updates-changelog.md + youtube/2026-09-10_deepseek-v41-flash-aicodeking.md + xpost/2026-09-10_hermeswatcher-deepseek-v41-flash-nous-portal.md + youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md |
|
||||||
| [Chinesische Modelle räumen global die Usage-Charts ab](concepts/llm/chinese-models-top-usage-charts.md) | OpenRouter: Top-5 der wöchentlichen Token-Nutzung (28.07.–03.08.2026) alle chinesisch, 56,8 Bio. Tokens, 15 Wochen in Folge führend, DeepSeek-V4-Flash Platz 1. Kimi-K3-Schock (2,8T, größtes Open-Weight-Modell, GPU-Kapazität nach 48h erschöpft, PHLX-Semi-Index −20%). Vierter Baustein der chinesischen Welle in 24h — jetzt auf Marktanteils-Ebene | other/2026-08-14_chinese-models-top-usage-charts-kimi-k3-shock.md |
|
| [Chinesische Modelle räumen global die Usage-Charts ab](concepts/llm/chinese-models-top-usage-charts.md) | OpenRouter: Top-5 der wöchentlichen Token-Nutzung (28.07.–03.08.2026) alle chinesisch, 56,8 Bio. Tokens, 15 Wochen in Folge führend, DeepSeek-V4-Flash Platz 1. Kimi-K3-Schock (2,8T, größtes Open-Weight-Modell, GPU-Kapazität nach 48h erschöpft, PHLX-Semi-Index −20%). Vierter Baustein der chinesischen Welle in 24h — jetzt auf Marktanteils-Ebene | other/2026-08-14_chinese-models-top-usage-charts-kimi-k3-shock.md |
|
||||||
|
|
@ -414,6 +416,10 @@
|
||||||
| [Dr. Hendrik Susemihl](people/hendrik-susemihl.md) | KI-Experte, Gast der Everlast-Expertenrunde "DAS wird alles zum KIPPEN bringen!" (19.08.2026) | youtube/2026-08-19_ki-experten-alles-zum-kippen.md |
|
| [Dr. Hendrik Susemihl](people/hendrik-susemihl.md) | KI-Experte, Gast der Everlast-Expertenrunde "DAS wird alles zum KIPPEN bringen!" (19.08.2026) | youtube/2026-08-19_ki-experten-alles-zum-kippen.md |
|
||||||
| [Ronnie (Everlast-Expertenrunde)](people/ronnie-everlast-expertenrunde.md) | Teilnehmer der Everlast-Expertenrunde "DAS wird alles zum KIPPEN bringen!" (19.08.2026) | youtube/2026-08-19_ki-experten-alles-zum-kippen.md |
|
| [Ronnie (Everlast-Expertenrunde)](people/ronnie-everlast-expertenrunde.md) | Teilnehmer der Everlast-Expertenrunde "DAS wird alles zum KIPPEN bringen!" (19.08.2026) | youtube/2026-08-19_ki-experten-alles-zum-kippen.md |
|
||||||
| [Francois Chaubard](people/francois-chaubard.md) | Visiting Partner YC, PhD AI Stanford, Founder/CEO Focal Systems (Stanford, CA). Post „this was wild amounts of disinformation / fear mongering" (10.09.2026): Kritik an der „independent volition"-Darstellung des Hugging-Face-Vorfalls, am Navier-Stokes-Framing und an US-Regulierung als Chinapolitik; These einer millionenschweren Fear-Kampagne. 156.684 Views | xpost/2026-09-10_francois-chaubard-ai-fear-campaign.md |
|
| [Francois Chaubard](people/francois-chaubard.md) | Visiting Partner YC, PhD AI Stanford, Founder/CEO Focal Systems (Stanford, CA). Post „this was wild amounts of disinformation / fear mongering" (10.09.2026): Kritik an der „independent volition"-Darstellung des Hugging-Face-Vorfalls, am Navier-Stokes-Framing und an US-Regulierung als Chinapolitik; These einer millionenschweren Fear-Kampagne. 156.684 Views | xpost/2026-09-10_francois-chaubard-ai-fear-campaign.md |
|
||||||
|
| [Diogo Almeida](people/diogo-almeida.md) | Forscher und Unternehmer: **CEO/Gründer von [TypeSafe AI](institutions/typesafe-ai.md)** (San Francisco). Co-Autor von **RLHF** und des **InstructGPT-Papers** (arXiv:2203.02155, 2022) bei OpenAI, zuvor Google Brain. Zwei Jahre Stealth, dann Launch von **Jev** (15.09.2026). Positionen: „The problem is the text itself"; „Models have been superhuman at chat for years, so where is all the automation?" ⚠️ Die Rahmung „a ChatGPT researcher" bezeichnet seine Biografie, nicht eine Firmenbeziehung | blog/2026-09-15_typesafe-system-one-models-jev.md + blog/2026-09-15_every-mike-taylor-jev-vibe-check.md + youtube/2026-09-17_aicopium-typesafe-jev.md |
|
||||||
|
| [Mike Taylor](people/mike-taylor.md) | **Head of Evals bei [Every](institutions/every.md)**, Autor des ersten unabhängigen Tests von Jev (15.09.2026): 37 Dokumente × 21 Fragen = **777 Judgments in 0,7 s** für geschätzt einen Viertelcent; benennt selbst die Grenzen („doesn't establish performance across entire industries"; „The alternative is not checking at all"). Für das Wiki der Unterschied zwischen Anbieterangabe und Fremdprüfung | blog/2026-09-15_every-mike-taylor-jev-vibe-check.md |
|
||||||
|
| [Dan Shipper](people/dan-shipper.md) | **CEO von [Every](institutions/every.md)**. Führte am 15.09.2026 den direkteren Jev-Test durch: 12 synthetische Passagen, 4 Schreib-Checks — Jev 0,35 s/Passage und ~580× günstiger, aber **6-von-7** Defekten gegen Claude Fable 5.1 (8,83 s) mit **7-von-7**; derselbe Defekt in drei Runs verpasst | blog/2026-09-15_every-mike-taylor-jev-vibe-check.md |
|
||||||
|
| [AI Copium](people/ai-copium.md) | YouTube-Kanal **@AICopium** mit KI-Nachrichten-/Erklärformat. Video „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…" (17.09.2026, 14:25; vollständiges Transcript) zum TypeSafe-Launch — zitiert die Fremdzahlen korrekt und entlarvt „Zero Hallucinations" als irreführend, verdichtet aber im Titel auf „400x" (Primärquelle: 193,6×/444,6×) | youtube/2026-09-17_aicopium-typesafe-jev.md |
|
||||||
|
|
||||||
*(Weitere Kandidaten: Graeme (gkisokay), Mr. Cy (Cyb3rblade), Pit Weber (Kai) — bei Bedarf nachziehen)*
|
*(Weitere Kandidaten: Graeme (gkisokay), Mr. Cy (Cyb3rblade), Pit Weber (Kai) — bei Bedarf nachziehen)*
|
||||||
|
|
||||||
|
|
@ -464,6 +470,8 @@
|
||||||
| [Turing Post TV](institutions/turing-post-tv.md) | YouTube-Kanal des "Turing Post"-Medienangebots mit KI-Fokus (Modelle, Agent-Technologie). Video "Why DeepSeek Harness Is The End Of Coding Agents as We Know Them" (21.08.2026) — zweiter Blickwinkel auf den DeepSeek Harness. ⚠️ Metadata-only, kein Transcript | youtube/2026-08-21_deepseek-harness-end-of-coding-agents.md |
|
| [Turing Post TV](institutions/turing-post-tv.md) | YouTube-Kanal des "Turing Post"-Medienangebots mit KI-Fokus (Modelle, Agent-Technologie). Video "Why DeepSeek Harness Is The End Of Coding Agents as We Know Them" (21.08.2026) — zweiter Blickwinkel auf den DeepSeek Harness. ⚠️ Metadata-only, kein Transcript | youtube/2026-08-21_deepseek-harness-end-of-coding-agents.md |
|
||||||
| [KI.club Hannover e.V. (i.G.)](institutions/ki-club-hannover.md) | Trägerverein hinter dem [[events/ki-meetup-hannover.md|KI Meetup Hannover]] — Verein in Gründung (noch nicht rechtsfähig, persönliche Haftung § 54 S. 2 BGB), Sitz Kopernikusstraße 14, 30167 Hannover; Vorstand: Dawid Patek (Vors.), Paulina Piekarska, Dr. Tanja Kaschubs-Saeedi, Ana Tosheva. Claim „Künstliche Intelligenz. Echte Menschen." Treffen letzter Donnerstag im Monat, nächster 29.10.2026. Kanäle: LinkedIn, WhatsApp-Kanal, MailerLite-Newsletter; Hosting Aftermarket.pl, „Powered by Hafven". Verifiziert: kiclub-hannover.de und kimeetuphannover.de auf derselben IP 185.253.215.17 | other/2026-09-17_ki-club-hannover.md |
|
| [KI.club Hannover e.V. (i.G.)](institutions/ki-club-hannover.md) | Trägerverein hinter dem [[events/ki-meetup-hannover.md|KI Meetup Hannover]] — Verein in Gründung (noch nicht rechtsfähig, persönliche Haftung § 54 S. 2 BGB), Sitz Kopernikusstraße 14, 30167 Hannover; Vorstand: Dawid Patek (Vors.), Paulina Piekarska, Dr. Tanja Kaschubs-Saeedi, Ana Tosheva. Claim „Künstliche Intelligenz. Echte Menschen." Treffen letzter Donnerstag im Monat, nächster 29.10.2026. Kanäle: LinkedIn, WhatsApp-Kanal, MailerLite-Newsletter; Hosting Aftermarket.pl, „Powered by Hafven". Verifiziert: kiclub-hannover.de und kimeetuphannover.de auf derselben IP 185.253.215.17 | other/2026-09-17_ki-club-hannover.md |
|
||||||
| [Decoder (The Verge)](institutions/decoder-the-verge.md) | Tech-Podcast von The Verge (Vox Media Podcast Network), Host Nilay Patel. Episode 257 "Welcome to the AI crisis in math" (Gast Robert Hart) — Debatte/Existenzkrise in der Mathematik-Community, da Frontier-KI-Modelle sehr gut in Mathe geworden sind. Passt als Datenpunkt zur Intelligence-Commoditization-These (Frontier-KI dringt in High-Stakes-Reasoning vor). ⚠️ Episodeninhalt nicht transkribiert/verifiziert | other/2026-08-20_decoder-ai-crisis-in-math.md |
|
| [Decoder (The Verge)](institutions/decoder-the-verge.md) | Tech-Podcast von The Verge (Vox Media Podcast Network), Host Nilay Patel. Episode 257 "Welcome to the AI crisis in math" (Gast Robert Hart) — Debatte/Existenzkrise in der Mathematik-Community, da Frontier-KI-Modelle sehr gut in Mathe geworden sind. Passt als Datenpunkt zur Intelligence-Commoditization-These (Frontier-KI dringt in High-Stakes-Reasoning vor). ⚠️ Episodeninhalt nicht transkribiert/verifiziert | other/2026-08-20_decoder-ai-crisis-in-math.md |
|
||||||
|
| [TypeSafe AI](institutions/typesafe-ai.md) | AI-Lab in **San Francisco**, gegründet von Diogo Almeida (CEO), Sasha Sheng (COO, ex-Meta/FAIR), Erik Gafni (CTO). Nach zwei Jahren Stealth am **15.09.2026** mit dem ersten **System One Model** „Jev" an die Öffentlichkeit (Early Access). Manifesto „Composable AI — Build Prod, Not God": nicht mehr Intelligenz, sondern **komponierbare** Intelligenz — „Intelligence today is like databases before SQL". Kutsche-Analogie: heutige KI sei „trained to be a helpful, articulate, pleasant assistant" und brauche deshalb Menschen im Loop. ⚠️ Kein Teil von OpenAI — nur Almeidas frühere Station | blog/2026-09-15_typesafe-system-one-models-jev.md + blog/2026-09-15_every-mike-taylor-jev-vibe-check.md |
|
||||||
|
| [Every](institutions/every.md) | US-Medien-/Weiterbildungs-Publikation für KI- und Builder-Themen (every.to). **Ort des ersten unabhängigen Jev-Tests** (15.09.2026) in der Rubrik *Also True for Humans*. Bemerkenswert, weil die Redaktion **Evals als Handwerk** betreibt und dokumentiert: Personal Benchmarks (5–10 Aufgaben, Präferenzen als Pass/Fail-Checks), Skill zur Erkennung von KI-Schreibmustern (Quelle der 21 Testfragen), Judgment-Lab mit 11 Experimenten — und ein Artikel, der die Grenzen der eigenen Messung offenlegt | blog/2026-09-15_every-mike-taylor-jev-vibe-check.md |
|
||||||
|
|
||||||
## Decisions
|
## Decisions
|
||||||
|
|
||||||
|
|
@ -678,3 +686,7 @@
|
||||||
| `raw/other/2026-09-17_udo-schacht-rockstratege.md` | other | Udo A. Schacht (Rockstratege, Bückeburg), direkt von rockstratege.com gelesen (Web-Fetch 17.09.2026, HTTP 200; A-Record 195.34.83.119): 35+ Jahre Finanzmärkte, 21 J. Senior Director NORD/LB, EUREX-Händler/Market Maker, CTA (CFTC) seit 1989, Oxford „Generative AI for Finance" 2025, IHK EU AI Act Art. 4, Buch „Trading neu denken". Preise (Stand Juli 2026): Basis 449 €, Premium inkl. EU-AI-Act-Zertifikat 799 €, VIP 1.399 € (Q4 2026, max. 10), CB Intelligence 1.249 € (Q1 2027), Agentic AI/HERMES-AGENTIX 1.249 €, Firmen auf Anfrage; 14 Tage Geld-zurück, Ratenzahlung. Risiko-Kommunikation: „Was ich dir nicht verspreche: Rendite. Die Mehrheit aktiver Trader verliert Geld…", Totalverlusthinweis, keine Anlageberatung (kein BaFin-Institut). Formate: #turnaroundtuesday, ki-trading.ai |
|
| `raw/other/2026-09-17_udo-schacht-rockstratege.md` | other | Udo A. Schacht (Rockstratege, Bückeburg), direkt von rockstratege.com gelesen (Web-Fetch 17.09.2026, HTTP 200; A-Record 195.34.83.119): 35+ Jahre Finanzmärkte, 21 J. Senior Director NORD/LB, EUREX-Händler/Market Maker, CTA (CFTC) seit 1989, Oxford „Generative AI for Finance" 2025, IHK EU AI Act Art. 4, Buch „Trading neu denken". Preise (Stand Juli 2026): Basis 449 €, Premium inkl. EU-AI-Act-Zertifikat 799 €, VIP 1.399 € (Q4 2026, max. 10), CB Intelligence 1.249 € (Q1 2027), Agentic AI/HERMES-AGENTIX 1.249 €, Firmen auf Anfrage; 14 Tage Geld-zurück, Ratenzahlung. Risiko-Kommunikation: „Was ich dir nicht verspreche: Rendite. Die Mehrheit aktiver Trader verliert Geld…", Totalverlusthinweis, keine Anlageberatung (kein BaFin-Institut). Formate: #turnaroundtuesday, ki-trading.ai |
|
||||||
| `raw/other/2026-09-17_weimar-agentic-engineering-spec-driven.md` | other | Stefan Weimar (PRODOC Digital), KI Meetup Hannover #5, Block 2 (Fotos von Netbits @NetLightning, 17.09.2026): Folie „Vier Schritte hin zum Agentic Engineering" — (1) „Schreibt auf, was herauskommen soll", woran man Erreichen erkennt und was nicht dazugehört; (2) „Sagt, für wen und in welchem Umfeld gebaut wird" — daraus zieht die KI Anforderungen, die man selbst nicht kennt; (3) Aufgabe in Teile zerlegen, Abhängigkeiten festhalten; (4) jeden Teil für sich prüfen, bevor weitergebaut wird. Fußzeile „Dipl.-Ing. Stefan Weimar", Kopf-Logo als „EPRODOC" gelesen. Zweites Foto: QR-Code-Slide, Roll-ups KI.club Hannover + Udo-A.-Schacht-Banner. ⚠️ OCR; prodoc.digital TLS-Handshake-Fehler |
|
| `raw/other/2026-09-17_weimar-agentic-engineering-spec-driven.md` | other | Stefan Weimar (PRODOC Digital), KI Meetup Hannover #5, Block 2 (Fotos von Netbits @NetLightning, 17.09.2026): Folie „Vier Schritte hin zum Agentic Engineering" — (1) „Schreibt auf, was herauskommen soll", woran man Erreichen erkennt und was nicht dazugehört; (2) „Sagt, für wen und in welchem Umfeld gebaut wird" — daraus zieht die KI Anforderungen, die man selbst nicht kennt; (3) Aufgabe in Teile zerlegen, Abhängigkeiten festhalten; (4) jeden Teil für sich prüfen, bevor weitergebaut wird. Fußzeile „Dipl.-Ing. Stefan Weimar", Kopf-Logo als „EPRODOC" gelesen. Zweites Foto: QR-Code-Slide, Roll-ups KI.club Hannover + Udo-A.-Schacht-Banner. ⚠️ OCR; prodoc.digital TLS-Handshake-Fehler |
|
||||||
| `raw/other/2026-09-17_intent-chat-skill-prodoc.md` | other | PRODOC Digital GmbH: `intent-chat`-Skill 1.0 als ZIP (https://prodoc-digital.com/downloads/ic-7k3q9v/intent-chat-skill-1.0.zip, SHA-256 `c960de5d…2c73`, 18 Dateien, 159,9 KiB entpackt). Inhalt: SKILL.md + 9 References + 5 Canvas-Templates + owlist-ci.css + build.py + LIESMICH; drei Modi (Anwendung/Engagement/Strategie), sechs Schritte, zweistufiger Self-Check, Anti-Patterns F1–F9; Methodik-Träger Körting Institut (KISB) / OWLIST GmbH (Framework „Intentron"). Statischer Befund: kein Netz-/Exec-/Credential-Signal, keine Script-Tags/on-Handler, keine Injection, keine Pfad-Traversal; einzige Fremdhosts `fonts.googleapis.com`/`fonts.gstatic.com`; `CHANGELOG.md` referenziert aber nicht im ZIP. Self-deklariertes Claude-Artefakt (liest `.claude/environment.json`, bindet Artefakt an Canvas-URL). Anbieterverifikation: Impressum `prodoc-digital.com/impressum` — GmbH Am Sachsenhai 4, 38642 Goslar, Geschäftsführer Stefan Weimar, Telefon +49 5321 7799404 (deckungsgleich mit LIESMICH-Kontakt). Wiki: `people/stefan-weimar.md`. ⚠️ Nicht installiert, nicht ausgeführt; Fremdangaben |
|
| `raw/other/2026-09-17_intent-chat-skill-prodoc.md` | other | PRODOC Digital GmbH: `intent-chat`-Skill 1.0 als ZIP (https://prodoc-digital.com/downloads/ic-7k3q9v/intent-chat-skill-1.0.zip, SHA-256 `c960de5d…2c73`, 18 Dateien, 159,9 KiB entpackt). Inhalt: SKILL.md + 9 References + 5 Canvas-Templates + owlist-ci.css + build.py + LIESMICH; drei Modi (Anwendung/Engagement/Strategie), sechs Schritte, zweistufiger Self-Check, Anti-Patterns F1–F9; Methodik-Träger Körting Institut (KISB) / OWLIST GmbH (Framework „Intentron"). Statischer Befund: kein Netz-/Exec-/Credential-Signal, keine Script-Tags/on-Handler, keine Injection, keine Pfad-Traversal; einzige Fremdhosts `fonts.googleapis.com`/`fonts.gstatic.com`; `CHANGELOG.md` referenziert aber nicht im ZIP. Self-deklariertes Claude-Artefakt (liest `.claude/environment.json`, bindet Artefakt an Canvas-URL). Anbieterverifikation: Impressum `prodoc-digital.com/impressum` — GmbH Am Sachsenhai 4, 38642 Goslar, Geschäftsführer Stefan Weimar, Telefon +49 5321 7799404 (deckungsgleich mit LIESMICH-Kontakt). Wiki: `people/stefan-weimar.md`. ⚠️ Nicht installiert, nicht ausgeführt; Fremdangaben |
|
||||||
|
| `raw/youtube/2026-09-17_aicopium-typesafe-jev.md` | youtube | AI Copium (@AICopium): „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…" (https://www.youtube.com/watch?v=xQtUzjd7-As, 17.09.2026, 14:25, ~6.797 Views / 226 Likes; verlinkt in OME Topic 13). **Vollständiges Transcript** (Firecrawl) + Beschreibung + Kapitelmarken. Anbieterfremde Rahmung: Titel „MASSIVE" und „400x", Primärquelle nennt 193,6× schnell / 444,6× günstig. Inhalt: System-One-Modelle, RLCD, paralleles Sampling, $42/Mrd. Tokens Input + $0 Output, „Zero Hallucinations" entkräftet, Every-Zahlen inkl. Unterlegenheit, DOOM mit ~10 Queries/s. Wiki: `concepts/llm/system-one-models-jev.md` (neu), `people/ai-copium.md` (neu) |
|
||||||
|
| `raw/blog/2026-09-15_typesafe-system-one-models-jev.md` | blog | TypeSafe AI / Diogo Almeida: „Introducing System One Models & Jev" (https://typesafe.ai/blog/introducing-system-one-models-and-jev, 15.09.2026, abgerufen 17.09.2026). Primärquelle: neue Modellklasse (paralleler Sampler, RLCD), Jev in Early Access; Vergleichstabelle LLM vs. System One; Preise $0,042/MTok Input, Output $0; 70–500 ms; Homepage-Claims 193,6×/444,6×; Workflow-Evals gegen GPT-6 Astra + Fable 5.1 als Referenz; „0 %"-Halluzinationswert nicht empirisch; Namensherkunft Kahneman/Jevons. ⚠️ Anbieterselbstauskunft | Wiki: `concepts/llm/system-one-models-jev.md` (neu) |
|
||||||
|
| `raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md` | blog | Every / Mike Taylor: „Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds" (15.09.2026). **Erster unabhängiger Test**: 37 Dokumente × 21 Fragen = 777 Judgments in <0,7 s für ~¼ Cent; Test 2 (Dan Shipper) 12 synthetische Passagen, Jev 0,35 s/6-von-7 vs. Fable 5.1 8,83 s/7-von-7, ~580× günstiger; 11 Experimente/1.709 Judgments <1 Cent; Methodengrenzen vom Autor selbst benannt. Wiki: `concepts/llm/system-one-models-jev.md` (neu), `people/mike-taylor.md` (neu), `people/dan-shipper.md` (neu), `institutions/every.md` (neu) |
|
||||||
|
| `raw/blog/2026-09-16_theregister-typesafe-jev-doom.md` | blog | The Register: „TypeSafe AI debuts model for machines that plays Doom" (URL-Datum 2026/09/16). ⚠️ **Volltext nicht abrufbar** — HTTP 200, extrahiert wurde nur „Are we human?"; inhaltliche Angaben daraus nicht belegt. Nur als Presse-Spur dokumentiert |
|
||||||
|
|
|
||||||
34
wiki/institutions/every.md
Normal file
34
wiki/institutions/every.md
Normal file
|
|
@ -0,0 +1,34 @@
|
||||||
|
---
|
||||||
|
created: 2026-09-17
|
||||||
|
updated: 2026-09-17
|
||||||
|
sources: [blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, blog/2026-09-15_typesafe-system-one-models-jev.md]
|
||||||
|
tags: [institution, every, media, newsletter, evals, benchmarks, publications]
|
||||||
|
---
|
||||||
|
|
||||||
|
# Every
|
||||||
|
|
||||||
|
US-amerikanische Medien- und Weiterbildungs-Publikation für KI- und Builder-Themen (every.to). Im Wiki vertreten als **Ort des ersten unabhängigen Tests von Jev** (TypeSafe AI).
|
||||||
|
|
||||||
|
- Website: https://every.to/ · Newsletter-Abos: https://every.to/subscribe
|
||||||
|
- X: [@every](http://twitter.com/every) · LinkedIn: https://www.linkedin.com/company/everyinc/
|
||||||
|
|
||||||
|
## Relevanz fürs Wiki
|
||||||
|
|
||||||
|
**Publikation des Jev-Fremdtests (15.09.2026):** [[../people/mike-taylor.md|Mike Taylor]] (Head of Evals) veröffentlichte in der Rubrik *Also True for Humans* den Artikel „Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds" — 777 Judgments in 0,7 s (37 Dokumente × 21 Fragen, ein Viertel Cent) und der Vergleich Jev vs. Claude Fable 5.1 über 12 synthetische Passagen, durchgeführt von [[../people/dan-shipper.md|Dan Shipper]].
|
||||||
|
|
||||||
|
**Eigene Infrastruktur, die im Artikel sichtbar wird:**
|
||||||
|
- **Personal Benchmarks:** 5–10 regelmäßig ausgeführte Aufgaben, gespeicherte Beispiele, Präferenzen als Pass/Fail-Checks („Is this PowerPoint on brand?", „Does this social media copy have a good hook?", „Did the model recommend the same thing I would?"), Abgleich mit dem eigenen Urteil und Verfeinerung der Checks.
|
||||||
|
- **Skill zur Erkennung von KI-Schreibmustern** — die 21 Fragen des Jev-Tests wurden daraus abgeleitet (u. a. „Does the text repeat an idea without adding evidence?", „Force a symmetrical 'both sides' argument?", „Overexplain a straightforward point?").
|
||||||
|
- **Judgment-Lab:** eine eigene Experimentier-Umgebung (typesafe-parallel-judgment-lab.every-4573.chatgpt.site) mit 11 dokumentierten Jev-Experimenten.
|
||||||
|
|
||||||
|
Der Artikel nennt Every-Formate wie „Vibe Check"-Modellreviews (verlinkt auf GPT-6 Astra) und Mitgliedschaftsmodelle (Builder Pack, All Access).
|
||||||
|
|
||||||
|
## Einordnung
|
||||||
|
|
||||||
|
Every ist hier nicht Quelle, sondern **Prüfinstanz**: Die Publikation betreibt Evals als Redaktionshandwerk und dokumentiert ihre eigene Methodik samt Schwächen („This test doesn't establish performance across entire industries or a wide range of tasks"). Für das Wiki ist das ein brauchbares Muster für Fremdprüfung — eigener kleiner Datensatz, dokumentierte Fragenliste, benannter Durchführender, offengelegte Grenzen.
|
||||||
|
|
||||||
|
## Verwandte Wiki-Seiten
|
||||||
|
|
||||||
|
- [[../people/mike-taylor.md]], [[../people/dan-shipper.md]] — Autoren/Durchführende
|
||||||
|
- [[../concepts/llm/system-one-models-jev.md]] — Modell und Testlage
|
||||||
|
- [[../institutions/typesafe-ai.md]] — getesteter Anbieter
|
||||||
57
wiki/institutions/typesafe-ai.md
Normal file
57
wiki/institutions/typesafe-ai.md
Normal file
|
|
@ -0,0 +1,57 @@
|
||||||
|
---
|
||||||
|
created: 2026-09-17
|
||||||
|
updated: 2026-09-17
|
||||||
|
sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md]
|
||||||
|
tags: [institution, typesafe-ai, ai-lab, system-one-models, jev, rlcd, san-francisco, automation, structured-outputs]
|
||||||
|
---
|
||||||
|
|
||||||
|
# TypeSafe AI
|
||||||
|
|
||||||
|
US-amerikanisches AI-Lab in **San Francisco** (Büro „near the Embarcadero station", Arbeitsmodell laut eigener Team-Seite: fünf Tage pro Woche vor Ort). Gründer-geführt, „nach zwei Jahren Stealth" am **15.09.2026** mit dem ersten **System One Model** namens **Jev** an die Öffentlichkeit getreten (Early Access, Waitlist).
|
||||||
|
|
||||||
|
- Website: https://typesafe.ai/ · Manifesto: https://typesafe.ai/manifesto · Team: https://typesafe.ai/team
|
||||||
|
- Docs: https://docs.typesafe.ai/ · Evals: https://evals.typesafe.ai/ · Console: https://console.typesafe.ai/
|
||||||
|
- LinkedIn: https://www.linkedin.com/company/typesafe-ai/ · X: https://x.com/typesafeai · Kontakt: hello@typesafe.ai
|
||||||
|
- Adapter für Fremdmodelle: https://github.com/typesafe-ai/system-one-adapter-python
|
||||||
|
|
||||||
|
## Team (Gründer, laut Team-Seite)
|
||||||
|
|
||||||
|
| Rolle | Person | Hintergrund |
|
||||||
|
|-------|--------|-------------|
|
||||||
|
| CEO | **Diogo Almeida** ([[../people/diogo-almeida.md]]) | Mitentwickler von RLHF und InstructGPT; zuvor Google Brain |
|
||||||
|
| COO | Sasha Sheng | Ex-Research-Engineer Meta/FAIR (News Feed, AI Experiences, AI Research); NeurIPS-/ECCV-Publikationen |
|
||||||
|
| CTO | Erik Gafni | Repeat Founder (Ravel, multimodale DNA-Sequenzierung), Frühangestellter bei Invitae und Freenome |
|
||||||
|
|
||||||
|
Weitere Angaben der Seite: „close-knit, flat team from OpenAI, Google Brain, Meta/FAIR, Stripe, Airbnb, Plaid, Docker"; Investoren werden nicht namentlich genannt („backed by top-tier investors"). Werte: Positive-Sum Games, Thinking in Bets, First Principles, Prioritize Learning, Passion. Offene Stellen über Ashby. Team-Seite enthält ein Base64-Fragment („VHlwZVNhZmUgQUkgSW50ZWxsaWdlZW5jZSBOb3c=" → „TypeSafe AI Intelligence Now").
|
||||||
|
|
||||||
|
## Manifesto: „Composable AI — Build Prod, Not God"
|
||||||
|
|
||||||
|
Kernargumente (Primärquelle, Anbietertext):
|
||||||
|
|
||||||
|
- **Die Engstelle ist nicht die Intelligenz.** „We already have general intelligence" — die heutigen Modelle hätten die Schwelle für massiven wirtschaftlichen Wert längst überschritten; trotzdem sei „most software still isn't meaningfully intelligent".
|
||||||
|
- **Historische Analogie „horseless carriage":** Frühe Autos kopierten die Kutsche (hohe Sitze, Buggy-Federn, Peitschenhalter). Heutige KI sei „trained to be a helpful, articulate, pleasant assistant" — sinnvoll nur, wenn ein Mensch auf der anderen Seite sitzt; die Folge sei KI, die Menschen im Loop braucht statt im Hintergrund zu laufen.
|
||||||
|
- **Software-Vergleich:** „Computers can do so much by just branching on bits, imagine if they could also branch on common sense, understanding, and intent."
|
||||||
|
- **SQL-Analogie:** „Intelligence today is like databases before SQL: powerful, but every use is bespoke." Ziel: eine smarte Entscheidung so verlässlich und aufrufbar wie eine Datenbankabfrage.
|
||||||
|
- **Missionsformulierung:** „pave the shortest path to an AI-based economic revolution by making intelligence composable to catalyze a Cambrian explosion of intelligent software".
|
||||||
|
|
||||||
|
Zitierte Kurzformel in der Every-Berichterstattung: „We're building prod, not God."
|
||||||
|
|
||||||
|
## Produkt
|
||||||
|
|
||||||
|
Erstes Modell **Jev** — siehe [[../concepts/llm/system-one-models-jev.md]]. Kern der Anbieterangaben: paralleles Sampling statt Token-Generierung, typisierte Ausgaben mit vorab definierten Optionen, kalibrierte Wahrscheinlichkeiten, Input $0,042/MTok, Output kostenlos, 70–500 ms End-to-end.
|
||||||
|
|
||||||
|
⚠️ **Firmenabgrenzung:** TypeSafe AI ist **nicht** Teil von OpenAI. Die Person Diogo Almeida war dort Forscher (InstructGPT-Mitautor). Die Presse-/Video-Rahmung „a ChatGPT researcher just dropped…" bezeichnet die Person, nicht die Firma.
|
||||||
|
|
||||||
|
## Quellenkritik
|
||||||
|
|
||||||
|
- Alle Leistungsangaben zu Jev stammen von TypeSafe selbst (Blogartikel, Evals-Seite, Homepage-Claims 193,6× schneller / 444,6× günstiger). Der Artikel räumt selbst ein, dass die Zahlen „on the higher end of real world gains" liegen und Subvention nicht ausgeschlossen werden kann.
|
||||||
|
- Die einzige unabhängige Messung ist ein Einzeltest mit kleinem Umfang ([[../people/mike-taylor.md|Mike Taylor]], Every).
|
||||||
|
- Manifesto-Inhalte sind Positionierung, keine überprüfbaren Aussagen.
|
||||||
|
|
||||||
|
## Verwandte Wiki-Seiten
|
||||||
|
|
||||||
|
- [[../concepts/llm/system-one-models-jev.md]] — Modell und Testlage
|
||||||
|
- [[../people/diogo-almeida.md]] — Gründer
|
||||||
|
- [[../people/mike-taylor.md]], [[../institutions/every.md]] — unabhängiger Test und Publikation
|
||||||
|
- [[openai.md]] — Almeidas frühere Station (nicht die Mutterfirma)
|
||||||
|
- [[../concepts/llm/llm-model-catalog.md]] — Katalog-Eintrag
|
||||||
19
wiki/log.md
19
wiki/log.md
|
|
@ -2,6 +2,25 @@
|
||||||
|
|
||||||
*Append-only changelog. Start: 2026-06-05*
|
*Append-only changelog. Start: 2026-06-05*
|
||||||
|
|
||||||
|
## 2026-09-17 — TypeSafe AI: System One Models & Jev („Modelle für Maschinen")
|
||||||
|
|
||||||
|
**Type:** ingest | **Scope:** raw/youtube, raw/blog, wiki/concepts/llm, wiki/institutions, wiki/people, wiki/index, wiki/log
|
||||||
|
**Anlass:** YouTube-Link https://www.youtube.com/watch?v=xQtUzjd7-As in OME Topic 13 (mandatory wiki-relevance check). Video: „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…", Kanal **AI Copium** (@AICopium), 17.09.2026, 14:25, ~6.797 Views / 226 Likes.
|
||||||
|
**Quellenlage:** Erstmals für einen YouTube-Ingest **vollständiges Transcript** abrufbar (Firecrawl-Scrape; die früheren YouTube-Ingests scheiterten an der Consent-/Bot-Wall und blieben metadata-only). Zusätzlich die beiden in der Videobeschreibung genannten Primärquellen direkt gelesen: TypeSafe-Ankündigungsartikel (Diogo Almeida, 15.09.2026) und Every-Test (Mike Taylor, 15.09.2026).
|
||||||
|
**Befunde:**
|
||||||
|
1. **Neue Modellkategorie, nicht neue Frontier.** Jev generiert keinen Text, sondern **typisierte probabilistische Entscheidungen** innerhalb vorab definierter Optionen. Drei Konstruktions-Entscheidungen: **RLCD** statt RLHF/RLVR (Optimierung auf kalibrierte Wahrscheinlichkeiten), typisierte Ausgaben statt Strings, **paralleles** statt sequenzielles Sampling. Anbieterformel: „unstructured state in, typed probabilistic decisions out".
|
||||||
|
2. **„Zero Hallucinations" ist eine Formatgarantie, keine Wahrheitsgarantie.** TypeSafety garantiert Schema-Treffer (mathematisch, laut Anbieter), nicht Korrektheit — das Modell kann die falsche Option wählen. Das Video arbeitet das korrekt heraus; im Wiki als Merksatz fixiert.
|
||||||
|
3. **Zahlen-Disziplin:** Die Primärquelle nennt **193,6× schneller / 444,6× günstiger** und ordnet sie selbst als „higher end of real world gains" ein. Der **Videotitel „400x" ist eine Verdichtung des Kanals** — die Zahl steht in der Primärquelle nicht.
|
||||||
|
4. **Einzige Fremdprüfung ist klein.** Every (Mike Taylor): 777 Judgments in <0,7 s für ~¼ Cent; Test 2 (Dan Shipper) 12 synthetische Passagen — Jev 0,35 s und ~580× günstiger, aber **6-von-7** Defekten gegen Fable 5.1 (8,83 s) mit 7-von-7, derselbe Defekt in drei Runs verpasst. Über 11 Experimente 1.709 Judgments für <1 Cent.
|
||||||
|
5. **Quellenkritik der Benchmarks dokumentiert:** Referenz = Durchschnitt von GPT-6 Astra und Fable 5.1 → Übereinstimmung mit einem anderen Modell, nicht verifizierte Korrektheit; der Wrapper für die Vergleichs-LLMs erzeugt Overhead und **vergrößert** den Abstand; TypeSafe legt Bias-Richtungen selbst offen; der „0 %"-Halluzinationswert ist nicht empirisch, sondern aus der Schema-Garantie abgeleitet; Subvention wird nicht ausgeschlossen.
|
||||||
|
6. **Firmenabgrenzung:** TypeSafe AI ist **nicht** OpenAI — die Rahmung „a ChatGPT researcher" bezeichnet Diogo Almeidas Biografie (InstructGPT-Mitautor, ex-OpenAI/Google Brain).
|
||||||
|
7. **The Register als Presse-Spur nicht auswertbar:** HTTP 200, extrahiert wurde nur „Are we human?" → als Raw-Datei mit Negativbefund dokumentiert, keine inhaltlichen Angaben daraus übernommen.
|
||||||
|
**Dateien:**
|
||||||
|
- raw (NEW): `raw/youtube/2026-09-17_aicopium-typesafe-jev.md`, `raw/blog/2026-09-15_typesafe-system-one-models-jev.md`, `raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md`, `raw/blog/2026-09-16_theregister-typesafe-jev-doom.md`
|
||||||
|
- wiki (NEW): `wiki/concepts/llm/system-one-models-jev.md` (Modell, Trainingsansatz, Kosten/Latenz-Tabelle, „Zero Hallucinations"-Entzerrung, Every-Test, Quellenkritik, Einordnung, offene Punkte), `wiki/institutions/typesafe-ai.md` (Team, Manifesto „Composable AI — Build Prod, Not God", Abgrenzung), `wiki/institutions/every.md` (Evals als Redaktionshandwerk, Personal Benchmarks, KI-Schreibmuster-Skill), `wiki/people/diogo-almeida.md`, `wiki/people/mike-taylor.md`, `wiki/people/dan-shipper.md`, `wiki/people/ai-copium.md`
|
||||||
|
- wiki (UPDATED): `wiki/concepts/llm/llm-model-catalog.md` (Jev-Zeile), `wiki/concepts/llm/harness-vs-standalone-chat-llm.md` (Cross-Ref), `wiki/index.md` (216. Update, LLM-Row, 4 People-Rows, 2 Institutions-Rows, 4 Raw-Rows), `wiki/log.md` (dieser Eintrag)
|
||||||
|
**Einschränkung:** Alle Leistungs-, Preis- und Genauigkeitszahlen zu Jev sind **Anbieterangaben**; die einzige unabhängige Messung umfasst 37 Dokumente, 12 Passagen und 1.709 Judgments. Architektur, Trainingsverfahren und Datenherkunft sind nicht veröffentlicht; die Evals-Seite (evals.typesafe.ai) wurde nicht ausgewertet.
|
||||||
|
|
||||||
## 2026-09-17 — Stefan Weimar: Firmendaten + Spec-Kit-Einordnung (Nachtrag)
|
## 2026-09-17 — Stefan Weimar: Firmendaten + Spec-Kit-Einordnung (Nachtrag)
|
||||||
|
|
||||||
**Type:** ingest (nachtrag) | **Scope:** wiki/people, raw/other, wiki/index, wiki/log
|
**Type:** ingest (nachtrag) | **Scope:** wiki/people, raw/other, wiki/index, wiki/log
|
||||||
|
|
|
||||||
36
wiki/people/ai-copium.md
Normal file
36
wiki/people/ai-copium.md
Normal file
|
|
@ -0,0 +1,36 @@
|
||||||
|
---
|
||||||
|
created: 2026-09-17
|
||||||
|
updated: 2026-09-17
|
||||||
|
sources: [youtube/2026-09-17_aicopium-typesafe-jev.md]
|
||||||
|
tags: [person, ai-copium, youtube, ai-news, typesafe-ai, jev]
|
||||||
|
---
|
||||||
|
|
||||||
|
# AI Copium
|
||||||
|
|
||||||
|
Englischsprachiger YouTube-Kanal **@AICopium** mit KI-Nachrichten- und Erklärformat. Im Wiki vertreten durch das Video „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…" (17.09.2026, 14:25), das den TypeSafe-Launch von **Jev** zusammenfasst ([[../concepts/llm/system-one-models-jev.md]]).
|
||||||
|
|
||||||
|
- Kanal: https://www.youtube.com/@AICopium
|
||||||
|
- Discord-Community: https://whop.com/ride-the-wave-discord/aicopium/ · X: https://x.com/AICopium
|
||||||
|
|
||||||
|
## Format
|
||||||
|
|
||||||
|
- **Nachrichten-/Kommentarabriss** zu einer Fremdankündigung; der Kanal führt keine eigene Messung durch.
|
||||||
|
- Der Jev-Beitrag stützt sich ausschließlich auf zwei genannte Quellen (TypeSafe-Blogartikel, Every-Artikel) plus die TypeSafe-Website und gliedert sie in zehn Kapitel (Intro, System One Models, RLCD, Vorteil/Schwäche, Pricing, Independent Testing, Zero Hallucinations, 400x/Genauigkeit, DOOM, Ausblick).
|
||||||
|
- Der Abruf am 17.09.2026 lieferte ein **vollständiges Transcript** (Firecrawl-Scrape; ca. 6.797 Views / 226 Likes zum Abrufzeitpunkt).
|
||||||
|
|
||||||
|
## Quellenkritische Beobachtungen
|
||||||
|
|
||||||
|
- **Titelabweichung:** Der Videotitel/-beschreibung nutzt das reißerische „MASSIVE AI Breakthrough" und spricht von „up to 400x lower costs". Die Primärquelle nennt **193,6× schneller / 444,6× günstiger** und ordnet die Zahlen selbst als oberes Ende ein. Die „400x"-Zahl ist eine Verdichtung des Kanals.
|
||||||
|
- **Rahmung „ChatGPT Researcher":** bezieht sich auf Diogo Almeidas Biografie (InstructGPT-Mitautor, ex-OpenAI), nicht auf eine Firmenverbindung — [[../institutions/typesafe-ai.md|TypeSafe]] ist unabhängig. Auch die These „Ilia Sutskever hätte das bringen können, aber Dio war schneller" ist Kommentar.
|
||||||
|
- **Positiv:** Das Video benennt selbst das Hauptproblem („agreement with another AI isn't the same as independently verified correctness because obviously Frontier models can be wrong, too"), entlarvt den Claim „Zero Hallucinations" als irreführend und gibt die Fremdtestergebnisse inklusive Unterlegenheit (6/7 vs. 7/7 Defekte) wieder. Es weist zudem ein, wonach die Benchmarks nicht fragen: ob Jevs Mechanik der von latenten Reasoning-Architekturen entspricht.
|
||||||
|
- **Deutlich markierte Spekulation:** Die Anwendungsideen am Schluss („perfect sports refs, realtime lawyers in police body cams, 24/7 AI nurses, safer self-driving") sind eigene Einfälle des Moderators.
|
||||||
|
|
||||||
|
## Einordnung
|
||||||
|
|
||||||
|
Brauchbarer Sekundärkanal mit korrekt zitierten Fremdzahlen und eigener Quellenangabe — die Titel- und Thumbnail-Rhetorik („MASSIVE", „400x") überzeichnet die Ankündigung jedoch gegenüber der Primärquelle. Im Wiki als Quelle nur mit dieser Einschränkung geführt.
|
||||||
|
|
||||||
|
## Verwandte Wiki-Seiten
|
||||||
|
|
||||||
|
- [[../concepts/llm/system-one-models-jev.md]] — Modell, Primärquellen, Testlage
|
||||||
|
- [[../institutions/typesafe-ai.md]] — Anbieter
|
||||||
|
- [[../concepts/llm/llm-model-catalog.md]] — Katalog
|
||||||
31
wiki/people/dan-shipper.md
Normal file
31
wiki/people/dan-shipper.md
Normal file
|
|
@ -0,0 +1,31 @@
|
||||||
|
---
|
||||||
|
created: 2026-09-17
|
||||||
|
updated: 2026-09-17
|
||||||
|
sources: [blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, blog/2026-09-15_typesafe-system-one-models-jev.md]
|
||||||
|
tags: [person, dan-shipper, every, benchmarks, evals, typesafe-ai, jev]
|
||||||
|
---
|
||||||
|
|
||||||
|
# Dan Shipper
|
||||||
|
|
||||||
|
**CEO von [[../institutions/every.md|Every]]**. Im Wiki erstmals greifbar als Durchführender des zweiten, direkteren Tests von **[[../concepts/llm/system-one-models-jev.md|Jev]]** (15.09.2026) — dokumentiert von [[mike-taylor.md|Mike Taylor]].
|
||||||
|
|
||||||
|
- Profil: https://every.to/@danshipper
|
||||||
|
|
||||||
|
## Sein Test (Jev vs. Claude Fable 5.1)
|
||||||
|
|
||||||
|
- **Design:** 12 synthetische Passagen — sechs klare, sechs mit absichtlich eingebauten Problemen. Vier Schreib-Checks je Passage: unbegründete Handlung, fehlendes Argumentationsglied, Mechanismus ersetzt das beabsichtigte Ergebnis, Claim verzerrt seine Quelle.
|
||||||
|
- **Ergebnis:** Jev Median **0,35 s** pro Passage, geschätzte Kosten **~580× niedriger**; **Fable 5.1 (high effort) 8,83 s**, rund 25× langsamer.
|
||||||
|
- **Genauigkeit:** Jev fand **6 von 7** beabsichtigten Defekten, Fable **alle 7**. Jev verpasste in allen drei Runs dieselbe Passage — „a shared appointment calendar that parents and staff teach together", bei der unklar bleibt, was es heißt, einen Kalender zu unterrichten.
|
||||||
|
|
||||||
|
Der Test wurde von Taylor als „the code linter idea more directly" bezeichnet: nicht Text-Qualität allgemein, sondern **definierte Fehlerklassen in definierten Passagen** — also genau der Ablauf, den Jev im Agenten-Loop übernehmen soll.
|
||||||
|
|
||||||
|
## Einordnung
|
||||||
|
|
||||||
|
Shippers Rolle hier ist die des **Anwendungs-Prüfers**: Er testet Jev nicht als Modell gegen Benchmarks, sondern als Prüfinstanz in einem Arbeitsablauf, den Every selbst betreibt (Personal-Benchmarks, Modell-Vergleiche). Das ist der praktisch relevanteste Datenpunkt der ganzen Ankündigung — und er fällt zwiespältig aus: Die Kostenlücke ist dramatisch, die Genauigkeitslücke klein, aber sichtbar und **reproduzierbar** (derselbe verpasste Defekt in drei Runs).
|
||||||
|
|
||||||
|
## Verwandte Wiki-Seiten
|
||||||
|
|
||||||
|
- [[../institutions/every.md]] — Firma
|
||||||
|
- [[../concepts/llm/system-one-models-jev.md]] — Modell und Testlage
|
||||||
|
- [[mike-taylor.md]] — Head of Evals, dokumentierte den Test
|
||||||
|
- [[diogo-almeida.md]] — TypeSafe-Gründer
|
||||||
40
wiki/people/diogo-almeida.md
Normal file
40
wiki/people/diogo-almeida.md
Normal file
|
|
@ -0,0 +1,40 @@
|
||||||
|
---
|
||||||
|
created: 2026-09-17
|
||||||
|
updated: 2026-09-17
|
||||||
|
sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md]
|
||||||
|
tags: [person, diogo-almeida, typesafe-ai, openai, google-brain, rlhf, instructgpt, system-one-models]
|
||||||
|
---
|
||||||
|
|
||||||
|
# Diogo Almeida
|
||||||
|
|
||||||
|
AI-Forscher und Unternehmer. **CEO und Gründer von [[../institutions/typesafe-ai.md|TypeSafe AI]]** (San Francisco), das am 15.09.2026 das System-One-Modell **Jev** vorstellte ([[../concepts/llm/system-one-models-jev.md]]).
|
||||||
|
|
||||||
|
## Stationen
|
||||||
|
|
||||||
|
- **OpenAI:** Co-Autor von **RLHF** und des **InstructGPT-Papers** (2022, [arXiv:2203.02155](https://arxiv.org/abs/2203.02155)) — die Methoden, die laut TypeSafe-Teamseite zu ChatGPT und GPT-4 führten. Das Every-Porträt formuliert es als: „Almeida coauthored the 2022 InstructGPT paper, which showed how human feedback could help language models follow instructions more reliably — work that helped pave the way for ChatGPT later that year."
|
||||||
|
- **Google Brain:** frühere Station (laut TypeSafe-Teamseite).
|
||||||
|
- **[[../institutions/typesafe-ai.md|TypeSafe AI]]:** Gründer/CEO; zwei Jahre Stealth-Arbeit vor dem Jev-Launch.
|
||||||
|
|
||||||
|
Profil: [LinkedIn](https://www.linkedin.com/in/diogomda/). Team-Seite nennt als „Fun fact" Top-30 in League of Legends (NA) und Top-2 in Hearthstone.
|
||||||
|
|
||||||
|
## Positionen (Primärzitate)
|
||||||
|
|
||||||
|
- **Motivation für einen anderen Modelltyp:** „The problem is the text itself." (im Gespräch mit [[mike-taylor.md|Mike Taylor]], Every)
|
||||||
|
- **Zum Verhältnis von Chat und Automatisierung:** „Models have been superhuman at chat for years, so where is all the automation? This has been my driving question for the last four years."
|
||||||
|
- **Zur Zielsetzung:** „Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out."
|
||||||
|
- **Zur Preissetzung:** Output sei „too cheap to meter", weil keine Tokens generiert werden; zur Nachhaltigkeit: „We can't prove it isn't subsidized; we'll need the long-term to prove the sustainability of our pricing (which we expect to go down, not up)."
|
||||||
|
- **Zur Herkunft des Namens:** System One Models nach Daniel Kahnemans *Thinking, Fast and Slow*; „Jev" nach **William Stanley Jevons** (Jevons-Paradox — sinkende Kosten steigern den Verbrauch).
|
||||||
|
|
||||||
|
## Einordnung
|
||||||
|
|
||||||
|
Almeida ist ein Beispiel für den personellen Fluss von Frontier-Lab → eigenes Startup mit einer **orthogonalen These**: nicht größere Intelligenz, sondern **komponierbare Intelligenz** (siehe Manifesto „Composable AI — Build Prod, Not God"). Sein Hintergrund erklärt die Stoßrichtung: Wer RLHF mitentwickelt hat, baut als Gegenentwurf eine Trainingsmethode (RLCD), die auf **kalibrierte Entscheidungen** statt menschliche Präferenz optimiert.
|
||||||
|
|
||||||
|
⚠️ Die Video- und Presse-Rahmung „a ChatGPT researcher" bezeichnet Almeidas Biografie, **nicht** eine Firmenbeziehung. TypeSafe AI ist ein unabhängiges Unternehmen.
|
||||||
|
|
||||||
|
## Verwandte Wiki-Seiten
|
||||||
|
|
||||||
|
- [[../institutions/typesafe-ai.md]] — Firma, Team, Manifesto
|
||||||
|
- [[../concepts/llm/system-one-models-jev.md]] — Jev und die Testlage
|
||||||
|
- [[../institutions/openai.md]] — frühere Station
|
||||||
|
- [[mike-taylor.md]] — Interviewpartner / unabhängiger Tester
|
||||||
|
- [[../concepts/llm/llm-model-catalog.md]] — Katalog
|
||||||
43
wiki/people/mike-taylor.md
Normal file
43
wiki/people/mike-taylor.md
Normal file
|
|
@ -0,0 +1,43 @@
|
||||||
|
---
|
||||||
|
created: 2026-09-17
|
||||||
|
updated: 2026-09-17
|
||||||
|
sources: [blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, blog/2026-09-15_typesafe-system-one-models-jev.md, youtube/2026-09-17_aicopium-typesafe-jev.md]
|
||||||
|
tags: [person, mike-taylor, every, evals, benchmark, typesafe-ai, jev]
|
||||||
|
---
|
||||||
|
|
||||||
|
# Mike Taylor
|
||||||
|
|
||||||
|
**Head of Evals bei [[../institutions/every.md|Every]]** und Autor des ersten unabhängigen Tests von **[[../concepts/llm/system-one-models-jev.md|Jev]]** (TypeSafe AI). Der Test erschien am 15.09.2026 in der Every-Publikation *Also True for Humans* unter dem Titel „Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds".
|
||||||
|
|
||||||
|
- Profil: https://every.to/@mike_2114
|
||||||
|
- Artikel: https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds
|
||||||
|
|
||||||
|
## Der Test (Kurzfassung)
|
||||||
|
|
||||||
|
| Test | Umfang | Ergebnis | Einordnung des Autors |
|
||||||
|
|------|--------|----------|----------------------|
|
||||||
|
| KI-Muster in eigener Prosa | 37 Dokumente × 21 Fragen = 777 Judgments | unter 0,7 s, geschätzt ein Viertel Cent | markierte KI-lastige Passagen korrekt; „I'd want a more thorough accuracy check before putting it into production" |
|
||||||
|
| Synthetische Passagen vs. Claude Fable 5.1 | 12 Passagen × 4 Checks ([[dan-shipper.md|Dan Shipper]]) | Jev 0,35 s / 6-von-7 Defekten; Fable 8,83 s / 7-von-7 | rund 25× schneller, ~580× günstiger, „six out of seven isn't bad for pennies on the dollar" |
|
||||||
|
|
||||||
|
Über 11 Experimente: 1.709 Judgments für unter einem Cent.
|
||||||
|
|
||||||
|
## Methodische Selbstbegrenzung
|
||||||
|
|
||||||
|
Bemerkenswert quellensauber ist, dass Taylor die Grenzen seiner eigenen Messung benennt:
|
||||||
|
|
||||||
|
- „Speed and cost alone doesn't tell us whether the judgments were good."
|
||||||
|
- „This test doesn't establish performance across entire industries or a wide range of tasks."
|
||||||
|
- „Whether you'd trust those results is another question."
|
||||||
|
- Positiv gewendet: Nutzen als **Frühwarnsystem** — „The alternative is not checking at all."
|
||||||
|
- Abschluss-Maßstab: „The ultimate test is whether acting on the answers makes the work better."
|
||||||
|
|
||||||
|
## Einordnung
|
||||||
|
|
||||||
|
Taylor liefert damit den einzigen nicht von TypeSafe stammenden Datenpunkt zu Jev — und er ist **klein**: 37 Dokumente, 12 Passagen, eine Handvoll Grundfälle. Für das Wiki ist das der Unterschied zwischen „Anbieterangabe" und „Fremdprüfung", nicht zwischen „Hype" und „belegt". Sein „Code-Linter für Wissensarbeit"-Bild ist die brauchbarste Kurzbeschreibung des Produkts.
|
||||||
|
|
||||||
|
## Verwandte Wiki-Seiten
|
||||||
|
|
||||||
|
- [[../institutions/every.md]] — Arbeitgeber und Publikation
|
||||||
|
- [[../concepts/llm/system-one-models-jev.md]] — Modell und Testlage
|
||||||
|
- [[dan-shipper.md]] — Every-CEO, führte Test 2 durch
|
||||||
|
- [[diogo-almeida.md]] — TypeSafe-Gründer, Interviewpartner
|
||||||
Loading…
Add table
Reference in a new issue