knowledge-base/wiki/concepts/llm/system-one-models-jev.md

208 lines
20 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-09-17
updated: 2026-09-18
sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, blog/2026-09-16_theregister-typesafe-jev-doom.md, blog/2026-09-16_vercel-jev-ai-gateway.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, xpost/2026-09-15_almeida-jev-launch-post.md, youtube/2026-09-18_berman-jev.md, other/2026-09-17_typesafe-workflow-evals.md, blog/2026-09-17_devto-jev-vs-luna-bake-off.md, other/2026-09-18_typesafe-docs-jev-spezifikation.md, xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md, youtube/2026-09-18_gary-explains-jev-caveat.md]
tags: [concept, llm, typesafe, jev, system-one-models, rlcd, structured-outputs, calibrated-decisions, parallel-sampling, inference-cost, automation, harness]
---
# System One Models & Jev (TypeSafe AI)
> **Quelle:** TypeSafe-Ankündigungsartikel von Diogo Almeida (15.09.2026, https://typesafe.ai/blog/introducing-system-one-models-and-jev) + unabhängiger Test von Mike Taylor in Every (15.09.2026) + Video-Zusammenfassung von AI Copium (17.09.2026). Primärquelle = Anbieter; die unabhängige Prüfung ist ein Einzeltest mit kleinem Stichprobenumfang.
## Kernidee
**Jev** ist das erste Modell einer neuen Klasse, die TypeSafe **[[../../institutions/typesafe-ai.md|System One Models]]** nennt: keine Textgenerierung, sondern **typisierte probabilistische Entscheidungen** für Software. Anbieterselbstbeschreibung: „unstructured state in, typed probabilistic decisions out" — und „a frontier-intelligence function call".
Der Ansatz setzt auf **strukturierte Ausgaben mit vorab definierten Optionen** statt Strings, auf **paralleles Sampling** statt autoregressiver Token-Generierung und auf **kalibrierte Wahrscheinlichkeiten** statt überkonfidenter Fließtexte.
## Drei Konstruktions-Entscheidungen
| Achse | Bestehende LLMs | Jev |
|-------|-----------------|-----|
| Optimierung | RLHF / RLVR — menschliche Präferenz bzw. verifizierbare Rewards | **RLCD** (Reinforcement Learning for Calibrated Decisions) |
| Ausgabe | Strings — müssen geparst und validiert werden | **Type-safe structured values**; Ausgabeoptionen und Struktur vorab definiert |
| Sampling | sequenziell, ein Token nach dem anderen | **parallel**, alle Urteile in einer Query |
Zielgröße laut Anbieter: Werte nahe 1 sollen häufiger zutreffen; „If it flags 100 customer messages as having a 90 percent chance of expressing anger, about 90 should express anger" ([[../../people/mike-taylor.md|Mike Taylor]]).
## Anbieterangaben zu Kosten und Geschwindigkeit
| Kennzahl | TypeSafe-Angabe |
|----------|-----------------|
| End-to-end-Latenz | **70500 ms** (LLMs laut Artikel 3329 s) |
| Speedup | 40×200× „for System One shaped queries"; Homepage-Claim **193,6× schneller** |
| Kosten-Input | **$0,042 / MTok** = $42 pro Milliarde Tokens |
| Kosten-Output | **$0** („too cheap to meter", da keine Token generiert werden) |
| Kosten-CLAIM Homepage | **444,6× günstiger** |
| Genauigkeit | „near state-of-the-art" auf den eigenen vier Workflows |
⚠️ Die im Videotitel/-beschreibung und im Kapitelmarken-Layout kursierende **„400x"**-Zahl findet sich in der Primärquelle nicht; dort stehen **193,6× / 444,6×**, und der Artikel ordnet selbst ein: „we expect that these are on the higher end of real world gains".
## Was „keine Halluzination" heißt — und was nicht
TypeSafe schreibt, Jev könne nicht halluzinieren; gemeint ist **Type-Safety**: Das Modell kann kein Feld mit falschem Typ füllen und keine Option erfinden, die nicht im Schema steht. Das ist laut Anbieter mathematisch garantiert („Schema matching is guaranteed").
Nicht gemeint ist semantische Korrektheit:
- Jev kann die **falsche Option wählen** — ein Rückerstattungsantrag kann „approve" erhalten, obwohl „reject" richtig wäre ([[../../people/mike-taylor.md|Taylor]] / AI Copium).
- Das ist keine neue Eigenschaft von Jev: LLMs lassen sich ebenfalls auf Formate zwingen (z. B. OpenAI Structured Outputs, DSPy).
**Merksatz fürs Wiki:** Type-Safety ist eine Formatgarantie, keine Wahrheitsgarantie. Der verwandte Mechanismus — Gate vs. probabilistische Generierung — steht in [[harness-vs-standalone-chat-llm.md]].
## Unabhängiger Test (Every, 15.09.2026)
Zwei Messungen, beide von **[[../../people/mike-taylor.md|Mike Taylor]]** (Head of Evals, [[../../institutions/every.md|Every]]):
**Test 1 — 37 Dokumente × 21 Fragen:**
- 27 eigene Every-Artikel + 10 bewusst KI-stilisierte Gegenstücke
- **777 Judgments in unter 0,7 Sekunden**, geschätzt **ein Viertel Cent**
- Eigenbewertung des Testerstellers: markierte KI-lastige Passagen korrekt, aber „I'd want a more thorough accuracy check before putting it into production"
**Test 2 — 12 synthetische Passagen, 4 Schreib-Checks ([[../../people/dan-shipper.md|Dan Shipper]]):**
| | Jev | Claude Fable 5.1 (high effort) |
|---|---|---|
| Median pro Passage | **0,35 s** | **8,83 s** |
| Geschwindigkeit | ~25× schneller | — |
| Kosten | ~580× niedriger | — |
| Defekte gefunden | **6 von 7** | **7 von 7** |
Jev verpasste in allen drei Runs dieselbe Passage („a shared appointment calendar that parents and staff teach together"). Über 11 Experimente: 1.709 Judgments für unter einem Cent.
**Was der Test nicht zeigt:** Breite über Branchen und Aufgabentypen. Der Autor sagt es selbst; die Zahl der Grundfälle ist einstellig.
## Benchmark-Lage (Anbieter-Evals, lokal gelesen 18.09.2026)
Die Genauigkeitszahlen, die seit dem Launch zitiert werden, stammen von **[evals.typesafe.ai](https://evals.typesafe.ai/)** (HTTP 200, Text extrahierbar; Raw: `raw/other/2026-09-17_typesafe-workflow-evals.md`). Vier Workflows (Security Incidents, Agent Trace Observability, Invoice Processing, Customer Service), je Modell zwei Ausführungen: **workflow** (strukturierter Harness) vs. **prompt** (alles in einem Prompt).
**Aggregat im Workflow-Modus, gleichgewichtet über die vier Workflows:**
| Modell | Genauigkeit | Kosten/Fall | Latenz/Fall |
|--------|-------------|-------------|-------------|
| **Jev** | **67,8 %** | **$0,0004** | **0,4 s** |
| luna | 66,8 % | $0,0033 | 12,9 s |
| terra | 67,9 % | $0,0304 | 10,1 s |
| sonnet 5 | 67,8 % | $0,1174 | 78,1 s |
| sol | **74,1 %** | $0,0836 | 23,3 s |
| opus 5 | **73,1 %** | $0,1761 | 37,8 s |
| haiku 4.5 | 53,6 % | $0,0195 | 12,5 s |
| DS v4 flash | 64,4 % | $0,0059 | 51,9 s |
| DS v4 pro | 65,5 % | $0,0413 | 86,5 s |
**Häufigste Fehllektüre:** Jev liegt **auf Augenhöhe mit Terra (67,9 %) und Sonnet 5 (67,8 %)**, einen Punkt über Luna — und **unter Sol (74,1 %) und Opus 5 (73,1 %)**. Die Aussage „über Opus 5" ist invertiert. Der Vorsprung liegt bei Kosten und Latenz (rund 1/8 der Luna-Kosten, 1/30 deren Latenz), nicht in der Genauigkeitskrone.
**Jev je Workflow — die Streuung hinter dem Mittel:**
| Workflow | Jev | Bester Konkurrent |
|----------|-----|-------------------|
| Customer Service | **76,0 %** | sol 78,3 % · opus 5 72,4 % |
| Agent Trace Observability | 71,6 % | sol 76,6 % · opus 5 75,2 % |
| Security Incidents | 61,7 % | opus 5 66,2 % · sol 62,5 % |
| Invoice Processing | 61,8 % | sol 79,1 % · opus 5 78,4 % |
Der Mittelwert verbirgt eine Spanne von 61,7 % bis 76,0 %; bei Rechnungsverarbeitung liegt Jev fast 18 Punkte hinter Sol.
**Wogegen gemessen wird:** Referenz sind laut Seite „labels generated via an average of the responses of GPT-6 Astra and Claude Fable 5.1, both at high thinking" — kein Mensch labelt, keine unabhängige Ground Truth. Wo beide Frontier-Modelle falsch liegen, wird ein abweichend richtiges Modell **abgewertet** ([[../../people/gabriel-anhaia.md|Gabriel Anhaia]], [Dev.to 17.09.2026](https://dev.to/gabrielanhaia/jev-beat-gpt-luna-by-1-point-gpt-6-and-claude-wrote-the-answer-key-314k)). Die Seite legt ihre Harness-Annahme selbst offen: „we assume that the code is correct".
## Guardrail-Tausch bei Vercel `fx`
Der bislang gewichtigste **Fremdnutzen** liegt nicht in den Evals, sondern in einem Werkzeugwechsel: Vercel-CEO **Guillermo Rauch** ([@rauchg](https://x.com/rauchg), 871.158 Follower) schreibt laut Dev.to-Bericht, der Sicherheits-Reviewer in `fx` (Vercel-Labs-CLI, Modus „auto", prüft jeden Befehl) laufe heute auf **GPT-5.6 Luna** und **Jev sei „up to 18x faster (p95) and more accurate"** — „likely new default". Vercel-Bauer **Pranit** ([@fazxes](https://x.com/fazxes)) berichtet „~5-18x faster and more accurate than gpt-5.6-luna, our current top choice". ⚠️ **Vercel hat den Benchmark nicht veröffentlicht** (Stand 17.09.): keine Fallzahlen, kein Datensatz. Die Zahlen sind als Werkzeugangabe zu lesen, nicht als Messung.
## Spezifikation (Anbieter-Docs, lokal gelesen 18.09.2026)
Harte Angaben aus **https://docs.typesafe.ai/models** (HTTP 200, 338.781 Byte; Raw: `raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md`):
| Feld | Wert |
|------|------|
| Aktuelles Modell | **Jev 1.13** · Modell-ID **`jev-1.13.0`** |
| Preis | **$42/Btok** bzw. $0,042/Mtok Input; „Output tokens are free" |
| Rate Limits | **250.000 Token/Sekunde** · **1.200 Requests/Minute** |
| Kontext | **64k Token pro Request**; **32k für State + längste Frage** |
| Eingabe | **Nur Text** — String, JSON-Objekt oder Array. **Keine Bild-, Audio- oder Video-Eingabe** |
Zwei Punkte, die in der öffentlichen Diskussion regelmäßig falsch wiedergegeben werden:
- **„32k Kontext" ist die engere der zwei Grenzen.** Die Doku nennt 64k pro Request; die 32k beziehen sich auf State plus die *längste Einzelfrage*. Wer nur 32k nennt, unterschlägt die Hälfte (so im [[../../people/cj-zafir.md|CJ-Zafir]]-Post).
- **Text-Only ist eine harte Grenze für Computer-Use.** Ein Desktop- oder Browser-Agent kann Bildschirminhalte **nicht** an Jev geben; er muss den Zustand erst in Text übersetzen. Das relativiert jede Demo, die den Eindruck erweckt, Jev „sehe" den Bildschirm (etwa [[../agents/jev-sprachsteuerung-computer-use.md]]).
**Erster Nutzungs-Kostenwert:** [[../../people/cj-zafir.md|CJ Zafir]] berichtet **$3,40 Ausgaben in 24 Stunden** — bei $0,042/MTok rund **81 Mio. Input-Token**, also etwa 19 Durchläufe des bekannten 4,2-Mio.-Postfachs. Bisher waren alle Kostenangaben Anbieterpreise oder Demo-Rechnungen Dritter.
## Quellenkritik der Benchmarks
Die eigenen Workflow-Evals messen **Übereinstimmung mit Referenzantworten** (Durchschnitt aus GPT-6 Astra und Fable 5.1), nicht unabhängig verifizierte Korrektheit. TypeSafe legt die Bias-Richtungen selbst offen:
- Referenzwahl „biases answers towards OpenAI and Anthropic's models" → eigene Leistung gegenüber DeepSeek vermutlich unterschätzt.
- Workflows „made by individuals on our model capabilities team, so some bias could exist" — aber nicht in der Trainingsverteilung.
- Die Vergleichs-LLMs liefen über einen eigenen Wrapper, der sie zu Wahrscheinlichkeiten zwingt: laut Artikel langsamer und teurer als freie Entscheidungen — das **vergrößert** den gemessenen Abstand.
- Die „0 %" in den Halluzinations-Plots sind **nicht empirisch**, sondern aus der Schema-Garantie abgeleitet.
- LLM-Vergleichszahlen stammen von OpenRouter (Routing-Bias möglich).
- Preis: „We can't prove it isn't subsidized; we'll need the long-term to prove the sustainability of our pricing."
## Einordnung
- **Neue Achse statt neuer Frontier.** Jev konkurriert nicht mit Chat- und Coding-Frontier-Modellen, sondern mit der Rolle, die bisher DSPy-Pipelines, Klassifikatoren und Guardrail-Modelle gespielt haben — nur als Foundation-Model. Das ist der eigentliche Beitrag: eine eigene Produktkategorie „Modell für Maschinen" (so auch die Presse-Formulierung „model for machines").
- **Preis als Freigrenze für Häufigkeit.** Die relevante Verschiebung ist nicht „billiger pro Call", sondern „Checks sind so billig, dass man sie während der Arbeit und nicht danach laufen lässt" — 1.709 Urteile für unter einem Cent. Praktische Konsequenz: dauerhafte Verifikation statt Stichprobe am Ende, vgl. [[../agents/agent-budget-breaker.md]] (Kostendeckel als Voraussetzung unbewachter Schleifen).
- **Der Linter-Vergleich ist stark.** „Ein Code-Linter für Wissensarbeit" beschreibt den Nutzen präziser als jede Benchmark-Zahl: schnell, billig, unvollständig genau, aber besser als gar keine Prüfung. Genau das ist auch seine Grenze — ein Linter ersetzt keinen Test.
- **Verifikation wird zur eigenen Fehlerquelle.** Wenn Prüf-Urteile von einem Modell kommen, das kalibriert, aber nicht korrekt ist, wandert die Fehlerquelle in das Gate. Kalibrierung ist die entscheidende Eigenschaft: Nur wenn 0,9 wirklich 90 % Trefferquote bedeutet, kann Code sinnvoll auf Wahrscheinlichkeiten branchen.
- **Latentes Reasoning als Nebenlinie.** Das Video zieht die Parallele zu OpenAIs *recurrent depth / looped transformers* — Reasoning im latenten Raum statt ausgeschriebener Gedankenkette — und nennt die Safety-Warnung, dass das die Überwachung erschwert. Das Video räumt selbst ein: „we don't know that Jev works the same way internally." Hier ist die Parallele Deutung, kein Befund.
- **Namensgebung als These:** „Jev" nach **William Stanley Jevons** — Jevons-Paradox: sinkende Kosten erhöhen den Verbrauch. Der Name ist das Programmm: Intelligenz wird billiger, also wird mehr davon verbraucht.
- Bezug zur Harness-Deutung unseres Wikis: Jev besetzt **weder Modell-Prompting noch Orchestrierung**, sondern die Gate-Schicht im Ablauf — vgl. [[harness-vs-standalone-chat-llm.md]] („Grounding-Tools verhindern keine probabilistische Generierung — nur Gates tun das") und [[../agents/harness-loop-graph-engineering.md]].
## Verteilung: über den Vercel AI Gateway (ab 16.09.2026)
Der Weg zu Jev führt seit dem **16.09.2026** nicht mehr nur über TypeSafes eigene Waitlist: Das Modell läuft im **[[../../institutions/vercel.md|Vercel]] AI Gateway** unter der ID `typesafe-ai/jev`, nutzbar über das AI SDK (7.0.105+) und die `experimental evaluate`-API. Die Gateway-Seiten nennen `$0.04 / 1 Mio. Input-Token` (gerundete Anzeige gegenüber $0,042), **Zero Data Retention** und **No Training** als pro-Request-Schalter, und sie rechnen Auswertungen gegen Gateway-Budgets ab.
Für die Einordnung bedeutsamer als der Zugangsweg: Die ersten Zahlen, die nach dem Launch durch die Timeline laufen, stammen aus einem **Startup-Ideen-Post** von [[../../people/greg-isenberg.md|Greg Isenberg]] (18.09.2026), nicht aus einer Messung — „1,700 emails for 18 cents" ist eine zweit- bis dritthändige Größenordnung ohne Token-Aufschlüsselung und Datensatz. Details, die sieben dort genannten Geschäftsideen und die Quellenkritik: [[jev-vercel-ai-gateway.md]].
Merksatz: Der Launch war eine Ankündigung, die Gateway-Listung ist Verteilung — und Verteilungszahlen sind keine Leistungszahlen.
## Ankündigungspost und Zahlenherkunft
Der Launch-Post von Diogo Almeida ([@CompleteSkeptic](https://x.com/CompleteSkeptic), 15.09.2026, [34,9 Mio. Views](https://x.com/CompleteSkeptic/status/2099925682726002904)) nennt **Spannen**, nicht Einzelwerte: „20-200x faster", „40-400x cheaper (w/ output tokens free)". Die im Umlauf befindlichen „200×/400×" sind die Obergrenzen dieser Spannen; die Workflow-Auswertung nennt 193,6×/444,6×. Wer die Spannen-Obergrenze als Erwartungswert liest, überzeichnet den Anbieter bereits selbst (Raw: `raw/xpost/2026-09-15_almeida-jev-launch-post.md`).
## Demo-Welle (16.18.09.2026)
Neben Benchmarks und Verteilung entstand eine Welle öffentlicher Bauprojekte — Doom, Wikipedia-Races, Kleinstadt-Simulation, Schach gegen Frontier-LLMs, Ad-Blocker, Jev-Modellrouter. Diese Demos zeigen das Modell **im Loop** und liefern damit Evidenz, die kein Standard-Eval abfragt. Abstufung, Gegenprüfung und Grenzen: [[jev-praxis-demos.md]].
## Rezeption in der Erklärebene (18.09.2026)
Zwei Tage nach der Ankündigung erreicht Jev die allgemeine Tech-Erklärebene: **Gary Explains** veröffentlichte am 18.09.2026 ein Video („…is a New Class of AI Model that is FAST and CHEAP - But There is a Caveat!"), dessen Beschreibung den Kern sauber benennt: Jev ist **kein LLM**, sondern „versteht natürliche Sprache und antwortet mit strukturierten Antworten samt Konfidenzwert". Kein neuer Faktenlieferant, sondern ein Verbreitungssignal. Metadata-only, kein Transkript: `raw/youtube/2026-09-18_gary-explains-jev-caveat.md`.
## Offene Punkte
- ⚠️ **Alle Leistungszahlen sind Anbieterangaben** außer dem einen Every-Einzeltest (37 Dokumente, 12 Passagen, 1.709 Judgments). Keine peer-reviewte Evaluation, keine breite Fremdprüfung.
- ⚠️ Die Evals-Seite (https://evals.typesafe.ai/, jetzt lokal ausgewertet) nennt **keine Fallzahlen und keine Rohdaten**; ein Nachbau der vier Workflows ist Dritten nicht möglich.
- ⚠️ Architektur, Trainingsverfahren und Datenherkunft von Jev sind nicht veröffentlicht — ob paralleles Sampling die genannten Latenzen erklärt, ist nicht überprüfbar.
- Offen: ob der Preis ($42/Mrd. Input, $0 Output) nachhaltig ist — der Anbieter räumt Subvention nicht ausgeschlossen aus.
- Offen: ob der Gateway-Preis dem Direkt-API-Preis entspricht und ob Rate Limits/SLA existieren — auf den Gateway-Seiten nicht ausgewiesen ([[jev-vercel-ai-gateway.md]]).
- Offen: Fehlerkosten bei falscher, aber kalibrierter Entscheidung — der Every-Test liefert dazu nur ein Datenpaar (6/7 vs. 7/7).
- [[../../institutions/typesafe-ai.md|TypeSafe]] hat drei Gründer (Almeida, Sheng, Gafni), Sitzt in San Francisco und ist **nicht** mit OpenAI verbunden — Almeida ist ehemaliger OpenAI-/Google-Brain-Forscher. Die Video-/Presse-Rahmung „a ChatGPT researcher" ist Zuschreibung, keine Firmenbeziehung.
## Verwandte Wiki-Seiten
- [[../../institutions/typesafe-ai.md]] — Firma, Team, Manifesto
- [[../../people/diogo-almeida.md]] — Gründer, InstructGPT-Mitautor
- [[../../people/mike-taylor.md]] — Autor des unabhängigen Tests
- [[../../people/dan-shipper.md]] — Every-CEO, Test 2
- [[../../institutions/every.md]] — Publikation des Fremdtests
- [[../../people/ai-copium.md]] — Kanal, der das Video gepostet hat
- [[harness-vs-standalone-chat-llm.md]] — Gate vs. Generierung
- [[llm-model-catalog.md]] — Modellkatalog
- [[../agents/agent-budget-breaker.md]] — Kostendeckel für unbewachte Schleifen
- [[../agents/harness-loop-graph-engineering.md]] — Harness-Ebene
- [[llm-sycophancy-confabulation.md]] — Fehlerklassen jenseits von Halluzination
- [[jev-vercel-ai-gateway.md]] — Verteilung über den Vercel AI Gateway, Isenberg-Post, sieben Geschäftsideen
- [[jev-praxis-demos.md]] — Demo-Welle (Doom, Wikipedia-Races, Schach, Modellrouter) und ihre Belastbarkeit
- [[../agents/jev-sprachsteuerung-computer-use.md]] — Sprachsteuerung als Desktop-Agent (Text-Only-Grenze beachten)
- [[../../people/cj-zafir.md]] — Erfahrungsbericht mit Ausgabenwert und Fehllektüren
- [[../../institutions/vercel.md]] — Gateway-Betreiber
- [[../../people/greg-isenberg.md]] — Startup-Ideen-Kanal, der die „18 Cent"-Zahl verbreitet
## Quellen
- [TypeSafe: Introducing System One Models & Jev](https://typesafe.ai/blog/introducing-system-one-models-and-jev) (15.09.2026, abgerufen 17.09.2026)
- [Every: Mini-Vibe Check (Mike Taylor)](https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds) (15.09.2026)
- [AI Copium: „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…"](https://www.youtube.com/watch?v=xQtUzjd7-As) (17.09.2026, 14:25, vollständiges Transcript)
- Raw: `raw/blog/2026-09-15_typesafe-system-one-models-jev.md`, `raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md`, `raw/youtube/2026-09-17_aicopium-typesafe-jev.md`
- [Vercel AI Gateway — Jev](https://vercel.com/ai-gateway/models/jev) und [Vercel Changelog](https://vercel.com/changelog/typesafe-ai-jev-now-available-on-ai-gateway) (16.09.2026, Gateway-Listung, lokal gelesen)
- [X-Post @gregisenberg](https://x.com/gregisenberg/status/2101018750916948237) (18.09.2026, 18:41 UTC; 29.661 Views / 415 Likes bei Abruf 21:31 UTC)
- Erwähnung ohne auswertbaren Inhalt: [The Register](https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/5296711) (16.09.2026; Volltext nicht abrufbar, nur „Are we human?" extrahiert)