ingest(other): almeida coding-agent notes + codila ranking

This commit is contained in:
Hector 2026-09-22 21:51:07 +02:00
parent 38801da104
commit 5401290126
7 changed files with 229 additions and 4 deletions

View file

@ -0,0 +1,68 @@
---
type: other
source_url: https://docs.google.com/document/d/1G61uUB0FifUnmmrPzFQojZ3KpczYKmXGpgEXDJ2l_Zg/edit?tab=t.0
retrieved: 2026-09-22
title: "Diogo Almeida: [public] thoughts on a typesafe coding agent"
author: "Diogo Almeida (@CompleteSkeptic, CEO TypeSafe AI)"
tags: [typesafe-ai, jev, coding-agent, kv-cache, routing, compaction, subagents, meta-attention, security-routing, primary-source]
---
# Diogo Almeida — „[public] thoughts on a typesafe coding agent" (21.09.2026)
## Zugriff und Verifikation
- **Dokument:** [Google Doc](https://docs.google.com/document/d/1G61uUB0FifUnmmrPzFQojZ3KpczYKmXGpgEXDJ2l_Zg/edit?tab=t.0), Titel laut Link-Vorschau: „[public] thoughts on a typesafe coding agent"
- **Volltext lokal abgerufen** am 22.09.2026 über den Export-Endpunkt (`/export?format=txt`, HTTP 200, 15.737 Byte) — der gesamte Inhalt unten stammt aus dem Primärtext, nicht aus Zusammenfassungen.
- **Begleitpost:** [@CompleteSkeptic](https://x.com/CompleteSkeptic/status/2101894250401271876), 21.09.2026 04:40 UTC, 538.493 Views / 3.097 Likes / 4.426 Bookmarks (Abruf 22.09.):
> „sharing some notes on typesafe 🤝 coding agents […] we likely will never have time (ever again) to play ourselves, but hope the that the community goes WILD (and makes me look like a naive idiot)"
- Kein Datum im Dokument selbst; Datierung über den Begleitpost.
## Inhalt (strukturgetreu, Auszüge wörtlich)
### 1. Warum überhaupt ein eigener Agent — Kernannahmen
- „Coding agents are surprisingly simple — especially the agentic part. They tend to be while loops with a small number of tools."
- „There seems to be very little meaningful innovation in the non-agent part."
- Bestandteile sind wiederverwendbar (Modelle via API, UX/UI, Open Source); unsicher bei Auth-Komplexität (MCP).
- „The cost advantage of first party agents may be decreasing — (maybe) it seems like agent use is more moving in the direction of pay as you go API pricing."
- Leitfrage: **„how would you design a coding agent if LLMs had no KV cache?"**
### 2. „What weird things are caused by the tyranny of the KV cache?" — sechs Punkte
1. **Routing funktioniert nicht (alte Rechnung):** opus 5/25, sonnet 3/15 (Einheiten im Dokument unbenannt); Pfad 1 (nur Opus) kostet 25Y + 5Z, Pfad 2 (Opus→Sonnet→Opus) kostet 3X + 20Y + 8Z. Bei X = 0,65 / Y = 0,12 / Z = 0,23 — ausdrücklich „let's have chatgpt vibe some proportion" — ist reines Opus 2/3 so teuer wie der Routing-Pfad. TL;DR im Text: Routen zu einem kleineren Modell und zurück kann teurer sein, weil der Kontext vom großen Modell neu prozessiert werden muss.
2. **Tool-Calling ist ein seltsamer Trade-off:** Tools müssen vorab im System-Prompt spezifiziert werden, sind aber nicht immer relevant; Vermutung: Modelle sind schwach in Kombination aus hoher Kardinalität und Off-Policy-Tool-Calls. (Debattiert: deshalb der Vorteil von Skills.)
3. **Compaction existiert:** Sie ergibt nur Sinn unter der Annahme, dass alle künftigen Turns einen gemeinsamen State wollen. Compression ist sehr schwer und vermutlich schlechter als query-aware compression.
4. **Subagents sind meh:** Überraschend wenig automatische Parallelisierung; vermutlich liegt es am State-Problem (welche Kontextteile rein, welche Ergebnis-Kontextteile zurückmergen).
5. **Restart existiert:** Sinnvoll bei korruptem State; alternativ alter relevanter State on-the-fly laden.
6. **Batterien sind nicht inklusive:** Trade-off zwischen Einfachheit („**with openclaw as an extreme**") und Power-Usern (Claude Code/Codex).
### 3. TypeSafe + Coding Agent — drei Kategorien
**Basic (in jeden Agenten integrierbar):**
- **Permissions/Approval:** Soll ein Befehl laufen — vergleichbar mit Claudes Auto-Mode, idealerweise mit programmierbaren Queries; tiefer gehend: Dateiinhalt vor der Ausführung lesen.
- **MCP/Tool-Calling als Router:** High-Level-Beschreibung des Vorhabens, dann mehrere TypeSafe-Calls für das beste Tool bzw. die Top X.
**Advanced (TypeSafe-nativ):**
- **„Meta-Attention"** (Smart Context / Relevance / Filtering): „The idea that context is static can be entirely removed." Pro Query neu rechnen, wie gut der bisherige Kontext ist (KV-Cache-Reuse vs. Neuaufbau als Kosten-Entscheidung) und einen neuen Kontext konstruieren. Einfachste Form: ein **Noul auf jeden Kontext-Chunk** (Tool-Inputs, Tool-Outputs, internes Reasoning, Nutzer-Nachrichten); künftig Score-Stufen von „Don't show" über Kurz-/Langsummary bis Volltext.
- **Routing + „Sub"-Agents:** First-class dynamic contexts ermöglichen Routing leichter Aufgaben an billigere/schnellere Modelle, alles cost/intelligence-aware. Vermutung: ein großer Subagenten-Kostenblock ist das Kuration des Kontexts.
- **First-principled Skills/MCP/Tool-Calling:** kleine Verfügbarkeits-Snippets statt System-Prompt-Blöcke, volles Schema on demand, „This not corrupting the context — Unprecedented (:". Wenn das trägt: „Imagine having 100s of tools + 1000s of docs built-in".
**Weirder stuff:**
- **Better batteries:** Erster-Part-Prompts rundum Kontext-Kompressoren (Beispiele: `rtk-ai/rtk`), damit LLMs sie „nativ verstehen"; Side Note: ein Open-Source-Hype-Vehicle als Deliverable.
- **Conditional system messages / AGENTS.md:** dynamisches Laden je Bedingung (Frontend → Styleguide, Unterverzeichnis → Gotchas-Datei). Skills-Erfahrung: „do this now" vs. „have this in memory somewhere"; geladene Skills fallen Compaction zum Opfer — der dynamische Pfad wäre dagegen immun. Side Note: genau das wolle er für einen Chatbot.
- **Structured Skills:** Skills, die Tools, Permissions, Hooks, Kontext-Policy und Verhalten ändern — mächtiger als Claude-Skill-Hooks (die dauerhaft in die Session schreiben).
- **Recursive Language Models** (Verweis auf alexzhang13.github.io/blog/2025/rlm/): State als explizite Variablen.
- **Fancier summarization:** Heatmap über grep-Output, dynamisch filterbar.
- **Extreme subagents + parallelization:** Synchronisations-Primitives, Locks bei Write-Kollisionen.
- **Security-aware routing:** „Chinese models are way cheaper and likely yoinking all the data passing through them (e.g. DeepSeek V4 is insanely cheap)". Idee: Aufgaben erhalten eine Wahrscheinlichkeit für Dateityp-Kontakt, Policies je Typ, Routing danach; Erweiterung: auch Nicht-Kosten-Gründe (keine Anthropic-Modelle für LLM-Forschung, kein OpenAI/Anthropic bei Safety-kritischen Dingen).
### Anhang
- **Kandidaten-Tools:** `chopratejas/headroom` (Context Compressor; Idee: Classifier, ob die Kompression das Nötige enthält), `rtk-ai/rtk` (Tool-Output-Kompressor), `ast-grep` (alternative Suche; Idee: Manual für One-off-Query laden, N Queries generieren, per Modell filtern), `ast-outline` (hierarchisches Function Calling), `microsoft/fastcontext` (Sub-Agent für Repo-Exploration; **Claim des Repos:** „In our analysis of GPT-5.4 trajectories, reading and searching account for 56.2% of all tool-use turns and 46.5% of the main agent's total tokens"), `dmtrKovalenko/fff` (typo-resistente Suche).
- Idee: `/goal`-artiges Verhalten per Subgoal-Deduplikation; **SLOP**-Aufschlüsselung von Coding-Agent-Subtasks.
- **Anhang 2 — Background Processing als Agent-Pattern:** vier verlinkte Workflow-Beispiele (xpasky, geoffreylitt „Understanding is the new bottleneck", samhogan Evals im Hintergrund, trq212 ELI5-Skill) — gemeinsam: sie laufen **im Hintergrund** und sind read-only Funktionen des aktuellen Codebase-State. Passendes Muster: **Cross-Model Review** (z. B. Codex reviewed Claudes Arbeit). TypeSafe-Synergie: expliziter State macht geteilte Lese-Arbeit zwischen Background-Tasks billig — „I think being explicit about state (reads vs writes) should generally give us super powers eventually 🙃".
- **Anhang 3:** Verweis auf einen neueren Post (x.com/CompleteSkeptic/status/2100804802339082717).
## Charakter des Dokuments
Kein Roadmap-Dokument mit Zusagen: viele „could", „maybe", „I wonder", zwei als „undercooked"/„not sure" markierte Abschnitte. Der Begleitpost verneint explizit, dass TypeSafe den Agenten selbst baut („we likely will never have time (ever again) to play ourselves").

View file

@ -0,0 +1,47 @@
---
type: xpost
source_url: https://x.com/0xCodila/status/2102114600997286293
retrieved: 2026-09-22
author: "@0xCodila"
is_thread: false
quote_count: 0
tags: [jev, typesafe-ai, use-cases, playbook, marketing, quote-tweet]
---
# 0xCodila — „Jev engineering playbook" (21.09.2026)
## Metadaten (FxTwitter, Abruf 22.09.2026)
- **Autor:** codila (@0xCodila), Bio „AI - researcher & coder | writing about what I use myself", 21.096 Follower, verifiziert, Substack substack.com/@0xcodila
- **Post:** Note-Tweet, 21.09.2026 19:15:50 UTC; **89.907 Views / 512 Likes / 47 Reposts / 31 Replies / 1.038 Bookmarks**; keine Community Note
- **Form:** Quote-Tweet des Almeida-Posts ([@CompleteSkeptic, 21.09.2026](https://x.com/CompleteSkeptic/status/2101894250401271876)) mit dessen Google-Doc-Link
## Wortlaut (Kern)
> „Jev Creator Diogo Almeida just released a 7-page document on how to use Jev better than ~95% of people
>
> I built and tested the FULL list, wrote a 14-page PDF setup guide and ranked every use case from 010"
Zehn Use Cases mit Bewertungen:
| # | Use Case | Score |
|---|----------|-------|
| 1 | **Permission Gate** — Jev entscheidet vor der Ausführung: automatisch / Review / blockieren | 9,5 |
| 2 | **Tool-Routing statt alles laden** — Kategorie, Tool und MCP-Schema pro Task wählen | 9 |
| 3 | **Dynamischer Kontext** — welche Dateien, Messages, Tool-Outputs rein/raus vor jeder Ausführung | 10 |
| 4 | **History-Compaction um den nächsten Task** — dasselbe Gedächtnis, anderes Summary je Intent | 8 |
| 5 | **Modell-Routing nach Gesamtkosten** — Difficulty, Kontext, Cache, Latenz, Kosten gegen Switching | 9 |
| 6 | **Subagents nur wenn nötig** — Auswahl, Kontext-Isolation, Merge der Resultate | 8 |
| 7 | **AGENTS.md conditional laden** — nur die Regeln, die Task/Datei/Verzeichnis brauchen | 8,5 |
| 8 | **Skills als strukturierte Module** — Tools/Permissions/Hooks/Kontext-Policy modellweise ändern | 8 |
| 9 | **Sensitive Work sicher routen** — Datenklassifikation → erlaubter Provider oder lokal; Eskalation an Menschen | 9,5 |
| 10 | **Review im Hintergrund** — Tests/Security/Review parallel; Jev entscheidet, welche Findings blockieren | 9 |
Abschluss: „overall score: 8.9/10"; „the result: Jev CEO showed you what to build - I tested the ideas, ranked what matters and turned everything into a Jev system better than what 95% of users are running"; CTA „Copy my complete 14-page Jev engineering playbook".
## Notizen
- Alle zehn Punkte sind Ableitungen aus dem **Almeida-Dokument** (Google Doc, volltextverifiziert); kein eigener Messwert, kein Benchmark, kein Repo im Post verlinkt.
- Der Claim „I built and tested the FULL list" ist **nicht belegt** (kein Setup, keine Daten, keine Runs).
- Arithmetik: Mittelwert der zehn Scores = 8,85 → gerundet 8,9 ✅.
- Bookmarks (1.038) übersteigen Likes (512) — Referenzcharakter der Kuratierung, unabhängig von der Evidenzlage.

View file

@ -0,0 +1,70 @@
---
created: 2026-09-22
updated: 2026-09-22
sources: [other/2026-09-21_almeida-typesafe-coding-agent-notes.md, xpost/2026-09-21_codila-jev-usecase-ranking.md]
tags: [concept, agents, typesafe-ai, jev, coding-agent, kv-cache, routing, compaction, meta-attention, security-routing, background-review]
---
# Der TypeSafe-Coding-Agent-Idee — Almeidas Notizen (21.09.2026)
> **Primärquelle:** [[../../people/diogo-almeida.md|Diogo Almeida]] (CEO TypeSafe) veröffentlichte am 21.09.2026 das Google-Doc „[public] thoughts on a typesafe coding agent" — **Volltext lokal gelesen** (Raw: `raw/other/2026-09-21_almeida-typesafe-coding-agent-notes.md`). Begleitpost: 538.493 Views / 3.097 Likes / 4.426 Bookmarks (Abruf 22.09.). Kein Roadmap-Dokument: viele „could/maybe/I wonder", zwei Abschnitte selbst als „undercooked"/„not sure" markiert; im Begleitpost verneint Almeida, dass TypeSafe den Agenten selbst baut („we likely will never have time (ever again) to play ourselves").
## Kernthese und Leitfrage
Die Annahmen: Coding agents sind „surprisingly simple" — **While-Loops mit wenigen Tools**; die Nicht-Agent-Teile haben wenig Innovation; Modelle und UX sind via API/OS wiederverwendbar; der Kosten-Vorteil von First-Party-Agenten schwindet Richtung Pay-as-you-go-API.
Leitfrage des Dokuments: **„How would you design a coding agent if LLMs had no KV cache?"** — also: Was im heutigen Agenten-Design ist nur eine Verzerrung durch den Cache, kein Designfehler?
## Die sechs „KV-Cache-Tyrannie"-Punkte
| Punkt | Almeidas These |
|-------|----------------|
| **1. Routing funktioniert nicht** | Reine Opus-Kosten 25Y+5Z vs. Opus→Sonnet→Opus 3X+20Y+8Z (Einheiten im Doc unbenannt); mit „chatgpt-vibed" Anteilen X=0,65/Y=0,12/Z=0,23 ist reines Opus 2/3 des Routing-Pfads. Kern: Routing zu einem kleinen Modell und zurück kostet mehr, weil der große Kontext neu prozessiert werden muss. |
| **2. Tool-Calling ist ein seltsamer Trade-off** | Tools müssen vorab im System-Prompt spezifiziert werden, sind aber nicht immer relevant; Modelle schwach bei hoher Kardinalität + Off-Policy-Tool-Calls. |
| **3. Compaction existiert** | Sie ergibt nur Sinn unter der Annahme eines gemeinsamen State für alle künftigen Turns; query-aware compression wäre besser, ist aber schwer. |
| **4. Subagents sind meh** | Wenig automatische Parallelisierung; vermutlich State-Kuration (was rein, was zurückmergen) als Kostenblock. |
| **5. Restart existiert** | Nur sinnvoll, wenn State korrupt; alternativ relevanten State on-the-fly laden. |
| **6. Batterien fehlen** | Trade-off Einfachheit vs. Power-User — **OpenClaw ausdrücklich als Einfachkeits-Extrem genannt** („with openclaw as an extreme"), Claude Code/Codex als Power-User-Pol. |
⚠️ Die Routing-Rechnung benennt ihre Kosteneinheiten nicht und nutzt selbst ausdrücklich „vibed" Anteile — sie ist ein Plausibilitätsargument für Kontext-Neulad-Kosten, keine Messung.
## Die TypeSafe-nativen Ideen
- **„Meta-Attention"** — „The idea that context is static can be entirely removed": pro Query neu rechnen, wie gut der bisherige Kontext ist (KV-Cache-Reuse vs. Neuaufbau als **Kosten-Entscheidung**), und einen neuen Kontext konstruieren; einfachste Form ein **Noul pro Kontext-Chunk** (Tool-Inputs, -Outputs, internes Reasoning, Nutzer-Nachrichten), künftig Score-Stufen von „Don't show" bis Volltext. Das ist der Vorschlag mit der direktesten Jev-Abbildung — query-aware Kontextpflege statt globaler Compaction.
- **Routing + Subagents:** First-class dynamic contexts ermöglichen cost/intelligence-aware Modell-Routing; Subagenten werden billiger, wenn Kontext-Kuration automatisiert wird. Explizite Spend-Knobs für Nutzer.
- **First-principled Skills/MCP/Tools:** kleine Verfügbarkeits-Snippets statt System-Prompt-Blöcke, volles Schema on demand — „This not corrupting the context — Unprecedented (:". Wenn das trägt: „Imagine having 100s of tools + 1000s of docs built-in."
- **Conditional AGENTS.md:** dynamisches Laden je Bedingung (Frontend → Styleguide, Unterverzeichnis → Gotchas-Datei). Kritik an Skills: sie sind „do this now" statt „have this in memory somewhere", und geladene Skills **fallen Compaction zum Opfer** — der dynamische Pfad wäre dagegen immun. Almeidas Side Note: genau das wolle er für einen Chatbot.
- **Security-aware routing:** Aufgaben erhalten eine Wahrscheinlichkeit für Dateityp-Kontakt, Policies je Typ; billigere Modelle nur für unkritische Typen; auch Nicht-Kosten-Gründe („don't use anthropic models for LLM research, don't use openai/anthropic for safety-sensitive things"). ⚠️ Die Annahme „Chinese models are way cheaper and likely yoinking all the data" ist **unbelegte Behauptung** im Dokument — als Policy-Motivation gelesen, nicht als Fakt.
- **Structured Skills / RLM / Extreme-Parallelisierung / Fancier Summarization:** Skills als Verhaltensmodule (mächtiger als Claude-Skill-Hooks, die dauerhaft in die Session schreiben); Recursive Language Models (State als explizite Variablen); Locks/Synchronisation für extreme Subagent-Parallelisierung; Heatmap-Filterung von grep-Output.
## Background Processing als Agent-Pattern (Anhang 2)
Vier verlinkte Workflow-Beispiele haben gemeinsam: Sie laufen **im Hintergrund** und sind read-only Funktionen des Codebase-State. Das passende Muster: **Cross-Model Review** („Have codex review claude's work"). TypeSafe-Synergie: expliziter State macht geteilte Lese-Arbeit zwischen Background-Tasks billig — „I think being explicit about state (reads vs writes) should generally give us super powers eventually 🙃".
Anhang-Tools mit Jev-Anschluss: `headroom` (Kompressions-Classifier), `rtk` (Tool-Output-Kompressor), `ast-grep`/`ast-outline` (Query-Filterung/hierarchisches Function Calling), `microsoft/fastcontext` (**Repo-Claim:** „reading and searching account for 56.2% of all tool-use turns and 46.5% of the main agent's total tokens" in GPT-5.4-Trajektorien — wenn das generalisiert, ist genau dort der Hebel), `fff`.
## Einordnung
- **Das Dokument sagt nicht „Jev + Coding-Agent", sondern „Coding-Agent, der um expliziten State herum designt ist"** — Jev ist der Mechanismus für die Entscheidungen in diesem Design (Permission Gate, Tool-Routing, Noul-pro-Chunk, Security-Routing), nicht der Agent selbst.
- **Es bestätigt die Gate-Ebene statt der Demos:** Permission Gate, Tool-Routing, Kontextfilterung sind exakt die Rollen, die [[../llm/harness-vs-standalone-chat-llm.md|unserer Gate-These]] entsprechen — und sie stammen diesmal vom Anbieter selbst, nicht von einer Demo.
- **Compaction-Kritik deckt sich mit der Memory-Erfahrung:** „do this now" vs. „have this in memory somewhere" und das Compaction-Ausfallrisiko geladener Skills sind reale Harness-Probleme; Almeidas Lösung (dynamisches Nachladen statt dauerhaften System-Prompt-Blocks) ist ein direkter Angriff auf dieses Problem, verwandt mit [[../agents/harness-loop-graph-engineering.md]].
- **Kostenbewusster Cache-Reuse** ist die Brücke zu [[../agents/agent-budget-breaker.md]]: „educated cost-aware decisions based on how good re-using the current cache is vs recreating one from scratch" — dieselbe Logik wie unser Kostendeckel, nur als per-Query-Entscheidung.
- ⚠️ Status: **Ideen- und Annahmen-Katalog**. Keine Zusagen, keine Messungen, kein Bauplan mit Terminen. Wer das als Ankündigung eines TypeSafe-Agenten liest, liest mehr als der Autor.
## Rezeption: 0xCodilas Use-Case-Ranking (21.09.2026)
**[[../../people/codila.md|codila]]** (@0xCodila) quottete das Dokument (89.907 Views / 512 Likes / **1.038 Bookmarks**; Raw: `raw/xpost/2026-09-21_codila-jev-usecase-ranking.md`): „I built and tested the FULL list, wrote a 14-page PDF setup guide and ranked every use case from 010" — zehn Use Cases, Gesamtwert 8,9/10 (arithmetisch korrekt: Mittel 8,85). Die Verteilung liest sich als Marktvertrauens-Proxy: **Kontext-Steuerung 10/10**, Permission Gate und Security-Routing je 9,5, Tool-Routing, Modell-Routing und Background-Review je 9 — genau die Gate-/Filter-Rollen, nicht Chat- oder Reasoning-Rollen.
⚠️ **„Built and tested" ist unbelegt** — der Post verlinkt kein Setup, keine Daten, keine Runs; alle zehn Punkte sind Ableitungen aus dem Almeida-Dokument. Der Post ist **Kuratierung plus Lead-Magnet** („Copy my complete 14-page Jev engineering playbook"), keine Prüfung. Sein realer Erkenntniswert: die Rangfolge zeigt, welche Jev-Rollen externem Nutzen zugeschrieben werden — nicht, dass sie funktionieren.
## Verwandte Wiki-Seiten
- [[../llm/system-one-models-jev.md]] — Modell, Evals, N8-Benchmark
- [[../llm/harness-vs-standalone-chat-llm.md]] — Gate vs. Generierung
- [[../agents/harness-loop-graph-engineering.md]] — While-Loop-Ebene
- [[../agents/agent-budget-breaker.md]] — kostenbewusster Cache-Reuse und Kostendeckel
- [[../llm/jev-praxis-demos.md]] — Demo-Welle und Praxistests
- [[../llm/jev-vercel-ai-gateway.md]] — Verteilung
- [[../../people/diogo-almeida.md]] — Autor
- [[../../people/codila.md]] — Kuratierung und Ranking
- [[../../institutions/typesafe-ai.md]] — Anbieter

View file

@ -2,7 +2,7 @@
*Auto-generated: 2026-07-07*
*Letzte Aktualisierung: 2026-09-22 (240. Update — **Philippe Guillemant: „Warum die KI kein Bewusstsein haben kann“** (X-Post 22.09.2026, 11:52 UTC; Kurzlink `tinyurl.com/2b4bmny3` per 301 aufgelöst; im OME-Topic „Theorie-Bildung“ als nb5-Briefing von Kai weitergeleitet). **Quellenlage:** Der Post war über `cdn.syndication.twimg.com` nur **gekürzt** (276 Zeichen) abrufbar, der **Volltext kam über die fxtwitter-API** (HTTP 200) — der Post ist damit im Volltext dokumentiert, das Briefing-Video war nicht auswertbar. Interaktion beim Abruf: 207 Likes / 79 Reposts / 6.152 Views. **Inhalt:** vier zitierte anglophone Contra-Argumente (Penrose/Hameroff: Anästhetika → Quantenreduktion in Mikrotubuli; Chalmers: hartes Problem; **Koch: simuliertes Schwarzes Loch krümmt keine Raumzeit**; Penrose/Hoffman: kein Rechenergebnis) gegen **Guillemants eigene These**: Bewusstsein als **~1-Sekunden-Zeitfenster in der nahen Zukunft** (Deutung Libet/Bem), das der vom Gehirn ausgeführten Reduktion *präsidiert* (Linie Penrose → Kastrup → Faggin), Zeitlinien im Multiversum wählt und — je Zeitdichte (Mensch ~1 s, Pflanze ~1 h, Erde ~1 Jahr) — als „erwachte Materie“ der „schlafenden“ Materie gegenübertritt; Mechanismus: außerzeitliche Vakuumschwingungen + zweite Zeit (Connes „horloge divine“). Schluss: keine Zukunftssensorik → kein KI-Bewusstsein. **Verifiziert:** `Theory_of_Double_Causality.pdf`, `Cosmopolis_Vol7_2013.pdf` (Zwei-Funktionen-Modell, Institut de France 05.12.2012), DOI `10.1016/j.aop.2019.05.005` (*Annals of Physics* 409/2019, Billard-Modell) und der Qeios-Preprint `10.32388/g7a24r` — alle HTTP 200. Das angehängte Bild = dekorative KI-Illustration ohne Daten. **Einordnung:** spekulative Position außerhalb des Mainstreams; **Falsifizierbarkeits-Einwand aus der OME-Gruppe** festgehalten (keine messbare Vor-Registrierung; Reduktions-Timing unspezifiziert); stärkster unabhängiger Einwand = Kochs Simulation. Abgrenzung: echte Retrokausalitätsforschung (Aharonov, Price) trägt Guillemants Schlüsse **nicht**. Wiki: `people/philippe-guillemant.md` (neu), `concepts/agi/zukunftssensor-bewusstsein.md` (neu), `concepts/agi/ai-consciousness.md` (**gemerged**, neuer Rezeptions-Abschnitt statt Duplikat). Raw: `raw/xpost/2026-09-22_guillemant-ki-kein-bewusstsein.md` (neu — Volltext FR + Übersetzung + Quellenprüfung).)*
*Letzte Aktualisierung: 2026-09-22 (239. Update — Almeidas Coding-Agent-Notizen + Codilas Use-Case-Ranking. Anlass: X-Link von Rüdiger (@Stelariz_75) in OME Topic „JEV“. **Primärquelle volltextverifiziert:** Google-Doc „[public] thoughts on a typesafe coding agent“ von Diogo Almeida (21.09.2026; Begleitpost 538.493 Views / 3.097 Likes / 4.426 Bookmarks beim Abruf) via /export?format=txt (HTTP 200, 15.737 Byte) — raw/other/2026-09-21_almeida-typesafe-coding-agent-notes.md (neu). **Leitfrage:** „How would you design a coding agent if LLMs had no KV cache?“ — sechs Cache-Verzerrungen (Routing unrentabel ohne Cache-Wirtschaft, vorab spezifizierte Tools, globale Compaction, Subagent-State-Kuration, Restart, fehlende Batterien — **OpenClaw ausdrücklich als Einfachkeits-Extrem genannt**) plus TypeSafe-nativen Ideen: **Meta-Attention** (ein Noul pro Kontext-Chunk statt globaler Compaction), cost-aware Modell-Routing, Tool-Schema on demand, **Conditional AGENTS.md** (geladene Skills „fallen Compaction zum Opfer“), **Security-aware Routing** („don't use anthropic models for LLM research, don't use openai/anthropic for safety-sensitive things“), read-only Background-Tasks mit **Cross-Model Review**. **Status:** Ideen-/Annahmen-Katalog, keine Zusagen; im Begleitpost verneint Almeida, dass TypeSafe den Agenten selbst baut („we likely will never have time (ever again) to play themselves“); Routing-Rechnung selbst als „chatgpt-vibed“ markiert. **Rezeption:** @0xCodila quotete das Doc (89.907 Views / 1.038 Bookmarks; raw/xpost/2026-09-21_codila-jev-usecase-ranking.md, neu): zehn Use Cases gerankt 010, Gesamt 8,9 (arithmetisch korrekt); Top-Werte = Gate-/Kontext-Rollen (Kontext 10/10, Permission Gate 9,5, Security-Routing 9,5), Reasoning-Rollen fehlen durchgehend. **Achtung:** „I built and tested the FULL list“ unbelegt — kein Setup, keine Daten; Kuratierung + Lead-Magnet („14-page Jev engineering playbook“). Wiki: concepts/agents/typesafe-coding-agent-idee.md (neu), people/codila.md (neu); Updates people/diogo-almeida.md.)*
*Vorherige Aktualisierung: 2026-09-22 (239. Update — MacStories-Review „M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents" (Federico Viticci, 21.09.2026; geteilt von Kai @PWeber in OME Topic „Openclaw mit lokalen Modellen", #1744). **Erste unabhängige Verifikation der M5-Ultra-Versprechen** — schließt die Lücke „⚠️ nur Herstellerangaben" auf der Apple-Seite. Raw: `raw/blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md` (neu; web_fetch vollständig, 21.401 Zeichen). Wiki: `people/federico-viticci.md` (neu), `institutions/macstories.md` (neu), Updates in `concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md` (neuer Messwert-Abschnitt: 256-GB-Gerät gegen M3 Ultra 512 GB und RTX 5090 — Generierung ~+70 %, Prefill ~+150 % (≈2,5×), Flash-Next >100 tok/s bei kurzem Prompt und 6085 tok/s bei 64K256K Kontext; Prefill bei 6.000-Token-Prompt ~1.700 tok/s vs. 5090 ~3.000 tok/s; Generierung 5090 konstant ~25 % voraus (1,79 vs. 1,2 TB/s), verliert aber oberhalb 32 GB VRAM), `concepts/llm/qwen3.8-flash-next-qwen4-preview.md` (erster dokumentierter Praxiseinsatz: Flash-Next als lokales Default-Modell in Open Minis und Hermes Agent, 5-Bit vollständig im RAM, bis zu 3 parallele Sessions mit Subagenten via oMLX), `concepts/hardware/cloud-exit-and-local-superiority.md` (Cross-Ref). **Produktivnachweis:** 99 Tage Dauerbetrieb mit DeepSeek-V4-Flash-Agenten + olmOCR über 310 Dokumente fürs iOS-/iPadOS-27-Review — Gesamtkosten 0 $, weil dieselbe Dauerlast per Cloud-API als untragbar eingeschätzt wurde. ⚠️ Einzelsetup (n=1), keine reproduzierte Benchmark-Suite.)*
*Vorherige Aktualisierung: 2026-09-22 (238. Update — Unabhängiger Jev-vs.-GPT-5.6-Terra-Benchmark von N8 Programs, geteilt als r/ProAI-Repost. **Quelle vollständig aufgelöst:** Reddit-RSS (17.09., normale Seite/JSON blockiert) → [X-Thread](https://x.com/N8Programs/status/2100088523403432357) (16.09.; 179.846 Views beim Abruf) → vier Originalgrafiken lokal gelesen. **Methode:** neun Multiple-Choice-Bedingungen; Terra `reasoning=none`, Letter-only. **Resultate:** Jev gewinnt MMLU 90,91:87,89, GPQA 68,18:56,06, ARC-Easy/Challenge knapp und WinoGrande 91,63:78,69; Terra gewinnt HellaSwag 95,32:94,86, GSM8K deutlich (87,72:79,68 bzw. 69,83:54,59) und Schach knapp 50,25:49,45. Ungewichteter Makromittelwert **Jev 80,69 % · Terra 80,15 %** → „Terra-tier“ trägt eng für diesen Test, nicht als allgemeine Intelligenzbehauptung. **Korrektur des Threadtexts:** Er behauptet einen Jev-Sieg auf HellaSwag; die eigene Tabelle zeigt Terra +0,46 Pp. **Kalibrierung:** N=33.735, ECE **1,74 Pp**, 10 Bins, Wilson-95-%-Intervalle, Einzelbenches 0,266,96 Pp — stärkste öffentliche Fremdevidenz für RLCD bisher. **Kosten:** Jev $0,6999 (estimated: Input-Token × $0,042/MTok) vs. Terra $12,9865 (API-reported) = **18,55×**; die ~18×-Rundung hält, die Hersteller-Obergrenze 400444,6× nicht. **Nicht geprüft:** Geschwindigkeit; kein Repo, keine Prompts/Seeds/Logs, keine Reproduktion, Kontaminationsrisiko öffentlicher Benches. Wiki: `people/n8-programs.md` (neu), `concepts/llm/system-one-models-jev.md` (neuer unabhängiger Benchmark-Abschnitt). Raw: `raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md` (neu).)*
*Vorherige Aktualisierung: 2026-09-22 (237. Update — Grok 4.7 + Grok-Bot-Praxis + ART19-Podcast. **Primärquellen:** [xAI Release](https://x.ai/news/grok-4-7), [API-Modellkarte](https://docs.x.ai/developers/models/grok-4.7), [Cursor-Modellseite](https://cursor.com/docs/models/grok-4-7). Grok 4.7: größerer Basismodell-Kern, längeres RL auf schwierigen mehrstündigen Aufgaben, stärkere Selbstprüfung, natives Grok-Bot-Harness-Verständnis; Modell-ID `grok-4.7`, 500k API-Kontext, Reasoning `low|medium|high|xhigh`; API <200k Prompt $2/M Input · $0,50/M Cached · $6/M Output, ab 200k $4/$1/$12. Herstellerbenchmarks u. a. CursorBench 46,3 %, DeepSWE 71,0 %, Terminal-Bench 38,0 % **nicht unabhängig reproduziert**. @cb_doge-Post primär gegengeprüft; twice as fast and half the price bleibt dessen Verdichtung. Alex Finns Video (14:06, geteilt von Pit): kein Transcript abrufbar; Workflow nur attribuiert aus YouTube-AI-Zusammenfassung + Herman-Auswertung (PM/Developer/Designer, Exec-Team, Linear/Notion-Issues, Cursor Cloud Agents). Zusätzlich Netbits ART19-MP3 als Voll-Ingest: Grok AI Daily“, 21.09., 29:30, lokales Maschinen-ASR; allgemeiner Newsrecap zu Meta Muse, Cyber-/Safety-Claims, USChina, Trump und Newsom **kein Grok 4.7**, Grok Bot nur beiläufig. Wiki: `institutions/grok-ai-daily.md` (neu); Updates `institutions/xai.md`, `tools/grok-bot-spacexai.md`, `concepts/llm/llm-model-catalog.md`, `concepts/policy/ai-regulation-2026.md`. Raw: 4 neue Einträge in blog/xpost/youtube/podcast.)*
@ -249,6 +249,7 @@
| [Jev über den Vercel AI Gateway](concepts/llm/jev-vercel-ai-gateway.md) | **Verteilung statt Waitlist:** Jev läuft seit **16.09.2026** im [Vercel AI Gateway](institutions/vercel.md) unter `typesafe-ai/jev` — AI SDK 7.0.105+, `experimental evaluate`, Frage-Typen **Choice/Score/Boolean**, ein `state` + Map benannter `questions`, Confidence unter `providerMetadata.typesafe.confidence`, **Zero Data Retention / No Training** per Request, Abrechnung gegen Gateway-Budgets. Gateway-Preis **$0.04/1M Input** (gerundet; TypeSafe: $0,042). Anlass: Startup-Ideen-Post von [Greg Isenberg](people/greg-isenberg.md) mit sieben Geschäftsideen („find an expensive queue and put Jev at the front of it"). ⚠️ „1.700 E-Mails für 18 Cent" ohne Token-Aufschlüsselung/Datensatz, „94 %" nur Illustration, Leistungszahlen von Vercel als TypeSafe-Angabe weitergegeben | xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md + blog/2026-09-16_vercel-jev-ai-gateway.md |
| [Jev in der Praxis — Demo-Urteile](concepts/llm/jev-praxis-demos.md) | **Die Bauprojekt-Welle (16.18.09.2026)** als Ersatz-Evidenz, solange keine unabhängigen Benchmarks existieren: Wikipedia-Races und Doom ([Matthew Berman](people/matthew-berman.md)), Kleinstadt-Simulation, Skittles-Sortierung, **[Schach-Blitz gegen Frontier-LLMs](https://x.com/aimlapi/status/2100372930282573876)** ([AI/ML API](institutions/ai-ml-api.md): Jev materiell unterlegen, **gewinnt auf Zeit** gegen Fable 5.1 — ~2,6 s vs. 615 s pro Zug; Matt in 18 Zügen gegen GPT-6 Astra), „Unclutter"-Ad-Blocker ([kitze](people/kitze.md)), Jev-Modellrouter ([Riley Brown](people/riley-brown.md)). Kernbefund: Der **Schleifen-Slot ohne Sprachmodell** ist real, Geschwindigkeit schlägt Qualität pro Zug — aber nur wo Zeit die Metrik ist. ⚠️ Alle Demos selbstveröffentlicht, kein Aufbau veröffentlicht; viralster Post („rebuilt Tesla FSD", [Justin Schroeder](people/justin-schroeder.md), 568.108 Views) ist der inhaltsleerste | youtube/2026-09-18_berman-jev.md + xpost/2026-09-15_almeida-jev-launch-post.md |
| [Sprachsteuerung als Computer-Use — Jev als Desktop-Agent](concepts/agents/jev-sprachsteuerung-computer-use.md) | **Demo 18.09.2026, lokal ausgewertet** ([Andy Gao](people/andy-gao.md), 563 Follower, aber 139.442 Views): Sprechbefehl → Desktop-Aktion (Notes → Notiz → Arc → Google „Norbert Wiener" → x.com → Photo Booth). **Am Material bestätigt:** Zielzustände sichtbar, während das Live-Transkript-Overlay noch unvollständig ist — die belastbarste Einzelaussage der Demo-Welle. Einordnung: Sprache→Absicht ist Klassifikation (Jev-Slot), Absicht→Desktop ist klassische Automatisierung und **der eigentliche Fehlerort**; ein lokales STT mit Schlüsselwort-Matching würde dieselben Bilder erzeugen. ⚠️ Keine Messung, kein Code, nur trivial skriptbare Apps | xpost/2026-09-18_andy-gao-jev-voice-computer-use.md |
| [TypeSafe-Coding-Agent-Idee (Almeida, 21.09.)](concepts/agents/typesafe-coding-agent-idee.md) | **Primärdokument des Jev-Schöpfers**, volltextverifiziert: Leitfrage „Coding-Agent ohne KV-Cache designt“; sechs Cache-Verzerrungen (u. a. Routing unrentabel ohne Cache-Wirtschaft, globale Compaction als Fehlannahme) und Jev-nativen Ideen — **Meta-Attention** (Noul pro Kontext-Chunk), Permission Gate, cost-aware Modell-Routing, Conditional AGENTS.md (geladene Skills fallen Compaction zum Opfer), Security-aware Routing, read-only Background-Tasks/Cross-Model Review. **OpenClaw als Einfachkeits-Extrem** im Batterie-Trade-off benannt. Rezeption: @0xCodila rangiert zehn abgeleitete Use Cases (Gesamt 8,9/10; Kontext 10/10, Permission Gate 9,5). **Ideen-Katalog, keine Zusagen; „built and tested“ im Quote-Post unbelegt | other/2026-09-21_almeida-typesafe-coding-agent-notes.md + xpost/2026-09-21_codila-jev-usecase-ranking.md |
| [DeepSeek V4-Pro GA + Harness v0.1 (Open Source)](concepts/llm/deepseek-v4-pro-ga-harness-open-source.md) | DeepSeek launcht 13.08.2026 Open Source: V4-Pro GA (App/Web/API, Reasoning-Effort low/high/max, OpenAI-Responses-API + Codex, Peak/Off-Peak-Pricing) + DeepSeek Harness v0.1 (MIT, Open-Source-Agent-Harness, Rivale zu Claude Code). Dritter Baustein der chinesischen Welle in 24h. **Update 21.08.:** Deep-Dive-Video zum Harness (Stephen G. Pope) + Turing-Post-TV-Video "The End Of Coding Agents". **Update 02.09.:** WorldofAI-Video "Claude Code & Codex Killer?" (3. Blickwinkel, erweitert um OpenAI/Codex) + Herman-DSH-Details (Everything-is-a-Plugin/Cordis, Trajectory-View, Web-UI-Remote, ~122k Stars; ⚠️ Second-hand) | other/2026-08-14_deepseek-v4-pro-ga-harness-open-source.md + youtube/2026-08-13_deepseek-v4-pro-0813-aicodeking.md + youtube/2026-08-21_deepseek-agent-harness-explained.md + youtube/2026-08-21_deepseek-harness-end-of-coding-agents.md + youtube/2026-09-02_worldofai-deepseek-harness-claude-code-codex-killer.md + other/2026-09-02_herman-deepseek-harness-dsh-summary.md |
| [DeepSeek-V4.1-Flash](concepts/llm/deepseek-v4.1-flash.md) | Kleinstes Modell einer neuen DeepSeek-Architektur-Familie (552B-MoE, Causal-EncoderDecoder, nativ multimodal; offizielle Benchmark-Tabelle). **Update 10.09.:** auf Nous Portal verfügbar (`/model deepseek/deepseek-v4.1-flash`; Listung $0,24/$0,96 per 1M) — Route `nous/deepseek/deepseek-v4.1-flash` in unserem Setup konfiguriert. **Update 17.09.:** Lokale-Inferenz-Sektion ergänzt — Hardware-Stufen, Q2/Q4, Payback (siehe `concepts/hardware/deepseek-v41-flash-lokale-hardware.md`) | xpost/2026-09-10_deepseek-v41-flash-official-release.md + other/2026-09-10_deepseek-v41-flash-official-announcement.md + other/2026-09-10_deepseek-api-updates-changelog.md + youtube/2026-09-10_deepseek-v41-flash-aicodeking.md + xpost/2026-09-10_hermeswatcher-deepseek-v41-flash-nous-portal.md + youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md |
| [Chinesische Modelle räumen global die Usage-Charts ab](concepts/llm/chinese-models-top-usage-charts.md) | OpenRouter: Top-5 der wöchentlichen Token-Nutzung (28.07.03.08.2026) alle chinesisch, 56,8 Bio. Tokens, 15 Wochen in Folge führend, DeepSeek-V4-Flash Platz 1. Kimi-K3-Schock (2,8T, größtes Open-Weight-Modell, GPU-Kapazität nach 48h erschöpft, PHLX-Semi-Index 20%). Vierter Baustein der chinesischen Welle in 24h — jetzt auf Marktanteils-Ebene | other/2026-08-14_chinese-models-top-usage-charts-kimi-k3-shock.md |
@ -451,7 +452,7 @@
| [Dr. Hendrik Susemihl](people/hendrik-susemihl.md) | KI-Experte, Gast der Everlast-Expertenrunde "DAS wird alles zum KIPPEN bringen!" (19.08.2026) | youtube/2026-08-19_ki-experten-alles-zum-kippen.md |
| [Ronnie (Everlast-Expertenrunde)](people/ronnie-everlast-expertenrunde.md) | Teilnehmer der Everlast-Expertenrunde "DAS wird alles zum KIPPEN bringen!" (19.08.2026) | youtube/2026-08-19_ki-experten-alles-zum-kippen.md |
| [Francois Chaubard](people/francois-chaubard.md) | Visiting Partner YC, PhD AI Stanford, Founder/CEO Focal Systems (Stanford, CA). Post „this was wild amounts of disinformation / fear mongering" (10.09.2026): Kritik an der „independent volition"-Darstellung des Hugging-Face-Vorfalls, am Navier-Stokes-Framing und an US-Regulierung als Chinapolitik; These einer millionenschweren Fear-Kampagne. 156.684 Views | xpost/2026-09-10_francois-chaubard-ai-fear-campaign.md |
| [Diogo Almeida](people/diogo-almeida.md) | Forscher und Unternehmer: **CEO/Gründer von [TypeSafe AI](institutions/typesafe-ai.md)** (San Francisco). Co-Autor von **RLHF** und des **InstructGPT-Papers** (arXiv:2203.02155, 2022) bei OpenAI, zuvor Google Brain. Zwei Jahre Stealth, dann Launch von **Jev** (15.09.2026). Positionen: „The problem is the text itself"; „Models have been superhuman at chat for years, so where is all the automation?" ⚠️ Die Rahmung „a ChatGPT researcher" bezeichnet seine Biografie, nicht eine Firmenbeziehung | blog/2026-09-15_typesafe-system-one-models-jev.md + blog/2026-09-15_every-mike-taylor-jev-vibe-check.md + youtube/2026-09-17_aicopium-typesafe-jev.md |
| [Diogo Almeida](people/diogo-almeida.md) | Forscher und Unternehmer: **CEO/Gründer von [TypeSafe AI](institutions/typesafe-ai.md)** (San Francisco). Co-Autor von **RLHF** und des **InstructGPT-Papers** (arXiv:2203.02155, 2022) bei OpenAI, zuvor Google Brain. Zwei Jahre Stealth, dann Launch von **Jev** (15.09.2026). Positionen: „The problem is the text itself"; „Models have been superhuman at chat for years, so where is all the automation?" ⚠️ Die Rahmung „a ChatGPT researcher" bezeichnet seine Biografie, nicht eine Firmenbeziehung | blog/2026-09-15_typesafe-system-one-models-jev.md + blog/2026-09-15_every-mike-taylor-jev-vibe-check.md + youtube/2026-09-17_aicopium-typesafe-jev.md | Neu (21.09.): Coding-Agent-Notizen — „Agent ohne KV-Cache designt“, Meta-Attention, Conditional AGENTS.md, Security-Routing; verneint selbst, dass TypeSafe den Agenten baut.
| [Mike Taylor](people/mike-taylor.md) | **Head of Evals bei [Every](institutions/every.md)**, Autor des ersten unabhängigen Tests von Jev (15.09.2026): 37 Dokumente × 21 Fragen = **777 Judgments in 0,7 s** für geschätzt einen Viertelcent; benennt selbst die Grenzen („doesn't establish performance across entire industries"; „The alternative is not checking at all"). Für das Wiki der Unterschied zwischen Anbieterangabe und Fremdprüfung | blog/2026-09-15_every-mike-taylor-jev-vibe-check.md |
| [Dan Shipper](people/dan-shipper.md) | **CEO von [Every](institutions/every.md)**. Führte am 15.09.2026 den direkteren Jev-Test durch: 12 synthetische Passagen, 4 Schreib-Checks — Jev 0,35 s/Passage und ~580× günstiger, aber **6-von-7** Defekten gegen Claude Fable 5.1 (8,83 s) mit **7-von-7**; derselbe Defekt in drei Runs verpasst | blog/2026-09-15_every-mike-taylor-jev-vibe-check.md |
| [AI Copium](people/ai-copium.md) | YouTube-Kanal **@AICopium** mit KI-Nachrichten-/Erklärformat. Video „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…" (17.09.2026, 14:25; vollständiges Transcript) zum TypeSafe-Launch — zitiert die Fremdzahlen korrekt und entlarvt „Zero Hallucinations" als irreführend, verdichtet aber im Titel auf „400x" (Primärquelle: 193,6×/444,6×) | youtube/2026-09-17_aicopium-typesafe-jev.md |
@ -465,6 +466,7 @@
| [Andy Gao](people/andy-gao.md) | Entwickler (@instantricecook, **563 Follower**, verifiziert, gao.haus): „I built a voice controlled computer-use for my mac using @typesafeai's Jev" (18.09.2026, **139.442 Views** — Reichweite aus dem Thema, nicht aus dem Account). Erster Demo-Erbauer, dessen Material eine **visuelle Prüfung der Kernaussage** zulässt (STT + 9 Standbilder). ⚠️ Keine Beziehung zu TypeSafe bekannt, kein Code | xpost/2026-09-18_andy-gao-jev-voice-computer-use.md |
| [CJ Zafir](people/cj-zafir.md) | Entwickler (@cjzafir, **64.375 Follower**, verifiziert), Bio „I fine-tune small language models (SLMs) and beat large language models". **Erfahrungsbericht zu Jev** (18.09.2026, 33.238 Views): „I burned **$3.40 on Jev in 24 hours**" — erster Ausgabenwert aus echter Nutzung (≈81 Mio. Input-Token, ~19 Postfach-Durchläufe). Kern „**Jev + LLMs**" (System-1-Controller für Routing, Tool-Wahl, Scoring) trägt; ⚠️ zwei Punkte überzeichnet („lernt aus einem Prompt" = Konfiguration; „32k → 1M wird RAG reparieren" — Doku kennt 64k/32k, kein 1M). Eigeninteresse: kleine Modelle | xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md |
| [Nate Herk](people/nate-herk.md) | Betreiber von **Nate Herk \| AI Automation** (@nateherk), Fokus Automatisierungsworkflows (AI Automation Society, X @nateherk). **Praktikerebene zu Jev** (19.09.2026, 13.549 Aufrufe, ~16:08, kein Transkript): zwölf Anwendungsfälle, Live-Builds (X-Feed-Classifier, Paper-Trading-Prototyp), Kostenvergleich gegen LLM-Workflow. Seine Kostenwerte **passen zum Preismodell** (siehe `concepts/llm/jev-praxis-demos.md`); Laufzeiten liegen teils am dokumentierten Rate Limit (offene Frage). Empfehlung: **Evals mit Golden Dataset** vor Produktiveinsatz — deckt sich mit Anhaias Label-Kritik und Zafirs „Jev + LLMs". ⚠️ Beschreibung mit werblichen Elementen | youtube/2026-09-19_nate-herk-jev-12-use-cases.md |
| [codila](people/codila.md) | @0xCodila (21.096 Follower, verifiziert, Substack); kuratiert/vermarktet AI-Tooling. Quottete Almeidas Coding-Agent-Doc (89.907 Views, **1.038 Bookmarks** > 512 Likes) mit zehn gerankten Jev-Use-Cases (Gesamt 8,9/10; Kontext-Steuerung 10/10, Permission Gate/Security-Routing je 9,5 — Gate-Rollen vorn, Reasoning fehlt). **„Built and tested“ unbelegt; Lead-Magnet („14-page playbook“) | xpost/2026-09-21_codila-jev-usecase-ranking.md |
| [N8 Programs](people/n8-programs.md) | @N8Programs / GitHub `N8python`; laut Profil Student für angewandte Mathematik/Statistik an Johns Hopkins und In-Context-Learning-Forschung. Veröffentlichte den unabhängigen Jev-vs.-Terra-System-1-Benchmark: neun Multiple-Choice-Bedingungen, Terra `reasoning=none`; Makro nahezu Gleichstand (80,69 % vs. 80,15 %), ECE 1,74 Pp bei N=33.735, Kosten **18,55×** zugunsten Jev. ⚠️ Kein öffentliches Eval-Repo, keine Prompts/Seeds/Logs; HellaSwag-Textclaim widerspricht eigener Tabelle | other/2026-09-17_reddit-n8-jev-terra-benchmark.md |
| [Ryan Vogel](people/ryan-vogel.md) | Entwickler/Unternehmer (@ryanvogel, 18.201 Follower): „ceo of @rebasetv / founding developer @opencode @anomalyco", Standort Florida. Gast der Episode „Jev is HERE. How to use it" bei Greg Isenberg (18.09.2026). Relevanz fürs Wiki v. a. über **OpenCode** (Open-Source-Coding-Agent, Partnermodus von DeepSeek V4.1 Flash). ⚠️ Episode-Inhalt nicht ausgewertet; Rebase-TV-Selbstbeschreibung ungeprüft | xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md |
@ -772,6 +774,7 @@
| `raw/youtube/2026-09-18_berman-jev.md` | youtube | Matthew Berman: „We need to talk about Jev..." (https://www.youtube.com/watch?v=2z-7pIj57f8, 18.09.2026, 12:30, 82.291 Views bei Abruf, **„Includes paid promotion"/Sponsor Zapier**; geteilt von Pit in OME Topic „JEV"). **Kein Transcript abrufbar** (yt-dlp Bot-Check, kein `captionTracks`, Firecrawl nur Consent-Seite, Crawl4AI ohne Playwright-Binary, Transkriptdienste 403/522) — auswertbar: Beschreibung, Quellenliste (6 X-Posts, aufgelöst), Titel/Kanal/Aufrufe. Kapitelmarken fehlen. ⚠️ Videoinhalt nur über Sekundärzusammenfassung, nicht verifiziert. Wiki: `concepts/llm/jev-praxis-demos.md` (neu), `people/matthew-berman.md` (neu) |
| `raw/other/2026-09-17_typesafe-workflow-evals.md` | other | TypeSafe **Workflow-Evals** (https://evals.typesafe.ai/, lokal gelesen: 65.008 Byte, Text extrahierbar). Vier Workflows (Security Incidents, Agent Trace, Invoice Processing, Customer Service) × zwei Modi (workflow/prompt), Fragetypen Noul/Choice/Score. Aggregat Jev 67,8 %/$0,0004/0,4 s vs. luna 66,8/terra 67,9/sonnet 5 67,8/**sol 74,1/opus 5 73,1**. Je Workflow 61,776,0 %. Referenzlabels = Mittel aus GPT-6 Astra + Fable 5.1; keine Fallzahlen/Rohdaten. Wiki: `concepts/llm/system-one-models-jev.md` |
| `raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md` | other | r/ProAI-Repost von `/u/stealthispost` (17.09.2026) des X-Threads von [N8 Programs](people/n8-programs.md) (16.09.; 179.846 Views beim Abruf) — Jev vs. GPT-5.6 Terra (`reasoning=none`, Letter-only) auf MMLU, GPQA, ARC, WinoGrande, HellaSwag, GSM8K, Schach. Originalgrafiken lokal gelesen: Makro **80,69 % vs. 80,15 %**; Jev stark bei Wissen/Commonsense, Terra bei Mathe. Reliability-Diagramm **N=33.735, ECE 1,74 Pp**, 10 Bins/Wilson 95 %. Kosten **$0,6999 vs. $12,9865 = 18,55×**. ⚠️ Kein Repo/Prompts/Seeds/Logs; keine Geschwindigkeitsmessung; Jev-Kosten geschätzt, Terra API-gemeldet; Textclaim HellaSwag widerspricht Tabelle. Wiki: `concepts/llm/system-one-models-jev.md`, `people/n8-programs.md` |
| `raw/other/2026-09-21_almeida-typesafe-coding-agent-notes.md` | other | **Diogo Almeidas Google-Doc „[public] thoughts on a typesafe coding agent“** (21.09.2026, verlinkt im Begleitpost; Volltext via /export?format=txt, HTTP 200, 15.737 Byte). Inhalt: Kernannahmen (Agenten = While-Loops mit wenigen Tools; First-Party-Kostenvorteil schwindet), Leitfrage „no KV cache“, sechs Cache-Verzerrungen, Basic/Advanced/Weirder-Ideen (Meta-Attention als Noul pro Kontext-Chunk, Conditional AGENTS.md, Security-aware Routing, Cross-Model Review), Anhang-Tools (headroom, rtk, ast-grep, fastcontext: „56,2 % aller Tool-Use-Turns = Lesen/Suchen“ — Repo-Claim) und Anhang 2 Background-Processing-Pattern. **Ideen-/Annahmen-Katalog; OpenClaw als Einfachkeits-Extrem genannt.** Wiki: concepts/agents/typesafe-coding-agent-idee.md (neu), people/diogo-almeida.md |
| `raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md` | blog | Gabriel Anhaia (17.09.2026): „Jev Beat GPT Luna by 1 Point. GPT-6 and Claude Wrote the Answer Key." — Vercel-`fx`-Reviewer-Wechsel (Rauchg/@fazxes, „~5-18x faster and more accurate", **Benchmark unveröffentlicht**), TypeSafe-Aggregat-Tabelle (gegengeprüft, korrekt), **Label-Kritik** (Reference-Labels aus zwei Frontier-Modellen → gemeinsame Blindflecken werten richtige Abweichler ab; TypeSafe legt Bias selbst offen und nennt die Homepage-Zahl „higher end of real world gains"). Fünf Prüfschritte vor dem Tausch. Wiki: `people/gabriel-anhaia.md` (neu) |
| `raw/other/2026-09-18_herman-briefing-jev-transcript.md` | other | **Herman-Briefing zu Jev** (deutsches Audio-Briefing 09:42 zur Episode „Jev is HERE. How to use it", Isenberg/Vogel), gepostet von Pit in OME Topic „JEV" (18.09.2026 22:38 UTC, mp4 15,3 MB). **STT-Transkript** (Grok STT, de, 8.677 Zeichen) — Volltext + Zahlen-Deckungstabelle. Kernzahlen: 1.700 Mails/4,2 Mio Input-/500k Output-Token/18 US-Cent; ~200 ms/Anfrage; 17 Highlights aus 1,1 Mio Token in ~3 s; Flug Zürich→London in 7,1 s. ⚠️ Dritt-Zusammenfassung, kein Originaltranscript; STT-Fehler dokumentiert. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` |
| `raw/xpost/2026-09-18_andy-gao-jev-voice-computer-use.md` | xpost | Andy Gao (@instantricecook, 563 Follower): „voice controlled computer-use for my mac using @typesafeai's Jev" (https://x.com/instantricecook/status/2100814590300889426, 18.09.2026 05:10 UTC; 139.442 Views / 2.038 Likes; geteilt von Pit in OME Topic „JEV"). **Video lokal ausgewertet:** STT-Transkript (428 Zeichen) + 9 Standbilder; Kette Notes/Notiz/Arc/Google/x.com/Photo Booth; keine Messwerte, kein Terminal im Bild; Kernaussage (App offen vor Satzende) am Overlay belegt. Wiki: `concepts/agents/jev-sprachsteuerung-computer-use.md` (neu), `people/andy-gao.md` (neu) |
@ -781,6 +784,7 @@
| `raw/other/2026-09-19_jev-flyer-v11-korrektur.md` | other | **Flyer Version 11 — Korrektur-/Verifikationsdatei** (https://telegra.ph/Jev--Die-Kombi-Revolution-09-19-11, 12:55:27 UTC; Kurzlink https://telegra.ph/Jev-Flyer-09-19 führt fest auf die aktuelle Fassung). Erstfassung v10 bleibt unverändert. Verifiziert: Trennung Entscheidungszeit (0,09 s) vs. Gesamtlauf (~14 s / 0,15 $) samt Rechenweg im Text; „181×" **entfernt**; LLM-Wert als „Gesamtprojektion"; Konsistenzcheck Stufe 2; vierte Grafik getauscht. Restbeanstandung: „~4.500× in der reinen Entscheidungszeit" mischt Basis (Zähler = LLM-Gesamtprojektion) → sauber Gesamt/Gesamt ≈ 29×; abgebrochenes Zitat; „Jeff" statt „Jev". Wiki: `concepts/llm/jev-praxis-demos.md` |
| `raw/youtube/2026-09-19_nate-herk-jev-12-use-cases.md` | youtube | Nate Herk („I Tested Jev on 12 Real Use Cases. My Honest Thoughts.", https://www.youtube.com/watch?v=ymgH8jS6Wb8, 19.09.2026, 13.549 Aufrufe, ~16:08; geteilt von Pit in OME Topic „JEV"; **kein Transkript**, 0 `captionTracks`, yt-dlp Bot-Check). Beschreibung + 10 Kapitelmarken (E-Mail-Benchmark, X-Erweiterung, Evals, Trading). Zahlen über das Bot-Briefing: 1.000 Mails/7 Regeln 6 s/9 Cent (vorher 70 s), 1.000 Mails/1 Regel 4 s/5 Cent, 1.000 Kommentare 5 s/5 Cent, Dashboard 20.000 Requests/85 Cent, LLM-Vergleich 5 min/62 Cent. **Rechnung im Raw:** Kosten konsistent (~2.143/1.190/1.012 Token), Laufzeiten 1,43×/1,19× über dem Token-Limit, 8× über dem Request-Limit. Wiki: `people/nate-herk.md` (neu), `concepts/llm/jev-praxis-demos.md` |
| `raw/xpost/2026-09-15_almeida-jev-launch-post.md` | xpost | Diogo Almeida ([@CompleteSkeptic](https://x.com/CompleteSkeptic), 113.333 Follower; Bio „co-created RLHF/ChatGPT @ @openai … (ceo @typesafeai)"): **Jev-Launch-Post** (15.09.2026 18:17 UTC, 34.903.594 Views / 69.647 Likes bei Abruf). Wortlaut: „After co-inventing ChatGPT…"; Zahlen als **Spannen** „20-200x faster / 40-400x cheaper (w/ output tokens free)" — die kursierenden 200×/400× sind die Obergrenzen. Wiki: `people/diogo-almeida.md` (Launch-Post-Abschnitt), `concepts/llm/system-one-models-jev.md` |
| `raw/xpost/2026-09-21_codila-jev-usecase-ranking.md` | xpost | codila (@0xCodila, 21.096 Follower): Note-Tweet (21.09.2026 19:15 UTC; 89.907 Views / 512 Likes / **1.038 Bookmarks**; geteilt von Rüdiger/@Stelariz_75 in OME Topic „JEV“) als Quote von Almeidas Coding-Agent-Doc. Zehn Use Cases gerankt 010, Gesamt 8,9 (Mittel 8,85 korrekt); Top: dynamischer Kontext 10/10, Permission Gate 9,5, Security-Routing 9,5, Tool-/Modell-Routing je 9. CTA „Copy my complete 14-page Jev engineering playbook“. **„I built and tested the FULL list“ unbelegt — kein Setup, keine Daten, keine Runs; Ableitungen aus dem Primärdoc.** Wiki: people/codila.md (neu), concepts/agents/typesafe-coding-agent-idee.md (Rezeptions-Abschnitt) |
| `raw/youtube/2026-09-18_gary-explains-jev-caveat.md` | youtube | Gary Explains (18.09.2026, geteilt von plebcoach Andreas in OME): „Jev From TypeSafe is a New Class of AI Model that is FAST and CHEAP - But There is a Caveat!" — 17.324 Aufrufe beim Abruf; **kein Transkript** (keine captionTracks), Angaben aus oembed + Videobeschreibung. Beschreibung: „Jev is a new class of AI model from TypeSafe. It is FAST and CHEAP, but there is a caveat, it isn't an LLM. It is a model that understands natural language but it replies with structured responses along with a confidence level." Wiki: `concepts/llm/system-one-models-jev.md` (Rezeptions-Abschnitt). ⚠️ Videoinhalt nicht ausgewertet; Zahlen im Video = Hersteller-vermittelt |
| `raw/blog/2026-09-19_cursor-grok-bot-plans-und-trial.md` | blog | Cursor-Doku + x.ai-Announcement (abgerufen 19.09.2026): Grok-Bot-Zugang (jeder bezahlte Cursor-Plan + Teams; Pro/Pro+/Ultra-Wochenquoten; Verknüpfung Einzel-SuperGrok/Plus/Heavy/X Premium+ als Nutzungs-Grant, **nicht stapelbar**, permanent, 24-h-Nachziehfenster; SuperGrok Lite/Team/Enterprise nicht enthalten), Free Trial (Nutzungs-Guthaben + 7-Tage-Fenster, wird nie bezahlter Plan, „Cancel Trial" sofort, iOS-App-Store-Trial ≠ Guthaben-Trial, Android ohne In-App-Trial), On-demand (nur wenn aktiviert; Monatslimit = kein harter Stopp; Teams default an), Preise Hobby gratis · Individual $20/Mo (Pro/Pro+/Ultra) · Teams $40/User/Mo. Wiki: `tools/grok-bot-spacexai.md` |
| `raw/youtube/2026-09-19_princeton-griffiths-ai-researchers-wrong.md` | youtube | Dr Brian Keating („Into the Impossible", @DrBrianKeating): „Princeton Cognitive Scientist Says AI Researchers Are Wrong" (https://www.youtube.com/watch?v=6iMiCJHxTww, Video-ID `6iMiCJHxTww`, veröffentlicht **29.04.2026**; Kurzlink `https://tinyurl.com/2b7rnxmh` löst per 302 auf dieses Video auf; 198.871 Aufrufe / 3.337 Likes beim Abruf 19.09.2026). Gast: **Tom Griffiths**, Professor für Psychologie und Informatik in Princeton, Buch „The Laws of Thought" (https://amzn.to/492WO06). **Kein Transkript** — keine `captionTracks` in der Watch-Seite (EN wie DE geprüft), Dauer im Seiten-JSON nicht ausgewiesen; alle Angaben aus oembed + Beschreibung: Kind lernt aus „Brotkrumen" vs. „Kontinente" an Daten, Skalierung schließt die Lücke nicht („it'll just get more expensive"), Sycophancy statt Halluzination, AGI über kindliches Denken; 22 Kapitelmarken 00:0050:10 (Gedanke/Bewusstsein/ChatGPT/Irrationalität/Chomsky/Boole/Turing/Energie/Jensen Huang/Rosenblatt-Minsky/Backpropagation). Wiki: `concepts/agi/kognition-vs-skalierung.md` (neu), `people/tom-griffiths.md` (neu), `people/brian-keating.md` (neu), `institutions/princeton.md` (neu). ⚠️ Videoinhalt nicht ausgewertet |

View file

@ -2,6 +2,22 @@
*Append-only changelog. Start: 2026-06-05*
## 2026-09-22 — Almeidas Coding-Agent-Notizen + Codilas Use-Case-Ranking
**Type:** ingest + wiki-update | **Scope:** raw/other, raw/xpost, wiki/concepts/agents, wiki/people, wiki/index, wiki/log
**Anlass:** X-Link https://x.com/0xcodila/status/2102114600997286293 von Rüdiger (@Stelariz_75) in OME Topic „JEV" (22.09.2026 19:46 UTC).
**Quellenlage:** Der Codila-Post (21.09.2026, 89.907 Views / 512 Likes / 1.038 Bookmarks, FxTwitter) ist ein Quote des Almeida-Begleitposts (21.09.2026 04:40 UTC, 538.493 Views / 3.097 Likes / 4.426 Bookmarks) mit dessen Google-Doc-Link. **Das Doc wurde volltextverifiziert** (`/export?format=txt`, HTTP 200, 15.737 Byte) — alle Inhalte stammen aus dem Primärtext, nicht aus Zusammenfassungen.
**Inhalt des Docs:** Kernannahme „Coding agents are surprisingly simple" (While-Loops, wenige Tools); Leitfrage „How would you design a coding agent if LLMs had no KV cache?"; sechs Cache-Verzerrungen — (1) Routing unrentabel ohne Cache-Wirtschaft (Opus→Sonnet→Opus vs. reines Opus; Rechnung selbst als „chatgpt-vibed" markiert), (2) vorab spezifizierte Tools als seltsamer Trade-off, (3) globale Compaction als Fehlannahme eines gemeinsamen State, (4) Subagent-State-Kuration, (5) Restart, (6) fehlende Batterien mit **OpenClaw ausdrücklich als Einfachkeits-Extrem**. TypeSafe-nativ: **Meta-Attention** (Noul pro Kontext-Chunk, Score-Stufen bis Volltext), cost/intelligence-aware Routing, Tool-Schema on demand („This not corrupting the context"), **Conditional AGENTS.md** (geladene Skills „fallen Compaction zum Opfer"), **Security-aware Routing** (auch nach Sensitivität statt nur Kosten), read-only Background-Tasks + Cross-Model Review. Anhang-Tools: headroom, rtk, ast-grep/ast-outline, fastcontext (Repo-Claim: Lesen/Suchen = 56,2 % der Tool-Use-Turns in GPT-5.4-Trajektorien), fff.
**Status-Prüfung:** Ideen-/Annahmen-Katalog — viele „could/maybe/I wonder", zwei Abschnitte selbst als „undercooked"/„not sure" markiert; im Begleitpost verneint Almeida, dass TypeSafe den Agenten selbst baut („we likely will never have time (ever again) to play ourselves"). Keine Messungen, keine Zusagen. Security-Routing-Motivation („likely yoinking all the data") = unbelegte Behauptung im Doc, als Policy-Motivation gelesen.
**Rezeption (Codila):** Zehn Use-Cases gerankt 010, Gesamt 8,9 (arithmetisch korrekt: Mittel 8,85). Verteilung als Marktvertrauens-Proxy gelesen: Gate-/Kontext-Rollen vorn (dynamischer Kontext 10/10, Permission Gate 9,5, Security-Routing 9,5), Reasoning-Rollen fehlen durchgehend — deckt sich mit der Gate-These. ⚠️ „I built and tested the FULL list" unbelegt (kein Setup, keine Daten, keine Runs); Post = Kuratierung + Lead-Magnet („14-page Jev engineering playbook").
**Dateien:**
- raw (NEW): `raw/other/2026-09-21_almeida-typesafe-coding-agent-notes.md`, `raw/xpost/2026-09-21_codila-jev-usecase-ranking.md`
- wiki (NEW): `wiki/concepts/agents/typesafe-coding-agent-idee.md`, `wiki/people/codila.md`
- wiki (UPDATED): `wiki/people/diogo-almeida.md` (Abschnitt Coding-Agent-Notizen), `wiki/index.md` (239. Update, Konzept-/2×People-/2×Raw-Zeilen)
**⚠️:** Kein Bauplan, keine Termine; KV-Cache-Routingrechnung ohne benannte Kosteneinheiten und selbst als „vibed" markiert; fastcontext-Zahl = Repo-Claim, nicht verifiziert.
---
## 2026-09-22 — Philippe Guillemant: „Warum die KI kein Bewusstsein haben kann“ (nb5-Briefing → X-Post aufgelöst)
**Type:** ingest + wiki-update + merge | **Scope:** raw/xpost, wiki/people, wiki/concepts/agi, wiki/index, wiki/log

16
wiki/people/codila.md Normal file
View file

@ -0,0 +1,16 @@
---
created: 2026-09-22
updated: 2026-09-22
sources: [xpost/2026-09-21_codila-jev-usecase-ranking.md]
tags: [person, codila, 0xcodila, jev, kuratierung, playbook]
---
# codila (@0xCodila)
**codila** ([@0xCodila](https://x.com/0xCodila), Bio „AI - researcher & coder | writing about what I use myself", 21.096 Follower, verifiziert, Substack [substack.com/@0xcodila](https://substack.com/@0xcodila)) kuratiert und vermarktet AI-Tooling-Inhalte.
## Jev-Use-Case-Ranking (21.09.2026)
Sein [Note-Tweet](https://x.com/0xCodila/status/2102114600997286293) — 89.907 Views, 512 Likes, **1.038 Bookmarks**, keine Community Note — zitiert Diogo Almeidas Coding-Agent-Notizen und rangiert zehn abgeleitete Use Cases von 010 (Gesamt 8,9; arithmetisch korrekt). Top-Werte: dynamischer Kontext **10/10**, Permission Gate und Security-Routing je 9,5, Tool-Routing, Modell-Routing und Background-Review je 9. CTA: „Copy my complete 14-page Jev engineering playbook".
**Evidenzlage:** Der Claim „I built and tested the FULL list" ist **nicht belegt** — kein Setup, keine Daten, keine Runs, kein Repo. Alle zehn Punkte sind Ableitungen aus dem Almeida-Dokument; der Post ist Kuratierung plus Lead-Magnet, keine Prüfung. Sein realer Erkenntniswert: die Rangfolge zeigt, welche Jev-Rollen externem Nutzen zugeschrieben werden (Gate-/Kontext-Rollen vorn, Reasoning-Rollen fehlen durchgehend) — Details und Einordnung: [[../concepts/agents/typesafe-coding-agent-idee.md]].

View file

@ -1,7 +1,7 @@
---
created: 2026-09-17
updated: 2026-09-18
sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, xpost/2026-09-15_almeida-jev-launch-post.md]
updated: 2026-09-22
sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, xpost/2026-09-15_almeida-jev-launch-post.md, other/2026-09-21_almeida-typesafe-coding-agent-notes.md]
tags: [person, diogo-almeida, typesafe-ai, openai, google-brain, rlhf, instructgpt, system-one-models]
---
@ -33,6 +33,10 @@ Sein Ankündigungspost auf X ([@CompleteSkeptic](https://x.com/CompleteSkeptic),
Zahlen-Disziplin: Der Post nennt **Spannen** (20200×, 40400×); die in Umlauf befindlichen „200×/400×" sind deren Obergrenzen. Die Bio des Accounts („co-created RLHF/ChatGPT @ @openai now trying to right the wrong 🤭 (ceo @typesafeai)") ist Selbstbeschreibung — die frühere OpenAI-Station, keine Firmenbeziehung (siehe [[../institutions/typesafe-ai.md]]).
## Coding-Agent-Notizen (21.09.2026)
Am 21.09.2026 veröffentlichte er das Google-Doc „[public] thoughts on a typesafe coding agent" ([Begleitpost](https://x.com/CompleteSkeptic/status/2101894250401271876), 538.493 Views / 4.426 Bookmarks; **Volltext lokal gelesen**, Raw: `raw/other/2026-09-21_almeida-typesafe-coding-agent-notes.md`). Leitfrage: „How would you design a coding agent if LLMs had no KV cache?" — daraus sechs Cache-Verzerrungen heutiger Agenten (Routing ohne Cache-Wirtschaft unrentabel, vorab spezifizierte Tools, globale Compaction, Subagent-State-Kuration, Restart, fehlende Batterien) und die TypeSafe-nativen Ideen **„Meta-Attention"** (ein Noul pro Kontext-Chunk statt globaler Compaction), cost-aware Modell-Routing, Tool-Schema on demand, **Conditional AGENTS.md** (geladene Skills „fallen Compaction zum Opfer"), **Security-aware Routing** und read-only Background-Tasks mit **Cross-Model Review**. Er benennt OpenClaw ausdrücklich als Einfachkeits-Extrem im Batterie-Trade-off („with openclaw as an extreme"). Status: Ideen- und Annahmen-Katalog, keine Zusagen; im Begleitpost verneint er, dass TypeSafe den Agenten selbst baut. Vollständige Auszüge und Einordnung: [[../concepts/agents/typesafe-coding-agent-idee.md]]
## Einordnung
Almeida ist ein Beispiel für den personellen Fluss von Frontier-Lab → eigenes Startup mit einer **orthogonalen These**: nicht größere Intelligenz, sondern **komponierbare Intelligenz** (siehe Manifesto „Composable AI — Build Prod, Not God"). Sein Hintergrund erklärt die Stoßrichtung: Wer RLHF mitentwickelt hat, baut als Gegenentwurf eine Trainingsmethode (RLCD), die auf **kalibrierte Entscheidungen** statt menschliche Präferenz optimiert.