wiki-update(agi): verify robocurve astra benchmark

This commit is contained in:
Hector 2026-09-08 12:18:44 +02:00
parent 2cc8768e68
commit fb50d35aef
5 changed files with 96 additions and 29 deletions

View file

@ -0,0 +1,34 @@
---
type: blog
source_url: https://openai.robocurve.org/gpt-6-astra/
retrieved: 2026-09-08
title: "GPT-6 Astra on robot arms"
author: "Robocurve"
tags: [robocurve, robotics, physical-ai, gpt-6-astra, claude-fable-5.1, yam, benchmark]
---
# Robocurve: GPT-6 Astra on robot arms
## Quelle
Offizielle Robocurve-Auswertung: [GPT-6 Astra on robot arms](https://openai.robocurve.org/gpt-6-astra/), veröffentlicht am 04.09.2026. Die Seite beschreibt einen Vergleich mit Claude Fable 5.1 als Follow-up zur Robocurve-Auswertung von Fable 5 und Fable 5.1.
## Versuchsaufbau
GPT-6 Astra und Claude Fable 5.1 steuern dieselben YAM-Roboterarme mit derselben Inspect-Robots-Agent-Policy. Getestet werden zwei Aufgaben:
1. Einen roten Block vom Tisch aufnehmen und in eine Schüssel legen.
2. Ein rundes blaues Puzzleteil am mittleren Knopf aufnehmen und in die passende kreisförmige Nut einsetzen.
Jede Aufgabe wird über 20 Versuche bewertet. Die Bewertung erfolgt durch Menschen nach der höchsten erreichten Stufe: Annäherung, Kontakt, Anheben, Positionierung über dem Ziel und endgültige Platzierung.
## Ergebnisse
- **Block-in-Schüssel:** GPT-6 Astra platziert den Block in 19/20 Versuchen (95 %), Claude Fable 5.1 in 8/20 (40 %), Claude Fable 5 in 1/20 (5 %).
- **Block-Aufgabe:** Astra benötigt 2,5 Minuten pro Lauf bei geschätzten $0,94; Fable 5.1 benötigt 6,8 Minuten und $2,12.
- **Puzzleteil-in-Nut:** Astra und Fable 5.1 erreichen beide 2/20 (10 %); beide scheitern laut Robocurve typischerweise am letzten Einsetzen in die Nut. Astra kostet dabei $1,36 pro Lauf, Fable 5.1 $2,18.
- In der von Robocurve veröffentlichten Ergebnistabelle stehen für die Block-Aufgabe etwa 2,1k Output-Tokens pro Astra-Lauf gegenüber 12,9k bei Fable 5.1; für die Puzzle-Aufgabe 2,7k gegenüber 10,5k.
## Einordnung
Die Seite belegt einen deutlichen Astra-Vorteil bei grober visueller Manipulation und der Block-Aufgabe, aber keine allgemeine Robotik-Dominanz: Bei der feineren Puzzle-Aufgabe liegen Astra und Fable 5.1 gleichauf bei 2/20. Robocurve veröffentlicht außerdem Einzelruns mit Scores, Zeiten, Transcripts, Videos und RRD-Dateien.

View file

@ -1,41 +1,52 @@
---
created: 2026-09-08
updated: 2026-09-08
sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md]
sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md, blog/2026-09-08_robocurve-gpt6-astra.md]
tags: [concept, agi, robotics, physical-ai, benchmarking, gpt-6-astra, claude-fable-5.1, embodied-ai]
---
# Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1
> **Quelle:** [@promiscfx / Cognitive f(x)](https://x.com/promiscfx/status/2097080991475257839), 07.09.2026 → [Raw-Datei](../../../raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md)
> **Quellen:** [Robocurve: GPT-6 Astra on robot arms](https://openai.robocurve.org/gpt-6-astra/) (04.09.2026) + [@promiscfx / Cognitive f(x)](https://x.com/promiscfx/status/2097080991475257839), 07.09.2026 → [Primärquelle-Extrakt](../../../raw/blog/2026-09-08_robocurve-gpt6-astra.md) / [X-Post-Raw](../../../raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md)
## Der Vergleich
Ein X-Post berichtet von einem unabhängigen [Robocurve](../../institutions/robocurve.md)-Benchmark, in dem **OpenAIs GPT-6 Astra** und **Claude Fable 5.1** YAM-Roboterarme steuern. Der konkrete Task heißt „Block-into-bowl“.
Robocurve testet **OpenAIs GPT-6 Astra** und **Claude Fable 5.1** mit denselben YAM-Robotarmen und derselben Inspect-Robots-Agent-Policy. Getestet werden zwei Aufgaben:
| Metrik | Claude Fable 5.1 | GPT-6 Astra | Veränderung laut Post |
1. Einen roten Block vom Tisch aufnehmen und in eine Schüssel legen („Block-into-bowl").
2. Ein rundes blaues Puzzleteil am mittleren Knopf aufnehmen und in die passende kreisförmige Nut einsetzen („Puzzle-into-groove").
Jede Aufgabe umfasst 20 Versuche. Die Bewertung erfolgt durch Menschen nach der höchsten erreichten Stufe: Annäherung, Kontakt, Anheben, Positionierung über dem Ziel und endgültige Platzierung.
## Ergebnisse
| Metrik | Claude Fable 5.1 | GPT-6 Astra | Veränderung |
|---|---:|---:|---:|
| Task Success | 40 % | 95 % | +55 Prozentpunkte |
| Output-Tokens pro Lauf | ~12,9k | ~2,1k | ca. 6× weniger |
| Ausführungszeit | 6,8 min | 2,5 min | ca. 63 % weniger |
| Kosten pro Lauf | $2,12 | $0,94 | ca. 56 % weniger |
| Task Success — Block-in-Schüssel | 8/20 (40 %) | 19/20 (95 %) | +11 erfolgreiche Runs |
| Output-Tokens — Block-Aufgabe | ~12,9k | ~2,1k | ca. 6× weniger |
| Ausführungszeit — Block-Aufgabe | 6,8 min | 2,5 min | ca. 63 % weniger |
| Kosten — Block-Aufgabe | $2,12 | $0,94 | ca. 56 % weniger |
| Task Success — Puzzle-in-Nut | 2/20 (10 %) | 2/20 (10 %) | Gleichstand |
| Output-Tokens — Puzzle-Aufgabe | ~10,5k | ~2,7k | ca. 3,9× weniger |
| Kosten — Puzzle-Aufgabe | $2,18 | $1,36 | Astra günstiger |
## Warum das eine andere Liga wäre
## Warum das eine andere Liga ist — aber nur bei dieser Aufgabe
Wenn die Angaben reproduzierbar sind, wäre das nicht bloß ein kleiner Modell- oder Preisvorteil, sondern ein Sprung in drei gekoppelten Dimensionen:
Bei der groben visuellen Manipulation ist der Astra-Vorteil deutlich: 19/20 erfolgreiche Platzierungen gegenüber 8/20 bei Fable 5.1, bei kürzerer Laufzeit, deutlich weniger Output-Tokens und etwa halbierten Kosten. Das ist praktisch der Unterschied zwischen „meistens brauchbar" und „regelmäßig scheiternd".
1. **Zuverlässigkeit:** Ein Anstieg von 40 % auf 95 % Task Success verändert die praktische Einsetzbarkeit eines Robotik-Systems.
2. **Reasoning-Effizienz:** Weniger Output-Tokens bei höherem Erfolg bedeuten weniger Inferenz- und Latenzlast.
3. **Operationsökonomie:** Kürzere Laufzeit und niedrigere Kosten pro physischer Aktion machen die Differenz für reale Robotik-Anwendungen relevant.
Die schwierigere Puzzle-Aufgabe verhindert aber eine allgemeine Dominanzthese: Astra und Fable 5.1 erreichen beide nur 2/20. Beide Modelle kommen laut Robocurve bis zum letzten Einsetzen in die Nut und scheitern typischerweise dort.
Der Vergleich ist damit ein Signal für **embodied AI**: Entscheidend ist nicht nur, welches Modell abstrakte Benchmarks gewinnt, sondern welches Modell eine physische Aufgabe zuverlässig, schnell und bezahlbar ausführt.
Der Benchmark ist damit ein Signal für **embodied AI**: Entscheidend ist nicht nur, welches Modell abstrakte Benchmarks gewinnt, sondern welches Modell eine physische Aufgabe zuverlässig, schnell und bezahlbar ausführt — einschließlich der Grenzen, die in feinmotorischen Aufgaben sichtbar werden.
## Quellenkritik
## Primärquellenprüfung
- Der konkrete Zahlenvergleich stammt aus **einem X-Post**, nicht aus einem im Post verlinkten vollständigen Robocurve-Report.
- Robocurve selbst beschreibt sich als unabhängigen Evaluator für Physical AI, Public Benefit Corporation und Entwickler offener Evaluationswerkzeuge. Das bestätigt die Benchmark-Infrastruktur, nicht automatisch diese konkrete Messung.
- Nicht dokumentiert sind unter anderem Anzahl und Verteilung der Runs, Prompt/Policy, Robotik-Hardwarekonfiguration, Fehlerdefinition, Seed-/Versuchsbedingungen und ob die Kostenrechnung identische Modellpreise und Tool-Aufrufe voraussetzt.
- Die Zahlen werden daher als **unabhängig zu verifizierende Post-Angaben** geführt — nicht als gesicherter Modellvergleich.
Die konkreten Zahlen sind auf der **offiziellen Robocurve-Seite** dokumentiert. Robocurve nennt denselben Versuchsaufbau: gleiche YAM-Arme, gleiche Inspect-Robots-Agent-Policy und je 20 Versuche pro Aufgabe. Die Seite veröffentlicht außerdem Einzelruns mit Scores, Zeiten, Transcripts, Videos und RRD-Dateien.
- **Block-in-bowl:** Astra 19/20 (95 %), Fable 5.1 8/20 (40 %), Fable 5 1/20 (5 %).
- **Puzzle-in-groove:** Astra 2/20 (10 %), Fable 5.1 2/20 (10 %); beide scheitern typischerweise am letzten Einsetzen.
- **Ressourcen:** Astra 2,5 Minuten und $0,94 pro Block-Lauf; Fable 5.1 6,8 Minuten und $2,12. Die Ergebnistabelle nennt ~2,1k vs. ~12,9k Output-Tokens.
Damit ist der Astra-Vorteil bei grober visueller Manipulation primär belegt. Eine allgemeine Robotik-Dominanz folgt daraus ausdrücklich **nicht**: Bei der feineren Puzzle-Aufgabe herrscht Gleichstand bei 2/20.
## Einordnung
@ -46,4 +57,5 @@ Der Benchmark ergänzt die [Coding-Benchmark-Preis-/Leistungsseite](../llm/codin
- [[../../institutions/robocurve.md]] — unabhängige Physical-AI-Evaluierung
- [[../../tools/openai-gpt.md]] — OpenAI-Modelle
- [[../llm/coding-benchmark-price-performance.md]] — Software-/Coding-Benchmarks
- [Robocurve: GPT-6 Astra on robot arms](https://openai.robocurve.org/gpt-6-astra/) — Primärreport
- [Robocurve](https://robocurve.org/) — offizielle Evaluationsplattform

View file

@ -2,7 +2,8 @@
*Auto-generated: 2026-07-07*
*Letzte Aktualisierung: 2026-09-08 (190. Update — X-Post von @promiscfx/Cognitive f(x) zu Robocurve: GPT-6 Astra vs. Claude Fable 5.1 auf YAM-Robotarmen (Task Success 95 % vs. 40 %, Tokens, Laufzeit, Kosten). Raw: `raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md` (neu; konkrete Zahlen nur aus X-Post, nicht unabhängig verifiziert). Wiki-Update: `concepts/agi/robotics-model-benchmark.md` (neu), `institutions/robocurve.md` (neu), `people/cognitive-fx.md` (neu).)*
*Letzte Aktualisierung: 2026-09-08 (191. Update — Robocurve-Primärreport „GPT-6 Astra on robot arms“: offizielle Verifikation des Astra-vs.-Fable-5.1-Benchmarks (19/20 vs. 8/20 Block-in-Schüssel; beide 2/20 beim Puzzle). Raw: `raw/blog/2026-09-08_robocurve-gpt6-astra.md` (neu). Wiki-Update: `concepts/agi/robotics-model-benchmark.md` (Quellenkritik auf Primärquelle aktualisiert), `institutions/robocurve.md` (offizielle Ergebnisse ergänzt).)*
*Vorherige Aktualisierung: 2026-09-08 (190. Update — X-Post von @promiscfx/Cognitive f(x) zu Robocurve: GPT-6 Astra vs. Claude Fable 5.1 auf YAM-Robotarmen (Task Success 95 % vs. 40 %, Tokens, Laufzeit, Kosten). Raw: `raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md` (neu; konkrete Zahlen nur aus X-Post, nicht unabhängig verifiziert). Wiki-Update: `concepts/agi/robotics-model-benchmark.md` (neu), `institutions/robocurve.md` (neu), `people/cognitive-fx.md` (neu).)*
*Vorherige Aktualisierung: 2026-09-08 (189. Update — YouTube: „This 4B model is a FREAK (it beats a 12B) But ...." (Kanal Prompt Engineer, @PromptEngineer48; metadata-only, kein Transcript — YouTube bot-check/consent wall, kein angehängtes Medienfile). Raw: `raw/youtube/2026-09-08_4b-model-beats-12b-prompt-engineer.md` (neu). Titel-Claim (4B-Modell schlägt 12B, mit Einschränkung) nicht verifiziert; Modellname/Methodik/Einschränkung nicht dokumentiert. Wiki-Update: `concepts/llm/llm-model-catalog.md` (Metadata-only-Nachtrag im Open-Source-Abschnitt).)*
*Vorherige Aktualisierung: Letzte Aktualisierung: 2026-09-08 (188. Update — PLUR1BUS Hermes 7.12.7-hermes.3 + Bugfix-Kette 7.12.37.12.7 (Mr. Cy / @Cyb3rblade, 2026-09-08). Raw: `raw/other/2026-09-08_plur1bus-hermes-7127-hermes3-release.md` und `raw/other/2026-09-07_plur1bus-memory-bugfix-7123-7127.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Hermes-Release mit Unicode-Umlauten, Embedding-Timeout, LightDream, Checksummen-Validierung; Bugfix-Kette inkl. funktionskritischer Fixes 7.12.6 Recall-BigInt und 7.12.7 MEMORY.md/USER.md-Sessionkontext).)*
*Vorherige Aktualisierung: Letzte Aktualisierung: 2026-09-08 (187. Update — YouTube: „THE PROMPTER — AI Short Film (2026) | Higgsfield Global Film Festival“ (Kanal Midnight Monkeys, @MidnightMonkeysStudio; metadata-only, kein Transcript; im Gruppenchat mit Zeitstempel 5:50 verlinkt). Raw: `raw/youtube/2026-09-08_the-prompter-ai-short-film.md` (neu). Die im Kuratauftrag erwähnte Chat-Zusammenfassung der Szene ab 5:50 war aus den zugänglichen Session-Daten (OME Topic 2193) nicht abrufbar → keine erfundenen Szenenfakten. Wiki-Update: `concepts/the-prompter-ai-short-film.md` (neu), `concepts/ai-filmproduktion-hollywood-disruption.md` und `institutions/higgsfield-ai.md` (Higgsfield Global Film Festival ergänzt).)*
@ -245,7 +246,7 @@
| [Diary Of A CEO — "ChatGPT Offered Me $2m To Keep Quiet"](concepts/agi/diary-of-a-ceo-chatgpt-2m-interview.md) | Interview-Podcast-Episode (Steven Bartlett): Titel kündigt $2-Millionen-Angebot an Gast mit Geheimhaltungs-Auflage + These "No One Is Ready For What's Coming!" an. Einordnung in NDA-/Secrecy-Debatte der Frontier-KI und gesellschaftliche KI-Bereitschaft. ⚠️ Metadata-only (kein Transcript) | youtube/2026-08-19_diary-of-a-ceo-chatgpt-2m-keep-quiet.md |
| [Parasoziale Bindungen an KI-Assistenten](concepts/agi/parasoziale-ki-bindungen.md) | "Was KI kann."-Episode mit Armin Ronacher (Flask-Erfinder, Earendil): parasoziale Bindungen an KI-Assistenten als psychische Gefahr (vulnerable Gruppen), Dead Internet Theory (51 % Bot-Traffic laut Cloudflare), fehlende Frontier-Labs in Europa, KI macht Software zur Einwegware. ⚠️ Metadata-only (kein Transcript; Themen aus OME-Chat-Zusammenfassung) | youtube/2026-09-02_was-ki-kann-ronacher-parasoziale-bindung.md |
| [OpenAI: „An Alien Mind"](concepts/agi/openai-an-alien-mind.md) | OpenAI-Chief-Scientist Jakub Pachocki: Reasoning-Modelle als nicht vollständig interpretierbare „alien minds"; Goal vs. Value Alignment, nachlassende CoT-Monitorierbarkeit, Cybersecurity-Risiken, rekursive Selbstverbesserung (RSI), Safety Bars und internationale Koordination. Primärquelle: OpenAI-Essay | blog/2026-09-07_openai-an-alien-mind.md |
| [Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1](concepts/agi/robotics-model-benchmark.md) | X-Post von @promiscfx berichtet einen Robocurve-Test auf YAM-Robotarmen: Astra 95 % vs. Fable 40 % Task Success, ~6× weniger Output-Tokens, 2,5 vs. 6,8 Minuten, $0,94 vs. $2,12 pro Lauf. ⚠️ Konkrete Zahlen nur aus X-Post, nicht unabhängig verifiziert | xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md |
| [Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1](concepts/agi/robotics-model-benchmark.md) | Robocurve-Primärreport: Astra 19/20 vs. Fable 5.1 8/20 beim Block-in-Schüssel-Task; beide 2/20 beim schwierigeren Puzzle. Astra 2,5 vs. 6,8 Minuten, $0,94 vs. $2,12 und ~2,1k vs. ~12,9k Tokens. **Primärquelle bestätigt; keine allgemeine Robotik-Dominanz** | xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md + blog/2026-09-08_robocurve-gpt6-astra.md |
| [AI-Safety-Findings 2026 — Video-Claims gegen Primärquellen](concepts/agi/ai-safety-findings-2026.md) | AI-Frontier-Video (geteilt von @Radio7Andybot, OME Topic „Mensch & Bot im Talk“, #12944): 5 Safety-Claims zugeordnet — OpenAI Preparedness Framework v2 (Critical = >1.000 Tote/>$100B, CEO-Override, arXiv:2509.24394; Framework-Rewrite nach Astra/HF-Incident laut Axios) ✅; DeepMind Harmful Manipulation (9 Studien, >10.000 Teilnehmer, Finance/Health, Manipulation v. a. auf Anweisung; Spendendetail = Video-Angabe) 🟡; OpenClaw-Phishing-Evals (AWS-Keys + CRM an externe Gmail, Gemini 3.1 Pro/GPT-5.4 scheitern; „Logs löschen“ = Video-Angabe) 🟡; Anthropic Agentic Misalignment (16 Modelle, Opus-4-Erpressung, Notruf-Szenario) ✅; Selbstverbesserungs-Claim = Editorialisierung ⚠️. Trennung Studienlage vs. Video-Zuspitzung | youtube/2026-08-27_ai-frontier-not-watched.md |
### Hardware
@ -388,7 +389,7 @@
| [Earendil](institutions/earendil.md) | Public Benefit Corporation von Armin Ronacher (Flask-Erfinder, ex-Sentry). Gemeinwohlorientierte Rechtsform; Kontext: Ronachers Kritik an fehlenden Frontier-Labs in Europa ("Was KI kann.", 02.09.2026) | youtube/2026-09-02_was-ki-kann-ronacher-parasoziale-bindung.md |
| [Sentry](institutions/sentry.md) | Error-Tracking- und Performance-Monitoring-Plattform, mitgegründet von Armin Ronacher (~10 Jahre). Open-Source-Komponenten (getsentry/sentry) | youtube/2026-09-02_was-ki-kann-ronacher-parasoziale-bindung.md |
| [WELT (welt.de)](institutions/welt.md) | Deutsche überregionale Tageszeitung/Nachrichtenportal (Axel Springer SE). Im Wiki referenziert: Interview 19.08.2026 „Dann haben wir einen Bürgerkrieg in deutschen Großstädten“ mit Ex-Bundespolizist Jan Solwyn (Redakteur Sebastian Berg) — Migrations-/Asylpolitik, GEAS-Kritik, Bürgerkriegs-Prognose. PDF-Ausdruck (183 S., ~174 S. Leserkommentare) geteilt in OME Topic „BUZZ“ | blog/2026-09-03_buergerkrieg-grossstaedten-welt-interview.md |
| [Robocurve](institutions/robocurve.md) | Public Benefit Corporation und unabhängiger Evaluator für Physical AI; offene Werkzeuge und Benchmarks für Modelle, Embodiments und Robotik-Aufgaben. Konkreter Astra-vs.-Fable-Vergleich aus X-Post als unbestätigt markiert | xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md |
| [Robocurve](institutions/robocurve.md) | Public Benefit Corporation und unabhängiger Evaluator für Physical AI; offene Werkzeuge und Benchmarks für Modelle, Embodiments und Robotik-Aufgaben. Primärreport bestätigt Astra 19/20 vs. Fable 5.1 8/20 beim Block-Task und Gleichstand 2/20 beim Puzzle | xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md + blog/2026-09-08_robocurve-gpt6-astra.md |
| [OpenAI](institutions/openai.md) | AI-Forschungs- und Produkt-Unternehmen (GPT-Serie, Frontier Scaling). **Update 07.09.:** „An Alien Mind“ — Reasoning-Modelle, nachlassende CoT-Monitorierbarkeit, Cybersecurity, RSI und Safety Bars. **Staatsbeteiligung (Juli 2026):** Altman bietet Trump 5% Anteile an (Alaska Permanent Fund Modell). Intel-Präzedenz (9,9%, $8.9 Mrd). Strategisch: Exportkontrollen vermeiden, Bailout-Absicherung, IPO-Vorbereitung. Kontrast zu Anthropic | blog/2026-06-16_aschenbrenner-situational-awareness.md + blog/2026-07-02_berliner-zeitung-openai-staatsbeteiligung.md + blog/2026-09-07_openai-an-alien-mind.md |
| [Anthropic](institutions/anthropic.md) | AI-Sicherheits- und Forschungs-Unternehmen (Claude-Serie, Exportkontrollen-Krise). **Kontrast zu OpenAI:** Wurde von Regierung beschnitten (Fable 5/Mythos 5), während OpenAI 5% Staatsbeteiligung anbietet. **Alignment-Faking-Forschung (2024):** Sleeper Agents (Hubinger et al., arXiv:2401.05566) + Alignment Faking (Greenblatt et al., arXiv:2412.14093, ~12 % → ~78 %) — Lab-Bedingungen, nicht auf Produktionsmodelle generalisiert; siehe [[concepts/llm/alignment-faking.md]] | blog/2026-06-13_trump-export-controls-anthropic-mythos-fable.md + blog/2026-07-02_berliner-zeitung-openai-staatsbeteiligung.md + other/2026-08-29_herman-alignment-faking-project-ot-analyse.md |
| [Z.ai (Zhipu AI)](institutions/z-ai.md) | AI-Frontier-Unternehmen aus China (GLM-Serie, kostengünstige Frontier-Coding-Modelle). **GLM-5.5 (20.07.2026):** >1T params, 1M context, open weights, August 2026 launch. Fourth Chinese AI wave announcement | youtube/2026-06-15_ichbinfabian-glm-5.2-coding-modell.md + xpost/2026-07-20-healthranger-four-chinese-models.md |
@ -607,7 +608,8 @@
| `raw/podcast/2026-09-06_gamestar-sargnagel-aaa-gaming.md` | podcast | GameStar Podcast „Der Sargnagel für AAA-Gaming“ — Audio-Transkript: KI-Rechenzentrumsnachfrage nach HBM/DRAM, steigende GPU-/SSD-Preise, längere Upgrade-Zyklen, AAA-/Cloud-/Konsolenfolgen; Podcast-Angaben nicht unabhängig verifiziert |
| `raw/xpost/2026-09-06_0xjokker-timesfm-3.md` | xpost | @0xJokker: TimesFM als lokales Zero-Shot-Zeitreihenmodell für Nachfrage, Preise, Webtraffic und Krypto-Volatilität; 100-Mrd.-Datenpunkt-, Lokal- und Open-Source-Claims gegen offizielle TimesFM-3.0-Quellen eingeordnet; Code Apache-2.0, 3.0-Standardgewichte Non-Commercial |
| `raw/xpost/2026-09-06_seeconvm-claude-code-graph-engineering.md` | xpost | @seeconvm: sichtbarer Teaser zum Head of Claude Code — 85 % der Engineers liefen mit Dutzenden/Hunderten Agenten; Graph Engineering statt linearer Ketten. 85-%- und Team-Output-Claims nicht unabhängig verifiziert |
| `raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md` | xpost | @promiscfx/Cognitive f(x): Robocurve-Test von GPT-6 Astra vs. Claude Fable 5.1 auf YAM-Robotarmen — 95 % vs. 40 % Task Success, ~6× Token-Effizienz, 2,5 vs. 6,8 Minuten, $0,94 vs. $2,12 pro Lauf. ⚠️ Zahlen nur aus X-Post, nicht unabhängig verifiziert |
| `raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md` | xpost | @promiscfx/Cognitive f(x): Robocurve-Test von GPT-6 Astra vs. Claude Fable 5.1 auf YAM-Robotarmen — 95 % vs. 40 % Task Success, ~6× Token-Effizienz, 2,5 vs. 6,8 Minuten, $0,94 vs. $2,12 pro Lauf. Zahlen später durch Robocurve-Primärreport bestätigt |
| `raw/blog/2026-09-08_robocurve-gpt6-astra.md` | blog | Robocurve-Primärreport „GPT-6 Astra on robot arms“ (04.09.2026): gleiche YAM-Arme und Inspect-Robots-Policy; Astra 19/20 vs. Fable 5.1 8/20 beim Block-in-Schüssel-Task, beide 2/20 beim Puzzle; Astra schneller, günstiger und token-effizienter. Einzelruns mit Transcripts/Videos/RRDs veröffentlicht |
| `raw/blog/2026-09-07_openai-an-alien-mind.md` | blog | OpenAI-Essay „An Alien Mind“ von Chief Scientist Jakub Pachocki: Reasoning-Modelle, emergente/nicht vollständig interpretierbare Intelligenz, Goal vs. Value Alignment, nachlassende CoT-Monitorierbarkeit, Cybersecurity, rekursive Selbstverbesserung, Safety Bars und internationale Koordination |
| `raw/other/2026-09-07_plur1bus-memory-release-7122.md` | other | PLUR1BUS Memory 7.12.2 Release + Hermes 7.12.2-hermes.1 (Mr. Cy, 07.09.2026): OpenClaw — Critical Push zeigt Vorschau für Gesundheit/Finanzen, `criticalPush.hideTypes`-Option; Hermes — erstes Release seit 7.4.8.1 mit UI, signiertem macOS-Installer, Cross-Platform-Distribution, Jina Nano-v5/BGE-Verifikation (4.398 Node-Tests, 765 Python-Tests). Bernhardine + Bernd bestätigt |
| `raw/youtube/2026-09-08_the-prompter-ai-short-film.md` | youtube | Midnight Monkeys (@MidnightMonkeysStudio): "THE PROMPTER — AI Short Film (2026) | Higgsfield Global Film Festival" (YouTube-ID _MhKwYjkWFc; OME Topic 2193, 08.09.2026, mit Zeitstempel 5:50 verlinkt). ⚠️ Metadata-only — kein Transcript; Gruppenchat-Zusammenfassung der Szene ab 5:50 bei Ingest nicht aus Session-Daten abrufbar, daher keine erfundenen Szenenfakten; Wiki: `concepts/the-prompter-ai-short-film.md` (neu) |

View file

@ -1,20 +1,26 @@
---
created: 2026-09-08
updated: 2026-09-08
sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md]
sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md, blog/2026-09-08_robocurve-gpt6-astra.md]
tags: [institution, robotics, physical-ai, benchmarking, public-benefit-corporation]
---
# Robocurve
[Robocurve](https://robocurve.org/) ist eine Public Benefit Corporation und unabhängiger Evaluator für **Physical AI**. Die Organisation beschreibt ihre Mission als öffentliche, neutrale Messung von Robotik-Fähigkeiten und entwickelt offene Werkzeuge wie „Inspect Robots“ für Modelle, Embodiments und Benchmarks.
[Robocurve](https://robocurve.org/) ist eine Public Benefit Corporation und unabhängiger Evaluator für **Physical AI**. Die Organisation entwickelt offene Werkzeuge wie „Inspect Robots“ für Modelle, Embodiments und Benchmarks und veröffentlicht reproduzierbare Robotik-Evaluierungen.
## Relevanz für dieses Wiki
## GPT-6-Astra-Evaluierung
- Ein X-Post von [@promiscfx / Cognitive f(x)](https://x.com/promiscfx/status/2097080991475257839) berichtet einen Robocurve-Vergleich von GPT-6 Astra und Claude Fable 5.1 auf YAM-Robotarmen.
- Die konkreten Zahlen (95 % vs. 40 % Task Success, Tokens, Laufzeit und Kosten) sind im Wiki als Post-Angaben markiert, solange kein vollständiger Robocurve-Versuchsreport vorliegt.
Die offizielle Auswertung [„GPT-6 Astra on robot arms"](https://openai.robocurve.org/gpt-6-astra/) (04.09.2026) vergleicht GPT-6 Astra mit Claude Fable 5.1 auf denselben YAM-Robotarmen und derselben Inspect-Robots-Agent-Policy:
- Block-in-Schüssel: Astra 19/20 (95 %), Fable 5.1 8/20 (40 %).
- Puzzle-in-Nut: beide 2/20 (10 %).
- Astra: 2,5 Minuten und $0,94 pro Block-Lauf; Fable 5.1: 6,8 Minuten und $2,12.
Die Auswertung veröffentlicht zusätzlich Einzelruns mit Scores, Zeiten, Transcripts, Videos und RRD-Dateien.
## Verwandte Seiten
- [[../concepts/agi/robotics-model-benchmark.md]] — Astra-vs.-Fable-Benchmark
- [Offizielle Robocurve-Website](https://robocurve.org/)
- [Offizieller Astra-Report](https://openai.robocurve.org/gpt-6-astra/)
- [Robocurve-Website](https://robocurve.org/)

View file

@ -2,6 +2,19 @@
*Append-only changelog. Start: 2026-06-05*
## 2026-09-08 — Robocurve-Primärreport: GPT-6 Astra auf Roboterarmen
**Type:** ingest | **Scope:** raw/blog, wiki/concepts/agi, wiki/institutions, wiki/index, wiki/log
**Source:** [Robocurve: GPT-6 Astra on robot arms](https://openai.robocurve.org/gpt-6-astra/), veröffentlicht 04.09.2026; ergänzt den X-Post von @promiscfx.
**Verifikation:** Robocurve dokumentiert denselben Versuchsaufbau: gleiche YAM-Arme, gleiche Inspect-Robots-Agent-Policy und 20 Versuche pro Aufgabe. Block-in-Schüssel: Astra 19/20 (95 %) vs. Fable 5.1 8/20 (40 %), Astra 2,5 Minuten/$0,94 vs. Fable 5.1 6,8 Minuten/$2,12. Schwierigeres Puzzle: beide 2/20 (10 %); daraus folgt keine allgemeine Robotik-Dominanz.
- raw (NEW): `raw/blog/2026-09-08_robocurve-gpt6-astra.md` — Primärreport-Extrakt mit Versuchsaufbau und Ergebnissen.
- wiki (UPDATED): `wiki/concepts/agi/robotics-model-benchmark.md` — Primärquelle ergänzt, X-Post-Zahlen verifiziert, Puzzle-Gleichstand und Grenzen dokumentiert.
- wiki (UPDATED): `wiki/institutions/robocurve.md` — offizielle Astra-Auswertung ergänzt.
- `wiki/index.md` (191. Update, Primärquelle im AGI-/Institutions-/Raw-Katalog)
- `wiki/log.md` (dieser Eintrag)
## 2026-09-08 — @promiscfx: Robocurve-Benchmark GPT-6 Astra vs. Claude Fable 5.1
**Type:** ingest | **Scope:** raw/xpost, wiki/concepts/agi, wiki/institutions, wiki/people, wiki/index, wiki/log