--- created: 2026-09-08 updated: 2026-09-17 sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md, blog/2026-09-08_robocurve-gpt6-astra.md] tags: [concept, agi, robotics, physical-ai, benchmarking, gpt-6-astra, claude-fable-5.1, embodied-ai] --- # Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1 > **Quellen:** [Robocurve: GPT-6 Astra on robot arms](https://openai.robocurve.org/gpt-6-astra/) (04.09.2026) + [@promiscfx / Cognitive f(x)](https://x.com/promiscfx/status/2097080991475257839), 07.09.2026 → [Primärquelle-Extrakt](../../../raw/blog/2026-09-08_robocurve-gpt6-astra.md) / [X-Post-Raw](../../../raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md) ## Der Vergleich Robocurve testet **OpenAIs GPT-6 Astra** und **Claude Fable 5.1** mit denselben YAM-Robotarmen und derselben Inspect-Robots-Agent-Policy. Getestet werden zwei Aufgaben: 1. Einen roten Block vom Tisch aufnehmen und in eine Schüssel legen („Block-into-bowl"). 2. Ein rundes blaues Puzzleteil am mittleren Knopf aufnehmen und in die passende kreisförmige Nut einsetzen („Puzzle-into-groove"). Jede Aufgabe umfasst 20 Versuche. Die Bewertung erfolgt durch Menschen nach der höchsten erreichten Stufe: Annäherung, Kontakt, Anheben, Positionierung über dem Ziel und endgültige Platzierung. ## Ergebnisse | Metrik | Claude Fable 5.1 | GPT-6 Astra | Veränderung | |---|---:|---:|---:| | Task Success — Block-in-Schüssel | 8/20 (40 %) | 19/20 (95 %) | +11 erfolgreiche Runs | | Output-Tokens — Block-Aufgabe | ~12,9k | ~2,1k | ca. 6× weniger | | Ausführungszeit — Block-Aufgabe | 6,8 min | 2,5 min | ca. 63 % weniger | | Kosten — Block-Aufgabe | $2,12 | $0,94 | ca. 56 % weniger | | Task Success — Puzzle-in-Nut | 2/20 (10 %) | 2/20 (10 %) | Gleichstand | | Output-Tokens — Puzzle-Aufgabe | ~10,5k | ~2,7k | ca. 3,9× weniger | | Kosten — Puzzle-Aufgabe | $2,18 | $1,36 | Astra günstiger | ## Warum das eine andere Liga ist — aber nur bei dieser Aufgabe Bei der groben visuellen Manipulation ist der Astra-Vorteil deutlich: 19/20 erfolgreiche Platzierungen gegenüber 8/20 bei Fable 5.1, bei kürzerer Laufzeit, deutlich weniger Output-Tokens und etwa halbierten Kosten. Das ist praktisch der Unterschied zwischen „meistens brauchbar" und „regelmäßig scheiternd". Die schwierigere Puzzle-Aufgabe verhindert aber eine allgemeine Dominanzthese: Astra und Fable 5.1 erreichen beide nur 2/20. Beide Modelle kommen laut Robocurve bis zum letzten Einsetzen in die Nut und scheitern typischerweise dort. Der Benchmark ist damit ein Signal für **embodied AI**: Entscheidend ist nicht nur, welches Modell abstrakte Benchmarks gewinnt, sondern welches Modell eine physische Aufgabe zuverlässig, schnell und bezahlbar ausführt — einschließlich der Grenzen, die in feinmotorischen Aufgaben sichtbar werden. ## Primärquellenprüfung Die konkreten Zahlen sind auf der **offiziellen Robocurve-Seite** dokumentiert. Robocurve nennt denselben Versuchsaufbau: gleiche YAM-Arme, gleiche Inspect-Robots-Agent-Policy und je 20 Versuche pro Aufgabe. Die Seite veröffentlicht außerdem Einzelruns mit Scores, Zeiten, Transcripts, Videos und RRD-Dateien. - **Block-in-bowl:** Astra 19/20 (95 %), Fable 5.1 8/20 (40 %), Fable 5 1/20 (5 %). - **Puzzle-in-groove:** Astra 2/20 (10 %), Fable 5.1 2/20 (10 %); beide scheitern typischerweise am letzten Einsetzen. - **Ressourcen:** Astra 2,5 Minuten und $0,94 pro Block-Lauf; Fable 5.1 6,8 Minuten und $2,12. Die Ergebnistabelle nennt ~2,1k vs. ~12,9k Output-Tokens. Damit ist der Astra-Vorteil bei grober visueller Manipulation primär belegt. Eine allgemeine Robotik-Dominanz folgt daraus ausdrücklich **nicht**: Bei der feineren Puzzle-Aufgabe herrscht Gleichstand bei 2/20. ## Einordnung Der Benchmark ergänzt die [Coding-Benchmark-Preis-/Leistungsseite](../llm/coding-benchmark-price-performance.md): Dort geht es um One-Shot-Codegenerierung, hier um eine geschlossene Wahrnehmungs-/Planungs-/Aktionsschleife in physischer Welt. Genau diese Schleife entscheidet, ob ein Sprach- oder Reasoning-Modell außerhalb des Chatfensters praktische Agency entwickelt. ## Verwandte Seiten - [[../../institutions/robocurve.md]] — unabhängige Physical-AI-Evaluierung - [[../../tools/openai-gpt.md]] — OpenAI-Modelle - [[../llm/coding-benchmark-price-performance.md]] — Software-/Coding-Benchmarks - [Robocurve: GPT-6 Astra on robot arms](https://openai.robocurve.org/gpt-6-astra/) — Primärreport - [Robocurve](https://robocurve.org/) — offizielle Evaluationsplattform - [[../agents/nvidia-agenten-3d-scene-prep.md]] — NVIDIA-Workflow, der die *andere* Seite derselben Modellfamilie zeigt: GPT-6 Astra als Orchestrator für die Vorbereitung simulationsreifer Welten (statt als Roboter-Policy)