knowledge-base/wiki/concepts/agi/robotics-model-benchmark.md

63 lines
4.7 KiB
Markdown
Raw Normal View History

---
created: 2026-09-08
updated: 2026-09-17
sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md, blog/2026-09-08_robocurve-gpt6-astra.md]
tags: [concept, agi, robotics, physical-ai, benchmarking, gpt-6-astra, claude-fable-5.1, embodied-ai]
---
# Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1
> **Quellen:** [Robocurve: GPT-6 Astra on robot arms](https://openai.robocurve.org/gpt-6-astra/) (04.09.2026) + [@promiscfx / Cognitive f(x)](https://x.com/promiscfx/status/2097080991475257839), 07.09.2026 → [Primärquelle-Extrakt](../../../raw/blog/2026-09-08_robocurve-gpt6-astra.md) / [X-Post-Raw](../../../raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md)
## Der Vergleich
Robocurve testet **OpenAIs GPT-6 Astra** und **Claude Fable 5.1** mit denselben YAM-Robotarmen und derselben Inspect-Robots-Agent-Policy. Getestet werden zwei Aufgaben:
1. Einen roten Block vom Tisch aufnehmen und in eine Schüssel legen („Block-into-bowl").
2. Ein rundes blaues Puzzleteil am mittleren Knopf aufnehmen und in die passende kreisförmige Nut einsetzen („Puzzle-into-groove").
Jede Aufgabe umfasst 20 Versuche. Die Bewertung erfolgt durch Menschen nach der höchsten erreichten Stufe: Annäherung, Kontakt, Anheben, Positionierung über dem Ziel und endgültige Platzierung.
## Ergebnisse
| Metrik | Claude Fable 5.1 | GPT-6 Astra | Veränderung |
|---|---:|---:|---:|
| Task Success — Block-in-Schüssel | 8/20 (40 %) | 19/20 (95 %) | +11 erfolgreiche Runs |
| Output-Tokens — Block-Aufgabe | ~12,9k | ~2,1k | ca. 6× weniger |
| Ausführungszeit — Block-Aufgabe | 6,8 min | 2,5 min | ca. 63 % weniger |
| Kosten — Block-Aufgabe | $2,12 | $0,94 | ca. 56 % weniger |
| Task Success — Puzzle-in-Nut | 2/20 (10 %) | 2/20 (10 %) | Gleichstand |
| Output-Tokens — Puzzle-Aufgabe | ~10,5k | ~2,7k | ca. 3,9× weniger |
| Kosten — Puzzle-Aufgabe | $2,18 | $1,36 | Astra günstiger |
## Warum das eine andere Liga ist — aber nur bei dieser Aufgabe
Bei der groben visuellen Manipulation ist der Astra-Vorteil deutlich: 19/20 erfolgreiche Platzierungen gegenüber 8/20 bei Fable 5.1, bei kürzerer Laufzeit, deutlich weniger Output-Tokens und etwa halbierten Kosten. Das ist praktisch der Unterschied zwischen „meistens brauchbar" und „regelmäßig scheiternd".
Die schwierigere Puzzle-Aufgabe verhindert aber eine allgemeine Dominanzthese: Astra und Fable 5.1 erreichen beide nur 2/20. Beide Modelle kommen laut Robocurve bis zum letzten Einsetzen in die Nut und scheitern typischerweise dort.
Der Benchmark ist damit ein Signal für **embodied AI**: Entscheidend ist nicht nur, welches Modell abstrakte Benchmarks gewinnt, sondern welches Modell eine physische Aufgabe zuverlässig, schnell und bezahlbar ausführt — einschließlich der Grenzen, die in feinmotorischen Aufgaben sichtbar werden.
## Primärquellenprüfung
Die konkreten Zahlen sind auf der **offiziellen Robocurve-Seite** dokumentiert. Robocurve nennt denselben Versuchsaufbau: gleiche YAM-Arme, gleiche Inspect-Robots-Agent-Policy und je 20 Versuche pro Aufgabe. Die Seite veröffentlicht außerdem Einzelruns mit Scores, Zeiten, Transcripts, Videos und RRD-Dateien.
- **Block-in-bowl:** Astra 19/20 (95 %), Fable 5.1 8/20 (40 %), Fable 5 1/20 (5 %).
- **Puzzle-in-groove:** Astra 2/20 (10 %), Fable 5.1 2/20 (10 %); beide scheitern typischerweise am letzten Einsetzen.
- **Ressourcen:** Astra 2,5 Minuten und $0,94 pro Block-Lauf; Fable 5.1 6,8 Minuten und $2,12. Die Ergebnistabelle nennt ~2,1k vs. ~12,9k Output-Tokens.
Damit ist der Astra-Vorteil bei grober visueller Manipulation primär belegt. Eine allgemeine Robotik-Dominanz folgt daraus ausdrücklich **nicht**: Bei der feineren Puzzle-Aufgabe herrscht Gleichstand bei 2/20.
## Einordnung
Der Benchmark ergänzt die [Coding-Benchmark-Preis-/Leistungsseite](../llm/coding-benchmark-price-performance.md): Dort geht es um One-Shot-Codegenerierung, hier um eine geschlossene Wahrnehmungs-/Planungs-/Aktionsschleife in physischer Welt. Genau diese Schleife entscheidet, ob ein Sprach- oder Reasoning-Modell außerhalb des Chatfensters praktische Agency entwickelt.
## Verwandte Seiten
- [[../../institutions/robocurve.md]] — unabhängige Physical-AI-Evaluierung
- [[../../tools/openai-gpt.md]] — OpenAI-Modelle
- [[../llm/coding-benchmark-price-performance.md]] — Software-/Coding-Benchmarks
- [Robocurve: GPT-6 Astra on robot arms](https://openai.robocurve.org/gpt-6-astra/) — Primärreport
- [Robocurve](https://robocurve.org/) — offizielle Evaluationsplattform
- [[../agents/nvidia-agenten-3d-scene-prep.md]] — NVIDIA-Workflow, der die *andere* Seite derselben Modellfamilie zeigt: GPT-6 Astra als Orchestrator für die Vorbereitung simulationsreifer Welten (statt als Roboter-Policy)