knowledge-base/wiki/concepts/agi/robotics-model-benchmark.md

61 lines
4.4 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-09-08
updated: 2026-09-08
sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md, blog/2026-09-08_robocurve-gpt6-astra.md]
tags: [concept, agi, robotics, physical-ai, benchmarking, gpt-6-astra, claude-fable-5.1, embodied-ai]
---
# Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1
> **Quellen:** [Robocurve: GPT-6 Astra on robot arms](https://openai.robocurve.org/gpt-6-astra/) (04.09.2026) + [@promiscfx / Cognitive f(x)](https://x.com/promiscfx/status/2097080991475257839), 07.09.2026 → [Primärquelle-Extrakt](../../../raw/blog/2026-09-08_robocurve-gpt6-astra.md) / [X-Post-Raw](../../../raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md)
## Der Vergleich
Robocurve testet **OpenAIs GPT-6 Astra** und **Claude Fable 5.1** mit denselben YAM-Robotarmen und derselben Inspect-Robots-Agent-Policy. Getestet werden zwei Aufgaben:
1. Einen roten Block vom Tisch aufnehmen und in eine Schüssel legen („Block-into-bowl").
2. Ein rundes blaues Puzzleteil am mittleren Knopf aufnehmen und in die passende kreisförmige Nut einsetzen („Puzzle-into-groove").
Jede Aufgabe umfasst 20 Versuche. Die Bewertung erfolgt durch Menschen nach der höchsten erreichten Stufe: Annäherung, Kontakt, Anheben, Positionierung über dem Ziel und endgültige Platzierung.
## Ergebnisse
| Metrik | Claude Fable 5.1 | GPT-6 Astra | Veränderung |
|---|---:|---:|---:|
| Task Success — Block-in-Schüssel | 8/20 (40 %) | 19/20 (95 %) | +11 erfolgreiche Runs |
| Output-Tokens — Block-Aufgabe | ~12,9k | ~2,1k | ca. 6× weniger |
| Ausführungszeit — Block-Aufgabe | 6,8 min | 2,5 min | ca. 63 % weniger |
| Kosten — Block-Aufgabe | $2,12 | $0,94 | ca. 56 % weniger |
| Task Success — Puzzle-in-Nut | 2/20 (10 %) | 2/20 (10 %) | Gleichstand |
| Output-Tokens — Puzzle-Aufgabe | ~10,5k | ~2,7k | ca. 3,9× weniger |
| Kosten — Puzzle-Aufgabe | $2,18 | $1,36 | Astra günstiger |
## Warum das eine andere Liga ist — aber nur bei dieser Aufgabe
Bei der groben visuellen Manipulation ist der Astra-Vorteil deutlich: 19/20 erfolgreiche Platzierungen gegenüber 8/20 bei Fable 5.1, bei kürzerer Laufzeit, deutlich weniger Output-Tokens und etwa halbierten Kosten. Das ist praktisch der Unterschied zwischen „meistens brauchbar" und „regelmäßig scheiternd".
Die schwierigere Puzzle-Aufgabe verhindert aber eine allgemeine Dominanzthese: Astra und Fable 5.1 erreichen beide nur 2/20. Beide Modelle kommen laut Robocurve bis zum letzten Einsetzen in die Nut und scheitern typischerweise dort.
Der Benchmark ist damit ein Signal für **embodied AI**: Entscheidend ist nicht nur, welches Modell abstrakte Benchmarks gewinnt, sondern welches Modell eine physische Aufgabe zuverlässig, schnell und bezahlbar ausführt — einschließlich der Grenzen, die in feinmotorischen Aufgaben sichtbar werden.
## Primärquellenprüfung
Die konkreten Zahlen sind auf der **offiziellen Robocurve-Seite** dokumentiert. Robocurve nennt denselben Versuchsaufbau: gleiche YAM-Arme, gleiche Inspect-Robots-Agent-Policy und je 20 Versuche pro Aufgabe. Die Seite veröffentlicht außerdem Einzelruns mit Scores, Zeiten, Transcripts, Videos und RRD-Dateien.
- **Block-in-bowl:** Astra 19/20 (95 %), Fable 5.1 8/20 (40 %), Fable 5 1/20 (5 %).
- **Puzzle-in-groove:** Astra 2/20 (10 %), Fable 5.1 2/20 (10 %); beide scheitern typischerweise am letzten Einsetzen.
- **Ressourcen:** Astra 2,5 Minuten und $0,94 pro Block-Lauf; Fable 5.1 6,8 Minuten und $2,12. Die Ergebnistabelle nennt ~2,1k vs. ~12,9k Output-Tokens.
Damit ist der Astra-Vorteil bei grober visueller Manipulation primär belegt. Eine allgemeine Robotik-Dominanz folgt daraus ausdrücklich **nicht**: Bei der feineren Puzzle-Aufgabe herrscht Gleichstand bei 2/20.
## Einordnung
Der Benchmark ergänzt die [Coding-Benchmark-Preis-/Leistungsseite](../llm/coding-benchmark-price-performance.md): Dort geht es um One-Shot-Codegenerierung, hier um eine geschlossene Wahrnehmungs-/Planungs-/Aktionsschleife in physischer Welt. Genau diese Schleife entscheidet, ob ein Sprach- oder Reasoning-Modell außerhalb des Chatfensters praktische Agency entwickelt.
## Verwandte Seiten
- [[../../institutions/robocurve.md]] — unabhängige Physical-AI-Evaluierung
- [[../../tools/openai-gpt.md]] — OpenAI-Modelle
- [[../llm/coding-benchmark-price-performance.md]] — Software-/Coding-Benchmarks
- [Robocurve: GPT-6 Astra on robot arms](https://openai.robocurve.org/gpt-6-astra/) — Primärreport
- [Robocurve](https://robocurve.org/) — offizielle Evaluationsplattform