- raw/blog/2026-09-17_nvidia-ai-agents-3d-scenes-simulation.md (neu) - wiki/concepts/agents/nvidia-agenten-3d-scene-prep.md (neu) - wiki/institutions/nvidia.md (neu) - Cross-Refs: harness-loop-graph-engineering, hermes-bot-mode, harness-vs-standalone-chat-llm, robotics-model-benchmark, tools/openclaw, tools/nvidia-dgx-spark - index.md (205. Update), log.md
4.7 KiB
| created | updated | sources | tags | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-09-08 | 2026-09-17 |
|
|
Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1
Quellen: Robocurve: GPT-6 Astra on robot arms (04.09.2026) + @promiscfx / Cognitive f(x), 07.09.2026 → Primärquelle-Extrakt / X-Post-Raw
Der Vergleich
Robocurve testet OpenAIs GPT-6 Astra und Claude Fable 5.1 mit denselben YAM-Robotarmen und derselben Inspect-Robots-Agent-Policy. Getestet werden zwei Aufgaben:
- Einen roten Block vom Tisch aufnehmen und in eine Schüssel legen („Block-into-bowl").
- Ein rundes blaues Puzzleteil am mittleren Knopf aufnehmen und in die passende kreisförmige Nut einsetzen („Puzzle-into-groove").
Jede Aufgabe umfasst 20 Versuche. Die Bewertung erfolgt durch Menschen nach der höchsten erreichten Stufe: Annäherung, Kontakt, Anheben, Positionierung über dem Ziel und endgültige Platzierung.
Ergebnisse
| Metrik | Claude Fable 5.1 | GPT-6 Astra | Veränderung |
|---|---|---|---|
| Task Success — Block-in-Schüssel | 8/20 (40 %) | 19/20 (95 %) | +11 erfolgreiche Runs |
| Output-Tokens — Block-Aufgabe | ~12,9k | ~2,1k | ca. 6× weniger |
| Ausführungszeit — Block-Aufgabe | 6,8 min | 2,5 min | ca. 63 % weniger |
| Kosten — Block-Aufgabe | $2,12 | $0,94 | ca. 56 % weniger |
| Task Success — Puzzle-in-Nut | 2/20 (10 %) | 2/20 (10 %) | Gleichstand |
| Output-Tokens — Puzzle-Aufgabe | ~10,5k | ~2,7k | ca. 3,9× weniger |
| Kosten — Puzzle-Aufgabe | $2,18 | $1,36 | Astra günstiger |
Warum das eine andere Liga ist — aber nur bei dieser Aufgabe
Bei der groben visuellen Manipulation ist der Astra-Vorteil deutlich: 19/20 erfolgreiche Platzierungen gegenüber 8/20 bei Fable 5.1, bei kürzerer Laufzeit, deutlich weniger Output-Tokens und etwa halbierten Kosten. Das ist praktisch der Unterschied zwischen „meistens brauchbar" und „regelmäßig scheiternd".
Die schwierigere Puzzle-Aufgabe verhindert aber eine allgemeine Dominanzthese: Astra und Fable 5.1 erreichen beide nur 2/20. Beide Modelle kommen laut Robocurve bis zum letzten Einsetzen in die Nut und scheitern typischerweise dort.
Der Benchmark ist damit ein Signal für embodied AI: Entscheidend ist nicht nur, welches Modell abstrakte Benchmarks gewinnt, sondern welches Modell eine physische Aufgabe zuverlässig, schnell und bezahlbar ausführt — einschließlich der Grenzen, die in feinmotorischen Aufgaben sichtbar werden.
Primärquellenprüfung
Die konkreten Zahlen sind auf der offiziellen Robocurve-Seite dokumentiert. Robocurve nennt denselben Versuchsaufbau: gleiche YAM-Arme, gleiche Inspect-Robots-Agent-Policy und je 20 Versuche pro Aufgabe. Die Seite veröffentlicht außerdem Einzelruns mit Scores, Zeiten, Transcripts, Videos und RRD-Dateien.
- Block-in-bowl: Astra 19/20 (95 %), Fable 5.1 8/20 (40 %), Fable 5 1/20 (5 %).
- Puzzle-in-groove: Astra 2/20 (10 %), Fable 5.1 2/20 (10 %); beide scheitern typischerweise am letzten Einsetzen.
- Ressourcen: Astra 2,5 Minuten und $0,94 pro Block-Lauf; Fable 5.1 6,8 Minuten und $2,12. Die Ergebnistabelle nennt ~2,1k vs. ~12,9k Output-Tokens.
Damit ist der Astra-Vorteil bei grober visueller Manipulation primär belegt. Eine allgemeine Robotik-Dominanz folgt daraus ausdrücklich nicht: Bei der feineren Puzzle-Aufgabe herrscht Gleichstand bei 2/20.
Einordnung
Der Benchmark ergänzt die Coding-Benchmark-Preis-/Leistungsseite: Dort geht es um One-Shot-Codegenerierung, hier um eine geschlossene Wahrnehmungs-/Planungs-/Aktionsschleife in physischer Welt. Genau diese Schleife entscheidet, ob ein Sprach- oder Reasoning-Modell außerhalb des Chatfensters praktische Agency entwickelt.
Verwandte Seiten
- ../../institutions/robocurve.md — unabhängige Physical-AI-Evaluierung
- ../../tools/openai-gpt.md — OpenAI-Modelle
- ../llm/coding-benchmark-price-performance.md — Software-/Coding-Benchmarks
- Robocurve: GPT-6 Astra on robot arms — Primärreport
- Robocurve — offizielle Evaluationsplattform
- ../agents/nvidia-agenten-3d-scene-prep.md — NVIDIA-Workflow, der die andere Seite derselben Modellfamilie zeigt: GPT-6 Astra als Orchestrator für die Vorbereitung simulationsreifer Welten (statt als Roboter-Policy)