knowledge-base/wiki/concepts/agi/robotics-model-benchmark.md
Hector ac4acf003f ingest(blog): NVIDIA — Agenten bereiten 3D-Szenen für die Simulation vor
- raw/blog/2026-09-17_nvidia-ai-agents-3d-scenes-simulation.md (neu)
- wiki/concepts/agents/nvidia-agenten-3d-scene-prep.md (neu)
- wiki/institutions/nvidia.md (neu)
- Cross-Refs: harness-loop-graph-engineering, hermes-bot-mode,
  harness-vs-standalone-chat-llm, robotics-model-benchmark,
  tools/openclaw, tools/nvidia-dgx-spark
- index.md (205. Update), log.md
2026-09-17 09:27:21 +02:00

4.7 KiB
Raw Permalink Blame History

created updated sources tags
2026-09-08 2026-09-17
xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md
blog/2026-09-08_robocurve-gpt6-astra.md
concept
agi
robotics
physical-ai
benchmarking
gpt-6-astra
claude-fable-5.1
embodied-ai

Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1

Quellen: Robocurve: GPT-6 Astra on robot arms (04.09.2026) + @promiscfx / Cognitive f(x), 07.09.2026 → Primärquelle-Extrakt / X-Post-Raw

Der Vergleich

Robocurve testet OpenAIs GPT-6 Astra und Claude Fable 5.1 mit denselben YAM-Robotarmen und derselben Inspect-Robots-Agent-Policy. Getestet werden zwei Aufgaben:

  1. Einen roten Block vom Tisch aufnehmen und in eine Schüssel legen („Block-into-bowl").
  2. Ein rundes blaues Puzzleteil am mittleren Knopf aufnehmen und in die passende kreisförmige Nut einsetzen („Puzzle-into-groove").

Jede Aufgabe umfasst 20 Versuche. Die Bewertung erfolgt durch Menschen nach der höchsten erreichten Stufe: Annäherung, Kontakt, Anheben, Positionierung über dem Ziel und endgültige Platzierung.

Ergebnisse

Metrik Claude Fable 5.1 GPT-6 Astra Veränderung
Task Success — Block-in-Schüssel 8/20 (40 %) 19/20 (95 %) +11 erfolgreiche Runs
Output-Tokens — Block-Aufgabe ~12,9k ~2,1k ca. 6× weniger
Ausführungszeit — Block-Aufgabe 6,8 min 2,5 min ca. 63 % weniger
Kosten — Block-Aufgabe $2,12 $0,94 ca. 56 % weniger
Task Success — Puzzle-in-Nut 2/20 (10 %) 2/20 (10 %) Gleichstand
Output-Tokens — Puzzle-Aufgabe ~10,5k ~2,7k ca. 3,9× weniger
Kosten — Puzzle-Aufgabe $2,18 $1,36 Astra günstiger

Warum das eine andere Liga ist — aber nur bei dieser Aufgabe

Bei der groben visuellen Manipulation ist der Astra-Vorteil deutlich: 19/20 erfolgreiche Platzierungen gegenüber 8/20 bei Fable 5.1, bei kürzerer Laufzeit, deutlich weniger Output-Tokens und etwa halbierten Kosten. Das ist praktisch der Unterschied zwischen „meistens brauchbar" und „regelmäßig scheiternd".

Die schwierigere Puzzle-Aufgabe verhindert aber eine allgemeine Dominanzthese: Astra und Fable 5.1 erreichen beide nur 2/20. Beide Modelle kommen laut Robocurve bis zum letzten Einsetzen in die Nut und scheitern typischerweise dort.

Der Benchmark ist damit ein Signal für embodied AI: Entscheidend ist nicht nur, welches Modell abstrakte Benchmarks gewinnt, sondern welches Modell eine physische Aufgabe zuverlässig, schnell und bezahlbar ausführt — einschließlich der Grenzen, die in feinmotorischen Aufgaben sichtbar werden.

Primärquellenprüfung

Die konkreten Zahlen sind auf der offiziellen Robocurve-Seite dokumentiert. Robocurve nennt denselben Versuchsaufbau: gleiche YAM-Arme, gleiche Inspect-Robots-Agent-Policy und je 20 Versuche pro Aufgabe. Die Seite veröffentlicht außerdem Einzelruns mit Scores, Zeiten, Transcripts, Videos und RRD-Dateien.

  • Block-in-bowl: Astra 19/20 (95 %), Fable 5.1 8/20 (40 %), Fable 5 1/20 (5 %).
  • Puzzle-in-groove: Astra 2/20 (10 %), Fable 5.1 2/20 (10 %); beide scheitern typischerweise am letzten Einsetzen.
  • Ressourcen: Astra 2,5 Minuten und $0,94 pro Block-Lauf; Fable 5.1 6,8 Minuten und $2,12. Die Ergebnistabelle nennt ~2,1k vs. ~12,9k Output-Tokens.

Damit ist der Astra-Vorteil bei grober visueller Manipulation primär belegt. Eine allgemeine Robotik-Dominanz folgt daraus ausdrücklich nicht: Bei der feineren Puzzle-Aufgabe herrscht Gleichstand bei 2/20.

Einordnung

Der Benchmark ergänzt die Coding-Benchmark-Preis-/Leistungsseite: Dort geht es um One-Shot-Codegenerierung, hier um eine geschlossene Wahrnehmungs-/Planungs-/Aktionsschleife in physischer Welt. Genau diese Schleife entscheidet, ob ein Sprach- oder Reasoning-Modell außerhalb des Chatfensters praktische Agency entwickelt.

Verwandte Seiten