knowledge-base/wiki/concepts/agi/robotics-model-benchmark.md

3.2 KiB
Raw Blame History

created updated sources tags
2026-09-08 2026-09-08
xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md
concept
agi
robotics
physical-ai
benchmarking
gpt-6-astra
claude-fable-5.1
embodied-ai

Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1

Quelle: @promiscfx / Cognitive f(x), 07.09.2026 → Raw-Datei

Der Vergleich

Ein X-Post berichtet von einem unabhängigen Robocurve-Benchmark, in dem OpenAIs GPT-6 Astra und Claude Fable 5.1 YAM-Roboterarme steuern. Der konkrete Task heißt „Block-into-bowl“.

Metrik Claude Fable 5.1 GPT-6 Astra Veränderung laut Post
Task Success 40 % 95 % +55 Prozentpunkte
Output-Tokens pro Lauf ~12,9k ~2,1k ca. 6× weniger
Ausführungszeit 6,8 min 2,5 min ca. 63 % weniger
Kosten pro Lauf $2,12 $0,94 ca. 56 % weniger

Warum das eine andere Liga wäre

Wenn die Angaben reproduzierbar sind, wäre das nicht bloß ein kleiner Modell- oder Preisvorteil, sondern ein Sprung in drei gekoppelten Dimensionen:

  1. Zuverlässigkeit: Ein Anstieg von 40 % auf 95 % Task Success verändert die praktische Einsetzbarkeit eines Robotik-Systems.
  2. Reasoning-Effizienz: Weniger Output-Tokens bei höherem Erfolg bedeuten weniger Inferenz- und Latenzlast.
  3. Operationsökonomie: Kürzere Laufzeit und niedrigere Kosten pro physischer Aktion machen die Differenz für reale Robotik-Anwendungen relevant.

Der Vergleich ist damit ein Signal für embodied AI: Entscheidend ist nicht nur, welches Modell abstrakte Benchmarks gewinnt, sondern welches Modell eine physische Aufgabe zuverlässig, schnell und bezahlbar ausführt.

Quellenkritik

  • Der konkrete Zahlenvergleich stammt aus einem X-Post, nicht aus einem im Post verlinkten vollständigen Robocurve-Report.
  • Robocurve selbst beschreibt sich als unabhängigen Evaluator für Physical AI, Public Benefit Corporation und Entwickler offener Evaluationswerkzeuge. Das bestätigt die Benchmark-Infrastruktur, nicht automatisch diese konkrete Messung.
  • Nicht dokumentiert sind unter anderem Anzahl und Verteilung der Runs, Prompt/Policy, Robotik-Hardwarekonfiguration, Fehlerdefinition, Seed-/Versuchsbedingungen und ob die Kostenrechnung identische Modellpreise und Tool-Aufrufe voraussetzt.
  • Die Zahlen werden daher als unabhängig zu verifizierende Post-Angaben geführt — nicht als gesicherter Modellvergleich.

Einordnung

Der Benchmark ergänzt die Coding-Benchmark-Preis-/Leistungsseite: Dort geht es um One-Shot-Codegenerierung, hier um eine geschlossene Wahrnehmungs-/Planungs-/Aktionsschleife in physischer Welt. Genau diese Schleife entscheidet, ob ein Sprach- oder Reasoning-Modell außerhalb des Chatfensters praktische Agency entwickelt.

Verwandte Seiten