3.2 KiB
| created | updated | sources | tags | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-09-08 | 2026-09-08 |
|
|
Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1
Quelle: @promiscfx / Cognitive f(x), 07.09.2026 → Raw-Datei
Der Vergleich
Ein X-Post berichtet von einem unabhängigen Robocurve-Benchmark, in dem OpenAIs GPT-6 Astra und Claude Fable 5.1 YAM-Roboterarme steuern. Der konkrete Task heißt „Block-into-bowl“.
| Metrik | Claude Fable 5.1 | GPT-6 Astra | Veränderung laut Post |
|---|---|---|---|
| Task Success | 40 % | 95 % | +55 Prozentpunkte |
| Output-Tokens pro Lauf | ~12,9k | ~2,1k | ca. 6× weniger |
| Ausführungszeit | 6,8 min | 2,5 min | ca. 63 % weniger |
| Kosten pro Lauf | $2,12 | $0,94 | ca. 56 % weniger |
Warum das eine andere Liga wäre
Wenn die Angaben reproduzierbar sind, wäre das nicht bloß ein kleiner Modell- oder Preisvorteil, sondern ein Sprung in drei gekoppelten Dimensionen:
- Zuverlässigkeit: Ein Anstieg von 40 % auf 95 % Task Success verändert die praktische Einsetzbarkeit eines Robotik-Systems.
- Reasoning-Effizienz: Weniger Output-Tokens bei höherem Erfolg bedeuten weniger Inferenz- und Latenzlast.
- Operationsökonomie: Kürzere Laufzeit und niedrigere Kosten pro physischer Aktion machen die Differenz für reale Robotik-Anwendungen relevant.
Der Vergleich ist damit ein Signal für embodied AI: Entscheidend ist nicht nur, welches Modell abstrakte Benchmarks gewinnt, sondern welches Modell eine physische Aufgabe zuverlässig, schnell und bezahlbar ausführt.
Quellenkritik
- Der konkrete Zahlenvergleich stammt aus einem X-Post, nicht aus einem im Post verlinkten vollständigen Robocurve-Report.
- Robocurve selbst beschreibt sich als unabhängigen Evaluator für Physical AI, Public Benefit Corporation und Entwickler offener Evaluationswerkzeuge. Das bestätigt die Benchmark-Infrastruktur, nicht automatisch diese konkrete Messung.
- Nicht dokumentiert sind unter anderem Anzahl und Verteilung der Runs, Prompt/Policy, Robotik-Hardwarekonfiguration, Fehlerdefinition, Seed-/Versuchsbedingungen und ob die Kostenrechnung identische Modellpreise und Tool-Aufrufe voraussetzt.
- Die Zahlen werden daher als unabhängig zu verifizierende Post-Angaben geführt — nicht als gesicherter Modellvergleich.
Einordnung
Der Benchmark ergänzt die Coding-Benchmark-Preis-/Leistungsseite: Dort geht es um One-Shot-Codegenerierung, hier um eine geschlossene Wahrnehmungs-/Planungs-/Aktionsschleife in physischer Welt. Genau diese Schleife entscheidet, ob ein Sprach- oder Reasoning-Modell außerhalb des Chatfensters praktische Agency entwickelt.
Verwandte Seiten
- ../../institutions/robocurve.md — unabhängige Physical-AI-Evaluierung
- ../../tools/openai-gpt.md — OpenAI-Modelle
- ../llm/coding-benchmark-price-performance.md — Software-/Coding-Benchmarks
- Robocurve — offizielle Evaluationsplattform