50 lines
3.2 KiB
Markdown
50 lines
3.2 KiB
Markdown
|
|
---
|
|||
|
|
created: 2026-09-08
|
|||
|
|
updated: 2026-09-08
|
|||
|
|
sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md]
|
|||
|
|
tags: [concept, agi, robotics, physical-ai, benchmarking, gpt-6-astra, claude-fable-5.1, embodied-ai]
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
# Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1
|
|||
|
|
|
|||
|
|
> **Quelle:** [@promiscfx / Cognitive f(x)](https://x.com/promiscfx/status/2097080991475257839), 07.09.2026 → [Raw-Datei](../../../raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md)
|
|||
|
|
|
|||
|
|
## Der Vergleich
|
|||
|
|
|
|||
|
|
Ein X-Post berichtet von einem unabhängigen [Robocurve](../../institutions/robocurve.md)-Benchmark, in dem **OpenAIs GPT-6 Astra** und **Claude Fable 5.1** YAM-Roboterarme steuern. Der konkrete Task heißt „Block-into-bowl“.
|
|||
|
|
|
|||
|
|
| Metrik | Claude Fable 5.1 | GPT-6 Astra | Veränderung laut Post |
|
|||
|
|
|---|---:|---:|---:|
|
|||
|
|
| Task Success | 40 % | 95 % | +55 Prozentpunkte |
|
|||
|
|
| Output-Tokens pro Lauf | ~12,9k | ~2,1k | ca. 6× weniger |
|
|||
|
|
| Ausführungszeit | 6,8 min | 2,5 min | ca. 63 % weniger |
|
|||
|
|
| Kosten pro Lauf | $2,12 | $0,94 | ca. 56 % weniger |
|
|||
|
|
|
|||
|
|
## Warum das eine andere Liga wäre
|
|||
|
|
|
|||
|
|
Wenn die Angaben reproduzierbar sind, wäre das nicht bloß ein kleiner Modell- oder Preisvorteil, sondern ein Sprung in drei gekoppelten Dimensionen:
|
|||
|
|
|
|||
|
|
1. **Zuverlässigkeit:** Ein Anstieg von 40 % auf 95 % Task Success verändert die praktische Einsetzbarkeit eines Robotik-Systems.
|
|||
|
|
2. **Reasoning-Effizienz:** Weniger Output-Tokens bei höherem Erfolg bedeuten weniger Inferenz- und Latenzlast.
|
|||
|
|
3. **Operationsökonomie:** Kürzere Laufzeit und niedrigere Kosten pro physischer Aktion machen die Differenz für reale Robotik-Anwendungen relevant.
|
|||
|
|
|
|||
|
|
Der Vergleich ist damit ein Signal für **embodied AI**: Entscheidend ist nicht nur, welches Modell abstrakte Benchmarks gewinnt, sondern welches Modell eine physische Aufgabe zuverlässig, schnell und bezahlbar ausführt.
|
|||
|
|
|
|||
|
|
## Quellenkritik
|
|||
|
|
|
|||
|
|
- Der konkrete Zahlenvergleich stammt aus **einem X-Post**, nicht aus einem im Post verlinkten vollständigen Robocurve-Report.
|
|||
|
|
- Robocurve selbst beschreibt sich als unabhängigen Evaluator für Physical AI, Public Benefit Corporation und Entwickler offener Evaluationswerkzeuge. Das bestätigt die Benchmark-Infrastruktur, nicht automatisch diese konkrete Messung.
|
|||
|
|
- Nicht dokumentiert sind unter anderem Anzahl und Verteilung der Runs, Prompt/Policy, Robotik-Hardwarekonfiguration, Fehlerdefinition, Seed-/Versuchsbedingungen und ob die Kostenrechnung identische Modellpreise und Tool-Aufrufe voraussetzt.
|
|||
|
|
- Die Zahlen werden daher als **unabhängig zu verifizierende Post-Angaben** geführt — nicht als gesicherter Modellvergleich.
|
|||
|
|
|
|||
|
|
## Einordnung
|
|||
|
|
|
|||
|
|
Der Benchmark ergänzt die [Coding-Benchmark-Preis-/Leistungsseite](../llm/coding-benchmark-price-performance.md): Dort geht es um One-Shot-Codegenerierung, hier um eine geschlossene Wahrnehmungs-/Planungs-/Aktionsschleife in physischer Welt. Genau diese Schleife entscheidet, ob ein Sprach- oder Reasoning-Modell außerhalb des Chatfensters praktische Agency entwickelt.
|
|||
|
|
|
|||
|
|
## Verwandte Seiten
|
|||
|
|
|
|||
|
|
- [[../../institutions/robocurve.md]] — unabhängige Physical-AI-Evaluierung
|
|||
|
|
- [[../../tools/openai-gpt.md]] — OpenAI-Modelle
|
|||
|
|
- [[../llm/coding-benchmark-price-performance.md]] — Software-/Coding-Benchmarks
|
|||
|
|
- [Robocurve](https://robocurve.org/) — offizielle Evaluationsplattform
|