knowledge-base/wiki/concepts/agi/robotics-model-benchmark.md

49 lines
3.2 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-09-08
updated: 2026-09-08
sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md]
tags: [concept, agi, robotics, physical-ai, benchmarking, gpt-6-astra, claude-fable-5.1, embodied-ai]
---
# Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1
> **Quelle:** [@promiscfx / Cognitive f(x)](https://x.com/promiscfx/status/2097080991475257839), 07.09.2026 → [Raw-Datei](../../../raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md)
## Der Vergleich
Ein X-Post berichtet von einem unabhängigen [Robocurve](../../institutions/robocurve.md)-Benchmark, in dem **OpenAIs GPT-6 Astra** und **Claude Fable 5.1** YAM-Roboterarme steuern. Der konkrete Task heißt „Block-into-bowl“.
| Metrik | Claude Fable 5.1 | GPT-6 Astra | Veränderung laut Post |
|---|---:|---:|---:|
| Task Success | 40 % | 95 % | +55 Prozentpunkte |
| Output-Tokens pro Lauf | ~12,9k | ~2,1k | ca. 6× weniger |
| Ausführungszeit | 6,8 min | 2,5 min | ca. 63 % weniger |
| Kosten pro Lauf | $2,12 | $0,94 | ca. 56 % weniger |
## Warum das eine andere Liga wäre
Wenn die Angaben reproduzierbar sind, wäre das nicht bloß ein kleiner Modell- oder Preisvorteil, sondern ein Sprung in drei gekoppelten Dimensionen:
1. **Zuverlässigkeit:** Ein Anstieg von 40 % auf 95 % Task Success verändert die praktische Einsetzbarkeit eines Robotik-Systems.
2. **Reasoning-Effizienz:** Weniger Output-Tokens bei höherem Erfolg bedeuten weniger Inferenz- und Latenzlast.
3. **Operationsökonomie:** Kürzere Laufzeit und niedrigere Kosten pro physischer Aktion machen die Differenz für reale Robotik-Anwendungen relevant.
Der Vergleich ist damit ein Signal für **embodied AI**: Entscheidend ist nicht nur, welches Modell abstrakte Benchmarks gewinnt, sondern welches Modell eine physische Aufgabe zuverlässig, schnell und bezahlbar ausführt.
## Quellenkritik
- Der konkrete Zahlenvergleich stammt aus **einem X-Post**, nicht aus einem im Post verlinkten vollständigen Robocurve-Report.
- Robocurve selbst beschreibt sich als unabhängigen Evaluator für Physical AI, Public Benefit Corporation und Entwickler offener Evaluationswerkzeuge. Das bestätigt die Benchmark-Infrastruktur, nicht automatisch diese konkrete Messung.
- Nicht dokumentiert sind unter anderem Anzahl und Verteilung der Runs, Prompt/Policy, Robotik-Hardwarekonfiguration, Fehlerdefinition, Seed-/Versuchsbedingungen und ob die Kostenrechnung identische Modellpreise und Tool-Aufrufe voraussetzt.
- Die Zahlen werden daher als **unabhängig zu verifizierende Post-Angaben** geführt — nicht als gesicherter Modellvergleich.
## Einordnung
Der Benchmark ergänzt die [Coding-Benchmark-Preis-/Leistungsseite](../llm/coding-benchmark-price-performance.md): Dort geht es um One-Shot-Codegenerierung, hier um eine geschlossene Wahrnehmungs-/Planungs-/Aktionsschleife in physischer Welt. Genau diese Schleife entscheidet, ob ein Sprach- oder Reasoning-Modell außerhalb des Chatfensters praktische Agency entwickelt.
## Verwandte Seiten
- [[../../institutions/robocurve.md]] — unabhängige Physical-AI-Evaluierung
- [[../../tools/openai-gpt.md]] — OpenAI-Modelle
- [[../llm/coding-benchmark-price-performance.md]] — Software-/Coding-Benchmarks
- [Robocurve](https://robocurve.org/) — offizielle Evaluationsplattform