2.1 KiB
| type | source_url | retrieved | title | author | tags | |||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| blog | https://openai.robocurve.org/gpt-6-astra/ | 2026-09-08 | GPT-6 Astra on robot arms | Robocurve |
|
Robocurve: GPT-6 Astra on robot arms
Quelle
Offizielle Robocurve-Auswertung: GPT-6 Astra on robot arms, veröffentlicht am 04.09.2026. Die Seite beschreibt einen Vergleich mit Claude Fable 5.1 als Follow-up zur Robocurve-Auswertung von Fable 5 und Fable 5.1.
Versuchsaufbau
GPT-6 Astra und Claude Fable 5.1 steuern dieselben YAM-Roboterarme mit derselben Inspect-Robots-Agent-Policy. Getestet werden zwei Aufgaben:
- Einen roten Block vom Tisch aufnehmen und in eine Schüssel legen.
- Ein rundes blaues Puzzleteil am mittleren Knopf aufnehmen und in die passende kreisförmige Nut einsetzen.
Jede Aufgabe wird über 20 Versuche bewertet. Die Bewertung erfolgt durch Menschen nach der höchsten erreichten Stufe: Annäherung, Kontakt, Anheben, Positionierung über dem Ziel und endgültige Platzierung.
Ergebnisse
- Block-in-Schüssel: GPT-6 Astra platziert den Block in 19/20 Versuchen (95 %), Claude Fable 5.1 in 8/20 (40 %), Claude Fable 5 in 1/20 (5 %).
- Block-Aufgabe: Astra benötigt 2,5 Minuten pro Lauf bei geschätzten $0,94; Fable 5.1 benötigt 6,8 Minuten und $2,12.
- Puzzleteil-in-Nut: Astra und Fable 5.1 erreichen beide 2/20 (10 %); beide scheitern laut Robocurve typischerweise am letzten Einsetzen in die Nut. Astra kostet dabei $1,36 pro Lauf, Fable 5.1 $2,18.
- In der von Robocurve veröffentlichten Ergebnistabelle stehen für die Block-Aufgabe etwa 2,1k Output-Tokens pro Astra-Lauf gegenüber 12,9k bei Fable 5.1; für die Puzzle-Aufgabe 2,7k gegenüber 10,5k.
Einordnung
Die Seite belegt einen deutlichen Astra-Vorteil bei grober visueller Manipulation und der Block-Aufgabe, aber keine allgemeine Robotik-Dominanz: Bei der feineren Puzzle-Aufgabe liegen Astra und Fable 5.1 gleichauf bei 2/20. Robocurve veröffentlicht außerdem Einzelruns mit Scores, Zeiten, Transcripts, Videos und RRD-Dateien.