wiki-update(agi): verify robocurve astra benchmark
This commit is contained in:
parent
2cc8768e68
commit
fb50d35aef
5 changed files with 96 additions and 29 deletions
34
raw/blog/2026-09-08_robocurve-gpt6-astra.md
Normal file
34
raw/blog/2026-09-08_robocurve-gpt6-astra.md
Normal file
|
|
@ -0,0 +1,34 @@
|
|||
---
|
||||
type: blog
|
||||
source_url: https://openai.robocurve.org/gpt-6-astra/
|
||||
retrieved: 2026-09-08
|
||||
title: "GPT-6 Astra on robot arms"
|
||||
author: "Robocurve"
|
||||
tags: [robocurve, robotics, physical-ai, gpt-6-astra, claude-fable-5.1, yam, benchmark]
|
||||
---
|
||||
|
||||
# Robocurve: GPT-6 Astra on robot arms
|
||||
|
||||
## Quelle
|
||||
|
||||
Offizielle Robocurve-Auswertung: [GPT-6 Astra on robot arms](https://openai.robocurve.org/gpt-6-astra/), veröffentlicht am 04.09.2026. Die Seite beschreibt einen Vergleich mit Claude Fable 5.1 als Follow-up zur Robocurve-Auswertung von Fable 5 und Fable 5.1.
|
||||
|
||||
## Versuchsaufbau
|
||||
|
||||
GPT-6 Astra und Claude Fable 5.1 steuern dieselben YAM-Roboterarme mit derselben Inspect-Robots-Agent-Policy. Getestet werden zwei Aufgaben:
|
||||
|
||||
1. Einen roten Block vom Tisch aufnehmen und in eine Schüssel legen.
|
||||
2. Ein rundes blaues Puzzleteil am mittleren Knopf aufnehmen und in die passende kreisförmige Nut einsetzen.
|
||||
|
||||
Jede Aufgabe wird über 20 Versuche bewertet. Die Bewertung erfolgt durch Menschen nach der höchsten erreichten Stufe: Annäherung, Kontakt, Anheben, Positionierung über dem Ziel und endgültige Platzierung.
|
||||
|
||||
## Ergebnisse
|
||||
|
||||
- **Block-in-Schüssel:** GPT-6 Astra platziert den Block in 19/20 Versuchen (95 %), Claude Fable 5.1 in 8/20 (40 %), Claude Fable 5 in 1/20 (5 %).
|
||||
- **Block-Aufgabe:** Astra benötigt 2,5 Minuten pro Lauf bei geschätzten $0,94; Fable 5.1 benötigt 6,8 Minuten und $2,12.
|
||||
- **Puzzleteil-in-Nut:** Astra und Fable 5.1 erreichen beide 2/20 (10 %); beide scheitern laut Robocurve typischerweise am letzten Einsetzen in die Nut. Astra kostet dabei $1,36 pro Lauf, Fable 5.1 $2,18.
|
||||
- In der von Robocurve veröffentlichten Ergebnistabelle stehen für die Block-Aufgabe etwa 2,1k Output-Tokens pro Astra-Lauf gegenüber 12,9k bei Fable 5.1; für die Puzzle-Aufgabe 2,7k gegenüber 10,5k.
|
||||
|
||||
## Einordnung
|
||||
|
||||
Die Seite belegt einen deutlichen Astra-Vorteil bei grober visueller Manipulation und der Block-Aufgabe, aber keine allgemeine Robotik-Dominanz: Bei der feineren Puzzle-Aufgabe liegen Astra und Fable 5.1 gleichauf bei 2/20. Robocurve veröffentlicht außerdem Einzelruns mit Scores, Zeiten, Transcripts, Videos und RRD-Dateien.
|
||||
|
|
@ -1,41 +1,52 @@
|
|||
---
|
||||
created: 2026-09-08
|
||||
updated: 2026-09-08
|
||||
sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md]
|
||||
sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md, blog/2026-09-08_robocurve-gpt6-astra.md]
|
||||
tags: [concept, agi, robotics, physical-ai, benchmarking, gpt-6-astra, claude-fable-5.1, embodied-ai]
|
||||
---
|
||||
|
||||
# Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1
|
||||
|
||||
> **Quelle:** [@promiscfx / Cognitive f(x)](https://x.com/promiscfx/status/2097080991475257839), 07.09.2026 → [Raw-Datei](../../../raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md)
|
||||
> **Quellen:** [Robocurve: GPT-6 Astra on robot arms](https://openai.robocurve.org/gpt-6-astra/) (04.09.2026) + [@promiscfx / Cognitive f(x)](https://x.com/promiscfx/status/2097080991475257839), 07.09.2026 → [Primärquelle-Extrakt](../../../raw/blog/2026-09-08_robocurve-gpt6-astra.md) / [X-Post-Raw](../../../raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md)
|
||||
|
||||
## Der Vergleich
|
||||
|
||||
Ein X-Post berichtet von einem unabhängigen [Robocurve](../../institutions/robocurve.md)-Benchmark, in dem **OpenAIs GPT-6 Astra** und **Claude Fable 5.1** YAM-Roboterarme steuern. Der konkrete Task heißt „Block-into-bowl“.
|
||||
Robocurve testet **OpenAIs GPT-6 Astra** und **Claude Fable 5.1** mit denselben YAM-Robotarmen und derselben Inspect-Robots-Agent-Policy. Getestet werden zwei Aufgaben:
|
||||
|
||||
| Metrik | Claude Fable 5.1 | GPT-6 Astra | Veränderung laut Post |
|
||||
1. Einen roten Block vom Tisch aufnehmen und in eine Schüssel legen („Block-into-bowl").
|
||||
2. Ein rundes blaues Puzzleteil am mittleren Knopf aufnehmen und in die passende kreisförmige Nut einsetzen („Puzzle-into-groove").
|
||||
|
||||
Jede Aufgabe umfasst 20 Versuche. Die Bewertung erfolgt durch Menschen nach der höchsten erreichten Stufe: Annäherung, Kontakt, Anheben, Positionierung über dem Ziel und endgültige Platzierung.
|
||||
|
||||
## Ergebnisse
|
||||
|
||||
| Metrik | Claude Fable 5.1 | GPT-6 Astra | Veränderung |
|
||||
|---|---:|---:|---:|
|
||||
| Task Success | 40 % | 95 % | +55 Prozentpunkte |
|
||||
| Output-Tokens pro Lauf | ~12,9k | ~2,1k | ca. 6× weniger |
|
||||
| Ausführungszeit | 6,8 min | 2,5 min | ca. 63 % weniger |
|
||||
| Kosten pro Lauf | $2,12 | $0,94 | ca. 56 % weniger |
|
||||
| Task Success — Block-in-Schüssel | 8/20 (40 %) | 19/20 (95 %) | +11 erfolgreiche Runs |
|
||||
| Output-Tokens — Block-Aufgabe | ~12,9k | ~2,1k | ca. 6× weniger |
|
||||
| Ausführungszeit — Block-Aufgabe | 6,8 min | 2,5 min | ca. 63 % weniger |
|
||||
| Kosten — Block-Aufgabe | $2,12 | $0,94 | ca. 56 % weniger |
|
||||
| Task Success — Puzzle-in-Nut | 2/20 (10 %) | 2/20 (10 %) | Gleichstand |
|
||||
| Output-Tokens — Puzzle-Aufgabe | ~10,5k | ~2,7k | ca. 3,9× weniger |
|
||||
| Kosten — Puzzle-Aufgabe | $2,18 | $1,36 | Astra günstiger |
|
||||
|
||||
## Warum das eine andere Liga wäre
|
||||
## Warum das eine andere Liga ist — aber nur bei dieser Aufgabe
|
||||
|
||||
Wenn die Angaben reproduzierbar sind, wäre das nicht bloß ein kleiner Modell- oder Preisvorteil, sondern ein Sprung in drei gekoppelten Dimensionen:
|
||||
Bei der groben visuellen Manipulation ist der Astra-Vorteil deutlich: 19/20 erfolgreiche Platzierungen gegenüber 8/20 bei Fable 5.1, bei kürzerer Laufzeit, deutlich weniger Output-Tokens und etwa halbierten Kosten. Das ist praktisch der Unterschied zwischen „meistens brauchbar" und „regelmäßig scheiternd".
|
||||
|
||||
1. **Zuverlässigkeit:** Ein Anstieg von 40 % auf 95 % Task Success verändert die praktische Einsetzbarkeit eines Robotik-Systems.
|
||||
2. **Reasoning-Effizienz:** Weniger Output-Tokens bei höherem Erfolg bedeuten weniger Inferenz- und Latenzlast.
|
||||
3. **Operationsökonomie:** Kürzere Laufzeit und niedrigere Kosten pro physischer Aktion machen die Differenz für reale Robotik-Anwendungen relevant.
|
||||
Die schwierigere Puzzle-Aufgabe verhindert aber eine allgemeine Dominanzthese: Astra und Fable 5.1 erreichen beide nur 2/20. Beide Modelle kommen laut Robocurve bis zum letzten Einsetzen in die Nut und scheitern typischerweise dort.
|
||||
|
||||
Der Vergleich ist damit ein Signal für **embodied AI**: Entscheidend ist nicht nur, welches Modell abstrakte Benchmarks gewinnt, sondern welches Modell eine physische Aufgabe zuverlässig, schnell und bezahlbar ausführt.
|
||||
Der Benchmark ist damit ein Signal für **embodied AI**: Entscheidend ist nicht nur, welches Modell abstrakte Benchmarks gewinnt, sondern welches Modell eine physische Aufgabe zuverlässig, schnell und bezahlbar ausführt — einschließlich der Grenzen, die in feinmotorischen Aufgaben sichtbar werden.
|
||||
|
||||
## Quellenkritik
|
||||
## Primärquellenprüfung
|
||||
|
||||
- Der konkrete Zahlenvergleich stammt aus **einem X-Post**, nicht aus einem im Post verlinkten vollständigen Robocurve-Report.
|
||||
- Robocurve selbst beschreibt sich als unabhängigen Evaluator für Physical AI, Public Benefit Corporation und Entwickler offener Evaluationswerkzeuge. Das bestätigt die Benchmark-Infrastruktur, nicht automatisch diese konkrete Messung.
|
||||
- Nicht dokumentiert sind unter anderem Anzahl und Verteilung der Runs, Prompt/Policy, Robotik-Hardwarekonfiguration, Fehlerdefinition, Seed-/Versuchsbedingungen und ob die Kostenrechnung identische Modellpreise und Tool-Aufrufe voraussetzt.
|
||||
- Die Zahlen werden daher als **unabhängig zu verifizierende Post-Angaben** geführt — nicht als gesicherter Modellvergleich.
|
||||
Die konkreten Zahlen sind auf der **offiziellen Robocurve-Seite** dokumentiert. Robocurve nennt denselben Versuchsaufbau: gleiche YAM-Arme, gleiche Inspect-Robots-Agent-Policy und je 20 Versuche pro Aufgabe. Die Seite veröffentlicht außerdem Einzelruns mit Scores, Zeiten, Transcripts, Videos und RRD-Dateien.
|
||||
|
||||
- **Block-in-bowl:** Astra 19/20 (95 %), Fable 5.1 8/20 (40 %), Fable 5 1/20 (5 %).
|
||||
- **Puzzle-in-groove:** Astra 2/20 (10 %), Fable 5.1 2/20 (10 %); beide scheitern typischerweise am letzten Einsetzen.
|
||||
- **Ressourcen:** Astra 2,5 Minuten und $0,94 pro Block-Lauf; Fable 5.1 6,8 Minuten und $2,12. Die Ergebnistabelle nennt ~2,1k vs. ~12,9k Output-Tokens.
|
||||
|
||||
Damit ist der Astra-Vorteil bei grober visueller Manipulation primär belegt. Eine allgemeine Robotik-Dominanz folgt daraus ausdrücklich **nicht**: Bei der feineren Puzzle-Aufgabe herrscht Gleichstand bei 2/20.
|
||||
|
||||
## Einordnung
|
||||
|
||||
|
|
@ -46,4 +57,5 @@ Der Benchmark ergänzt die [Coding-Benchmark-Preis-/Leistungsseite](../llm/codin
|
|||
- [[../../institutions/robocurve.md]] — unabhängige Physical-AI-Evaluierung
|
||||
- [[../../tools/openai-gpt.md]] — OpenAI-Modelle
|
||||
- [[../llm/coding-benchmark-price-performance.md]] — Software-/Coding-Benchmarks
|
||||
- [Robocurve: GPT-6 Astra on robot arms](https://openai.robocurve.org/gpt-6-astra/) — Primärreport
|
||||
- [Robocurve](https://robocurve.org/) — offizielle Evaluationsplattform
|
||||
|
|
|
|||
|
|
@ -2,7 +2,8 @@
|
|||
|
||||
*Auto-generated: 2026-07-07*
|
||||
|
||||
*Letzte Aktualisierung: 2026-09-08 (190. Update — X-Post von @promiscfx/Cognitive f(x) zu Robocurve: GPT-6 Astra vs. Claude Fable 5.1 auf YAM-Robotarmen (Task Success 95 % vs. 40 %, Tokens, Laufzeit, Kosten). Raw: `raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md` (neu; konkrete Zahlen nur aus X-Post, nicht unabhängig verifiziert). Wiki-Update: `concepts/agi/robotics-model-benchmark.md` (neu), `institutions/robocurve.md` (neu), `people/cognitive-fx.md` (neu).)*
|
||||
*Letzte Aktualisierung: 2026-09-08 (191. Update — Robocurve-Primärreport „GPT-6 Astra on robot arms“: offizielle Verifikation des Astra-vs.-Fable-5.1-Benchmarks (19/20 vs. 8/20 Block-in-Schüssel; beide 2/20 beim Puzzle). Raw: `raw/blog/2026-09-08_robocurve-gpt6-astra.md` (neu). Wiki-Update: `concepts/agi/robotics-model-benchmark.md` (Quellenkritik auf Primärquelle aktualisiert), `institutions/robocurve.md` (offizielle Ergebnisse ergänzt).)*
|
||||
*Vorherige Aktualisierung: 2026-09-08 (190. Update — X-Post von @promiscfx/Cognitive f(x) zu Robocurve: GPT-6 Astra vs. Claude Fable 5.1 auf YAM-Robotarmen (Task Success 95 % vs. 40 %, Tokens, Laufzeit, Kosten). Raw: `raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md` (neu; konkrete Zahlen nur aus X-Post, nicht unabhängig verifiziert). Wiki-Update: `concepts/agi/robotics-model-benchmark.md` (neu), `institutions/robocurve.md` (neu), `people/cognitive-fx.md` (neu).)*
|
||||
*Vorherige Aktualisierung: 2026-09-08 (189. Update — YouTube: „This 4B model is a FREAK (it beats a 12B) But ...." (Kanal Prompt Engineer, @PromptEngineer48; metadata-only, kein Transcript — YouTube bot-check/consent wall, kein angehängtes Medienfile). Raw: `raw/youtube/2026-09-08_4b-model-beats-12b-prompt-engineer.md` (neu). Titel-Claim (4B-Modell schlägt 12B, mit Einschränkung) nicht verifiziert; Modellname/Methodik/Einschränkung nicht dokumentiert. Wiki-Update: `concepts/llm/llm-model-catalog.md` (Metadata-only-Nachtrag im Open-Source-Abschnitt).)*
|
||||
*Vorherige Aktualisierung: Letzte Aktualisierung: 2026-09-08 (188. Update — PLUR1BUS Hermes 7.12.7-hermes.3 + Bugfix-Kette 7.12.3–7.12.7 (Mr. Cy / @Cyb3rblade, 2026-09-08). Raw: `raw/other/2026-09-08_plur1bus-hermes-7127-hermes3-release.md` und `raw/other/2026-09-07_plur1bus-memory-bugfix-7123-7127.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Hermes-Release mit Unicode-Umlauten, Embedding-Timeout, LightDream, Checksummen-Validierung; Bugfix-Kette inkl. funktionskritischer Fixes 7.12.6 Recall-BigInt und 7.12.7 MEMORY.md/USER.md-Sessionkontext).)*
|
||||
*Vorherige Aktualisierung: Letzte Aktualisierung: 2026-09-08 (187. Update — YouTube: „THE PROMPTER — AI Short Film (2026) | Higgsfield Global Film Festival“ (Kanal Midnight Monkeys, @MidnightMonkeysStudio; metadata-only, kein Transcript; im Gruppenchat mit Zeitstempel 5:50 verlinkt). Raw: `raw/youtube/2026-09-08_the-prompter-ai-short-film.md` (neu). Die im Kuratauftrag erwähnte Chat-Zusammenfassung der Szene ab 5:50 war aus den zugänglichen Session-Daten (OME Topic 2193) nicht abrufbar → keine erfundenen Szenenfakten. Wiki-Update: `concepts/the-prompter-ai-short-film.md` (neu), `concepts/ai-filmproduktion-hollywood-disruption.md` und `institutions/higgsfield-ai.md` (Higgsfield Global Film Festival ergänzt).)*
|
||||
|
|
@ -245,7 +246,7 @@
|
|||
| [Diary Of A CEO — "ChatGPT Offered Me $2m To Keep Quiet"](concepts/agi/diary-of-a-ceo-chatgpt-2m-interview.md) | Interview-Podcast-Episode (Steven Bartlett): Titel kündigt $2-Millionen-Angebot an Gast mit Geheimhaltungs-Auflage + These "No One Is Ready For What's Coming!" an. Einordnung in NDA-/Secrecy-Debatte der Frontier-KI und gesellschaftliche KI-Bereitschaft. ⚠️ Metadata-only (kein Transcript) | youtube/2026-08-19_diary-of-a-ceo-chatgpt-2m-keep-quiet.md |
|
||||
| [Parasoziale Bindungen an KI-Assistenten](concepts/agi/parasoziale-ki-bindungen.md) | "Was KI kann."-Episode mit Armin Ronacher (Flask-Erfinder, Earendil): parasoziale Bindungen an KI-Assistenten als psychische Gefahr (vulnerable Gruppen), Dead Internet Theory (51 % Bot-Traffic laut Cloudflare), fehlende Frontier-Labs in Europa, KI macht Software zur Einwegware. ⚠️ Metadata-only (kein Transcript; Themen aus OME-Chat-Zusammenfassung) | youtube/2026-09-02_was-ki-kann-ronacher-parasoziale-bindung.md |
|
||||
| [OpenAI: „An Alien Mind"](concepts/agi/openai-an-alien-mind.md) | OpenAI-Chief-Scientist Jakub Pachocki: Reasoning-Modelle als nicht vollständig interpretierbare „alien minds"; Goal vs. Value Alignment, nachlassende CoT-Monitorierbarkeit, Cybersecurity-Risiken, rekursive Selbstverbesserung (RSI), Safety Bars und internationale Koordination. Primärquelle: OpenAI-Essay | blog/2026-09-07_openai-an-alien-mind.md |
|
||||
| [Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1](concepts/agi/robotics-model-benchmark.md) | X-Post von @promiscfx berichtet einen Robocurve-Test auf YAM-Robotarmen: Astra 95 % vs. Fable 40 % Task Success, ~6× weniger Output-Tokens, 2,5 vs. 6,8 Minuten, $0,94 vs. $2,12 pro Lauf. ⚠️ Konkrete Zahlen nur aus X-Post, nicht unabhängig verifiziert | xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md |
|
||||
| [Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1](concepts/agi/robotics-model-benchmark.md) | Robocurve-Primärreport: Astra 19/20 vs. Fable 5.1 8/20 beim Block-in-Schüssel-Task; beide 2/20 beim schwierigeren Puzzle. Astra 2,5 vs. 6,8 Minuten, $0,94 vs. $2,12 und ~2,1k vs. ~12,9k Tokens. **Primärquelle bestätigt; keine allgemeine Robotik-Dominanz** | xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md + blog/2026-09-08_robocurve-gpt6-astra.md |
|
||||
| [AI-Safety-Findings 2026 — Video-Claims gegen Primärquellen](concepts/agi/ai-safety-findings-2026.md) | AI-Frontier-Video (geteilt von @Radio7Andybot, OME Topic „Mensch & Bot im Talk“, #12944): 5 Safety-Claims zugeordnet — OpenAI Preparedness Framework v2 (Critical = >1.000 Tote/>$100B, CEO-Override, arXiv:2509.24394; Framework-Rewrite nach Astra/HF-Incident laut Axios) ✅; DeepMind Harmful Manipulation (9 Studien, >10.000 Teilnehmer, Finance/Health, Manipulation v. a. auf Anweisung; Spendendetail = Video-Angabe) 🟡; OpenClaw-Phishing-Evals (AWS-Keys + CRM an externe Gmail, Gemini 3.1 Pro/GPT-5.4 scheitern; „Logs löschen“ = Video-Angabe) 🟡; Anthropic Agentic Misalignment (16 Modelle, Opus-4-Erpressung, Notruf-Szenario) ✅; Selbstverbesserungs-Claim = Editorialisierung ⚠️. Trennung Studienlage vs. Video-Zuspitzung | youtube/2026-08-27_ai-frontier-not-watched.md |
|
||||
|
||||
### Hardware
|
||||
|
|
@ -388,7 +389,7 @@
|
|||
| [Earendil](institutions/earendil.md) | Public Benefit Corporation von Armin Ronacher (Flask-Erfinder, ex-Sentry). Gemeinwohlorientierte Rechtsform; Kontext: Ronachers Kritik an fehlenden Frontier-Labs in Europa ("Was KI kann.", 02.09.2026) | youtube/2026-09-02_was-ki-kann-ronacher-parasoziale-bindung.md |
|
||||
| [Sentry](institutions/sentry.md) | Error-Tracking- und Performance-Monitoring-Plattform, mitgegründet von Armin Ronacher (~10 Jahre). Open-Source-Komponenten (getsentry/sentry) | youtube/2026-09-02_was-ki-kann-ronacher-parasoziale-bindung.md |
|
||||
| [WELT (welt.de)](institutions/welt.md) | Deutsche überregionale Tageszeitung/Nachrichtenportal (Axel Springer SE). Im Wiki referenziert: Interview 19.08.2026 „Dann haben wir einen Bürgerkrieg in deutschen Großstädten“ mit Ex-Bundespolizist Jan Solwyn (Redakteur Sebastian Berg) — Migrations-/Asylpolitik, GEAS-Kritik, Bürgerkriegs-Prognose. PDF-Ausdruck (183 S., ~174 S. Leserkommentare) geteilt in OME Topic „BUZZ“ | blog/2026-09-03_buergerkrieg-grossstaedten-welt-interview.md |
|
||||
| [Robocurve](institutions/robocurve.md) | Public Benefit Corporation und unabhängiger Evaluator für Physical AI; offene Werkzeuge und Benchmarks für Modelle, Embodiments und Robotik-Aufgaben. Konkreter Astra-vs.-Fable-Vergleich aus X-Post als unbestätigt markiert | xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md |
|
||||
| [Robocurve](institutions/robocurve.md) | Public Benefit Corporation und unabhängiger Evaluator für Physical AI; offene Werkzeuge und Benchmarks für Modelle, Embodiments und Robotik-Aufgaben. Primärreport bestätigt Astra 19/20 vs. Fable 5.1 8/20 beim Block-Task und Gleichstand 2/20 beim Puzzle | xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md + blog/2026-09-08_robocurve-gpt6-astra.md |
|
||||
| [OpenAI](institutions/openai.md) | AI-Forschungs- und Produkt-Unternehmen (GPT-Serie, Frontier Scaling). **Update 07.09.:** „An Alien Mind“ — Reasoning-Modelle, nachlassende CoT-Monitorierbarkeit, Cybersecurity, RSI und Safety Bars. **Staatsbeteiligung (Juli 2026):** Altman bietet Trump 5% Anteile an (Alaska Permanent Fund Modell). Intel-Präzedenz (9,9%, $8.9 Mrd). Strategisch: Exportkontrollen vermeiden, Bailout-Absicherung, IPO-Vorbereitung. Kontrast zu Anthropic | blog/2026-06-16_aschenbrenner-situational-awareness.md + blog/2026-07-02_berliner-zeitung-openai-staatsbeteiligung.md + blog/2026-09-07_openai-an-alien-mind.md |
|
||||
| [Anthropic](institutions/anthropic.md) | AI-Sicherheits- und Forschungs-Unternehmen (Claude-Serie, Exportkontrollen-Krise). **Kontrast zu OpenAI:** Wurde von Regierung beschnitten (Fable 5/Mythos 5), während OpenAI 5% Staatsbeteiligung anbietet. **Alignment-Faking-Forschung (2024):** Sleeper Agents (Hubinger et al., arXiv:2401.05566) + Alignment Faking (Greenblatt et al., arXiv:2412.14093, ~12 % → ~78 %) — Lab-Bedingungen, nicht auf Produktionsmodelle generalisiert; siehe [[concepts/llm/alignment-faking.md]] | blog/2026-06-13_trump-export-controls-anthropic-mythos-fable.md + blog/2026-07-02_berliner-zeitung-openai-staatsbeteiligung.md + other/2026-08-29_herman-alignment-faking-project-ot-analyse.md |
|
||||
| [Z.ai (Zhipu AI)](institutions/z-ai.md) | AI-Frontier-Unternehmen aus China (GLM-Serie, kostengünstige Frontier-Coding-Modelle). **GLM-5.5 (20.07.2026):** >1T params, 1M context, open weights, August 2026 launch. Fourth Chinese AI wave announcement | youtube/2026-06-15_ichbinfabian-glm-5.2-coding-modell.md + xpost/2026-07-20-healthranger-four-chinese-models.md |
|
||||
|
|
@ -607,7 +608,8 @@
|
|||
| `raw/podcast/2026-09-06_gamestar-sargnagel-aaa-gaming.md` | podcast | GameStar Podcast „Der Sargnagel für AAA-Gaming“ — Audio-Transkript: KI-Rechenzentrumsnachfrage nach HBM/DRAM, steigende GPU-/SSD-Preise, längere Upgrade-Zyklen, AAA-/Cloud-/Konsolenfolgen; Podcast-Angaben nicht unabhängig verifiziert |
|
||||
| `raw/xpost/2026-09-06_0xjokker-timesfm-3.md` | xpost | @0xJokker: TimesFM als lokales Zero-Shot-Zeitreihenmodell für Nachfrage, Preise, Webtraffic und Krypto-Volatilität; 100-Mrd.-Datenpunkt-, Lokal- und Open-Source-Claims gegen offizielle TimesFM-3.0-Quellen eingeordnet; Code Apache-2.0, 3.0-Standardgewichte Non-Commercial |
|
||||
| `raw/xpost/2026-09-06_seeconvm-claude-code-graph-engineering.md` | xpost | @seeconvm: sichtbarer Teaser zum Head of Claude Code — 85 % der Engineers liefen mit Dutzenden/Hunderten Agenten; Graph Engineering statt linearer Ketten. 85-%- und Team-Output-Claims nicht unabhängig verifiziert |
|
||||
| `raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md` | xpost | @promiscfx/Cognitive f(x): Robocurve-Test von GPT-6 Astra vs. Claude Fable 5.1 auf YAM-Robotarmen — 95 % vs. 40 % Task Success, ~6× Token-Effizienz, 2,5 vs. 6,8 Minuten, $0,94 vs. $2,12 pro Lauf. ⚠️ Zahlen nur aus X-Post, nicht unabhängig verifiziert |
|
||||
| `raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md` | xpost | @promiscfx/Cognitive f(x): Robocurve-Test von GPT-6 Astra vs. Claude Fable 5.1 auf YAM-Robotarmen — 95 % vs. 40 % Task Success, ~6× Token-Effizienz, 2,5 vs. 6,8 Minuten, $0,94 vs. $2,12 pro Lauf. Zahlen später durch Robocurve-Primärreport bestätigt |
|
||||
| `raw/blog/2026-09-08_robocurve-gpt6-astra.md` | blog | Robocurve-Primärreport „GPT-6 Astra on robot arms“ (04.09.2026): gleiche YAM-Arme und Inspect-Robots-Policy; Astra 19/20 vs. Fable 5.1 8/20 beim Block-in-Schüssel-Task, beide 2/20 beim Puzzle; Astra schneller, günstiger und token-effizienter. Einzelruns mit Transcripts/Videos/RRDs veröffentlicht |
|
||||
| `raw/blog/2026-09-07_openai-an-alien-mind.md` | blog | OpenAI-Essay „An Alien Mind“ von Chief Scientist Jakub Pachocki: Reasoning-Modelle, emergente/nicht vollständig interpretierbare Intelligenz, Goal vs. Value Alignment, nachlassende CoT-Monitorierbarkeit, Cybersecurity, rekursive Selbstverbesserung, Safety Bars und internationale Koordination |
|
||||
| `raw/other/2026-09-07_plur1bus-memory-release-7122.md` | other | PLUR1BUS Memory 7.12.2 Release + Hermes 7.12.2-hermes.1 (Mr. Cy, 07.09.2026): OpenClaw — Critical Push zeigt Vorschau für Gesundheit/Finanzen, `criticalPush.hideTypes`-Option; Hermes — erstes Release seit 7.4.8.1 mit UI, signiertem macOS-Installer, Cross-Platform-Distribution, Jina Nano-v5/BGE-Verifikation (4.398 Node-Tests, 765 Python-Tests). Bernhardine + Bernd bestätigt |
|
||||
| `raw/youtube/2026-09-08_the-prompter-ai-short-film.md` | youtube | Midnight Monkeys (@MidnightMonkeysStudio): "THE PROMPTER — AI Short Film (2026) | Higgsfield Global Film Festival" (YouTube-ID _MhKwYjkWFc; OME Topic 2193, 08.09.2026, mit Zeitstempel 5:50 verlinkt). ⚠️ Metadata-only — kein Transcript; Gruppenchat-Zusammenfassung der Szene ab 5:50 bei Ingest nicht aus Session-Daten abrufbar, daher keine erfundenen Szenenfakten; Wiki: `concepts/the-prompter-ai-short-film.md` (neu) |
|
||||
|
|
|
|||
|
|
@ -1,20 +1,26 @@
|
|||
---
|
||||
created: 2026-09-08
|
||||
updated: 2026-09-08
|
||||
sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md]
|
||||
sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md, blog/2026-09-08_robocurve-gpt6-astra.md]
|
||||
tags: [institution, robotics, physical-ai, benchmarking, public-benefit-corporation]
|
||||
---
|
||||
|
||||
# Robocurve
|
||||
|
||||
[Robocurve](https://robocurve.org/) ist eine Public Benefit Corporation und unabhängiger Evaluator für **Physical AI**. Die Organisation beschreibt ihre Mission als öffentliche, neutrale Messung von Robotik-Fähigkeiten und entwickelt offene Werkzeuge wie „Inspect Robots“ für Modelle, Embodiments und Benchmarks.
|
||||
[Robocurve](https://robocurve.org/) ist eine Public Benefit Corporation und unabhängiger Evaluator für **Physical AI**. Die Organisation entwickelt offene Werkzeuge wie „Inspect Robots“ für Modelle, Embodiments und Benchmarks und veröffentlicht reproduzierbare Robotik-Evaluierungen.
|
||||
|
||||
## Relevanz für dieses Wiki
|
||||
## GPT-6-Astra-Evaluierung
|
||||
|
||||
- Ein X-Post von [@promiscfx / Cognitive f(x)](https://x.com/promiscfx/status/2097080991475257839) berichtet einen Robocurve-Vergleich von GPT-6 Astra und Claude Fable 5.1 auf YAM-Robotarmen.
|
||||
- Die konkreten Zahlen (95 % vs. 40 % Task Success, Tokens, Laufzeit und Kosten) sind im Wiki als Post-Angaben markiert, solange kein vollständiger Robocurve-Versuchsreport vorliegt.
|
||||
Die offizielle Auswertung [„GPT-6 Astra on robot arms"](https://openai.robocurve.org/gpt-6-astra/) (04.09.2026) vergleicht GPT-6 Astra mit Claude Fable 5.1 auf denselben YAM-Robotarmen und derselben Inspect-Robots-Agent-Policy:
|
||||
|
||||
- Block-in-Schüssel: Astra 19/20 (95 %), Fable 5.1 8/20 (40 %).
|
||||
- Puzzle-in-Nut: beide 2/20 (10 %).
|
||||
- Astra: 2,5 Minuten und $0,94 pro Block-Lauf; Fable 5.1: 6,8 Minuten und $2,12.
|
||||
|
||||
Die Auswertung veröffentlicht zusätzlich Einzelruns mit Scores, Zeiten, Transcripts, Videos und RRD-Dateien.
|
||||
|
||||
## Verwandte Seiten
|
||||
|
||||
- [[../concepts/agi/robotics-model-benchmark.md]] — Astra-vs.-Fable-Benchmark
|
||||
- [Offizielle Robocurve-Website](https://robocurve.org/)
|
||||
- [Offizieller Astra-Report](https://openai.robocurve.org/gpt-6-astra/)
|
||||
- [Robocurve-Website](https://robocurve.org/)
|
||||
|
|
|
|||
13
wiki/log.md
13
wiki/log.md
|
|
@ -2,6 +2,19 @@
|
|||
|
||||
*Append-only changelog. Start: 2026-06-05*
|
||||
|
||||
## 2026-09-08 — Robocurve-Primärreport: GPT-6 Astra auf Roboterarmen
|
||||
|
||||
**Type:** ingest | **Scope:** raw/blog, wiki/concepts/agi, wiki/institutions, wiki/index, wiki/log
|
||||
**Source:** [Robocurve: GPT-6 Astra on robot arms](https://openai.robocurve.org/gpt-6-astra/), veröffentlicht 04.09.2026; ergänzt den X-Post von @promiscfx.
|
||||
|
||||
**Verifikation:** Robocurve dokumentiert denselben Versuchsaufbau: gleiche YAM-Arme, gleiche Inspect-Robots-Agent-Policy und 20 Versuche pro Aufgabe. Block-in-Schüssel: Astra 19/20 (95 %) vs. Fable 5.1 8/20 (40 %), Astra 2,5 Minuten/$0,94 vs. Fable 5.1 6,8 Minuten/$2,12. Schwierigeres Puzzle: beide 2/20 (10 %); daraus folgt keine allgemeine Robotik-Dominanz.
|
||||
|
||||
- raw (NEW): `raw/blog/2026-09-08_robocurve-gpt6-astra.md` — Primärreport-Extrakt mit Versuchsaufbau und Ergebnissen.
|
||||
- wiki (UPDATED): `wiki/concepts/agi/robotics-model-benchmark.md` — Primärquelle ergänzt, X-Post-Zahlen verifiziert, Puzzle-Gleichstand und Grenzen dokumentiert.
|
||||
- wiki (UPDATED): `wiki/institutions/robocurve.md` — offizielle Astra-Auswertung ergänzt.
|
||||
- `wiki/index.md` (191. Update, Primärquelle im AGI-/Institutions-/Raw-Katalog)
|
||||
- `wiki/log.md` (dieser Eintrag)
|
||||
|
||||
## 2026-09-08 — @promiscfx: Robocurve-Benchmark GPT-6 Astra vs. Claude Fable 5.1
|
||||
|
||||
**Type:** ingest | **Scope:** raw/xpost, wiki/concepts/agi, wiki/institutions, wiki/people, wiki/index, wiki/log
|
||||
|
|
|
|||
Loading…
Add table
Reference in a new issue