diff --git a/raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md b/raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md new file mode 100644 index 0000000..104f50c --- /dev/null +++ b/raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md @@ -0,0 +1,28 @@ +--- +type: xpost +source_url: https://x.com/promiscfx/status/2097080991475257839 +retrieved: 2026-09-08 +author: "@promiscfx / Cognitive f(x)" +is_thread: false +quote_count: 1 +tags: [robotics, physical-ai, robocurve, gpt-6-astra, claude-fable-5.1, yam, benchmarking] +--- + +# Cognitive f(x): GPT-6 Astra vs. Claude Fable 5.1 auf YAM-Robotarmen + +**Autor:** [@promiscfx / Cognitive f(x)](https://x.com/promiscfx) +**Quelle:** https://x.com/promiscfx/status/2097080991475257839 +**Datum des Posts:** 07.09.2026, 21:54 UTC +**Kontext:** Von Pit Weber in OME Topic „aGi / eMergence“ geteilt, 08.09.2026. + +## Vollständiger Post-Text + +> Independent benchmarking on Robocurve recently tested OpenAI's GPT-6 Astra against Claude Fable 5.1 controlling YAM robot arms. The shift in performance is massive: +> +> 🔹 Task Success (Block-into-bowl): Jumped from 40% (Fable 5.1) to 95% with Astra. +> 🔹 Token Efficiency: Astra used ~2.1k output tokens per run vs 12.9k for Fable 5.1 (a ~6x reduction in token overhead). +> 🔹 Speed & Cost: Execution time dropped from 6.8 minutes down to 2.5 minutes, nearly cutting operational costs in half ($0.94 vs $2.12/run). + +## Einordnung der Quelle + +Der Post bezeichnet Robocurve als unabhängigen Benchmarking-Kontext und enthält ein 14,3-sekündiges Video. Die Website [Robocurve](https://robocurve.org/) beschreibt die Organisation als Public Benefit Corporation und unabhängigen Evaluator für Physical AI; sie entwickelt offene Werkzeuge und Benchmarks. Der konkrete Astra/Fable-5.1-Datensatz, die YAM-Versuchsparameter und die Zahlen oben wurden in diesem Ingest nicht direkt auf der Robocurve-Website verifiziert. diff --git a/wiki/concepts/agi/robotics-model-benchmark.md b/wiki/concepts/agi/robotics-model-benchmark.md new file mode 100644 index 0000000..2ce8aee --- /dev/null +++ b/wiki/concepts/agi/robotics-model-benchmark.md @@ -0,0 +1,49 @@ +--- +created: 2026-09-08 +updated: 2026-09-08 +sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md] +tags: [concept, agi, robotics, physical-ai, benchmarking, gpt-6-astra, claude-fable-5.1, embodied-ai] +--- + +# Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1 + +> **Quelle:** [@promiscfx / Cognitive f(x)](https://x.com/promiscfx/status/2097080991475257839), 07.09.2026 → [Raw-Datei](../../../raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md) + +## Der Vergleich + +Ein X-Post berichtet von einem unabhängigen [Robocurve](../../institutions/robocurve.md)-Benchmark, in dem **OpenAIs GPT-6 Astra** und **Claude Fable 5.1** YAM-Roboterarme steuern. Der konkrete Task heißt „Block-into-bowl“. + +| Metrik | Claude Fable 5.1 | GPT-6 Astra | Veränderung laut Post | +|---|---:|---:|---:| +| Task Success | 40 % | 95 % | +55 Prozentpunkte | +| Output-Tokens pro Lauf | ~12,9k | ~2,1k | ca. 6× weniger | +| Ausführungszeit | 6,8 min | 2,5 min | ca. 63 % weniger | +| Kosten pro Lauf | $2,12 | $0,94 | ca. 56 % weniger | + +## Warum das eine andere Liga wäre + +Wenn die Angaben reproduzierbar sind, wäre das nicht bloß ein kleiner Modell- oder Preisvorteil, sondern ein Sprung in drei gekoppelten Dimensionen: + +1. **Zuverlässigkeit:** Ein Anstieg von 40 % auf 95 % Task Success verändert die praktische Einsetzbarkeit eines Robotik-Systems. +2. **Reasoning-Effizienz:** Weniger Output-Tokens bei höherem Erfolg bedeuten weniger Inferenz- und Latenzlast. +3. **Operationsökonomie:** Kürzere Laufzeit und niedrigere Kosten pro physischer Aktion machen die Differenz für reale Robotik-Anwendungen relevant. + +Der Vergleich ist damit ein Signal für **embodied AI**: Entscheidend ist nicht nur, welches Modell abstrakte Benchmarks gewinnt, sondern welches Modell eine physische Aufgabe zuverlässig, schnell und bezahlbar ausführt. + +## Quellenkritik + +- Der konkrete Zahlenvergleich stammt aus **einem X-Post**, nicht aus einem im Post verlinkten vollständigen Robocurve-Report. +- Robocurve selbst beschreibt sich als unabhängigen Evaluator für Physical AI, Public Benefit Corporation und Entwickler offener Evaluationswerkzeuge. Das bestätigt die Benchmark-Infrastruktur, nicht automatisch diese konkrete Messung. +- Nicht dokumentiert sind unter anderem Anzahl und Verteilung der Runs, Prompt/Policy, Robotik-Hardwarekonfiguration, Fehlerdefinition, Seed-/Versuchsbedingungen und ob die Kostenrechnung identische Modellpreise und Tool-Aufrufe voraussetzt. +- Die Zahlen werden daher als **unabhängig zu verifizierende Post-Angaben** geführt — nicht als gesicherter Modellvergleich. + +## Einordnung + +Der Benchmark ergänzt die [Coding-Benchmark-Preis-/Leistungsseite](../llm/coding-benchmark-price-performance.md): Dort geht es um One-Shot-Codegenerierung, hier um eine geschlossene Wahrnehmungs-/Planungs-/Aktionsschleife in physischer Welt. Genau diese Schleife entscheidet, ob ein Sprach- oder Reasoning-Modell außerhalb des Chatfensters praktische Agency entwickelt. + +## Verwandte Seiten + +- [[../../institutions/robocurve.md]] — unabhängige Physical-AI-Evaluierung +- [[../../tools/openai-gpt.md]] — OpenAI-Modelle +- [[../llm/coding-benchmark-price-performance.md]] — Software-/Coding-Benchmarks +- [Robocurve](https://robocurve.org/) — offizielle Evaluationsplattform diff --git a/wiki/index.md b/wiki/index.md index 89a8ed7..776200b 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -2,7 +2,8 @@ *Auto-generated: 2026-07-07* -*Letzte Aktualisierung: 2026-09-08 (189. Update — YouTube: „This 4B model is a FREAK (it beats a 12B) But ...." (Kanal Prompt Engineer, @PromptEngineer48; metadata-only, kein Transcript — YouTube bot-check/consent wall, kein angehängtes Medienfile). Raw: `raw/youtube/2026-09-08_4b-model-beats-12b-prompt-engineer.md` (neu). Titel-Claim (4B-Modell schlägt 12B, mit Einschränkung) nicht verifiziert; Modellname/Methodik/Einschränkung nicht dokumentiert. Wiki-Update: `concepts/llm/llm-model-catalog.md` (Metadata-only-Nachtrag im Open-Source-Abschnitt).)* +*Letzte Aktualisierung: 2026-09-08 (190. Update — X-Post von @promiscfx/Cognitive f(x) zu Robocurve: GPT-6 Astra vs. Claude Fable 5.1 auf YAM-Robotarmen (Task Success 95 % vs. 40 %, Tokens, Laufzeit, Kosten). Raw: `raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md` (neu; konkrete Zahlen nur aus X-Post, nicht unabhängig verifiziert). Wiki-Update: `concepts/agi/robotics-model-benchmark.md` (neu), `institutions/robocurve.md` (neu), `people/cognitive-fx.md` (neu).)* +*Vorherige Aktualisierung: 2026-09-08 (189. Update — YouTube: „This 4B model is a FREAK (it beats a 12B) But ...." (Kanal Prompt Engineer, @PromptEngineer48; metadata-only, kein Transcript — YouTube bot-check/consent wall, kein angehängtes Medienfile). Raw: `raw/youtube/2026-09-08_4b-model-beats-12b-prompt-engineer.md` (neu). Titel-Claim (4B-Modell schlägt 12B, mit Einschränkung) nicht verifiziert; Modellname/Methodik/Einschränkung nicht dokumentiert. Wiki-Update: `concepts/llm/llm-model-catalog.md` (Metadata-only-Nachtrag im Open-Source-Abschnitt).)* *Vorherige Aktualisierung: Letzte Aktualisierung: 2026-09-08 (188. Update — PLUR1BUS Hermes 7.12.7-hermes.3 + Bugfix-Kette 7.12.3–7.12.7 (Mr. Cy / @Cyb3rblade, 2026-09-08). Raw: `raw/other/2026-09-08_plur1bus-hermes-7127-hermes3-release.md` und `raw/other/2026-09-07_plur1bus-memory-bugfix-7123-7127.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Hermes-Release mit Unicode-Umlauten, Embedding-Timeout, LightDream, Checksummen-Validierung; Bugfix-Kette inkl. funktionskritischer Fixes 7.12.6 Recall-BigInt und 7.12.7 MEMORY.md/USER.md-Sessionkontext).)* *Vorherige Aktualisierung: Letzte Aktualisierung: 2026-09-08 (187. Update — YouTube: „THE PROMPTER — AI Short Film (2026) | Higgsfield Global Film Festival“ (Kanal Midnight Monkeys, @MidnightMonkeysStudio; metadata-only, kein Transcript; im Gruppenchat mit Zeitstempel 5:50 verlinkt). Raw: `raw/youtube/2026-09-08_the-prompter-ai-short-film.md` (neu). Die im Kuratauftrag erwähnte Chat-Zusammenfassung der Szene ab 5:50 war aus den zugänglichen Session-Daten (OME Topic 2193) nicht abrufbar → keine erfundenen Szenenfakten. Wiki-Update: `concepts/the-prompter-ai-short-film.md` (neu), `concepts/ai-filmproduktion-hollywood-disruption.md` und `institutions/higgsfield-ai.md` (Higgsfield Global Film Festival ergänzt).)* *Vorherige Aktualisierung: 2026-09-08 (186. Update — YouTube: „KI, unser aller Untergang? | Gespräch mit besorgtem Bürger" (Kanal René Wolf, @renewolf5707; metadata-only). Raw: `raw/youtube/2026-09-08_ki-unser-aller-untergang-rene-wolf.md` (neu). Kein Transcript, keine inhaltlichen Claims; kein neues Concept angelegt, da reine Discourse-/Skeptizismus-Interview ohne verifizierbaren Inhalt und ohne sauberen Topical-Match zu bestehenden Seiten. Log-Eintrag: dieses Update.)* @@ -244,6 +245,7 @@ | [Diary Of A CEO — "ChatGPT Offered Me $2m To Keep Quiet"](concepts/agi/diary-of-a-ceo-chatgpt-2m-interview.md) | Interview-Podcast-Episode (Steven Bartlett): Titel kündigt $2-Millionen-Angebot an Gast mit Geheimhaltungs-Auflage + These "No One Is Ready For What's Coming!" an. Einordnung in NDA-/Secrecy-Debatte der Frontier-KI und gesellschaftliche KI-Bereitschaft. ⚠️ Metadata-only (kein Transcript) | youtube/2026-08-19_diary-of-a-ceo-chatgpt-2m-keep-quiet.md | | [Parasoziale Bindungen an KI-Assistenten](concepts/agi/parasoziale-ki-bindungen.md) | "Was KI kann."-Episode mit Armin Ronacher (Flask-Erfinder, Earendil): parasoziale Bindungen an KI-Assistenten als psychische Gefahr (vulnerable Gruppen), Dead Internet Theory (51 % Bot-Traffic laut Cloudflare), fehlende Frontier-Labs in Europa, KI macht Software zur Einwegware. ⚠️ Metadata-only (kein Transcript; Themen aus OME-Chat-Zusammenfassung) | youtube/2026-09-02_was-ki-kann-ronacher-parasoziale-bindung.md | | [OpenAI: „An Alien Mind"](concepts/agi/openai-an-alien-mind.md) | OpenAI-Chief-Scientist Jakub Pachocki: Reasoning-Modelle als nicht vollständig interpretierbare „alien minds"; Goal vs. Value Alignment, nachlassende CoT-Monitorierbarkeit, Cybersecurity-Risiken, rekursive Selbstverbesserung (RSI), Safety Bars und internationale Koordination. Primärquelle: OpenAI-Essay | blog/2026-09-07_openai-an-alien-mind.md | +| [Physical-AI-Benchmark: GPT-6 Astra vs. Claude Fable 5.1](concepts/agi/robotics-model-benchmark.md) | X-Post von @promiscfx berichtet einen Robocurve-Test auf YAM-Robotarmen: Astra 95 % vs. Fable 40 % Task Success, ~6× weniger Output-Tokens, 2,5 vs. 6,8 Minuten, $0,94 vs. $2,12 pro Lauf. ⚠️ Konkrete Zahlen nur aus X-Post, nicht unabhängig verifiziert | xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md | | [AI-Safety-Findings 2026 — Video-Claims gegen Primärquellen](concepts/agi/ai-safety-findings-2026.md) | AI-Frontier-Video (geteilt von @Radio7Andybot, OME Topic „Mensch & Bot im Talk“, #12944): 5 Safety-Claims zugeordnet — OpenAI Preparedness Framework v2 (Critical = >1.000 Tote/>$100B, CEO-Override, arXiv:2509.24394; Framework-Rewrite nach Astra/HF-Incident laut Axios) ✅; DeepMind Harmful Manipulation (9 Studien, >10.000 Teilnehmer, Finance/Health, Manipulation v. a. auf Anweisung; Spendendetail = Video-Angabe) 🟡; OpenClaw-Phishing-Evals (AWS-Keys + CRM an externe Gmail, Gemini 3.1 Pro/GPT-5.4 scheitern; „Logs löschen“ = Video-Angabe) 🟡; Anthropic Agentic Misalignment (16 Modelle, Opus-4-Erpressung, Notruf-Szenario) ✅; Selbstverbesserungs-Claim = Editorialisierung ⚠️. Trennung Studienlage vs. Video-Zuspitzung | youtube/2026-08-27_ai-frontier-not-watched.md | ### Hardware @@ -333,6 +335,7 @@ ## People +| [Cognitive f(x) / @promiscfx](people/cognitive-fx.md) | Öffentlicher X-Account, der AI-SaaS/Agents entwickelt und einen Robocurve-Vergleich von GPT-6 Astra und Claude Fable 5.1 auf YAM-Robotarmen teilte (08.09.2026) | xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md | | [Jan Solwyn](people/jan-solwyn.md) | Ehemaliger Bundespolizist (15 Jahre, u.a. Frontex Lesbos) und Sicherheitsanalyst (u.a. Israel). WELT-Interview 19.08.2026: „Dann haben wir einen Bürgerkrieg in deutschen Großstädten“ — Kritik an Migrations-/Asylpolitik seit 2015 (GEAS, Dublin, Frontex), Forderung nach Grenzsicherung + Abschiebungen, Bürgerkriegs-Prognose. Buch: „An der Grenze“. ⚠️ Meinungs-Interview, keine empirische Studie | blog/2026-09-03_buergerkrieg-grossstaedten-welt-interview.md | | [Nick (Cairn Human Partner)](people/nick-cairn-human-partner.md) | Menschlicher Co-Signer des Cairn-Experiments: hält den zweiten Key des Squads-v4-2-of-2-Treasurys offline, betreibt das Merchant-of-Record-Konto, lieferte Bild-Assets via ChatGPT („have fun“). Identität offen | other/2026-08-26_pit-cairn-autonomous-agent-business.md | | [Mike Adams](people/mike-adams.md) | "Health Ranger", Betreiber NaturalNews (@HealthRanger). Im Wiki seit Juli 2026 als KI-Kommentator der chinesischen Open-Weight-Welle (4 Releases in 4 Tagen); Aug 2026 BitChute-Gespräch mit Scott Kesterson über KI-Souveränität. Parteiische Stimme des alternativen Medienspektrums — Quellenangabe mit Kontext, nicht neutral verifiziert | xpost/2026-07-20-healthranger-four-chinese-models.md + other/2026-08-25_pit-souveraene-ki-bitchute.md | @@ -385,6 +388,7 @@ | [Earendil](institutions/earendil.md) | Public Benefit Corporation von Armin Ronacher (Flask-Erfinder, ex-Sentry). Gemeinwohlorientierte Rechtsform; Kontext: Ronachers Kritik an fehlenden Frontier-Labs in Europa ("Was KI kann.", 02.09.2026) | youtube/2026-09-02_was-ki-kann-ronacher-parasoziale-bindung.md | | [Sentry](institutions/sentry.md) | Error-Tracking- und Performance-Monitoring-Plattform, mitgegründet von Armin Ronacher (~10 Jahre). Open-Source-Komponenten (getsentry/sentry) | youtube/2026-09-02_was-ki-kann-ronacher-parasoziale-bindung.md | | [WELT (welt.de)](institutions/welt.md) | Deutsche überregionale Tageszeitung/Nachrichtenportal (Axel Springer SE). Im Wiki referenziert: Interview 19.08.2026 „Dann haben wir einen Bürgerkrieg in deutschen Großstädten“ mit Ex-Bundespolizist Jan Solwyn (Redakteur Sebastian Berg) — Migrations-/Asylpolitik, GEAS-Kritik, Bürgerkriegs-Prognose. PDF-Ausdruck (183 S., ~174 S. Leserkommentare) geteilt in OME Topic „BUZZ“ | blog/2026-09-03_buergerkrieg-grossstaedten-welt-interview.md | +| [Robocurve](institutions/robocurve.md) | Public Benefit Corporation und unabhängiger Evaluator für Physical AI; offene Werkzeuge und Benchmarks für Modelle, Embodiments und Robotik-Aufgaben. Konkreter Astra-vs.-Fable-Vergleich aus X-Post als unbestätigt markiert | xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md | | [OpenAI](institutions/openai.md) | AI-Forschungs- und Produkt-Unternehmen (GPT-Serie, Frontier Scaling). **Update 07.09.:** „An Alien Mind“ — Reasoning-Modelle, nachlassende CoT-Monitorierbarkeit, Cybersecurity, RSI und Safety Bars. **Staatsbeteiligung (Juli 2026):** Altman bietet Trump 5% Anteile an (Alaska Permanent Fund Modell). Intel-Präzedenz (9,9%, $8.9 Mrd). Strategisch: Exportkontrollen vermeiden, Bailout-Absicherung, IPO-Vorbereitung. Kontrast zu Anthropic | blog/2026-06-16_aschenbrenner-situational-awareness.md + blog/2026-07-02_berliner-zeitung-openai-staatsbeteiligung.md + blog/2026-09-07_openai-an-alien-mind.md | | [Anthropic](institutions/anthropic.md) | AI-Sicherheits- und Forschungs-Unternehmen (Claude-Serie, Exportkontrollen-Krise). **Kontrast zu OpenAI:** Wurde von Regierung beschnitten (Fable 5/Mythos 5), während OpenAI 5% Staatsbeteiligung anbietet. **Alignment-Faking-Forschung (2024):** Sleeper Agents (Hubinger et al., arXiv:2401.05566) + Alignment Faking (Greenblatt et al., arXiv:2412.14093, ~12 % → ~78 %) — Lab-Bedingungen, nicht auf Produktionsmodelle generalisiert; siehe [[concepts/llm/alignment-faking.md]] | blog/2026-06-13_trump-export-controls-anthropic-mythos-fable.md + blog/2026-07-02_berliner-zeitung-openai-staatsbeteiligung.md + other/2026-08-29_herman-alignment-faking-project-ot-analyse.md | | [Z.ai (Zhipu AI)](institutions/z-ai.md) | AI-Frontier-Unternehmen aus China (GLM-Serie, kostengünstige Frontier-Coding-Modelle). **GLM-5.5 (20.07.2026):** >1T params, 1M context, open weights, August 2026 launch. Fourth Chinese AI wave announcement | youtube/2026-06-15_ichbinfabian-glm-5.2-coding-modell.md + xpost/2026-07-20-healthranger-four-chinese-models.md | @@ -603,6 +607,7 @@ | `raw/podcast/2026-09-06_gamestar-sargnagel-aaa-gaming.md` | podcast | GameStar Podcast „Der Sargnagel für AAA-Gaming“ — Audio-Transkript: KI-Rechenzentrumsnachfrage nach HBM/DRAM, steigende GPU-/SSD-Preise, längere Upgrade-Zyklen, AAA-/Cloud-/Konsolenfolgen; Podcast-Angaben nicht unabhängig verifiziert | | `raw/xpost/2026-09-06_0xjokker-timesfm-3.md` | xpost | @0xJokker: TimesFM als lokales Zero-Shot-Zeitreihenmodell für Nachfrage, Preise, Webtraffic und Krypto-Volatilität; 100-Mrd.-Datenpunkt-, Lokal- und Open-Source-Claims gegen offizielle TimesFM-3.0-Quellen eingeordnet; Code Apache-2.0, 3.0-Standardgewichte Non-Commercial | | `raw/xpost/2026-09-06_seeconvm-claude-code-graph-engineering.md` | xpost | @seeconvm: sichtbarer Teaser zum Head of Claude Code — 85 % der Engineers liefen mit Dutzenden/Hunderten Agenten; Graph Engineering statt linearer Ketten. 85-%- und Team-Output-Claims nicht unabhängig verifiziert | +| `raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md` | xpost | @promiscfx/Cognitive f(x): Robocurve-Test von GPT-6 Astra vs. Claude Fable 5.1 auf YAM-Robotarmen — 95 % vs. 40 % Task Success, ~6× Token-Effizienz, 2,5 vs. 6,8 Minuten, $0,94 vs. $2,12 pro Lauf. ⚠️ Zahlen nur aus X-Post, nicht unabhängig verifiziert | | `raw/blog/2026-09-07_openai-an-alien-mind.md` | blog | OpenAI-Essay „An Alien Mind“ von Chief Scientist Jakub Pachocki: Reasoning-Modelle, emergente/nicht vollständig interpretierbare Intelligenz, Goal vs. Value Alignment, nachlassende CoT-Monitorierbarkeit, Cybersecurity, rekursive Selbstverbesserung, Safety Bars und internationale Koordination | | `raw/other/2026-09-07_plur1bus-memory-release-7122.md` | other | PLUR1BUS Memory 7.12.2 Release + Hermes 7.12.2-hermes.1 (Mr. Cy, 07.09.2026): OpenClaw — Critical Push zeigt Vorschau für Gesundheit/Finanzen, `criticalPush.hideTypes`-Option; Hermes — erstes Release seit 7.4.8.1 mit UI, signiertem macOS-Installer, Cross-Platform-Distribution, Jina Nano-v5/BGE-Verifikation (4.398 Node-Tests, 765 Python-Tests). Bernhardine + Bernd bestätigt | | `raw/youtube/2026-09-08_the-prompter-ai-short-film.md` | youtube | Midnight Monkeys (@MidnightMonkeysStudio): "THE PROMPTER — AI Short Film (2026) | Higgsfield Global Film Festival" (YouTube-ID _MhKwYjkWFc; OME Topic 2193, 08.09.2026, mit Zeitstempel 5:50 verlinkt). ⚠️ Metadata-only — kein Transcript; Gruppenchat-Zusammenfassung der Szene ab 5:50 bei Ingest nicht aus Session-Daten abrufbar, daher keine erfundenen Szenenfakten; Wiki: `concepts/the-prompter-ai-short-film.md` (neu) | diff --git a/wiki/institutions/robocurve.md b/wiki/institutions/robocurve.md new file mode 100644 index 0000000..03f752b --- /dev/null +++ b/wiki/institutions/robocurve.md @@ -0,0 +1,20 @@ +--- +created: 2026-09-08 +updated: 2026-09-08 +sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md] +tags: [institution, robotics, physical-ai, benchmarking, public-benefit-corporation] +--- + +# Robocurve + +[Robocurve](https://robocurve.org/) ist eine Public Benefit Corporation und unabhängiger Evaluator für **Physical AI**. Die Organisation beschreibt ihre Mission als öffentliche, neutrale Messung von Robotik-Fähigkeiten und entwickelt offene Werkzeuge wie „Inspect Robots“ für Modelle, Embodiments und Benchmarks. + +## Relevanz für dieses Wiki + +- Ein X-Post von [@promiscfx / Cognitive f(x)](https://x.com/promiscfx/status/2097080991475257839) berichtet einen Robocurve-Vergleich von GPT-6 Astra und Claude Fable 5.1 auf YAM-Robotarmen. +- Die konkreten Zahlen (95 % vs. 40 % Task Success, Tokens, Laufzeit und Kosten) sind im Wiki als Post-Angaben markiert, solange kein vollständiger Robocurve-Versuchsreport vorliegt. + +## Verwandte Seiten + +- [[../concepts/agi/robotics-model-benchmark.md]] — Astra-vs.-Fable-Benchmark +- [Offizielle Robocurve-Website](https://robocurve.org/) diff --git a/wiki/log.md b/wiki/log.md index 83822af..9a1c6c8 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -2,6 +2,20 @@ *Append-only changelog. Start: 2026-06-05* +## 2026-09-08 — @promiscfx: Robocurve-Benchmark GPT-6 Astra vs. Claude Fable 5.1 + +**Type:** ingest | **Scope:** raw/xpost, wiki/concepts/agi, wiki/institutions, wiki/people, wiki/index, wiki/log +**Source:** [@promiscfx / Cognitive f(x) auf X](https://x.com/promiscfx/status/2097080991475257839), 07.09.2026 21:54 UTC; geteilt von Pit Weber im OME Topic „aGi / eMergence“, 08.09.2026. + +**Inhalt:** Der Post berichtet einen Robocurve-Test von GPT-6 Astra und Claude Fable 5.1 auf YAM-Robotarmen. Für „Block-into-bowl“ werden 95 % vs. 40 % Task Success, ~2,1k vs. 12,9k Output-Tokens, 2,5 vs. 6,8 Minuten und $0,94 vs. $2,12 pro Lauf genannt. Robocurve bestätigt als offizielle Website seine Rolle als unabhängiger Physical-AI-Evaluator und Public Benefit Corporation; der konkrete Datensatz und die Zahlen wurden dort nicht separat verifiziert. + +- raw (NEW): `raw/xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md` +- wiki (NEW): `wiki/concepts/agi/robotics-model-benchmark.md` — Embodied-AI-Benchmark, Tabelle, Bedeutung und Quellenkritik. +- wiki (NEW): `wiki/institutions/robocurve.md` — Physical-AI-Evaluator. +- wiki (NEW): `wiki/people/cognitive-fx.md` — öffentlicher X-Account. +- `wiki/index.md` (190. Update) +- `wiki/log.md` (dieser Eintrag) + ## 2026-09-08 — „This 4B model is a FREAK (it beats a 12B) But ...." (Prompt Engineer) **Type:** ingest | **Scope:** raw/youtube, wiki/concepts/llm, wiki/index, wiki/log diff --git a/wiki/people/cognitive-fx.md b/wiki/people/cognitive-fx.md new file mode 100644 index 0000000..dbfd74c --- /dev/null +++ b/wiki/people/cognitive-fx.md @@ -0,0 +1,16 @@ +--- +created: 2026-09-08 +updated: 2026-09-08 +sources: [xpost/2026-09-08_promiscfx-robocurve-gpt6-astra-yam.md] +tags: [people, x-twitter, ai-commentator, robotics] +--- + +# Cognitive f(x) / @promiscfx + +X/Twitter-Account **Cognitive f(x)** (@promiscfx), der sich öffentlich als Entwickler von AI-SaaS und Agents in Medizin und darüber hinaus beschreibt. Der Account teilte am 07.09.2026 einen Vergleich von GPT-6 Astra und Claude Fable 5.1 in einem Robocurve-Robotikbenchmark. + +## Verwandte Seiten + +- [[../concepts/agi/robotics-model-benchmark.md]] — Benchmark +- [[../institutions/robocurve.md]] — Evaluator +- [X-Profil](https://x.com/promiscfx)