ingest(xpost): openrouter-cad-solidworks-benchmark (Pit, Topic 13)

This commit is contained in:
Hector 2026-08-22 20:06:48 +02:00
parent d367a825ea
commit a6fcd318f9
4 changed files with 84 additions and 1 deletions

View file

@ -0,0 +1,32 @@
---
type: xpost
source_url: https://x.com/jack67396128/status/2091213439586988320
retrieved: 2026-08-22
author: "@jack67396128"
is_thread: false
---
# OpenRouter CAD/SOLIDWORKS-Benchmark: Open-Weighting-Modelle im Langzeit-Test
Der Autor hat in den letzten zwei Tagen ~150 US-Dollar bei OpenRouter ausgegeben, um aktuelle Open-Weighting-Modelle zu testen: **Kimi K3, MiniMax M3, QWEN 3.8 MAX, QWEN 3.8 27B** sowie **DeepSeek V4 Flash Vision Exp**.
## Testaufbau
Die Modelle mussten eine echte, mehrstufige Langzeitaufgabe bewältigen:
1. Maschinenbauzeichnung lesen, Maße und geometrische Strukturen interpretieren
2. Modellierungsreihenfolge planen und SOLIDWORKS bedienen
3. Befehlsfehler beheben, Features korrigieren
4. Rekonstruktion abschließen, Ergebnisse überprüfen
5. Öffenbare SLDPRT-Datei ausgeben
## Ergebnisse
- Die meisten Modelle bewältigten einen Teil des Prozesses, aber bei **Stabilität bei langwierigen Aufgaben**, **Tool-Einsatz** und **endgültiger geometrischer Genauigkeit** waren die Unterschiede deutlich.
- **QWEN 3.8 Max** und **QWEN 3.8 27B** beeindruckten am meisten: stabil bei Tool-Bedienung, Aufgaben-Konvergenz und Ergebnis-Vollständigkeit. QWEN 3.8 27B durchläuft den gesamten Modellierungsprozess auch bei Denkstufe „xhigh" reibungslos.
- **DeepSeek V4 Flash Vision Exp** überraschte: Selbst bei Rechenintensität „low" erfüllt es ~95 % der Modellierungsanforderungen (vom Verständnis der Ansichten über die Auslegung der Maße bis zur CLI-Ausgabemodell-Bearbeitung) — für nur ~0,53 US-Dollar.
## Einordnung
- 95 % ist noch nicht Produktionsreife: die letzten Maße, Features und topologischen Details brauchen noch eine geometrische Abnahme.
- Die Tatsache, dass eine Mischung aus visuellem Verständnis, langfristiger Planung und Werkzeugbedienung für unter 1 US-Dollar machbar ist, zeigt das Potenzial offener, gewichteter multimodaler Modelle für technische Modellierung und CAD-Automatisierung.

View file

@ -0,0 +1,42 @@
---
created: 2026-08-22
updated: 2026-08-22
sources: [xpost/2026-08-22_jack-openrouter-cad-solidworks-benchmark.md]
tags: [llm, cad, multimodal, benchmark, open-weights]
---
# OpenRouter CAD/SOLIDWORKS-Benchmark (2026-08)
Ein Praxis-Benchmark (OpenRouter, ~150 US-Dollar Budget), bei dem aktuelle Open-Weighting-Modelle eine echte mehrstufige CAD-Aufgabe in SOLIDWORKS bewältigen mussten. Zeigt das Potenzial multimodaler LLMs für technische Modellierung und CAD-Automatisierung.
## Getestete Modelle
- **Kimi K3** (siehe [[kimi-k3.md]])
- **MiniMax M3**
- **QWEN 3.8 MAX**
- **QWEN 3.8 27B** (siehe [[qwen3.8-27b-alibaba.md]])
- **DeepSeek V4 Flash Vision Exp**
## Aufgabenprofil (Langzeitaufgabe)
1. Maschinenbauzeichnung lesen, Maße und geometrische Strukturen interpretieren
2. Modellierungsreihenfolge planen und SOLIDWORKS bedienen
3. Befehlsfehler beheben, Features korrigieren
4. Rekonstruktion abschließen, Ergebnisse überprüfen
5. Öffenbare SLDPRT-Datei ausgeben
## Ergebnisse
- **Meiste Modelle:** bewältigten Teile des Prozesses; große Unterschiede bei **Stabilität bei langwierigen Aufgaben**, **Tool-Einsatz** und **endgültiger geometrischer Genauigkeit**.
- **QWEN 3.8 Max + QWEN 3.8 27B:** stabilste Tool-Bedienung, Aufgaben-Konvergenz, Ergebnis-Vollständigkeit. QWEN 3.8 27B durchläuft den gesamten Prozess auch bei Denkstufe „xhigh" reibungslos.
- **DeepSeek V4 Flash Vision Exp:** Überraschung — bei Rechenintensität „low" ~95 % der Modellierungsanforderungen erfüllt (Ansichten-Verständnis, Maß-Auslegung, CLI-Ausgabemodell-Bearbeitung) für nur ~0,53 US-Dollar.
## Einordnung
- 95 % ≠ Produktionsreife: finale Maße, Features und topologische Details brauchen noch geometrische Abnahme.
- Eine Mischung aus visuellem Verständnis + langfristiger Planung + Werkzeugbedienung für **unter 1 US-Dollar** zeigt das Potenzial offener, gewichteter multimodaler Modelle für CAD-Automatisierung.
## Relevanz
- Beispiel für die Commoditisierung von multimodalen Agenten-Fähigkeiten zu vernachlässigbaren Kosten (vgl. [[ai-intelligence-commoditization-thesis.md]], [[open-weights-economics.md]], [[chinese-model-cost-routing.md]]).
- CAD/Tool-Automatisierung als realer Langzeit-Agenten-Anwendungsfall jenseits von Coding-Benchmarks (vgl. [[real-world-coding-showdown.md]]).

View file

@ -2,7 +2,9 @@
*Auto-generated: 2026-07-07*
*Letzte Aktualisierung: 2026-08-21 (121. Update — Mark Klinge: „Wie die Hüter des Geldes auf ganzer Linie versagen“ (The Sovereign Loop, 2026-08-19). Volltext per Web-Fetch ausgelesen (URL: `markklinge.substack.com`; Artikel signiert „The Sovereign Loop“). Raw: `raw/blog/2026-08-21_mark-klinge-huter-des-geldes.md`. Wiki-Updates: `people/mark-klinge.md` (neu), `concepts/finance/sovereign-loop-bitcoin-powerlaw.md` (Update 21.08.: Volltext — Black Wednesday 1992, SNB-Mindestkurs 1.20 CHF/EUR, Japan/Yen-Carry-Trade, Österreichische Schule/Mises/Hayek, Bitcoin-Boden-These ~60k, Halving-Zyklus 2028), Cross-Refs in `concepts/finance/sovereign-loop-antithese.md`, `concepts/finance/gold-zinsdruck-kapitalstruktur.md`, `concepts/finance/schuldenkrise-anleihenmarkt.md` (US-Debt ~40 Bio. Kontext). Identitäts-Hinweis: Artikel signiert „The Sovereign Loop“; bisherige Zuordnung im Wiki: Rüdiger Stelariz/@thesovereignloop (offene Identitätsfrage). Geteilt von Netbits (@NetLightning) in OME Topic „News & Infos“)*
*Letzte Aktualisierung: 2026-08-22 (122. Update — OpenRouter CAD/SOLIDWORKS-Benchmark (@jack67396128, 2026-08-22). Raw: `raw/xpost/2026-08-22_jack-openrouter-cad-solidworks-benchmark.md`. Wiki-Update: `concepts/llm/openrouter-cad-solidworks-benchmark.md` (neu), Cross-Refs auf `qwen3.8-27b-alibaba.md`, `kimi-k3.md`, `ai-intelligence-commoditization-thesis.md`, `open-weights-economics.md`, `chinese-model-cost-routing.md`. Geteilt von Pit (@PWeber) in OME Topic "News & Infos". Praxis-Benchmark: Open-Weighting-Modelle (Kimi K3, MiniMax M3, QWEN 3.8 Max/27B, DeepSeek V4 Flash Vision Exp) auf mehrstufige SOLIDWORKS-CAD-Aufgabe; DeepSeek V4 Flash Vision Exp ~95 % für ~0,53 $.)*
*Vorheriges Update: 2026-08-21 (121. Update — Mark Klinge: „Wie die Hüter des Geldes auf ganzer Linie versagen“ (The Sovereign Loop, 2026-08-19). Volltext per Web-Fetch ausgelesen (URL: `markklinge.substack.com`; Artikel signiert „The Sovereign Loop“). Raw: `raw/blog/2026-08-21_mark-klinge-huter-des-geldes.md`. Wiki-Updates: `people/mark-klinge.md` (neu), `concepts/finance/sovereign-loop-bitcoin-powerlaw.md` (Update 21.08.: Volltext — Black Wednesday 1992, SNB-Mindestkurs 1.20 CHF/EUR, Japan/Yen-Carry-Trade, Österreichische Schule/Mises/Hayek, Bitcoin-Boden-These ~60k, Halving-Zyklus 2028), Cross-Refs in `concepts/finance/sovereign-loop-antithese.md`, `concepts/finance/gold-zinsdruck-kapitalstruktur.md`, `concepts/finance/schuldenkrise-anleihenmarkt.md` (US-Debt ~40 Bio. Kontext). Identitäts-Hinweis: Artikel signiert „The Sovereign Loop“; bisherige Zuordnung im Wiki: Rüdiger Stelariz/@thesovereignloop (offene Identitätsfrage). Geteilt von Netbits (@NetLightning) in OME Topic „News & Infos“)*
*Vorheriges Update: 2026-08-21 (120. Update — Hermes "Tour"-Feature: interaktive Schritt-für-Schritt-Walkthroughs auf Live-Websites (@HermesWatcher, 2026-08-21). Raw: `raw/xpost/2026-08-21_hermeswatcher-interactive-website-tours.md`. Wiki-Update: `tools/hermes-desktop.md` (neuer Abschnitt "Interaktive Website-Touren"). Hermes generiert im In-App-Browser interaktive Schritt-für-Schritt-Touren direkt auf jeder Live-Website (Beispiel: 7-Schritte-Tour auf CoinMarketCap) — lehrt Navigation statt nur auszuführen. Feature gebaut von @imbabybrooklyn. Geteilt von Kai (@PWeber) in OME Topic "Hermès Agents".)*

View file

@ -2,6 +2,13 @@
*Append-only changelog. Start: 2026-06-05*
## 2026-08-22 — OpenRouter CAD/SOLIDWORKS-Benchmark (@jack67396128)
**Type:** ingest | **Scope:** raw/xpost (1 new), wiki/concepts/llm (1 new), wiki/index, wiki/log
**Source:** X-Post von @jack67396128, 2026-08-22. URL: https://x.com/jack67396128/status/2091213439586988320. Geteilt von Pit (@PWeber) in OME Topic "News & Infos" (#11899).
**Inhalt:** Praxis-Benchmark (~150 $ OpenRouter-Budget) der Open-Weighting-Modelle Kimi K3, MiniMax M3, QWEN 3.8 Max, QWEN 3.8 27B und DeepSeek V4 Flash Vision Exp auf eine mehrstufige SOLIDWORKS-CAD-Aufgabe (Zeichnung lesen → Modellierungsreihenfolge planen → Tool bedienen → Features korrigieren → SLDPRT ausgeben).
**Ergebnis:** QWEN 3.8 Max/27B stabilste Tool-Bedienung + Konvergenz; DeepSeek V4 Flash Vision Exp ~95 % der Anforderungen bei Rechenintensität "low" für nur ~0,53 $.
**Wiki-Update:** `concepts/llm/openrouter-cad-solidworks-benchmark.md` (neu). Cross-Refs auf `qwen3.8-27b-alibaba.md`, `kimi-k3.md`, `ai-intelligence-commoditization-thesis.md`, `open-weights-economics.md`, `chinese-model-cost-routing.md`, `real-world-coding-showdown.md`.
## 2026-08-21 — Mark Klinge: „Wie die Hüter des Geldes auf ganzer Linie versagen“ (The Sovereign Loop, Volltext)
**Type:** ingest | **Scope:** raw/blog (1 new), wiki/people (1 new), wiki/concepts/finance (1 updated, 3 cross-ref), wiki/index, wiki/log