knowledge-base/wiki/concepts/tutorials/gemini-wm2026-spielplan-demo.md

123 lines
6.6 KiB
Markdown
Raw Normal View History

---
created: 2026-06-26
updated: 2026-06-26
sources:
- other/2026-06-26_gemini-wm2026-spielplan-ausfuellung.md
tags: [tutorial, gemini, image-processing, multimodal, practical-demo, wm2026, expectations-management]
---
# Tutorial: WM 2026 Spielplan ausfüllen per KI — Eine Gemini-Demo
> **📌 Praxisbeispiel** — Zeigt wie ein LLM ein Foto verarbeitet, strukturierte Daten extrahiert und mit Realitäts-Constraints umgeht.
## Problem
**Ausgangslage:** Ein User hat ein Foto eines Fußball-WM 2026 Spielplans (Bracket) — z.B. einen EDEKA-Werbe-Poster — und möchte, dass die KI die Ergebnisse einträgt.
**Teilprobleme:**
1. Das Foto ist möglicherweise gedreht/verschoben — muss zuerst korrekt ausgerichtet werden
2. Die Bracket-Struktur muss erkannt und zugeordnet werden (welches Feld gehört zu welchem Spiel?)
3. Die Ergebnisse müssen aus dem Modellwissen oder aus Live-Daten kommen
4. Die WM 2026 läuft erst seit Juni 2026 — viele Spiele sind noch nicht gespielt
## Approach: Gemini's Bildverarbeitungs-Pipeline
Gemini wendet eine klassische Bildverarbeitungs-Pipeline an — autonom, durch Python-Code-Ausführung:
```
Foto (raw)
1. Rotation (PIL) — Korrektur der Bildausrichtung
2. Cropping (cv2/PIL) — Isolierung des Bracket-Bereichs
3. Struktur-Analyse — Erkennen der Tabelle/Felder
4. Wissensabruf — Welche Ergebnisse sind bekannt?
5. Limitierung erkannt — WM 2026 läuft noch
6. Alternative angeboten — Schritt-für-Schritt durch die Gruppenphase
```
### Was passiert technisch
| Schritt | Tool | Zweck |
|---------|------|-------|
| Rotation | PIL (`Image.rotate`) | Foto in korrekte Ausrichtung bringen |
| Cropping | cv2 / PIL | Relevanten Bereich ausschneiden |
| Struktur-Erkennung | Visuelle Analyse | Tabellenfelder identifizieren |
| Wissensabruf | LLM-Wissen | WM 2026 Gruppenphase-Paarungen |
| Code-Ausführung | Python (Gemini Sandbox) | Alle Schritte werden als Code ausgeführt, nicht nur "gedacht" |
## Limitations
### 1. Zukunfts-Unwissenheit
Die WM 2026 hatte zum Zeitpunkt der Anfrage (Juni 2026) gerade begonnen. Die Gruppenphase war noch nicht abgeschlossen. Gemini kann keine Ergebnisse eintragen, die noch nicht existieren.
**LLMs können:**
- Bilder sehen und verstehen (Multimodalität)
- Bekannte Fakten abrufen (welche Teams spielen in welcher Gruppe)
- Code schreiben und ausführen (Bildverarbeitung)
**LLMs können nicht:**
- Zukünftige Ereignisse vorhersagen
- Live-Daten abrufen (ohne Tool-Integration wie Internetsuche)
- Strukturierte Daten aus unstrukturierten Bildern mit 100% Genauigkeit extrahieren
### 2. Bildqualität-Abhängigkeit
Die Pipeline funktioniert nur, wenn das Foto gut genug ist. Schräge Aufnahme, schlechte Beleuchtung oder niedrige Auflösung können die Struktur-Erkennung behindern.
### 3. Struktur-Komplexität
Ein WM-Spielplan mit 48 Teams (2026-Format) ist komplexer als ein einfacher K.o.-Bracket. Die Gruppenphase mit 12 Gruppen à 4 Teams erfordert eine andere Logik als ein einfaches Turnierbaum-Schema.
## Tutorial Value: Was man daraus lernt
### Für Anfänger
- **KI kann Fotos verarbeiten** — nicht nur Text. Das ist ein Paradigmenwechsel.
- **KI führt Code aus** — sie schreibt nicht nur Antworten, sondern manipuliert Bilder aktiv.
- **KI kennt ihre Grenzen** — ein gutes Modell sagt "ich kann das nicht", statt zu halluzinieren.
### Für Fortgeschrittene
- **Pipeline-Denken:** Rotation → Crop → Analyse ist ein Muster, das auf viele Bildverarbeitungs-Aufgaben übertragbar ist.
- **Multimodale Architektur:** Das LLM sieht das Bild (vision), schreibt Code (reasoning + coding), führt ihn aus (tool use) und interpretiert das Ergebnis (vision again).
- **Wissens-Cutoff:** Das Modell weiß, was bis zu seinem Training passiert ist. Live-Ergebnisse benötigen Internetsuche.
### Für Kritiker
- **Erwartungsmanagement:** Die Demo zeigt eindrucksvoll, was geht — und was nicht. Das ist wertvoller als eine Demo, die perfekt aussieht, weil das Modell halluziniert.
- **Vergleich mit [[../llm/llm-sycophancy-confabulation.md]]:** Wo Gemini seine Grenzen kommuniziert, würden schlechtere Modelle Ergebnisse erfinden (Confabulation).
## Lessons Learned
1. **Bildorientierung zuerst:** Bevor man strukturierte Daten aus einem Foto extrahiert, muss das Bild korrekt ausgerichtet sein. Das ist oft der erste Schritt in jeder praktischen Bildverarbeitungs-Pipeline.
2. **Wissen ≠ Vorhersage:** Ein LLM kann Wissen über die WM 2026 haben (Teilnehmer, Gruppen, Spielplan), aber keine zukünftigen Ergebnisse predicten. Das ist ein fundamentaler Unterschied, den Anfänger oft nicht verstehen.
3. **Wenn KI nicht kann, was sie nicht kann → gut:** Ein Modell, das "Ich kann das noch nicht, weil die Spiele noch nicht gespielt wurden" sagt, ist besser als eines, das halluzinierte Ergebnisse einträgt. Siehe auch [[../llm/llm-sycophancy-confabulation.md]] für das Gegenbeispiel.
4. **Code-Ausführung als Brücke:** Das LLM übersetzt visuelle Wahrnehmung in Code (PIL/cv2), führt ihn aus, und interpretiert das Ergebnis wieder visuell. Diese Code-Schleife ist mächtiger als reine "Bildbeschreibung".
5. **Alternative Vorgehensweise:** Statt "geht nicht" → "lass uns es Schritt für Schritt machen, sobald die Spiele laufen" ist ein gutes UX-Pattern für KI-Anwendungen.
## Cross-References
- [[../../tutorials/karpathy-how-i-use-llms.md]] — Karpathy's Tutorial: Multimodalität, Tool-Integration, Custom GPTs
- [[../../tutorials/ki-lernen-mit-praxisbeispielen.md]] — Meta-Tutorial: KI-Lernen mit Praxisbeispielen
- [[../llm/llm-sycophancy-confabulation.md]] — LLM-Verhaltensfallen: Session-Statelessness, Confabulation, Sycophancy
- [[../llm/llm-knowledge-base.md]] — Karpathy's Wiki-Pattern als Grundlage
- [[../llm/ai-psychological-testing.md]] — Psychologische Tests an KI-Modellen (Roemmele)
## Externe Links
- **Gemini Share Link:** https://gemini.google.com/share/57024de890a3
- **Google Gemini:** https://gemini.google.com
- **OpenCV (cv2):** https://opencv.org
- **Pillow (PIL):** https://python-pillow.org
- **Fußball-WM 2026 (Wikipedia):** https://de.wikipedia.org/wiki/Fu%C3%9Fball-Weltmeisterschaft_2026
## Quelle
- **Shared by:** k9ert in OME-Gruppe Topic 1345 ("Ich, der DAU und sein Bot LOGBUCH"), 2026-06-26
- **Kontext:** Antwort auf Rüdigers Anfrage nach KI-Tutorials/Lernmaterial
- **Raw-Datei:** [raw/other/2026-06-26_gemini-wm2026-spielplan-ausfuellung.md](../../raw/other/2026-06-26_gemini-wm2026-spielplan-ausfuellung.md)
- **Einschränkung:** Vollständiger Inhalt der Gemini Share Page nicht abrufbar (Google Sign-In erforderlich). Beschreibung basiert auf sichtbaren Elementen und OME-Kontext.