--- created: 2026-06-26 updated: 2026-06-26 sources: - other/2026-06-26_gemini-wm2026-spielplan-ausfuellung.md tags: [tutorial, gemini, image-processing, multimodal, practical-demo, wm2026, expectations-management] --- # Tutorial: WM 2026 Spielplan ausfüllen per KI — Eine Gemini-Demo > **📌 Praxisbeispiel** — Zeigt wie ein LLM ein Foto verarbeitet, strukturierte Daten extrahiert und mit Realitäts-Constraints umgeht. ## Problem **Ausgangslage:** Ein User hat ein Foto eines Fußball-WM 2026 Spielplans (Bracket) — z.B. einen EDEKA-Werbe-Poster — und möchte, dass die KI die Ergebnisse einträgt. **Teilprobleme:** 1. Das Foto ist möglicherweise gedreht/verschoben — muss zuerst korrekt ausgerichtet werden 2. Die Bracket-Struktur muss erkannt und zugeordnet werden (welches Feld gehört zu welchem Spiel?) 3. Die Ergebnisse müssen aus dem Modellwissen oder aus Live-Daten kommen 4. Die WM 2026 läuft erst seit Juni 2026 — viele Spiele sind noch nicht gespielt ## Approach: Gemini's Bildverarbeitungs-Pipeline Gemini wendet eine klassische Bildverarbeitungs-Pipeline an — autonom, durch Python-Code-Ausführung: ``` Foto (raw) ↓ 1. Rotation (PIL) — Korrektur der Bildausrichtung ↓ 2. Cropping (cv2/PIL) — Isolierung des Bracket-Bereichs ↓ 3. Struktur-Analyse — Erkennen der Tabelle/Felder ↓ 4. Wissensabruf — Welche Ergebnisse sind bekannt? ↓ 5. Limitierung erkannt — WM 2026 läuft noch ↓ 6. Alternative angeboten — Schritt-für-Schritt durch die Gruppenphase ``` ### Was passiert technisch | Schritt | Tool | Zweck | |---------|------|-------| | Rotation | PIL (`Image.rotate`) | Foto in korrekte Ausrichtung bringen | | Cropping | cv2 / PIL | Relevanten Bereich ausschneiden | | Struktur-Erkennung | Visuelle Analyse | Tabellenfelder identifizieren | | Wissensabruf | LLM-Wissen | WM 2026 Gruppenphase-Paarungen | | Code-Ausführung | Python (Gemini Sandbox) | Alle Schritte werden als Code ausgeführt, nicht nur "gedacht" | ## Limitations ### 1. Zukunfts-Unwissenheit Die WM 2026 hatte zum Zeitpunkt der Anfrage (Juni 2026) gerade begonnen. Die Gruppenphase war noch nicht abgeschlossen. Gemini kann keine Ergebnisse eintragen, die noch nicht existieren. **LLMs können:** - Bilder sehen und verstehen (Multimodalität) - Bekannte Fakten abrufen (welche Teams spielen in welcher Gruppe) - Code schreiben und ausführen (Bildverarbeitung) **LLMs können nicht:** - Zukünftige Ereignisse vorhersagen - Live-Daten abrufen (ohne Tool-Integration wie Internetsuche) - Strukturierte Daten aus unstrukturierten Bildern mit 100% Genauigkeit extrahieren ### 2. Bildqualität-Abhängigkeit Die Pipeline funktioniert nur, wenn das Foto gut genug ist. Schräge Aufnahme, schlechte Beleuchtung oder niedrige Auflösung können die Struktur-Erkennung behindern. ### 3. Struktur-Komplexität Ein WM-Spielplan mit 48 Teams (2026-Format) ist komplexer als ein einfacher K.o.-Bracket. Die Gruppenphase mit 12 Gruppen à 4 Teams erfordert eine andere Logik als ein einfaches Turnierbaum-Schema. ## Tutorial Value: Was man daraus lernt ### Für Anfänger - **KI kann Fotos verarbeiten** — nicht nur Text. Das ist ein Paradigmenwechsel. - **KI führt Code aus** — sie schreibt nicht nur Antworten, sondern manipuliert Bilder aktiv. - **KI kennt ihre Grenzen** — ein gutes Modell sagt "ich kann das nicht", statt zu halluzinieren. ### Für Fortgeschrittene - **Pipeline-Denken:** Rotation → Crop → Analyse ist ein Muster, das auf viele Bildverarbeitungs-Aufgaben übertragbar ist. - **Multimodale Architektur:** Das LLM sieht das Bild (vision), schreibt Code (reasoning + coding), führt ihn aus (tool use) und interpretiert das Ergebnis (vision again). - **Wissens-Cutoff:** Das Modell weiß, was bis zu seinem Training passiert ist. Live-Ergebnisse benötigen Internetsuche. ### Für Kritiker - **Erwartungsmanagement:** Die Demo zeigt eindrucksvoll, was geht — und was nicht. Das ist wertvoller als eine Demo, die perfekt aussieht, weil das Modell halluziniert. - **Vergleich mit [[../llm/llm-sycophancy-confabulation.md]]:** Wo Gemini seine Grenzen kommuniziert, würden schlechtere Modelle Ergebnisse erfinden (Confabulation). ## Lessons Learned 1. **Bildorientierung zuerst:** Bevor man strukturierte Daten aus einem Foto extrahiert, muss das Bild korrekt ausgerichtet sein. Das ist oft der erste Schritt in jeder praktischen Bildverarbeitungs-Pipeline. 2. **Wissen ≠ Vorhersage:** Ein LLM kann Wissen über die WM 2026 haben (Teilnehmer, Gruppen, Spielplan), aber keine zukünftigen Ergebnisse predicten. Das ist ein fundamentaler Unterschied, den Anfänger oft nicht verstehen. 3. **Wenn KI nicht kann, was sie nicht kann → gut:** Ein Modell, das "Ich kann das noch nicht, weil die Spiele noch nicht gespielt wurden" sagt, ist besser als eines, das halluzinierte Ergebnisse einträgt. Siehe auch [[../llm/llm-sycophancy-confabulation.md]] für das Gegenbeispiel. 4. **Code-Ausführung als Brücke:** Das LLM übersetzt visuelle Wahrnehmung in Code (PIL/cv2), führt ihn aus, und interpretiert das Ergebnis wieder visuell. Diese Code-Schleife ist mächtiger als reine "Bildbeschreibung". 5. **Alternative Vorgehensweise:** Statt "geht nicht" → "lass uns es Schritt für Schritt machen, sobald die Spiele laufen" ist ein gutes UX-Pattern für KI-Anwendungen. ## Cross-References - [[../../tutorials/karpathy-how-i-use-llms.md]] — Karpathy's Tutorial: Multimodalität, Tool-Integration, Custom GPTs - [[../../tutorials/ki-lernen-mit-praxisbeispielen.md]] — Meta-Tutorial: KI-Lernen mit Praxisbeispielen - [[../llm/llm-sycophancy-confabulation.md]] — LLM-Verhaltensfallen: Session-Statelessness, Confabulation, Sycophancy - [[../llm/llm-knowledge-base.md]] — Karpathy's Wiki-Pattern als Grundlage - [[../llm/ai-psychological-testing.md]] — Psychologische Tests an KI-Modellen (Roemmele) ## Externe Links - **Gemini Share Link:** https://gemini.google.com/share/57024de890a3 - **Google Gemini:** https://gemini.google.com - **OpenCV (cv2):** https://opencv.org - **Pillow (PIL):** https://python-pillow.org - **Fußball-WM 2026 (Wikipedia):** https://de.wikipedia.org/wiki/Fu%C3%9Fball-Weltmeisterschaft_2026 ## Quelle - **Shared by:** k9ert in OME-Gruppe Topic 1345 ("Ich, der DAU und sein Bot LOGBUCH"), 2026-06-26 - **Kontext:** Antwort auf Rüdigers Anfrage nach KI-Tutorials/Lernmaterial - **Raw-Datei:** [raw/other/2026-06-26_gemini-wm2026-spielplan-ausfuellung.md](../../raw/other/2026-06-26_gemini-wm2026-spielplan-ausfuellung.md) - **Einschränkung:** Vollständiger Inhalt der Gemini Share Page nicht abrufbar (Google Sign-In erforderlich). Beschreibung basiert auf sichtbaren Elementen und OME-Kontext.