--- type: blog source_url: https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html retrieved: 2026-07-07 title: "KI-Kosten reduzieren: Wie man mit Prompt-Caching messbar Token sparen kann" author: "heise online" paywall: true tags: [prompt-caching, kv-cache, token-optimization, cost-reduction, llm-inference, ollama, anthropic, transformer-architecture] --- # KI-Kosten reduzieren: Wie man mit Prompt-Caching messbar Token sparen kann > **Quelle:** heise+ Ratgeber-Artikel — [heise.de/ratgeber/...](https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html) > **Paywall:** heise+ (nur Leseprobe verfügbar) ## Artikel-Zusammenfassung Der heise-Plus-Ratgeber erklärt, wie Prompt-Caching die Kosten pro LLM-Anfrage senkt und die Antwortgeschwindigkeit erhöht. Der Mechanismus ist technisch simpel, wird aber oft übersehen oder durch ungeschickte Prompt-Strukturierung unwirksam gemacht. ### Funktionsweise Prompt-Caching speichert die internen Berechnungsergebnisse eines gleichbleibenden Prompt-Präfixes zwischen. Bei Folgeanfragen muss das Sprachmodell nur noch den neuen, abweichenden Teil verarbeiten. Die technische Grundlage ist der **KV-Cache der Transformer-Architektur**: Die einmal berechneten Key- und Value-Vektoren der Prefill-Phase werden wiederverwendet. Statt bei jeder Anfrage den gesamten Prompt neu zu berechnen, wird nur der veränderte Suffix prozessiert. ### Performance-Gewinne | Szenario | Verbesserung | |----------|-------------| | Lokal (z. B. Ollama) | Bis zu **10× schnellere** Inferenz | | Cloud (z. B. Anthropic) | Bis zu **90 % Kostenreduktion** | ### Wichtige Prompt-Struktur Entscheidend ist der Aufbau des Prompts: - **Anfang:** Stabile Inhalte — Systemanweisungen, Dokumente, Tooldefinitionen, bisheriger Gesprächsverlauf - **Ende:** Variable Daten — aktuelle Frage des Benutzers Bei korrekter Strukturierung kann der stabile Präfix gecached und nur der variable Suffix neu berechnet werden. ### Wie ein LLM Text erzeugt Ein LLM ist im Kern eine Textergänzungsmaschine. Die Eingabe (Prompt) besteht aus drei Schichten: 1. **System-Prompt** — Rollen- oder Verhaltensanweisung 2. **Kontext** — Dokumente, Tooldefinitionen, Gesprächsverlauf 3. **Aktuelle Frage** — Benutzereingabe ## Praktische Umsetzung Der Artikel beschreibt eine lokale Demo mit Ollama (ohne Paywall-Details verfügbar). Die Erkenntnisse sind auf Cloud-Anbieter wie Anthropic übertragbar. ## Relevanz für unser Setup Prompt-Caching ist für Hector besonders relevant, da es den Gegenpart zu **Model-Routing** darstellt: | Strategie | Ansatz | Hebel | |-----------|--------|-------| | **Model-Routing** | Task → günstigstes passendes Modell | Modellauswahl-Ebene | | **Prompt-Caching** | Stabile Prompt-Präfixe cachen | Token-Ebene | Beide Strategien sind komplementär und können kombiniert werden: Ein gerouteter Task (z. B. GLM 5.2 für Code-Execution) profitiert zusätzlich von einem gecachten System-Prompt-Präfix — insbesondere bei wiederholten Anfragen mit gleichem Kontext (z. B. Batch-Verarbeitung, Agenten-Loops mit stabilem System-Prompt). ## Externe Quellen - [heise online Artikel (Paywall)](https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html) - [Anthropic Prompt Caching Dokumentation](https://docs.anthropic.com/en/docs/build-with-claude/prompt-caching) - [Ollama](https://ollama.ai/)