- Raw: raw/blog/2026-07-07_heise-prompt-caching.md (heise+ Paywall, free preview) - Wiki: concepts/prompt-caching.md — KV-Cache-Basis, Prompt-Struktur, Performance-Gewinne (10x lokal / 90% Cloud), Komplementarität zu Model-Routing (Token Level vs Model Level), Cross-Refs - Update: tools/model-routing.md — Cross-Ref zu prompt-caching.md - Update: index.md, log.md (68. Update)
4.2 KiB
| created | updated | sources | tags | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-07-07 | 2026-07-07 |
|
|
Prompt-Caching — KV-Cache-Wiederverwendung zur Token- und Kostenreduktion
Stand: 2026-07-07. Quelle: heise+ Ratgeber-Artikel. Siehe raw:
[[../../raw/blog/2026-07-07_heise-prompt-caching.md]]
Grundprinzip
Prompt-Caching speichert die internen Berechnungsergebnisse eines gleichbleibenden Prompt-Präfixes zwischen. Bei Folgeanfragen muss das LLM nur noch den abweichenden Suffix verarbeiten. Das senkt sowohl Latenz als auch Token-Kosten.
Technische Grundlage: KV-Cache
Die Basis ist der KV-Cache der Transformer-Architektur:
- Während der Prefill-Phase berechnet der Transformer für jedes Token Key- und Value-Vektoren (Self-Attention)
- Diese Vektoren werden im KV-Cache gespeichert
- Bei der nächsten Anfrage mit identischem Präfix werden die gecachten Vektoren wiederverwendet, statt neu berechnet
- Nur die neuen Tokens des Suffix durchlaufen die volle Prefill-Berechnung
Prompt-Struktur ist entscheidend
Damit Prompt-Caching wirkt, muss der Prompt korrekt strukturiert sein:
| Position | Inhalt | Cache-Verhalten |
|---|---|---|
| Anfang (Präfix) | Systemanweisungen, Dokumente, Tooldefinitionen, Gesprächsverlauf | ✅ Wird gecached |
| Ende (Suffix) | Aktuelle Benutzerfrage, variable Parameter | 🔄 Neu berechnet |
Ein falscher Aufbau (z. B. variable Daten am Anfang) macht das Caching unwirksam.
Performance-Gewinne
| Szenario | Verbesserung |
|---|---|
| Lokal (Ollama, LM Studio) | Bis zu 10× schnellere Inferenz |
| Cloud (Anthropic, OpenAI) | Bis zu 90 % Kostenreduktion |
Was ist kein Prompt-Caching?
Prompt-Caching ist nicht:
- Context-Window-Effizienz (das Reduzieren der Prompt-Länge durch bessere Formulierung)
- Model-Routing (Auswahl des günstigsten Modells für einen Task)
- Semantisches Caching (ähnliche Queries erkennen und gecachte Antworten ausliefern)
- Batch-Processing (mehrere Prompts parallel verarbeiten)
Verbindung zu bestehendem Wiki
Komplementär zu Model-Routing
Prompt-Caching und Model-Routing sind komplementäre Kostenspar-Strategien auf verschiedenen Ebenen:
| Strategie | Wiki-Seite | Ebene | Hebel |
|---|---|---|---|
| Model-Routing | [[../tools/model-routing.md]] |
Modellauswahl | Task → günstigstes passendes Modell |
| Prompt-Caching | (diese Seite) | Token-Berechnung | Stabile Präfixe cachen → weniger Rechenaufwand |
Kombination: Ein über Model-Routing an GLM 5.2 gerouteter Code-Execution-Task profitiert zusätzlich von einem gecachten System-Prompt-Präfix. Besonders wirksam bei:
- Batch-Verarbeitung (gleicher System-Prompt, viele Varianten)
- Agenten-Loops (stabiler Instructions-Präfix, variierende Queries)
- RAG-Pipelines (Kontext-Dokumente am Anfang, Query am Ende)
KV-Cache in der Transformer-Architektur
Siehe auch [[../architecture/transformer-foundation.md]] für die klassische Transformer-Architektur, auf der der KV-Cache basiert.
Kostenspar-Patterns im OpenClaw-Stack
[[../tools/model-routing.md]]— Routing-Patterns für 90% Kosteneinsparung[[../concepts/llm/chinese-model-cost-routing.md]]— DeRonin's 87% Cost-Cut-Playbook[[../concepts/llm/glm-5.2-zai-coding-model.md]]— GLM 5.2 als günstige Execution-Ebene[[../architecture/model-routing.md]]— OpenClaw's Two-Model-Pipeline
Cloud-Anbieter mit Prompt-Caching
- Anthropic Claude — Dokumentiertes Prompt Caching, Cache-Read-Tokens werden günstiger abgerechnet
- OpenAI — Automatisches Caching langer Kontexte
- Google Gemini — Kontext-Caching über API
Lokale Implementierung
Mit Ollama lässt sich Prompt-Caching lokal nachvollziehen:
- Ollama cacht KV-Cache automatisch bei wiederholten Prefixes
- Der Geschwindigkeitsgewinn (bis 10×) ist direkt messbar
- Erkenntnisse sind auf Cloud-Anbieter übertragbar