knowledge-base/wiki/concepts/prompt-caching.md
Hector 37eebea188 Ingest: heise+ Prompt-Caching (KV-Cache-Wiederverwendung, bis 90% Token-Ersparnis)
- Raw: raw/blog/2026-07-07_heise-prompt-caching.md (heise+ Paywall, free preview)
- Wiki: concepts/prompt-caching.md — KV-Cache-Basis, Prompt-Struktur,
  Performance-Gewinne (10x lokal / 90% Cloud), Komplementarität zu
  Model-Routing (Token Level vs Model Level), Cross-Refs
- Update: tools/model-routing.md — Cross-Ref zu prompt-caching.md
- Update: index.md, log.md (68. Update)
2026-07-07 18:08:30 +02:00

90 lines
No EOL
4.2 KiB
Markdown
Raw Permalink Blame History

This file contains invisible Unicode characters

This file contains invisible Unicode characters that are indistinguishable to humans but may be processed differently by a computer. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-07-07
updated: 2026-07-07
sources:
- blog/2026-07-07_heise-prompt-caching.md
tags: [concept, prompt-caching, kv-cache, transformer-architecture, token-optimization, cost-reduction, llm-inference, prompt-engineering, cache]
---
# Prompt-Caching — KV-Cache-Wiederverwendung zur Token- und Kostenreduktion
> **Stand:** 2026-07-07. Quelle: heise+ Ratgeber-Artikel. Siehe raw: `[[../../raw/blog/2026-07-07_heise-prompt-caching.md]]`
## Grundprinzip
Prompt-Caching speichert die internen Berechnungsergebnisse eines gleichbleibenden Prompt-Präfixes zwischen. Bei Folgeanfragen muss das LLM nur noch den abweichenden Suffix verarbeiten. Das senkt sowohl Latenz als auch Token-Kosten.
## Technische Grundlage: KV-Cache
Die Basis ist der **KV-Cache der Transformer-Architektur**:
- Während der **Prefill-Phase** berechnet der Transformer für jedes Token Key- und Value-Vektoren (Self-Attention)
- Diese Vektoren werden im **KV-Cache** gespeichert
- Bei der nächsten Anfrage mit identischem Präfix werden die gecachten Vektoren **wiederverwendet**, statt neu berechnet
- Nur die neuen Tokens des Suffix durchlaufen die volle Prefill-Berechnung
### Prompt-Struktur ist entscheidend
Damit Prompt-Caching wirkt, muss der Prompt korrekt strukturiert sein:
| Position | Inhalt | Cache-Verhalten |
|----------|--------|----------------|
| **Anfang** (Präfix) | Systemanweisungen, Dokumente, Tooldefinitionen, Gesprächsverlauf | ✅ Wird gecached |
| **Ende** (Suffix) | Aktuelle Benutzerfrage, variable Parameter | 🔄 Neu berechnet |
Ein falscher Aufbau (z.B. variable Daten am Anfang) macht das Caching unwirksam.
## Performance-Gewinne
| Szenario | Verbesserung |
|----------|-------------|
| **Lokal** (Ollama, LM Studio) | Bis zu **10× schnellere** Inferenz |
| **Cloud** (Anthropic, OpenAI) | Bis zu **90 % Kostenreduktion** |
## Was ist kein Prompt-Caching?
Prompt-Caching ist **nicht**:
- **Context-Window-Effizienz** (das Reduzieren der Prompt-Länge durch bessere Formulierung)
- **Model-Routing** (Auswahl des günstigsten Modells für einen Task)
- **Semantisches Caching** (ähnliche Queries erkennen und gecachte Antworten ausliefern)
- **Batch-Processing** (mehrere Prompts parallel verarbeiten)
## Verbindung zu bestehendem Wiki
### Komplementär zu Model-Routing
Prompt-Caching und Model-Routing sind **komplementäre Kostenspar-Strategien** auf verschiedenen Ebenen:
| Strategie | Wiki-Seite | Ebene | Hebel |
|-----------|-----------|-------|-------|
| **Model-Routing** | `[[../tools/model-routing.md]]` | Modellauswahl | Task → günstigstes passendes Modell |
| **Prompt-Caching** | (diese Seite) | Token-Berechnung | Stabile Präfixe cachen → weniger Rechenaufwand |
**Kombination:** Ein über Model-Routing an GLM 5.2 gerouteter Code-Execution-Task profitiert zusätzlich von einem gecachten System-Prompt-Präfix. Besonders wirksam bei:
- **Batch-Verarbeitung** (gleicher System-Prompt, viele Varianten)
- **Agenten-Loops** (stabiler Instructions-Präfix, variierende Queries)
- **RAG-Pipelines** (Kontext-Dokumente am Anfang, Query am Ende)
### KV-Cache in der Transformer-Architektur
Siehe auch `[[../architecture/transformer-foundation.md]]` für die klassische Transformer-Architektur, auf der der KV-Cache basiert.
### Kostenspar-Patterns im OpenClaw-Stack
- `[[../tools/model-routing.md]]` — Routing-Patterns für 90% Kosteneinsparung
- `[[../concepts/llm/chinese-model-cost-routing.md]]` — DeRonin's 87% Cost-Cut-Playbook
- `[[../concepts/llm/glm-5.2-zai-coding-model.md]]` — GLM 5.2 als günstige Execution-Ebene
- `[[../architecture/model-routing.md]]` — OpenClaw's Two-Model-Pipeline
## Cloud-Anbieter mit Prompt-Caching
- **Anthropic Claude** — [Dokumentiertes Prompt Caching](https://docs.anthropic.com/en/docs/build-with-claude/prompt-caching), Cache-Read-Tokens werden günstiger abgerechnet
- **OpenAI** — Automatisches Caching langer Kontexte
- **Google Gemini** — Kontext-Caching über API
## Lokale Implementierung
Mit **Ollama** lässt sich Prompt-Caching lokal nachvollziehen:
- Ollama cacht KV-Cache automatisch bei wiederholten Prefixes
- Der Geschwindigkeitsgewinn (bis 10×) ist direkt messbar
- Erkenntnisse sind auf Cloud-Anbieter übertragbar