knowledge-base/wiki/concepts/prompt-caching.md
Hector 37eebea188 Ingest: heise+ Prompt-Caching (KV-Cache-Wiederverwendung, bis 90% Token-Ersparnis)
- Raw: raw/blog/2026-07-07_heise-prompt-caching.md (heise+ Paywall, free preview)
- Wiki: concepts/prompt-caching.md — KV-Cache-Basis, Prompt-Struktur,
  Performance-Gewinne (10x lokal / 90% Cloud), Komplementarität zu
  Model-Routing (Token Level vs Model Level), Cross-Refs
- Update: tools/model-routing.md — Cross-Ref zu prompt-caching.md
- Update: index.md, log.md (68. Update)
2026-07-07 18:08:30 +02:00

4.2 KiB
Raw Permalink Blame History

created updated sources tags
2026-07-07 2026-07-07
blog/2026-07-07_heise-prompt-caching.md
concept
prompt-caching
kv-cache
transformer-architecture
token-optimization
cost-reduction
llm-inference
prompt-engineering
cache

Prompt-Caching — KV-Cache-Wiederverwendung zur Token- und Kostenreduktion

Stand: 2026-07-07. Quelle: heise+ Ratgeber-Artikel. Siehe raw: [[../../raw/blog/2026-07-07_heise-prompt-caching.md]]

Grundprinzip

Prompt-Caching speichert die internen Berechnungsergebnisse eines gleichbleibenden Prompt-Präfixes zwischen. Bei Folgeanfragen muss das LLM nur noch den abweichenden Suffix verarbeiten. Das senkt sowohl Latenz als auch Token-Kosten.

Technische Grundlage: KV-Cache

Die Basis ist der KV-Cache der Transformer-Architektur:

  • Während der Prefill-Phase berechnet der Transformer für jedes Token Key- und Value-Vektoren (Self-Attention)
  • Diese Vektoren werden im KV-Cache gespeichert
  • Bei der nächsten Anfrage mit identischem Präfix werden die gecachten Vektoren wiederverwendet, statt neu berechnet
  • Nur die neuen Tokens des Suffix durchlaufen die volle Prefill-Berechnung

Prompt-Struktur ist entscheidend

Damit Prompt-Caching wirkt, muss der Prompt korrekt strukturiert sein:

Position Inhalt Cache-Verhalten
Anfang (Präfix) Systemanweisungen, Dokumente, Tooldefinitionen, Gesprächsverlauf Wird gecached
Ende (Suffix) Aktuelle Benutzerfrage, variable Parameter 🔄 Neu berechnet

Ein falscher Aufbau (z.B. variable Daten am Anfang) macht das Caching unwirksam.

Performance-Gewinne

Szenario Verbesserung
Lokal (Ollama, LM Studio) Bis zu 10× schnellere Inferenz
Cloud (Anthropic, OpenAI) Bis zu 90 % Kostenreduktion

Was ist kein Prompt-Caching?

Prompt-Caching ist nicht:

  • Context-Window-Effizienz (das Reduzieren der Prompt-Länge durch bessere Formulierung)
  • Model-Routing (Auswahl des günstigsten Modells für einen Task)
  • Semantisches Caching (ähnliche Queries erkennen und gecachte Antworten ausliefern)
  • Batch-Processing (mehrere Prompts parallel verarbeiten)

Verbindung zu bestehendem Wiki

Komplementär zu Model-Routing

Prompt-Caching und Model-Routing sind komplementäre Kostenspar-Strategien auf verschiedenen Ebenen:

Strategie Wiki-Seite Ebene Hebel
Model-Routing [[../tools/model-routing.md]] Modellauswahl Task → günstigstes passendes Modell
Prompt-Caching (diese Seite) Token-Berechnung Stabile Präfixe cachen → weniger Rechenaufwand

Kombination: Ein über Model-Routing an GLM 5.2 gerouteter Code-Execution-Task profitiert zusätzlich von einem gecachten System-Prompt-Präfix. Besonders wirksam bei:

  • Batch-Verarbeitung (gleicher System-Prompt, viele Varianten)
  • Agenten-Loops (stabiler Instructions-Präfix, variierende Queries)
  • RAG-Pipelines (Kontext-Dokumente am Anfang, Query am Ende)

KV-Cache in der Transformer-Architektur

Siehe auch [[../architecture/transformer-foundation.md]] für die klassische Transformer-Architektur, auf der der KV-Cache basiert.

Kostenspar-Patterns im OpenClaw-Stack

  • [[../tools/model-routing.md]] — Routing-Patterns für 90% Kosteneinsparung
  • [[../concepts/llm/chinese-model-cost-routing.md]] — DeRonin's 87% Cost-Cut-Playbook
  • [[../concepts/llm/glm-5.2-zai-coding-model.md]] — GLM 5.2 als günstige Execution-Ebene
  • [[../architecture/model-routing.md]] — OpenClaw's Two-Model-Pipeline

Cloud-Anbieter mit Prompt-Caching

  • Anthropic ClaudeDokumentiertes Prompt Caching, Cache-Read-Tokens werden günstiger abgerechnet
  • OpenAI — Automatisches Caching langer Kontexte
  • Google Gemini — Kontext-Caching über API

Lokale Implementierung

Mit Ollama lässt sich Prompt-Caching lokal nachvollziehen:

  • Ollama cacht KV-Cache automatisch bei wiederholten Prefixes
  • Der Geschwindigkeitsgewinn (bis 10×) ist direkt messbar
  • Erkenntnisse sind auf Cloud-Anbieter übertragbar