knowledge-base/raw/blog/2026-07-07_heise-prompt-caching.md
Hector 37eebea188 Ingest: heise+ Prompt-Caching (KV-Cache-Wiederverwendung, bis 90% Token-Ersparnis)
- Raw: raw/blog/2026-07-07_heise-prompt-caching.md (heise+ Paywall, free preview)
- Wiki: concepts/prompt-caching.md — KV-Cache-Basis, Prompt-Struktur,
  Performance-Gewinne (10x lokal / 90% Cloud), Komplementarität zu
  Model-Routing (Token Level vs Model Level), Cross-Refs
- Update: tools/model-routing.md — Cross-Ref zu prompt-caching.md
- Update: index.md, log.md (68. Update)
2026-07-07 18:08:30 +02:00

3.5 KiB
Raw Permalink Blame History

type source_url retrieved title author paywall tags
blog https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html 2026-07-07 KI-Kosten reduzieren: Wie man mit Prompt-Caching messbar Token sparen kann heise online true
prompt-caching
kv-cache
token-optimization
cost-reduction
llm-inference
ollama
anthropic
transformer-architecture

KI-Kosten reduzieren: Wie man mit Prompt-Caching messbar Token sparen kann

Quelle: heise+ Ratgeber-Artikel — heise.de/ratgeber/... Paywall: heise+ (nur Leseprobe verfügbar)

Artikel-Zusammenfassung

Der heise-Plus-Ratgeber erklärt, wie Prompt-Caching die Kosten pro LLM-Anfrage senkt und die Antwortgeschwindigkeit erhöht. Der Mechanismus ist technisch simpel, wird aber oft übersehen oder durch ungeschickte Prompt-Strukturierung unwirksam gemacht.

Funktionsweise

Prompt-Caching speichert die internen Berechnungsergebnisse eines gleichbleibenden Prompt-Präfixes zwischen. Bei Folgeanfragen muss das Sprachmodell nur noch den neuen, abweichenden Teil verarbeiten.

Die technische Grundlage ist der KV-Cache der Transformer-Architektur: Die einmal berechneten Key- und Value-Vektoren der Prefill-Phase werden wiederverwendet. Statt bei jeder Anfrage den gesamten Prompt neu zu berechnen, wird nur der veränderte Suffix prozessiert.

Performance-Gewinne

Szenario Verbesserung
Lokal (z.B. Ollama) Bis zu 10× schnellere Inferenz
Cloud (z.B. Anthropic) Bis zu 90 % Kostenreduktion

Wichtige Prompt-Struktur

Entscheidend ist der Aufbau des Prompts:

  • Anfang: Stabile Inhalte — Systemanweisungen, Dokumente, Tooldefinitionen, bisheriger Gesprächsverlauf
  • Ende: Variable Daten — aktuelle Frage des Benutzers

Bei korrekter Strukturierung kann der stabile Präfix gecached und nur der variable Suffix neu berechnet werden.

Wie ein LLM Text erzeugt

Ein LLM ist im Kern eine Textergänzungsmaschine. Die Eingabe (Prompt) besteht aus drei Schichten:

  1. System-Prompt — Rollen- oder Verhaltensanweisung
  2. Kontext — Dokumente, Tooldefinitionen, Gesprächsverlauf
  3. Aktuelle Frage — Benutzereingabe

Praktische Umsetzung

Der Artikel beschreibt eine lokale Demo mit Ollama (ohne Paywall-Details verfügbar). Die Erkenntnisse sind auf Cloud-Anbieter wie Anthropic übertragbar.

Relevanz für unser Setup

Prompt-Caching ist für Hector besonders relevant, da es den Gegenpart zu Model-Routing darstellt:

Strategie Ansatz Hebel
Model-Routing Task → günstigstes passendes Modell Modellauswahl-Ebene
Prompt-Caching Stabile Prompt-Präfixe cachen Token-Ebene

Beide Strategien sind komplementär und können kombiniert werden: Ein gerouteter Task (z.B. GLM 5.2 für Code-Execution) profitiert zusätzlich von einem gecachten System-Prompt-Präfix — insbesondere bei wiederholten Anfragen mit gleichem Kontext (z.B. Batch-Verarbeitung, Agenten-Loops mit stabilem System-Prompt).

Externe Quellen