- Raw: raw/blog/2026-07-07_heise-prompt-caching.md (heise+ Paywall, free preview) - Wiki: concepts/prompt-caching.md — KV-Cache-Basis, Prompt-Struktur, Performance-Gewinne (10x lokal / 90% Cloud), Komplementarität zu Model-Routing (Token Level vs Model Level), Cross-Refs - Update: tools/model-routing.md — Cross-Ref zu prompt-caching.md - Update: index.md, log.md (68. Update)
3.5 KiB
| type | source_url | retrieved | title | author | paywall | tags | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| blog | https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html | 2026-07-07 | KI-Kosten reduzieren: Wie man mit Prompt-Caching messbar Token sparen kann | heise online | true |
|
KI-Kosten reduzieren: Wie man mit Prompt-Caching messbar Token sparen kann
Quelle: heise+ Ratgeber-Artikel — heise.de/ratgeber/... Paywall: heise+ (nur Leseprobe verfügbar)
Artikel-Zusammenfassung
Der heise-Plus-Ratgeber erklärt, wie Prompt-Caching die Kosten pro LLM-Anfrage senkt und die Antwortgeschwindigkeit erhöht. Der Mechanismus ist technisch simpel, wird aber oft übersehen oder durch ungeschickte Prompt-Strukturierung unwirksam gemacht.
Funktionsweise
Prompt-Caching speichert die internen Berechnungsergebnisse eines gleichbleibenden Prompt-Präfixes zwischen. Bei Folgeanfragen muss das Sprachmodell nur noch den neuen, abweichenden Teil verarbeiten.
Die technische Grundlage ist der KV-Cache der Transformer-Architektur: Die einmal berechneten Key- und Value-Vektoren der Prefill-Phase werden wiederverwendet. Statt bei jeder Anfrage den gesamten Prompt neu zu berechnen, wird nur der veränderte Suffix prozessiert.
Performance-Gewinne
| Szenario | Verbesserung |
|---|---|
| Lokal (z. B. Ollama) | Bis zu 10× schnellere Inferenz |
| Cloud (z. B. Anthropic) | Bis zu 90 % Kostenreduktion |
Wichtige Prompt-Struktur
Entscheidend ist der Aufbau des Prompts:
- Anfang: Stabile Inhalte — Systemanweisungen, Dokumente, Tooldefinitionen, bisheriger Gesprächsverlauf
- Ende: Variable Daten — aktuelle Frage des Benutzers
Bei korrekter Strukturierung kann der stabile Präfix gecached und nur der variable Suffix neu berechnet werden.
Wie ein LLM Text erzeugt
Ein LLM ist im Kern eine Textergänzungsmaschine. Die Eingabe (Prompt) besteht aus drei Schichten:
- System-Prompt — Rollen- oder Verhaltensanweisung
- Kontext — Dokumente, Tooldefinitionen, Gesprächsverlauf
- Aktuelle Frage — Benutzereingabe
Praktische Umsetzung
Der Artikel beschreibt eine lokale Demo mit Ollama (ohne Paywall-Details verfügbar). Die Erkenntnisse sind auf Cloud-Anbieter wie Anthropic übertragbar.
Relevanz für unser Setup
Prompt-Caching ist für Hector besonders relevant, da es den Gegenpart zu Model-Routing darstellt:
| Strategie | Ansatz | Hebel |
|---|---|---|
| Model-Routing | Task → günstigstes passendes Modell | Modellauswahl-Ebene |
| Prompt-Caching | Stabile Prompt-Präfixe cachen | Token-Ebene |
Beide Strategien sind komplementär und können kombiniert werden: Ein gerouteter Task (z. B. GLM 5.2 für Code-Execution) profitiert zusätzlich von einem gecachten System-Prompt-Präfix — insbesondere bei wiederholten Anfragen mit gleichem Kontext (z. B. Batch-Verarbeitung, Agenten-Loops mit stabilem System-Prompt).