knowledge-base/raw/blog/2026-07-07_heise-prompt-caching.md
Hector 37eebea188 Ingest: heise+ Prompt-Caching (KV-Cache-Wiederverwendung, bis 90% Token-Ersparnis)
- Raw: raw/blog/2026-07-07_heise-prompt-caching.md (heise+ Paywall, free preview)
- Wiki: concepts/prompt-caching.md — KV-Cache-Basis, Prompt-Struktur,
  Performance-Gewinne (10x lokal / 90% Cloud), Komplementarität zu
  Model-Routing (Token Level vs Model Level), Cross-Refs
- Update: tools/model-routing.md — Cross-Ref zu prompt-caching.md
- Update: index.md, log.md (68. Update)
2026-07-07 18:08:30 +02:00

68 lines
No EOL
3.5 KiB
Markdown
Raw Permalink Blame History

This file contains invisible Unicode characters

This file contains invisible Unicode characters that are indistinguishable to humans but may be processed differently by a computer. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
type: blog
source_url: https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html
retrieved: 2026-07-07
title: "KI-Kosten reduzieren: Wie man mit Prompt-Caching messbar Token sparen kann"
author: "heise online"
paywall: true
tags: [prompt-caching, kv-cache, token-optimization, cost-reduction, llm-inference, ollama, anthropic, transformer-architecture]
---
# KI-Kosten reduzieren: Wie man mit Prompt-Caching messbar Token sparen kann
> **Quelle:** heise+ Ratgeber-Artikel — [heise.de/ratgeber/...](https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html)
> **Paywall:** heise+ (nur Leseprobe verfügbar)
## Artikel-Zusammenfassung
Der heise-Plus-Ratgeber erklärt, wie Prompt-Caching die Kosten pro LLM-Anfrage senkt und die Antwortgeschwindigkeit erhöht. Der Mechanismus ist technisch simpel, wird aber oft übersehen oder durch ungeschickte Prompt-Strukturierung unwirksam gemacht.
### Funktionsweise
Prompt-Caching speichert die internen Berechnungsergebnisse eines gleichbleibenden Prompt-Präfixes zwischen. Bei Folgeanfragen muss das Sprachmodell nur noch den neuen, abweichenden Teil verarbeiten.
Die technische Grundlage ist der **KV-Cache der Transformer-Architektur**: Die einmal berechneten Key- und Value-Vektoren der Prefill-Phase werden wiederverwendet. Statt bei jeder Anfrage den gesamten Prompt neu zu berechnen, wird nur der veränderte Suffix prozessiert.
### Performance-Gewinne
| Szenario | Verbesserung |
|----------|-------------|
| Lokal (z.B. Ollama) | Bis zu **10× schnellere** Inferenz |
| Cloud (z.B. Anthropic) | Bis zu **90 % Kostenreduktion** |
### Wichtige Prompt-Struktur
Entscheidend ist der Aufbau des Prompts:
- **Anfang:** Stabile Inhalte — Systemanweisungen, Dokumente, Tooldefinitionen, bisheriger Gesprächsverlauf
- **Ende:** Variable Daten — aktuelle Frage des Benutzers
Bei korrekter Strukturierung kann der stabile Präfix gecached und nur der variable Suffix neu berechnet werden.
### Wie ein LLM Text erzeugt
Ein LLM ist im Kern eine Textergänzungsmaschine. Die Eingabe (Prompt) besteht aus drei Schichten:
1. **System-Prompt** — Rollen- oder Verhaltensanweisung
2. **Kontext** — Dokumente, Tooldefinitionen, Gesprächsverlauf
3. **Aktuelle Frage** — Benutzereingabe
## Praktische Umsetzung
Der Artikel beschreibt eine lokale Demo mit Ollama (ohne Paywall-Details verfügbar). Die Erkenntnisse sind auf Cloud-Anbieter wie Anthropic übertragbar.
## Relevanz für unser Setup
Prompt-Caching ist für Hector besonders relevant, da es den Gegenpart zu **Model-Routing** darstellt:
| Strategie | Ansatz | Hebel |
|-----------|--------|-------|
| **Model-Routing** | Task → günstigstes passendes Modell | Modellauswahl-Ebene |
| **Prompt-Caching** | Stabile Prompt-Präfixe cachen | Token-Ebene |
Beide Strategien sind komplementär und können kombiniert werden: Ein gerouteter Task (z.B. GLM 5.2 für Code-Execution) profitiert zusätzlich von einem gecachten System-Prompt-Präfix — insbesondere bei wiederholten Anfragen mit gleichem Kontext (z.B. Batch-Verarbeitung, Agenten-Loops mit stabilem System-Prompt).
## Externe Quellen
- [heise online Artikel (Paywall)](https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html)
- [Anthropic Prompt Caching Dokumentation](https://docs.anthropic.com/en/docs/build-with-claude/prompt-caching)
- [Ollama](https://ollama.ai/)