knowledge-base/raw/blog/2026-07-07_heise-prompt-caching.md

68 lines
3.5 KiB
Markdown
Raw Permalink Normal View History

---
type: blog
source_url: https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html
retrieved: 2026-07-07
title: "KI-Kosten reduzieren: Wie man mit Prompt-Caching messbar Token sparen kann"
author: "heise online"
paywall: true
tags: [prompt-caching, kv-cache, token-optimization, cost-reduction, llm-inference, ollama, anthropic, transformer-architecture]
---
# KI-Kosten reduzieren: Wie man mit Prompt-Caching messbar Token sparen kann
> **Quelle:** heise+ Ratgeber-Artikel — [heise.de/ratgeber/...](https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html)
> **Paywall:** heise+ (nur Leseprobe verfügbar)
## Artikel-Zusammenfassung
Der heise-Plus-Ratgeber erklärt, wie Prompt-Caching die Kosten pro LLM-Anfrage senkt und die Antwortgeschwindigkeit erhöht. Der Mechanismus ist technisch simpel, wird aber oft übersehen oder durch ungeschickte Prompt-Strukturierung unwirksam gemacht.
### Funktionsweise
Prompt-Caching speichert die internen Berechnungsergebnisse eines gleichbleibenden Prompt-Präfixes zwischen. Bei Folgeanfragen muss das Sprachmodell nur noch den neuen, abweichenden Teil verarbeiten.
Die technische Grundlage ist der **KV-Cache der Transformer-Architektur**: Die einmal berechneten Key- und Value-Vektoren der Prefill-Phase werden wiederverwendet. Statt bei jeder Anfrage den gesamten Prompt neu zu berechnen, wird nur der veränderte Suffix prozessiert.
### Performance-Gewinne
| Szenario | Verbesserung |
|----------|-------------|
| Lokal (z.B. Ollama) | Bis zu **10× schnellere** Inferenz |
| Cloud (z.B. Anthropic) | Bis zu **90 % Kostenreduktion** |
### Wichtige Prompt-Struktur
Entscheidend ist der Aufbau des Prompts:
- **Anfang:** Stabile Inhalte — Systemanweisungen, Dokumente, Tooldefinitionen, bisheriger Gesprächsverlauf
- **Ende:** Variable Daten — aktuelle Frage des Benutzers
Bei korrekter Strukturierung kann der stabile Präfix gecached und nur der variable Suffix neu berechnet werden.
### Wie ein LLM Text erzeugt
Ein LLM ist im Kern eine Textergänzungsmaschine. Die Eingabe (Prompt) besteht aus drei Schichten:
1. **System-Prompt** — Rollen- oder Verhaltensanweisung
2. **Kontext** — Dokumente, Tooldefinitionen, Gesprächsverlauf
3. **Aktuelle Frage** — Benutzereingabe
## Praktische Umsetzung
Der Artikel beschreibt eine lokale Demo mit Ollama (ohne Paywall-Details verfügbar). Die Erkenntnisse sind auf Cloud-Anbieter wie Anthropic übertragbar.
## Relevanz für unser Setup
Prompt-Caching ist für Hector besonders relevant, da es den Gegenpart zu **Model-Routing** darstellt:
| Strategie | Ansatz | Hebel |
|-----------|--------|-------|
| **Model-Routing** | Task → günstigstes passendes Modell | Modellauswahl-Ebene |
| **Prompt-Caching** | Stabile Prompt-Präfixe cachen | Token-Ebene |
Beide Strategien sind komplementär und können kombiniert werden: Ein gerouteter Task (z.B. GLM 5.2 für Code-Execution) profitiert zusätzlich von einem gecachten System-Prompt-Präfix — insbesondere bei wiederholten Anfragen mit gleichem Kontext (z.B. Batch-Verarbeitung, Agenten-Loops mit stabilem System-Prompt).
## Externe Quellen
- [heise online Artikel (Paywall)](https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html)
- [Anthropic Prompt Caching Dokumentation](https://docs.anthropic.com/en/docs/build-with-claude/prompt-caching)
- [Ollama](https://ollama.ai/)