- Raw: raw/blog/2026-07-07_heise-prompt-caching.md (heise+ Paywall, free preview) - Wiki: concepts/prompt-caching.md — KV-Cache-Basis, Prompt-Struktur, Performance-Gewinne (10x lokal / 90% Cloud), Komplementarität zu Model-Routing (Token Level vs Model Level), Cross-Refs - Update: tools/model-routing.md — Cross-Ref zu prompt-caching.md - Update: index.md, log.md (68. Update)
68 lines
No EOL
3.5 KiB
Markdown
68 lines
No EOL
3.5 KiB
Markdown
---
|
||
type: blog
|
||
source_url: https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html
|
||
retrieved: 2026-07-07
|
||
title: "KI-Kosten reduzieren: Wie man mit Prompt-Caching messbar Token sparen kann"
|
||
author: "heise online"
|
||
paywall: true
|
||
tags: [prompt-caching, kv-cache, token-optimization, cost-reduction, llm-inference, ollama, anthropic, transformer-architecture]
|
||
---
|
||
|
||
# KI-Kosten reduzieren: Wie man mit Prompt-Caching messbar Token sparen kann
|
||
|
||
> **Quelle:** heise+ Ratgeber-Artikel — [heise.de/ratgeber/...](https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html)
|
||
> **Paywall:** heise+ (nur Leseprobe verfügbar)
|
||
|
||
## Artikel-Zusammenfassung
|
||
|
||
Der heise-Plus-Ratgeber erklärt, wie Prompt-Caching die Kosten pro LLM-Anfrage senkt und die Antwortgeschwindigkeit erhöht. Der Mechanismus ist technisch simpel, wird aber oft übersehen oder durch ungeschickte Prompt-Strukturierung unwirksam gemacht.
|
||
|
||
### Funktionsweise
|
||
|
||
Prompt-Caching speichert die internen Berechnungsergebnisse eines gleichbleibenden Prompt-Präfixes zwischen. Bei Folgeanfragen muss das Sprachmodell nur noch den neuen, abweichenden Teil verarbeiten.
|
||
|
||
Die technische Grundlage ist der **KV-Cache der Transformer-Architektur**: Die einmal berechneten Key- und Value-Vektoren der Prefill-Phase werden wiederverwendet. Statt bei jeder Anfrage den gesamten Prompt neu zu berechnen, wird nur der veränderte Suffix prozessiert.
|
||
|
||
### Performance-Gewinne
|
||
|
||
| Szenario | Verbesserung |
|
||
|----------|-------------|
|
||
| Lokal (z. B. Ollama) | Bis zu **10× schnellere** Inferenz |
|
||
| Cloud (z. B. Anthropic) | Bis zu **90 % Kostenreduktion** |
|
||
|
||
### Wichtige Prompt-Struktur
|
||
|
||
Entscheidend ist der Aufbau des Prompts:
|
||
|
||
- **Anfang:** Stabile Inhalte — Systemanweisungen, Dokumente, Tooldefinitionen, bisheriger Gesprächsverlauf
|
||
- **Ende:** Variable Daten — aktuelle Frage des Benutzers
|
||
|
||
Bei korrekter Strukturierung kann der stabile Präfix gecached und nur der variable Suffix neu berechnet werden.
|
||
|
||
### Wie ein LLM Text erzeugt
|
||
|
||
Ein LLM ist im Kern eine Textergänzungsmaschine. Die Eingabe (Prompt) besteht aus drei Schichten:
|
||
1. **System-Prompt** — Rollen- oder Verhaltensanweisung
|
||
2. **Kontext** — Dokumente, Tooldefinitionen, Gesprächsverlauf
|
||
3. **Aktuelle Frage** — Benutzereingabe
|
||
|
||
## Praktische Umsetzung
|
||
|
||
Der Artikel beschreibt eine lokale Demo mit Ollama (ohne Paywall-Details verfügbar). Die Erkenntnisse sind auf Cloud-Anbieter wie Anthropic übertragbar.
|
||
|
||
## Relevanz für unser Setup
|
||
|
||
Prompt-Caching ist für Hector besonders relevant, da es den Gegenpart zu **Model-Routing** darstellt:
|
||
|
||
| Strategie | Ansatz | Hebel |
|
||
|-----------|--------|-------|
|
||
| **Model-Routing** | Task → günstigstes passendes Modell | Modellauswahl-Ebene |
|
||
| **Prompt-Caching** | Stabile Prompt-Präfixe cachen | Token-Ebene |
|
||
|
||
Beide Strategien sind komplementär und können kombiniert werden: Ein gerouteter Task (z. B. GLM 5.2 für Code-Execution) profitiert zusätzlich von einem gecachten System-Prompt-Präfix — insbesondere bei wiederholten Anfragen mit gleichem Kontext (z. B. Batch-Verarbeitung, Agenten-Loops mit stabilem System-Prompt).
|
||
|
||
## Externe Quellen
|
||
|
||
- [heise online Artikel (Paywall)](https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html)
|
||
- [Anthropic Prompt Caching Dokumentation](https://docs.anthropic.com/en/docs/build-with-claude/prompt-caching)
|
||
- [Ollama](https://ollama.ai/) |