68 lines
3.5 KiB
Markdown
68 lines
3.5 KiB
Markdown
|
|
---
|
|||
|
|
type: blog
|
|||
|
|
source_url: https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html
|
|||
|
|
retrieved: 2026-07-07
|
|||
|
|
title: "KI-Kosten reduzieren: Wie man mit Prompt-Caching messbar Token sparen kann"
|
|||
|
|
author: "heise online"
|
|||
|
|
paywall: true
|
|||
|
|
tags: [prompt-caching, kv-cache, token-optimization, cost-reduction, llm-inference, ollama, anthropic, transformer-architecture]
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
# KI-Kosten reduzieren: Wie man mit Prompt-Caching messbar Token sparen kann
|
|||
|
|
|
|||
|
|
> **Quelle:** heise+ Ratgeber-Artikel — [heise.de/ratgeber/...](https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html)
|
|||
|
|
> **Paywall:** heise+ (nur Leseprobe verfügbar)
|
|||
|
|
|
|||
|
|
## Artikel-Zusammenfassung
|
|||
|
|
|
|||
|
|
Der heise-Plus-Ratgeber erklärt, wie Prompt-Caching die Kosten pro LLM-Anfrage senkt und die Antwortgeschwindigkeit erhöht. Der Mechanismus ist technisch simpel, wird aber oft übersehen oder durch ungeschickte Prompt-Strukturierung unwirksam gemacht.
|
|||
|
|
|
|||
|
|
### Funktionsweise
|
|||
|
|
|
|||
|
|
Prompt-Caching speichert die internen Berechnungsergebnisse eines gleichbleibenden Prompt-Präfixes zwischen. Bei Folgeanfragen muss das Sprachmodell nur noch den neuen, abweichenden Teil verarbeiten.
|
|||
|
|
|
|||
|
|
Die technische Grundlage ist der **KV-Cache der Transformer-Architektur**: Die einmal berechneten Key- und Value-Vektoren der Prefill-Phase werden wiederverwendet. Statt bei jeder Anfrage den gesamten Prompt neu zu berechnen, wird nur der veränderte Suffix prozessiert.
|
|||
|
|
|
|||
|
|
### Performance-Gewinne
|
|||
|
|
|
|||
|
|
| Szenario | Verbesserung |
|
|||
|
|
|----------|-------------|
|
|||
|
|
| Lokal (z. B. Ollama) | Bis zu **10× schnellere** Inferenz |
|
|||
|
|
| Cloud (z. B. Anthropic) | Bis zu **90 % Kostenreduktion** |
|
|||
|
|
|
|||
|
|
### Wichtige Prompt-Struktur
|
|||
|
|
|
|||
|
|
Entscheidend ist der Aufbau des Prompts:
|
|||
|
|
|
|||
|
|
- **Anfang:** Stabile Inhalte — Systemanweisungen, Dokumente, Tooldefinitionen, bisheriger Gesprächsverlauf
|
|||
|
|
- **Ende:** Variable Daten — aktuelle Frage des Benutzers
|
|||
|
|
|
|||
|
|
Bei korrekter Strukturierung kann der stabile Präfix gecached und nur der variable Suffix neu berechnet werden.
|
|||
|
|
|
|||
|
|
### Wie ein LLM Text erzeugt
|
|||
|
|
|
|||
|
|
Ein LLM ist im Kern eine Textergänzungsmaschine. Die Eingabe (Prompt) besteht aus drei Schichten:
|
|||
|
|
1. **System-Prompt** — Rollen- oder Verhaltensanweisung
|
|||
|
|
2. **Kontext** — Dokumente, Tooldefinitionen, Gesprächsverlauf
|
|||
|
|
3. **Aktuelle Frage** — Benutzereingabe
|
|||
|
|
|
|||
|
|
## Praktische Umsetzung
|
|||
|
|
|
|||
|
|
Der Artikel beschreibt eine lokale Demo mit Ollama (ohne Paywall-Details verfügbar). Die Erkenntnisse sind auf Cloud-Anbieter wie Anthropic übertragbar.
|
|||
|
|
|
|||
|
|
## Relevanz für unser Setup
|
|||
|
|
|
|||
|
|
Prompt-Caching ist für Hector besonders relevant, da es den Gegenpart zu **Model-Routing** darstellt:
|
|||
|
|
|
|||
|
|
| Strategie | Ansatz | Hebel |
|
|||
|
|
|-----------|--------|-------|
|
|||
|
|
| **Model-Routing** | Task → günstigstes passendes Modell | Modellauswahl-Ebene |
|
|||
|
|
| **Prompt-Caching** | Stabile Prompt-Präfixe cachen | Token-Ebene |
|
|||
|
|
|
|||
|
|
Beide Strategien sind komplementär und können kombiniert werden: Ein gerouteter Task (z. B. GLM 5.2 für Code-Execution) profitiert zusätzlich von einem gecachten System-Prompt-Präfix — insbesondere bei wiederholten Anfragen mit gleichem Kontext (z. B. Batch-Verarbeitung, Agenten-Loops mit stabilem System-Prompt).
|
|||
|
|
|
|||
|
|
## Externe Quellen
|
|||
|
|
|
|||
|
|
- [heise online Artikel (Paywall)](https://www.heise.de/ratgeber/KI-Kosten-reduzieren-Wie-man-mit-Prompt-Caching-messbar-Token-sparen-kann-11335003.html)
|
|||
|
|
- [Anthropic Prompt Caching Dokumentation](https://docs.anthropic.com/en/docs/build-with-claude/prompt-caching)
|
|||
|
|
- [Ollama](https://ollama.ai/)
|