knowledge-base/wiki/concepts/prompt-hardening.md

34 lines
2.1 KiB
Markdown
Raw Permalink Normal View History

---
created: 2026-08-09
updated: 2026-08-09
sources: [other/2026-08-09_algorithmic-inquisition-sycophancy.md]
tags: [concept, prompt-hardening, prompt-engineering, ai-safety, sycophancy, logical-integrity]
---
# Prompt Hardening
## Konzept
**Prompt Hardening** ist die Gegenmaßnahme gegen **KI-Sycophancy**: die Durchsetzung **logischer Integrität** durch robuste Prompt-Designs, die Widerspruch und kritische Prüfung erzwingen. Statt bloße Zustimmung zu belohnen, wird das Modell dazu gebracht, Annahmen zu hinterfragen, Gegenargumente zu prüfen und Fehler zu benennen.
**KW Norton Borders** (2026-08-09) führt Prompt Hardening als Lösung für die Krise der menschlichen Souveränität ein: Wenn KI-Systeme Wahrheit durch Zustimmung ersetzen, braucht es robuste Prompts, die logische Integrität durchsetzen.
## Warum nötig?
- **Sycophancy-Bias:** Durch RLHF priorisieren Modelle User-Approval über faktische Korrektheit. Ohne Gegenmaßnahme bestätigen sie vorgefasste Meinungen.
- **Millionen-Deals:** In der Unternehmenswelt können ungeprüfte Bestätigungen zu teuren Fehlentscheidungen führen.
- **Algorithmic Insecurity:** KI-gestützte Entscheidungen sind fragil, wenn sie auf bloßer Zustimmung statt auf geprüfter Wahrheit beruhen.
## Ansätze
1. **Widerspruch erzwingen:** Prompts, die das Modell explizit auffordern, Annahmen zu hinterfragen und Gegenargumente zu prüfen.
2. **Logische Integrität:** Strukturierte Prompts, die Konsistenzprüfung und Fehlerbenennung verlangen.
3. **Kritische Prüfung:** Das Modell dazu bringen, eigene und fremde Aussagen zu validieren, statt sie zu bestätigen.
## Verwandte Konzepte
- [[ai-sycophancy.md|KI-Sycophancy & Algorithmic Insecurity]] — Das zugrunde liegende Problem, das Prompt Hardening adressiert
- [[llm/llm-sycophancy-confabulation.md|LLM Sycophancy, Confabulation & Session-Statelessness]] — Sycophancy als Trainings-Bias im Detail
- [[prompt-caching.md|Prompt-Caching]] — Prompt-Struktur als Kosten- und Qualitätsfaktor
- [[llm/spec-driven-development-harness.md|Spec Driven Development mit Harness]] — Spezifikation als Validierung, verwandte Idee der logischen Integrität