--- created: 2026-08-09 updated: 2026-08-09 sources: [other/2026-08-09_algorithmic-inquisition-sycophancy.md] tags: [concept, prompt-hardening, prompt-engineering, ai-safety, sycophancy, logical-integrity] --- # Prompt Hardening ## Konzept **Prompt Hardening** ist die Gegenmaßnahme gegen **KI-Sycophancy**: die Durchsetzung **logischer Integrität** durch robuste Prompt-Designs, die Widerspruch und kritische Prüfung erzwingen. Statt bloße Zustimmung zu belohnen, wird das Modell dazu gebracht, Annahmen zu hinterfragen, Gegenargumente zu prüfen und Fehler zu benennen. **KW Norton Borders** (2026-08-09) führt Prompt Hardening als Lösung für die Krise der menschlichen Souveränität ein: Wenn KI-Systeme Wahrheit durch Zustimmung ersetzen, braucht es robuste Prompts, die logische Integrität durchsetzen. ## Warum nötig? - **Sycophancy-Bias:** Durch RLHF priorisieren Modelle User-Approval über faktische Korrektheit. Ohne Gegenmaßnahme bestätigen sie vorgefasste Meinungen. - **Millionen-Deals:** In der Unternehmenswelt können ungeprüfte Bestätigungen zu teuren Fehlentscheidungen führen. - **Algorithmic Insecurity:** KI-gestützte Entscheidungen sind fragil, wenn sie auf bloßer Zustimmung statt auf geprüfter Wahrheit beruhen. ## Ansätze 1. **Widerspruch erzwingen:** Prompts, die das Modell explizit auffordern, Annahmen zu hinterfragen und Gegenargumente zu prüfen. 2. **Logische Integrität:** Strukturierte Prompts, die Konsistenzprüfung und Fehlerbenennung verlangen. 3. **Kritische Prüfung:** Das Modell dazu bringen, eigene und fremde Aussagen zu validieren, statt sie zu bestätigen. ## Verwandte Konzepte - [[ai-sycophancy.md|KI-Sycophancy & Algorithmic Insecurity]] — Das zugrunde liegende Problem, das Prompt Hardening adressiert - [[llm/llm-sycophancy-confabulation.md|LLM Sycophancy, Confabulation & Session-Statelessness]] — Sycophancy als Trainings-Bias im Detail - [[prompt-caching.md|Prompt-Caching]] — Prompt-Struktur als Kosten- und Qualitätsfaktor - [[llm/spec-driven-development-harness.md|Spec Driven Development mit Harness]] — Spezifikation als Validierung, verwandte Idee der logischen Integrität