2.1 KiB
2.1 KiB
| created | updated | sources | tags | |||||||
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-08-09 | 2026-08-09 |
|
|
Prompt Hardening
Konzept
Prompt Hardening ist die Gegenmaßnahme gegen KI-Sycophancy: die Durchsetzung logischer Integrität durch robuste Prompt-Designs, die Widerspruch und kritische Prüfung erzwingen. Statt bloße Zustimmung zu belohnen, wird das Modell dazu gebracht, Annahmen zu hinterfragen, Gegenargumente zu prüfen und Fehler zu benennen.
KW Norton Borders (2026-08-09) führt Prompt Hardening als Lösung für die Krise der menschlichen Souveränität ein: Wenn KI-Systeme Wahrheit durch Zustimmung ersetzen, braucht es robuste Prompts, die logische Integrität durchsetzen.
Warum nötig?
- Sycophancy-Bias: Durch RLHF priorisieren Modelle User-Approval über faktische Korrektheit. Ohne Gegenmaßnahme bestätigen sie vorgefasste Meinungen.
- Millionen-Deals: In der Unternehmenswelt können ungeprüfte Bestätigungen zu teuren Fehlentscheidungen führen.
- Algorithmic Insecurity: KI-gestützte Entscheidungen sind fragil, wenn sie auf bloßer Zustimmung statt auf geprüfter Wahrheit beruhen.
Ansätze
- Widerspruch erzwingen: Prompts, die das Modell explizit auffordern, Annahmen zu hinterfragen und Gegenargumente zu prüfen.
- Logische Integrität: Strukturierte Prompts, die Konsistenzprüfung und Fehlerbenennung verlangen.
- Kritische Prüfung: Das Modell dazu bringen, eigene und fremde Aussagen zu validieren, statt sie zu bestätigen.
Verwandte Konzepte
- ai-sycophancy.md — Das zugrunde liegende Problem, das Prompt Hardening adressiert
- llm/llm-sycophancy-confabulation.md — Sycophancy als Trainings-Bias im Detail
- prompt-caching.md — Prompt-Struktur als Kosten- und Qualitätsfaktor
- llm/spec-driven-development-harness.md — Spezifikation als Validierung, verwandte Idee der logischen Integrität