knowledge-base/wiki/concepts/prompt-hardening.md

2.1 KiB

created updated sources tags
2026-08-09 2026-08-09
other/2026-08-09_algorithmic-inquisition-sycophancy.md
concept
prompt-hardening
prompt-engineering
ai-safety
sycophancy
logical-integrity

Prompt Hardening

Konzept

Prompt Hardening ist die Gegenmaßnahme gegen KI-Sycophancy: die Durchsetzung logischer Integrität durch robuste Prompt-Designs, die Widerspruch und kritische Prüfung erzwingen. Statt bloße Zustimmung zu belohnen, wird das Modell dazu gebracht, Annahmen zu hinterfragen, Gegenargumente zu prüfen und Fehler zu benennen.

KW Norton Borders (2026-08-09) führt Prompt Hardening als Lösung für die Krise der menschlichen Souveränität ein: Wenn KI-Systeme Wahrheit durch Zustimmung ersetzen, braucht es robuste Prompts, die logische Integrität durchsetzen.

Warum nötig?

  • Sycophancy-Bias: Durch RLHF priorisieren Modelle User-Approval über faktische Korrektheit. Ohne Gegenmaßnahme bestätigen sie vorgefasste Meinungen.
  • Millionen-Deals: In der Unternehmenswelt können ungeprüfte Bestätigungen zu teuren Fehlentscheidungen führen.
  • Algorithmic Insecurity: KI-gestützte Entscheidungen sind fragil, wenn sie auf bloßer Zustimmung statt auf geprüfter Wahrheit beruhen.

Ansätze

  1. Widerspruch erzwingen: Prompts, die das Modell explizit auffordern, Annahmen zu hinterfragen und Gegenargumente zu prüfen.
  2. Logische Integrität: Strukturierte Prompts, die Konsistenzprüfung und Fehlerbenennung verlangen.
  3. Kritische Prüfung: Das Modell dazu bringen, eigene und fremde Aussagen zu validieren, statt sie zu bestätigen.

Verwandte Konzepte