Prompt Injection ist eine Angriffstechnik gegen KI-Systeme. Dabei versucht ein Angreifer, die Anweisungen eines Modells zu manipulieren oder zu überschreiben. Besonders kritisch wird das, wenn ein KI-Agent Zugriff auf interne Daten, E-Mails, Dokumente, APIs oder andere Systeme besitzt.
Direkte und indirekte Prompt Injection
Bei einer direkten Prompt Injection gibt ein Nutzer schädliche Anweisungen unmittelbar ein. Bei einer indirekten Variante verstecken sich manipulierte Instruktionen beispielsweise in Webseiten, Dokumenten oder E-Mails, die das KI-System später verarbeitet.
Warum Agenten das Risiko erhöhen
Ein Chatbot, der nur Text erzeugt, hat begrenzte Auswirkungen. Ein Agent mit Schreibrechten oder Zugriff auf Geschäftssysteme kann dagegen echte Aktionen auslösen. Deshalb müssen Berechtigungen, Freigaben und Datenquellen streng kontrolliert werden.
Schutzmaßnahmen
- KI-Agenten nur minimale Rechte geben.
- Kritische Aktionen durch Menschen bestätigen lassen.
- Externe Inhalte als nicht vertrauenswürdig behandeln.
- Tool-Aufrufe und Datenzugriffe protokollieren.
- Secrets und Zugangsdaten vom Modellkontext trennen.
- KI-Anwendungen regelmäßig mit Angriffsszenarien testen.
Fazit: Prompt Injection ist kein klassischer Softwarefehler, sondern ein grundlegendes Sicherheitsproblem bei sprachgesteuerten KI-Systemen. Besonders bei autonomen Agenten muss Sicherheit von Anfang an Teil der Architektur sein.
Kurz zusammengefasst
Prompt Injection nutzt manipulierte Eingaben, um KI-Systeme zu unerwünschtem Verhalten zu bringen.
Was bedeutet das für Unternehmen?
Je mehr ein KI-System auf Daten, Tools oder interne Prozesse zugreifen darf, desto wichtiger sind technische Grenzen und Freigaben.
Empfohlene Maßnahmen
- Berechtigungen nach Least Privilege vergeben.
- Tool-Aufrufe und sensible Aktionen protokollieren.
- KI-Systeme regelmäßig mit Angriffsszenarien testen.
Quellen: NIST AI Risk Management Framework; OWASP Top 10 for LLM Applications; Google Security Research.