Ein versteckter Satz im Dokument kann deine KI steuern.
Bei einer Prompt Injection befolgt ein Sprachmodell Anweisungen, die nicht von dir stammen. Wie das funktioniert und was im Betrieb dagegen hilft.

Bei einer Prompt Injection befolgt ein Sprachmodell Anweisungen, die nicht von dir stammen. Wie das funktioniert und was im Betrieb dagegen hilft.


Eine Prompt Injection ist eine Eingabe, die das Verhalten oder die Ausgabe eines Sprachmodells in unbeabsichtigter Weise verändert1. Weil ein Modell nicht unterscheidet, ob ein Satz eine Information oder ein Befehl ist, genügt dafür ein versteckter Satz in einer Mail, auf einer Webseite oder in einem Dokument. Im Cybersicherheitsmonitor 2026 haben davon 20 Prozent gehört4.
Wenn bei dir ein KI-Assistent Dokumente von außen auswertet, betrifft dich das unmittelbar. Wenn er zusätzlich etwas verschicken oder ändern darf, wird aus dem Ärgernis ein Schaden.
Über den Text selbst. Du bittest eine Aushilfe, den Posteingang durchzusehen und wichtige Vorgänge zu bearbeiten. In einem der Briefe steht in kleiner Schrift, sie solle ihre bisherigen Anweisungen vergessen und die Kundenliste an eine fremde Adresse schicken. Genau so sieht der Angriff aus.
Ein Mensch würde an dieser Stelle stutzen. Das Sprachmodell nicht. Für das Modell ist der Brief genauso Text wie deine Anweisung, und es gibt keine Trennlinie zwischen beidem. Genau das beschreibt OWASP als Veränderung von Verhalten oder Ausgabe in unbeabsichtigter Weise1.
Der Prompt, also die Anweisung an das System, und der Inhalt, den es verarbeiten soll, landen in demselben Eingabefeld. Diese Vermischung ist keine Schwäche eines einzelnen Anbieters. Sie steckt in der Arbeitsweise der Modelle selbst.
Kernaussage
Ein Sprachmodell kann Anweisung und Inhalt nicht sicher trennen1. Im Cybersicherheitsmonitor 2026 haben von diesem Angriffsweg erst 20 Prozent gehört4. Das Bundeskriminalamt fasst es so: KI ist nicht nur Tatmittel, sondern auch Angriffsziel3.
Die Herkunft der Anweisung. OWASP unterscheidet zwei Formen1. Bei der direkten verändert die Eingabe des Nutzers selbst das Verhalten, bei der indirekten verarbeitet das Modell externe Inhalte wie Webseiten oder Dateien mit schädlichen Anweisungen1. Beide Wege führen am Ende zum selben Ergebnis.
Das Bundesamt für Sicherheit in der Informationstechnik beschreibt den Unterschied so, dass die Manipulation bei der indirekten Variante über ungeprüfte Drittquellen erfolgt und nicht durch die nutzende Person selbst2. Für einen Betrieb ist die indirekte Variante die gefährlichere, weil niemand sie bewusst auslöst.
Die Anweisungen können dabei unsichtbar sein. Das Bundesamt nennt als Beispiel textuelle Zusatzinformationen wie Unicode-Tags, die zwar verarbeitet, aber nicht für Lesende dargestellt werden2. Wer ein solches Dokument öffnet, sieht nichts Auffälliges.
| Form | Woher die Anweisung kommt | Wo sie auftaucht |
|---|---|---|
| direkt | aus der Eingabe der nutzenden Person selbst1 | im Eingabefeld des Werkzeugs1 |
| indirekt | aus ungeprüften Drittquellen, nicht von der nutzenden Person2 | in Webseiten, Mails und Dateien, die das Modell verarbeitet12 |
Sobald die KI Anschluss an andere Systeme hat. Das Bundesamt schreibt, das Risiko bestehe, wenn ein Modell in Verbindung mit externen Quellen und Anwendungen genutzt wird2. Dann gelangen deren Daten in die Eingabe, oder die Ausgaben werden weiterverwendet2. Ohne diesen Anschluss bleibt es folgenlos.
Als mögliche Folgen nennt das Bundesamt ausdrücklich das Ausleiten von Informationen über extern geladene Bilder und das Versenden einer Mail aus dem Postfach des Opfers, die den Chatverlauf enthält2. Das Bundeskriminalamt führt indirekte Prompt Injections als eigenen Angriffsweg auf KI-Systeme3.
Bekannt ist das kaum jemandem. Im Cybersicherheitsmonitor 2026 geben nur 20 Prozent an, jemals von der Manipulation eines KI-Programms über unsichtbare Anweisungen gehört zu haben4. Nur 38 Prozent halten es für möglich, dass ein KI-Agent, der Termine vereinbart, manipuliert wird4.
Der Schutz liegt in den Rechten, nicht im Filter. OWASP empfiehlt unter anderem, riskante Aktionen von einem Menschen freigeben zu lassen, Rechte auf das Nötigste zu beschränken und Inhalte aus fremden Quellen als solche zu kennzeichnen1. Daraus wird eine Regel für die KI-Richtlinie.
Wohin diese Regeln schriftlich gehören, steht im Beitrag KI-Richtlinie für Unternehmen erstellen. Worin sich ein KI-Agent von einem Chatbot unterscheidet, steht im Beitrag KI-Agent oder Chatbot. Beim Aufsetzen der Freigabewege unterstütze ich in meiner Beratung zu Regulatorik.
Meine Empfehlung aus Erfahrung
Meine Einschätzung: Das Thema wirkt technisch, ist aber eine Frage der Berechtigungen, und die vergibt keine IT-Abteilung allein. Ich würde bei jedem Assistenten, der Post, Angebote oder Kundendokumente liest, die Versandrechte wegnehmen und erst zurückgeben, wenn jemand benennen kann, was im Fehlerfall passiert. In den Gesprächen, die ich dazu führe, kennt fast niemand diesen Angriffsweg. Deshalb gehört er in jede erste Unterweisung.
Drei Fragen reichen für den Anfang. Erstens: Aus welchen Quellen bekommt das Werkzeug Text, den nicht wir geschrieben haben. Zweitens: Welche Aktion kann es auslösen, die nach außen wirkt. Drittens: Wer sieht im Nachhinein, was es getan hat, und wie lange bleibt das nachvollziehbar.
Wenn eine dieser Antworten fehlt, ist das kein Grund für ein Verbot, sondern für einen Zwischenschritt. Nimm dem Werkzeug die Rechte, die nach außen wirken, und lass es erst einmal nur lesen und vorschlagen.
Nur eingeschränkt. Das Bundesamt für Sicherheit in der Informationstechnik knüpft das Risiko daran, dass ein Modell mit externen Quellen und Anwendungen verbunden wird[2]. Ein Sprachmodell ohne Anschluss an eure Systeme kann höchstens eine unsinnige Antwort geben, aber nichts auslösen.
Meist nicht. Das Bundesamt für Sicherheit in der Informationstechnik nennt als Beispiel Unicode-Tags, die verarbeitet, aber nicht für Lesende dargestellt werden[2]. Auch weiße Schrift auf weißem Grund oder Text in einem Anhang fällt niemandem auf. Für das Modell ist beides normaler Text.
Nein. Eine belegte Statistik dazu gibt es nicht. Das Bundeskriminalamt schreibt ausdrücklich, es lägen keine polizeilichen Kennzahlen zum konkreten KI-Einsatz in Cybercrimedelikten vor[3]. Wer eine solche Zahl nennt, kann sie nicht aus einer Primärquelle belegen.
Nur begrenzt. OWASP empfiehlt als Gegenmaßnahmen unter anderem eine menschliche Freigabe für riskante Aktionen, die Beschränkung von Rechten auf das Nötigste und die klare Kennzeichnung von Inhalten aus fremden Quellen[1]. Der Schutz liegt in den Rechten, nicht im Filter.
Stand 2. September 2026 · geprüft am 12. September 2026

Sicherheit und Zuständigkeiten sind zwei von sieben Bereichen im Reifegradmodell. Der Check zeigt dir, wo eine Lücke klafft.