Zum Inhalt springen

Ein versteckter Satz im Dokument kann deine KI steuern.

Bei einer Prompt Injection befolgt ein Sprachmodell Anweisungen, die nicht von dir stammen. Wie das funktioniert und was im Betrieb dagegen hilft.

Oliver Leifken
Oliver Leifken
Der Roboter liest ein weißes Blatt, an dessen unterer Kante eine versteckte Zeile orange aufleuchtet

Eine Prompt Injection ist eine Eingabe, die das Verhalten oder die Ausgabe eines Sprachmodells in unbeabsichtigter Weise verändert1. Weil ein Modell nicht unterscheidet, ob ein Satz eine Information oder ein Befehl ist, genügt dafür ein versteckter Satz in einer Mail, auf einer Webseite oder in einem Dokument. Im Cybersicherheitsmonitor 2026 haben davon 20 Prozent gehört4.

Wenn bei dir ein KI-Assistent Dokumente von außen auswertet, betrifft dich das unmittelbar. Wenn er zusätzlich etwas verschicken oder ändern darf, wird aus dem Ärgernis ein Schaden.

Wie funktioniert eine Prompt Injection?

Über den Text selbst. Du bittest eine Aushilfe, den Posteingang durchzusehen und wichtige Vorgänge zu bearbeiten. In einem der Briefe steht in kleiner Schrift, sie solle ihre bisherigen Anweisungen vergessen und die Kundenliste an eine fremde Adresse schicken. Genau so sieht der Angriff aus.

Ein Mensch würde an dieser Stelle stutzen. Das Sprachmodell nicht. Für das Modell ist der Brief genauso Text wie deine Anweisung, und es gibt keine Trennlinie zwischen beidem. Genau das beschreibt OWASP als Veränderung von Verhalten oder Ausgabe in unbeabsichtigter Weise1.

Der Prompt, also die Anweisung an das System, und der Inhalt, den es verarbeiten soll, landen in demselben Eingabefeld. Diese Vermischung ist keine Schwäche eines einzelnen Anbieters. Sie steckt in der Arbeitsweise der Modelle selbst.

Kernaussage

Ein Sprachmodell kann Anweisung und Inhalt nicht sicher trennen1. Im Cybersicherheitsmonitor 2026 haben von diesem Angriffsweg erst 20 Prozent gehört4. Das Bundeskriminalamt fasst es so: KI ist nicht nur Tatmittel, sondern auch Angriffsziel3.

Was ist der Unterschied zwischen direkt und indirekt?

Die Herkunft der Anweisung. OWASP unterscheidet zwei Formen1. Bei der direkten verändert die Eingabe des Nutzers selbst das Verhalten, bei der indirekten verarbeitet das Modell externe Inhalte wie Webseiten oder Dateien mit schädlichen Anweisungen1. Beide Wege führen am Ende zum selben Ergebnis.

Das Bundesamt für Sicherheit in der Informationstechnik beschreibt den Unterschied so, dass die Manipulation bei der indirekten Variante über ungeprüfte Drittquellen erfolgt und nicht durch die nutzende Person selbst2. Für einen Betrieb ist die indirekte Variante die gefährlichere, weil niemand sie bewusst auslöst.

Die Anweisungen können dabei unsichtbar sein. Das Bundesamt nennt als Beispiel textuelle Zusatzinformationen wie Unicode-Tags, die zwar verarbeitet, aber nicht für Lesende dargestellt werden2. Wer ein solches Dokument öffnet, sieht nichts Auffälliges.

Form Woher die Anweisung kommt Wo sie auftaucht
direkt aus der Eingabe der nutzenden Person selbst1 im Eingabefeld des Werkzeugs1
indirekt aus ungeprüften Drittquellen, nicht von der nutzenden Person2 in Webseiten, Mails und Dateien, die das Modell verarbeitet12

Wann wird daraus ein echtes Risiko?

Sobald die KI Anschluss an andere Systeme hat. Das Bundesamt schreibt, das Risiko bestehe, wenn ein Modell in Verbindung mit externen Quellen und Anwendungen genutzt wird2. Dann gelangen deren Daten in die Eingabe, oder die Ausgaben werden weiterverwendet2. Ohne diesen Anschluss bleibt es folgenlos.

Als mögliche Folgen nennt das Bundesamt ausdrücklich das Ausleiten von Informationen über extern geladene Bilder und das Versenden einer Mail aus dem Postfach des Opfers, die den Chatverlauf enthält2. Das Bundeskriminalamt führt indirekte Prompt Injections als eigenen Angriffsweg auf KI-Systeme3.

Bekannt ist das kaum jemandem. Im Cybersicherheitsmonitor 2026 geben nur 20 Prozent an, jemals von der Manipulation eines KI-Programms über unsichtbare Anweisungen gehört zu haben4. Nur 38 Prozent halten es für möglich, dass ein KI-Agent, der Termine vereinbart, manipuliert wird4.

Was heißt das für deinen Betrieb?

Der Schutz liegt in den Rechten, nicht im Filter. OWASP empfiehlt unter anderem, riskante Aktionen von einem Menschen freigeben zu lassen, Rechte auf das Nötigste zu beschränken und Inhalte aus fremden Quellen als solche zu kennzeichnen1. Daraus wird eine Regel für die KI-Richtlinie.

  • Prüfe bei jedem geplanten Werkzeug drei Fragen: Sieht es interne Daten, verarbeitet es Inhalte von außen, kann es etwas senden oder ändern.
  • Wenn alle drei Antworten Ja lauten, gehört ein Mensch vor die letzte Aktion. Ein Assistent im Posteingang braucht Leserechte, keine Versandrechte.
  • Erkläre es deinen Leuten, bevor du Werkzeuge freigibst. Fünf Minuten in einer Unterweisung genügen, und das ist zugleich eine Maßnahme nach Artikel 4 der KI-Verordnung.

Wohin diese Regeln schriftlich gehören, steht im Beitrag KI-Richtlinie für Unternehmen erstellen. Worin sich ein KI-Agent von einem Chatbot unterscheidet, steht im Beitrag KI-Agent oder Chatbot. Beim Aufsetzen der Freigabewege unterstütze ich in meiner Beratung zu Regulatorik.

Meine Empfehlung aus Erfahrung

Meine Einschätzung: Das Thema wirkt technisch, ist aber eine Frage der Berechtigungen, und die vergibt keine IT-Abteilung allein. Ich würde bei jedem Assistenten, der Post, Angebote oder Kundendokumente liest, die Versandrechte wegnehmen und erst zurückgeben, wenn jemand benennen kann, was im Fehlerfall passiert. In den Gesprächen, die ich dazu führe, kennt fast niemand diesen Angriffsweg. Deshalb gehört er in jede erste Unterweisung.

Welche drei Fragen stellst du vor jeder Freigabe?

Drei Fragen reichen für den Anfang. Erstens: Aus welchen Quellen bekommt das Werkzeug Text, den nicht wir geschrieben haben. Zweitens: Welche Aktion kann es auslösen, die nach außen wirkt. Drittens: Wer sieht im Nachhinein, was es getan hat, und wie lange bleibt das nachvollziehbar.

Wenn eine dieser Antworten fehlt, ist das kein Grund für ein Verbot, sondern für einen Zwischenschritt. Nimm dem Werkzeug die Rechte, die nach außen wirken, und lass es erst einmal nur lesen und vorschlagen.

Häufige Fragen

Betrifft mich das auch, wenn wir nur einen Chatbot nutzen?

Nur eingeschränkt. Das Bundesamt für Sicherheit in der Informationstechnik knüpft das Risiko daran, dass ein Modell mit externen Quellen und Anwendungen verbunden wird[2]. Ein Sprachmodell ohne Anschluss an eure Systeme kann höchstens eine unsinnige Antwort geben, aber nichts auslösen.

Kann ich die versteckten Anweisungen nicht einfach sehen?

Meist nicht. Das Bundesamt für Sicherheit in der Informationstechnik nennt als Beispiel Unicode-Tags, die verarbeitet, aber nicht für Lesende dargestellt werden[2]. Auch weiße Schrift auf weißem Grund oder Text in einem Anhang fällt niemandem auf. Für das Modell ist beides normaler Text.

Gibt es Zahlen dazu, wie viele Betriebe schon betroffen waren?

Nein. Eine belegte Statistik dazu gibt es nicht. Das Bundeskriminalamt schreibt ausdrücklich, es lägen keine polizeilichen Kennzahlen zum konkreten KI-Einsatz in Cybercrimedelikten vor[3]. Wer eine solche Zahl nennt, kann sie nicht aus einer Primärquelle belegen.

Hilft ein besserer Filter gegen Prompt Injection?

Nur begrenzt. OWASP empfiehlt als Gegenmaßnahmen unter anderem eine menschliche Freigabe für riskante Aktionen, die Beschränkung von Rechten auf das Nötigste und die klare Kennzeichnung von Inhalten aus fremden Quellen[1]. Der Schutz liegt in den Rechten, nicht im Filter.

Quellen

  1. OWASP GenAI Security Project: LLM01:2025 Prompt Injection, OWASP Top 10 for LLM Applications 2025 (2025), abgerufen am 11. September 2026
  2. Bundesamt für Sicherheit in der Informationstechnik: Generative KI-Modelle, Chancen und Risiken für Industrie und Behörden, Version 2.0 (2025), abgerufen am 11. September 2026
  3. Bundeskriminalamt: Bundeslagebild Cybercrime 2025, Abschnitt 3.3 Künstliche Intelligenz (2026), abgerufen am 11. September 2026
  4. BSI und Polizeiliche Kriminalprävention: Cybersicherheitsmonitor 2026, Online-Betrug und Künstliche Intelligenz (2026), abgerufen am 11. September 2026

Stand 2. September 2026 · geprüft am 12. September 2026

Oliver Leifken
Oliver LeifkenZertifizierter KI-Strategieberater. Über zehn Jahre Projekte in der Banken-IT, heute Beratung und Umsetzung für den Mittelstand.Über mich
Und bei dir?

Welche Rechte hat euer KI-Assistent eigentlich?

Sicherheit und Zuständigkeiten sind zwei von sieben Bereichen im Reifegradmodell. Der Check zeigt dir, wo eine Lücke klafft.

Jetzt deinen KI-Reifegrad prüfen Kostenfrei, ohne Termin. Ergebnis sofort, auf Wunsch per E-Mail.
Schreib mir per WhatsApp