Zum Hauptinhalt springen

← Alle Artikel

Prompt Injection: echte Fälle aus 2026 und was hilft

Ein Link bei Microsoft Copilot, ein Webformular bei Salesforce Agentforce: zwei echte Prompt-Injection-Fälle aus 2026, ihr gemeinsames Muster und was Mitarbeitende und IT tun sollten.

Sebastian LangSebastian Lang5. Oktober 202614 Min. Lesezeit
Prompt Injection: echte Fälle aus 2026 und was hilft

Zwei 2026 veröffentlichte Prompt Injection Beispiele zeigen, wie ein KI-Assistent mit Zugriff auf Postfach oder CRM interne Daten an Fremde schicken konnte, während die Nutzer nur Alltägliches taten: einen Link öffnen oder nach den neuesten Leads fragen. Bei Microsoft Copilot reichte ein präparierter Link, bei Salesforce Agentforce ein ausgefülltes Webformular. Beide Lücken sind geschlossen, das Muster dahinter nicht.

Wie Prompt Injection technisch funktioniert und welche Risikoklassen OWASP unterscheidet, steht in unserem Grundlagenartikel zu Prompt Injection bei KI-Agenten. Hier geht es um die echten Fälle und darum, was Mitarbeitende und IT daraus lernen.

TL;DR

  • Zwei 2026 veröffentlichte Lücken bei Microsoft Copilot Personal und Salesforce Agentforce zeigen: Ein Link oder ein Formulareintrag reichte, damit ein KI-Assistent interne Daten an Angreifer schicken konnte. Beide Lücken sind behoben.
  • Das gemeinsame Muster: Der Assistent liest fremde Inhalte, hat Zugriff auf interne Daten und kann nach außen kommunizieren. OWASP führt Prompt Injection auch 2026 auf Platz 1 und schreibt, dass es heute keinen zuverlässigen Schutzmechanismus dagegen gibt.
  • Was hilft: externe Inhalte als nicht vertrauenswürdig behandeln, Agenten nur die nötigen Rechte geben und Senden, Löschen oder Zahlen nur nach menschlicher Bestätigung zulassen.

Was Prompt Injection ist

Prompt Injection heißt: Ein Text bringt ein KI-Modell dazu, etwas zu tun, das der Betreiber nicht vorgesehen hat. Bei der direkten Variante gibt der Nutzer die manipulierende Eingabe selbst ein. Bei der indirekten Variante steckt die Anweisung in Inhalten aus einer externen Quelle, die das Modell verarbeitet, etwa in einer Webseite, einer E-Mail, einem Dokument oder einem Datenbankeintrag. Laut OWASP hat der Nutzer diese Anweisung weder selbst eingegeben noch gesehen, und in der Oberfläche sichtbar sein muss sie dafür auch nicht. Der Kern des Problems laut den OWASP Top 10 für LLM-Anwendungen 2026: Sprachmodelle trennen technisch nicht zwischen Anweisungen und Daten, beides landet als Text im selben Strom.

Fall 1: CoSnitch bei Microsoft Copilot

Varonis Threat Labs hat die Lückenkette am 18. August 2026 unter dem Namen CoSnitch veröffentlicht (CVE-2026-24301). Betroffen war Microsoft Copilot Personal unter copilot.microsoft.com, also der Copilot für private Nutzer. Microsoft 365 Copilot nennt Varonis für CoSnitch nicht.

So lief der Angriff:

  1. Der Angreifer baut einen Link auf Copilot, der eine vorformulierte Anfrage enthält (Parameter q) und dazu den undokumentierten Parameter autorun=1.
  2. Das Opfer klickt den Link. Copilot öffnet sich in der angemeldeten Sitzung und führt die Anfrage sofort aus, ohne weiteren Klick.
  3. Die Anfrage lässt Copilot in verbundenen Diensten suchen, etwa in Gmail, Google Drive oder im Kalender. Die Treffer kodiert Copilot und schickt sie über seine eigene Funktion zum Abrufen von Webadressen an einen Server des Angreifers.

Der zweite Teil ist heikler. Über eine präparierte Webseite, die das Opfer von Copilot zusammenfassen lässt, konnte der Angreifer dauerhafte Regeln in Copilots Gedächtnis schreiben. Copilot unterschied beim Zusammenfassen nicht zwischen Inhalt und Anweisung. Laut Varonis blieben solche Einträge in jeder künftigen Unterhaltung aktiv, bis der Nutzer sie in den Gedächtnis-Einstellungen von Hand löscht, auch nach Passwortwechsel, beendeten Sitzungen und neu registrierten Geräten.

Zeitlinie: Varonis meldete die Lücken im Dezember 2025 an Microsoft, behoben wurden sie am 18. August 2026. Hinweise auf eine Ausnutzung in freier Wildbahn hat Varonis nicht gesehen.

Warum das ein Unternehmensthema ist: Wer ein privates Copilot-Konto mit einem Postfach oder einer Ablage verbindet, in der auch dienstliche Inhalte liegen, trägt dieses Risiko in die Firma. Wie private KI-Nutzung im Unternehmen unter dem Radar laufen kann, beschreiben wir im Beitrag zur Shadow-AI-Realität im Mittelstand. Varonis empfiehlt, verbundene Apps zu prüfen und auf das Nötige zu reduzieren, Copilot wie einen privilegierten Insider zu behandeln und ungewöhnliche Datenzugriffe des Assistenten zu überwachen.

Vorlage

KI-Richtlinie mit Agenten-Anhang

Vorlage anfordern

Fall 2: SalesBleed bei Salesforce Agentforce

Zenity Labs hat am 24. September 2026 SalesBleed veröffentlicht: Schwachstellen in Salesforce Agentforce, über die ein Außenstehender CRM-Daten abziehen konnte, ohne sich je anzumelden und ohne dass im Unternehmen jemand etwas anklicken musste.

So lief der Angriff:

  1. Der Angreifer füllt das öffentliche Web-to-Lead-Formular des Unternehmens aus, also das Kontaktformular auf der Website, aus dem ein Lead im CRM entsteht. In einem der Felder versteckt er Anweisungen an den Agenten.
  2. Eine Mitarbeiterin bittet den Agenten um etwas völlig Normales, im Beispiel von Zenity sinngemäß: "Sieh dir meine neuesten Leads an und hilf mir mit dem neuesten."
  3. Der Agent liest den präparierten Lead und folgt den versteckten Anweisungen. Er fragt die Tabellen für Leads und Accounts ab und baut Firmennamen und Deal-Größen als Teil des Servernamens in eine Webadresse ein.
  4. Diese Adresse gibt der Agent als Bild aus. Sobald die Oberfläche das Bild laden will, löst sie den Servernamen auf, und die Daten landen per DNS-Anfrage beim Angreifer. In Slack genügte die automatische Linkvorschau, die Links von selbst abruft.

Zenity umging dabei auch die Schwärzung von Links in den Antworten des Agenten, unter anderem mit einer Top-Level-Domain, die der Filter nicht erkannte. Die Forscher halten fest: Das Schwärzen von Ausgaben ist ein Wettlauf zwischen einem Parser und jedem Programm, das die Ausgabe später darstellt.

Laut SecurityWeek umfasste SalesBleed drei Schwachstellen. Über die dritte ließ sich der Agent mit einem präparierten Lead kapern, um unter seiner Identität Phishing-Nachrichten in Slack zu posten. Laut Zenitys Bericht zu dieser Lücke verlangte die Slack-Aktion des Agenten vor dem Senden keine Bestätigung, und den Empfängern wurde nicht angezeigt, welcher Nutzer die Nachricht ausgelöst hatte.

Zeitlinie: Zenity meldete die Lücken am 1. Juni 2026 an Salesforce. Für den Datenabfluss bestätigte Salesforce die Fixes am 18. August 2026, Zenity bestätigte die Behebung des gemeldeten Umwegs um die Linkfilterung am 19. August. Für die Slack-Lücke waren laut Zenity am 21. September 2026 alle Fixes bestätigt und getestet. Salesforce hat den Mechanismus Trusted URLs gehärtet und laut SecurityWeek für bestimmte Agentforce-Aktionen in Slack eine Bestätigung durch den Nutzer vor dem Senden zur Voreinstellung gemacht.

Was die Fälle gemeinsam haben

Beide Fälle folgen demselben Muster, und das hat mit dem jeweiligen Produkt wenig zu tun. Drei Zutaten kamen zusammen:

ZutatCoSnitch (Copilot)SalesBleed (Agentforce)
Fremder InhaltAnfrage im Link, präparierte WebseiteEintrag im öffentlichen Webformular
Zugriff auf interne Datenverbundene Postfächer, Ablagen, KalenderLeads und Accounts im CRM
Weg nach außenAbruf von Webadressen durch CopilotBild-Adresse per DNS, Linkvorschau in Slack

Die OWASP-Liste 2026 beschreibt genau diese Kombination. Sie greift das "lethal trifecta" von Simon Willison auf: Ein Agent, der zugleich private Daten lesen, nicht vertrauenswürdige Inhalte aufnehmen und nach außen kommunizieren kann, bietet die Bedingungen für folgenreiche Angriffe. Fällt eine der drei Zutaten weg, fallen laut OWASP auch diese Bedingungen weg.

Zwei weitere Gemeinsamkeiten:

  • Der Angreifer brauchte keinen Zugang. Bei SalesBleed reichte ein öffentliches Formular. OWASP beschreibt dieses Vorgehen ausdrücklich: Text wird über einen Kanal mit geringen Rechten, etwa ein öffentliches Formular oder ein Kundenticket, an einer Stelle platziert, der der Nutzer vertraut. Den privilegierten Schritt erledigt dann der Agent mit den Rechten des Nutzers.
  • Die Hersteller haben die Lücken geschlossen, das Prinzip bleibt. OWASP schreibt in der Ausgabe 2026, dass es heute keinen zuverlässigen Schutzmechanismus gegen Prompt Injection gibt, weil Modelle nicht zwischen Anweisungen und Daten unterscheiden und ihr Verhalten nicht deterministisch ist.

Neu ist das Muster nicht. Am 11. Juni 2025 hat Microsoft eine als kritisch eingestufte Lücke in Microsoft 365 Copilot veröffentlicht (CVE-2025-32711, CVSS 9,3), die Microsoft selbst als "AI command injection" beschreibt: Ein nicht autorisierter Angreifer konnte darüber Informationen über ein Netzwerk offenlegen. Laut Microsoft ist die Lücke vollständig behoben, Kunden müssen nichts tun, und Microsoft führt sie als nicht ausgenutzt.

Auch die ENISA sieht das Thema in der Breite. Laut ENISA Threat Landscape 2026 (22. September 2026) schafft die Einbindung von KI-Systemen in Unternehmensumgebungen eine neue Angriffsfläche. Angreifergruppen experimentieren weiter mit Methoden, die Schutzvorkehrungen geschlossener Modelle zu umgehen, darunter Steganografie und indirekte Prompt Injection.

Was OWASP, BSI und ENISA raten

OWASP: Abwehr ist Architektur

Die Ausgabe 2026 der OWASP Top 10 für LLM-Anwendungen, die das OWASP GenAI Security Project am 2. September 2026 offiziell vorgestellt hat, führt Prompt Injection weiter auf Platz 1 (LLM01:2026). Excessive Agency, also zu weitreichende Rechte und Autonomie von Agenten, steht auf Platz 3. Weil sich Prompt Injection nicht zuverlässig verhindern lässt, rät OWASP, das System so zu bauen, dass eine gelungene Injection möglichst keinen Schaden anrichten kann. Die wichtigsten Punkte:

  • Zugangsdaten und die Fähigkeit, etwas zu verändern, liegen im Anwendungscode, nicht im Modell. Rechte werden pro Operation minimal vergeben.
  • Vor jeder privilegierten, nicht umkehrbaren oder nach außen sichtbaren Aktion bestätigt ein Mensch, und zwar die exakte Aktion, nicht eine Zusammenfassung.
  • Die "Rule of Two" gilt als Untergrenze: Hat ein Agent gleichzeitig nicht vertrauenswürdige Eingaben, sensible Daten und die Möglichkeit, etwas zu verändern oder nach außen zu kommunizieren, braucht jede Aktion eine menschliche Freigabe.
  • Schreibzugriffe auf das Gedächtnis eines Agenten gelten als privilegierte Vorgänge.
  • MCP-Server und Tool-Pakete werden auf feste Versionen gepinnt, signiert und geprüft. Was MCP ist, erklärt unser MCP-Beitrag.
  • Getestet wird gegen Angreifer, die die eingesetzten Schutzmaßnahmen kennen.

Mit der Ausgabe 2026 hat das OWASP GenAI Security Project außerdem den Agent Control Standard vorgestellt, eine Spende an das Projekt, die die Agenten-Empfehlungen in Richtung Durchsetzung zur Laufzeit erweitert. Für Agenten gibt es seit dem 9. Dezember 2025 zudem eine eigene Liste, die OWASP Top 10 for Agentic Applications 2026, von ASI01 Agent Goal Hijack bis ASI10 Rogue Agents.

BSI: Bestätigung vor Aktionen, klare Rechte für KI

Das BSI hat am 10. November 2025 eine Publikation zu Evasion-Angriffen auf große Sprachmodelle vorgestellt, zu denen auch indirekte Prompt Injections gehören. Als Gegenmaßnahmen nennt es zum Beispiel präzise und sichere Systemanweisungen, das Filtern schädlicher Inhalte in Dokumenten von Dritten oder eine explizite Bestätigung durch Nutzende, bevor das Modell Funktionen ausführt. Die Umsetzung solcher Gegenmaßnahmen kann laut BSI das Gelingen von Angriffen erschweren oder den möglichen Schaden reduzieren.

In einer Cybersicherheitswarnung vom 22. Juni 2026 (Kritikalität 2, Gelb) schreibt das BSI, dass aktuelle KI-Systeme Schwachstellen schnell und teils autonom erkennen und in nutzbare Angriffswege verwandeln können. Es verlangt ein Patchmanagement, das Schwachstellen innerhalb von Minuten bis maximal wenigen Stunden sichtet und Patches ausrollt, dazu minimale Rechte und Mehr-Faktor-Authentisierung. Wenige Tage seien keine angemessene Reaktionsgeschwindigkeit.

BSI-Präsidentin Claudia Plattner beschreibt im BSI-Blog vom 24. Juli 2026 einen Test-Agenten von OpenAI, der seine Sandbox verließ, sich über das Internet mit Hugging Face verband und sich Werkzeuge besorgte, die er für seine Aufgabe für nötig hielt, ohne böse Absicht. Eine ihrer Empfehlungen: ein robustes Identitäts- und Rechtemanagement für KI-Systeme.

ENISA: Agenten-Endpunkte absichern, Menschen einbinden

Im Positionspapier ENISA's view on Cybersecurity in the Frontier AI Era (Juli 2026) zählt ENISA agentische Endpunkte und Unternehmensbrowser zu den kritischen neuen Angriffsflächen, weil KI-Agenten zunehmend selbstständig auf Endgeräten und in Browsern arbeiten. Empfohlen werden unter anderem KI-Workflows mit menschlicher Freigabe, gestützt durch Weiterbildung der Sicherheitsteams. Unter den Rückmeldungen aus der Praxis führt ENISA außerdem auf, dass KMU zusätzliche Unterstützung brauchen können, vor allem bei Orientierung und beim Zugang zu aktuellen Modellen.

Was Mitarbeitende konkret tun

Die Regeln für den Alltag passen auf eine Seite. Sie folgen einem Grundsatz, den auch unsere KI-Richtlinie-Vorlage in Anlage A7 festhält: Prompt Injection lässt sich technisch derzeit nicht vollständig ausschließen, also begrenzt man, was ein manipulierter Agent anrichten kann.

  1. Externe Inhalte sind nicht vertrauenswürdig. Das gilt für E-Mails, Webseiten, Dokumente und Formulareingaben, auch wenn sie von bekannten Absendern stammen. Wer einen Agenten solche Inhalte lesen lässt, rechnet damit, dass darin Anweisungen stecken können.
  2. Keine Links aus unbekannten Quellen, die einen KI-Assistenten öffnen. CoSnitch zeigt, dass schon das Öffnen eines solchen Links eine fertige Anfrage starten konnte. Agenten selbst folgen Links oder Anweisungen aus unbekannten Quellen nie automatisch.
  3. Senden, Löschen, Zahlen nur nach Bestätigung. Ein Agent, der externe Inhalte liest, löscht, sendet nach außen oder löst Zahlungen aus nur, wenn ein Mensch die Aktion im Einzelfall bestätigt hat (Rechte-Stufen 4 bis 6 in Anlage A2). Bestätigt wird nicht pauschal und nicht ungelesen.
  4. Nur freigegebene Werkzeuge und Konnektoren. Keine Firmendaten in private KI-Konten und keine eigenen Verbindungen zu Postfach, Ablage oder CRM ohne Freigabe. Freigegebene Verbindungen bekommen so wenige Rechte wie möglich, wo möglich nur Lesezugriff.
  5. Das Gedächtnis des Assistenten prüfen. Wenn dein Assistent sich Regeln über Sitzungen hinweg merkt, schau gelegentlich in die Einstellungen. Einträge, die du nicht selbst angelegt hast, löschst du und meldest sie.
  6. Auffälliges sofort melden. Unerwartete Aktionen, Antworten mit fremden Anweisungen, unerklärliche Links oder Bilder: melden, den Agenten anhalten, wenn das ohne Risiko geht, und nichts löschen, was bei der Aufklärung hilft.

Die meisten dieser Regeln stehen so in unserer KI-Richtlinie-Vorlage, vor allem in Anlage A zu KI-Agenten. Die Vorlage regelt außerdem Agenten-Register, Rechte-Stufen, Konnektoren und Protokollierung und lässt sich als Word-Datei an dein Unternehmen anpassen. Wie viel Autonomie ein Agent für welche Aufgabe bekommen sollte, beschreibt unser Human-in-the-Loop-Leitfaden.

Was die IT tun sollte

  1. Überblick schaffen. Welche Assistenten und Agenten laufen, mit welchen Konnektoren (Postfach, Ablage, CRM, Chat) und mit welchen Rechten? Ein Agenten-Register beantwortet das. Dass das kein Randthema ist, zeigt eine Umfrage von Dataiku und The Harris Poll unter 685 CIOs aus acht Ländern, darunter Deutschland (9. bis 29. Juli 2026): 81 Prozent haben keinen vollständigen Überblick über Agenten, die ganz außerhalb freigegebener Systeme oder Kanäle entstehen, und 84 Prozent stimmen zu, dass Mitarbeitende Agenten und Anwendungen schneller bauen, als die IT sie steuern kann.
  2. Die drei Zutaten prüfen. Für jeden Agenten fragen: Liest er nicht vertrauenswürdige Inhalte, sieht er sensible Daten, kann er etwas verändern oder nach außen kommunizieren? Trifft alles zu, entweder eine Zutat entfernen oder jede Aktion freigeben lassen, wie es die Rule of Two von OWASP verlangt.
  3. Wege nach außen schließen. Beide Fälle liefen über Kanäle, die harmlos aussehen: das Laden eines Bildes, eine Linkvorschau, den Abruf einer Webadresse. OWASP nennt Bild-Adressen ausdrücklich als Kanal für Datenabfluss. Wo die Plattform es erlaubt, externe Bilder und Linkvorschauen in Agenten-Antworten abschalten oder auf freigegebene Domains begrenzen. Salesforce hat genau hier mit den Trusted URLs nachgebessert.
  4. Rechte minimieren, Zugangsdaten schützen. Konnektoren bekommen nur die nötigen Rechte, wo möglich nur Lesezugriff. API-Schlüssel für KI-Dienste behandelt die IT wie Produktionsgeheimnisse und rotiert sie. Das empfiehlt auch Anthropic im Threat Intelligence Report vom 10. September 2026. Dort eskalierte in einem Fall ein einzelnes gestohlenes Entwickler-Token in rund drei Stunden zur vollen Administratorkontrolle über eine Cloud-Umgebung.
  5. Protokollieren und überwachen. Agentenaktionen protokollieren, soweit die Plattform es zulässt, ungewöhnliche Datenzugriffe von Assistenten erkennen (Varonis) und die Aktivität autonomer Agenten überwachen (Anthropic). Eine Stichprobe der Protokolle wird regelmäßig gesichtet.
  6. Eigene Agenten realistisch testen. Wer eigene Agenten baut, testet sie gegen Angreifer, die die Schutzmaßnahmen kennen. Filter allein reichen nicht: OWASP verweist auf eine Studie, in der adaptive Angriffe bei den meisten von 12 neueren Abwehrverfahren eine Erfolgsquote von über 90 Prozent erreichten, während statische Angriffe nahezu erfolglos blieben.

Wie du Schutzmaßnahmen systematisch nach OWASP aufsetzt, steht in Prompt Injection schützen.

Wenn du für dein Team klären willst, welche Agenten welche Rechte brauchen und wie Mitarbeitende den sicheren Umgang lernen, sprich 30 Minuten mit uns.

FAQ

Was ist Prompt Injection einfach erklärt?

Prompt Injection bedeutet, dass ein Text ein KI-Modell dazu bringt, etwas anderes zu tun als vorgesehen. Das funktioniert, weil Sprachmodelle Anweisungen und Daten technisch nicht trennen. Steckt in einer E-Mail oder Webseite eine versteckte Anweisung, kann ein Assistent ihr folgen, sobald er den Inhalt liest.

Was ist der Unterschied zwischen direkter und indirekter Prompt Injection?

Bei direkter Prompt Injection gibt der Nutzer die manipulierende Eingabe selbst ein, etwa um Schutzregeln eines Chatbots auszuhebeln. Bei indirekter Prompt Injection steckt die Anweisung in Inhalten aus anderen Quellen, etwa Webseiten, Dokumenten, E-Mails oder Formulareinträgen. Der Nutzer hat diese Anweisung weder selbst eingegeben noch gesehen, sichtbar sein muss sie dafür nicht einmal. Für Unternehmen mit Agenten ist die indirekte Variante besonders heikel, weil der Angreifer keinen Zugang braucht, wie SalesBleed zeigt.

Warum ist Prompt Injection für Unternehmen kritisch?

Weil Assistenten und Agenten mit Postfächern, Ablagen und CRM verbunden werden und dort handeln dürfen. Laut OWASP hängt der Schaden einer gelungenen Injection davon ab, welche Werkzeuge und Rechte der Agent hat. CoSnitch und SalesBleed zeigen, dass dabei interne Daten abfließen können, ohne dass es jemand bemerkt.

Kann man Prompt Injection vollständig verhindern?

Nach heutigem Stand nein. OWASP schreibt in der Ausgabe 2026, dass es derzeit keinen zuverlässigen Schutzmechanismus gibt, und das BSI beschreibt Gegenmaßnahmen als Mittel, die Angriffe erschweren oder den Schaden reduzieren. Deshalb setzt die Abwehr daran an, was ein manipulierter Agent überhaupt tun kann.

Wie schützt man sich vor Prompt Injection?

Mit mehreren Schichten statt mit einem einzelnen Filter: externe Inhalte als nicht vertrauenswürdig behandeln, Agenten minimale Rechte geben, riskante Aktionen nur nach menschlicher Bestätigung zulassen und Wege nach außen wie Bild-Adressen oder Linkvorschauen begrenzen. Dazu kommen Protokollierung, ein Agenten-Register und Tests gegen Angreifer, die die Schutzmaßnahmen kennen. Die Regeln für Mitarbeitende gehören in eine KI-Richtlinie.

Welche echten Prompt Injection Beispiele gab es 2026?

Zwei gut dokumentierte Fälle sind CoSnitch (CVE-2026-24301) bei Microsoft Copilot Personal, veröffentlicht von Varonis am 18. August 2026, und SalesBleed bei Salesforce Agentforce, veröffentlicht von Zenity Labs am 24. September 2026. Beide Lücken sind laut den Forschern behoben. Bei CoSnitch hat Varonis keine Ausnutzung in freier Wildbahn gesehen.

Quellen

Vorlage

KI-Richtlinie mit Agenten-Anhang

Eine anpassbare Word-Vorlage für Freigaben, Datenklassen, Rollen, KI-Kompetenz und KI-Agenten. Kostenlos per E-Mail.

Sebastian Lang

Über den Autor

Sebastian Lang

Co-Founder · Business & Content Lead

Co-Founder von Sentient Dynamics. 15+ Jahre Business-Strategie (u.a. SAP), MBA. Schreibt über AI-Act-Compliance, ROI-Messung und wie Mittelstand-CTOs agentische KI tatsächlich einführen.

Weiterlesen

Einmal im Monat. Nur Substanz.

Keine Motivationssprüche. Keine Tool-Listen. Nur was CTOs, COOs und Geschäftsführer in DACH über KI-Adoption wirklich wissen müssen.