Prompt Injection

Was ist Prompt Injection einfach erklärt?

Der Versuch, ein KI-System zu steuern, indem man ihm untergeschobene Anweisungen zu lesen gibt, statt es zu fragen. Weil ein Sprachmodell Anweisung und Inhalt nicht sicher trennt, kann Text aus einer Quelle wie ein Befehl wirken.

Was ist der Unterschied zwischen direkter und indirekter Prompt Injection?

Bei der direkten tippt der Angreifer die Anweisung selbst in den Chat. Bei der indirekten platziert er sie in Material, das das System später liest, etwa ein PDF, eine Produktbeschreibung oder eine Webseite. Die indirekte Variante ist gefährlicher, weil niemand etwas eintippt.

Reicht ein guter System-Prompt, um sich zu schützen?

Nein. Ein System-Prompt ist eine Bitte, keine Mauer. Sprachmodelle arbeiten probabilistisch, und eine gut platzierte Anweisung im Material kann die Vorgabe überstimmen. Ein Prompt ist eine Schicht von mehreren, nicht der Schutz.

Welche geschäftlichen Schäden kann Prompt Injection verursachen?

Falsche Aussagen, manipulierte Empfehlungen, untergeschobene Rabatte, Lead-Missbrauch, Datenabfluss und Kostenangriffe. Der Schaden trifft Glaubwürdigkeit, Umsatz und im schlimmsten Fall die Rechtslage.

Warum erhöhen RAG und Aktionsfunktionen das Risiko?

Jede zusätzliche Quelle, aus der ein Berater antwortet, ist eine mögliche Eintrittsstelle. Und je mehr ein Berater auslösen kann, etwa einen Rabatt oder eine Weiterleitung, desto teurer wird eine erfolgreiche Manipulation. Mehr Fähigkeit heißt mehr Angriffsfläche.

Wie schützt man einen KI-Kundenchat wirksam?

Mit mehreren Schichten (Defense in Depth): kuratierte Quellen, minimale Berechtigungen, serverseitige Kontrollen für kritische Aktionen, Ausgabeprüfung, menschliche Freigaben, regelmäßige Tests und Monitoring. Kritische Entscheidungen dürfen nicht allein im Sprachmodell fallen.

Kann man Prompt Injection vollständig verhindern?

Nein, solange KI-Systeme aus Text arbeiten. Seriöse Anbieter versprechen keine absolute Sicherheit, sondern benennen die Grenzen und bauen so, dass die Architektur auch dann trägt, wenn eine einzelne Schutzschicht versagt.

Wie geht Klariton mit dem Risiko um?

Klariton setzt auf mehrere Schutzschichten: kuratierte und nachvollziehbare Wissensquellen, kontrollierte Veröffentlichung, eingeschränkte Berechtigungen, Sicherheitstests und bewusste Aktivierung. Da Prompt Injection kein vollständig gelöstes Problem ist, werden besonders kritische Entscheidungen zusätzlich außerhalb des Sprachmodells technisch abgesichert.