Guardrails
Führen Sie Sicherheitsprüfungen vor und nach den Antworten Ihres Agenten aus: Themenfokus, Prompt-Injection-Erkennung und Inhaltsmoderation.
Guardrails sind Sicherheitsprüfungen, die vor und nach den Antworten Ihres Agenten ausgeführt werden. Aktivieren Sie die gewünschten Prüfungen, und der Agent blockiert Anfragen, die außerhalb davon liegen, statt sie zu beantworten.
Eine ehrliche Einschränkung vorab: Guardrails sind ein bestmöglicher Schutz, keine absolute Garantie. Die Prüfungen für Themenfokus, Prompt-Injection-Klassifizierung und Inhaltsmoderation rufen einen externen Anbieter auf; kommt es dabei zu einem Timeout oder Fehler, antwortet der Agent trotzdem, statt mit dem Anbieter auszufallen (Fail-Open-Verhalten). Nur der integrierte Prompt-Injection-Musterabgleich läuft vollständig lokal. Betrachten Sie Guardrails als starken Filter, nicht als harte Sicherheitsgrenze.
Guardrails aktivieren
- Gehen Sie zu Ihrem Agenten-Dashboard
- Klicken Sie auf Einstellungen
- Wählen Sie Sicherheit
- Öffnen Sie die Karte Guardrails und aktivieren Sie die gewünschten Prüfungen
- Speichern
Guardrails werden pro Agent konfiguriert. Jeder Agent hat seine eigenen Einstellungen – es gibt keinen Workspace-weiten Standard, aktivieren Sie sie also separat für jeden Agenten, den Sie schützen möchten.
Diese Einstellungen gelten für den Chat und für generierte E-Mail-Antworten. Die folgenden Abschnitte beschreiben das Verhalten im Chat; die Unterschiede bei E-Mails finden Sie unter E-Mail-Antworten.
Die drei Prüfungen
Themenfokus
Blockiert Anfragen, die nicht zum öffentlichen Zweck dieses Agenten passen – die Prüfung bewertet jede Anfrage anhand des Website-Namens Ihres Agenten, nicht anhand Ihrer Quellen. Nutzen Sie diese Prüfung, wenn Ihr Agent bei Ihrem Produkt, Ihrer Dienstleistung oder Ihrer Dokumentation bleiben soll, statt allgemeine Fragen zu beantworten.
Prompt-Injection-Erkennung
Blockiert Versuche, Ihre Anweisungen zu ersetzen, versteckte Prompts offenzulegen oder den Agenten zur Nutzung seiner Tools zu zwingen.
Inhaltsmoderation
Prüft Besuchereingaben und Agentenantworten auf unsichere Inhalte. Dies ist die einzige Prüfung, die auch betrachtet, was der Agent gesagt hat. Bei der Ausgabe prüft sie nur den Haupttext der Antwort des Agenten: automatisch generierte Chips mit vorgeschlagenen Nachrichten werden nicht separat geprüft – allerdings werden überhaupt keine Chips erzeugt, wenn die Hauptantwort markiert wurde.
Was bei der Eingabe passiert
Die aktivierten Prüfungen laufen, bevor das Modell eine Antwort verfasst.
- Ein schneller Musterabgleich für bekannte Prompt-Injection-Formulierungen kann eine Nachricht sofort blockieren, bevor die anderen Prüfungen laufen.
- Die übrigen aktivierten Prüfungen können gemeinsam statt nacheinander laufen.
- Löst eine aktivierte Prüfung an, wird der Zug blockiert, und der Besucher bekommt die Antwort des Modells nie zu sehen.
Die Prüfungen lesen nur einen begrenzten Ausschnitt, nicht die gesamte Nutzlast: Nur die ersten 8.000 Zeichen der Besuchernachricht werden geprüft (der bisherige Verlauf und Anhangstexte werden separat begrenzt), während die vollständige Nachricht trotzdem beim Modell ankommt. Eine ungewöhnlich lange Nachricht kann daher ungeprüften Inhalt an den Eingabeprüfungen vorbeischleusen.
Lösen bei derselben Nachricht mehrere Prüfungen aus, folgt der protokollierte Grund einer festen Meldereihenfolge: zuerst Inhaltsmoderation, dann der Prompt-Injection-Klassifizierer, dann der Themen-Klassifizierer.
Was der Besucher bei einer Blockierung sieht
Wenn Sie die Blockierungsnachricht (Override) ausgefüllt haben, erhält der Besucher diese Nachricht. Lassen Sie das Feld leer, verwendet der Agent stattdessen einen integrierten Standardtext:
- Themenfremde Anfragen erhalten „I can only help with questions about your site name. What would you like to know?“ (sinngemäß: „Ich kann nur bei Fragen zu Ihrem Website-Namen helfen. Was möchten Sie wissen?“)
- Jede andere Blockierung erhält „Sorry, I can't help with that. Is there anything else I can help you with?“ (sinngemäß: „Entschuldigung, dabei kann ich nicht helfen. Gibt es etwas anderes, womit ich helfen kann?“)
Der Override ist optional und auf 500 Zeichen begrenzt.
Zwei Dinge sollten Sie zu blockierten Zügen wissen:
- Sie zählen weiterhin zu Ihrem Nachrichtenkontingent. Die Prüfung läuft bei einer echten Anfrage, daher wird der Zug wie jeder andere abgerechnet.
- Sie werden gespeichert. Blockierte Züge erscheinen in den Chat-Protokollen mit dem angehängten Guardrail-Grund, sodass Sie prüfen können, was erkannt wurde.
Was bei der Ausgabe passiert
Die Inhaltsmoderation läuft außerdem einmal, nachdem das Modell geantwortet hat. Themenfokus und Prompt-Injection-Erkennung laufen nicht bei der Ausgabe.
Eine Markierung der Ausgabe zieht die Antwort nicht zurück – der Besucher hat sie bereits gesehen, und sie bleibt in der Unterhaltung erhalten. Stattdessen bewirkt die Markierung:
- Die Markierung wird auf diesem Zug vermerkt, sodass Sie ihn in den Chat-Protokollen prüfen können
- Die vorgeschlagenen Nachrichten, die dieser Zug sonst angeboten hätte, werden übersprungen
Es gibt keine Blockierung der Ausgabe: Antworten werden dem Besucher gestreamt, bevor die Prüfung abgeschlossen ist, daher ist die Ausgabeprüfung ein Prüfsignal, kein Filter. Das Verschärfen der Quellen und Anweisungen des Agenten macht unsichere Ausgaben unwahrscheinlicher, kann aber nicht garantieren, dass sie nie angezeigt werden.
E-Mail-Antworten
Bei E-Mails laufen die Prüfungen vor dem Entwerfen und nach der Generierung. Wird die Eingabe blockiert, bleibt die Nachricht zur manuellen Prüfung liegen, ohne dass eine Antwort generiert oder Nachrichtenkontingent verbraucht wird. Wird die Ausgabe markiert, bleibt der Entwurf unter Aktivität > E-Mails > Zu prüfen und wird nicht automatisch gesendet; das Generieren dieses Entwurfs verbraucht dennoch Kontingent.
Diese Prüfungen gelten auch, wenn Sie Antwort entwerfen wählen. Beim manuellen Senden werden die Prüfungen nicht erneut ausgeführt. Prüfen Sie markierte Entwürfe vor dem Senden. Informationen zur Einrichtung und zu den Posteingangseinstellungen finden Sie im E-Mail-Leitfaden.
Falsch-Positive
Sicherheitsprüfungen können gelegentlich eine berechtigte Anfrage blockieren. Prüfen Sie markierte Unterhaltungen in den Chat-Protokollen, bevor Sie breiter aktivieren. Das Filtern der Chat-Protokolle nach guardrail-markierten Unterhaltungen ist der schnellste Weg, um zu erkennen, ob eine Prüfung für Ihr Publikum zu aggressiv ist.
Wenn eine Prüfung zu viel blockiert:
- Schalten Sie sie aus. Der Themenfokus beurteilt jede Anfrage nur anhand des öffentlichen Zwecks Ihres Agenten (seines Website-Namens) – er liest weder Ihre Quellen noch Ihre Anweisungen, sodass zusätzliche Inhalte nicht erweitern können, was er akzeptiert
- Legen Sie eine freundlichere Blockierungsnachricht (Override) fest, damit die Sackgasse dennoch gut wirkt