Guardrails

Voer voor en na elk antwoord van je agent veiligheidscontroles uit: onderwerpfocus, prompt-injectiedetectie en contentmoderatie.

Guardrails zijn veiligheidscontroles die vóór en na elke reactie van je agent worden uitgevoerd. Schakel de controles in die je wilt, en de agent blokkeert verzoeken die daarbuiten vallen in plaats van ze te beantwoorden.

Eerlijke kanttekening vooraf: Guardrails zijn een best-effort maatregel, geen absolute garantie. De controles voor onderwerp, prompt-injectieclassificatie en contentmoderatie roepen een externe provider aan; loopt een controle vast op een timeout of fout, dan antwoordt de agent toch, in plaats van samen met de provider uit te vallen (fail-open-gedrag). Alleen de ingebouwde patroonherkenning voor prompt-injectie werkt volledig lokaal. Beschouw Guardrails als een sterk filter, niet als een harde beveiligingsgrens.

Guardrails inschakelen

  1. Ga naar het dashboard van je agent
  2. Klik op Instellingen
  3. Selecteer Beveiliging
  4. Open de kaart Guardrails en schakel de gewenste controles in
  5. Sla op

Guardrails worden per agent geconfigureerd. Elke agent heeft zijn eigen instellingen — er is geen standaardinstelling voor de hele werkruimte, dus schakel ze afzonderlijk in voor elke agent die je wilt beschermen.

Deze instellingen gelden voor chat en voor gegenereerde e-mailantwoorden. De onderstaande secties beschrijven het gedrag in de chat; zie E-mailantwoorden voor de verschillen bij e-mail.

De drie controles

Onderwerpfocus

Blokkeert verzoeken die geen verband houden met het publieke doel van deze agent — de controle beoordeelt elk verzoek aan de hand van de sitenaam van je agent, niet aan de hand van je bronnen. Gebruik dit wanneer je agent zich moet beperken tot je product, dienst of documentatie in plaats van algemene vragen te beantwoorden.

Prompt-injectiedetectie

Blokkeert pogingen om je instructies te vervangen, verborgen prompts te onthullen of de agent te dwingen zijn tools te gebruiken.

Contentmoderatie

Controleert de invoer van bezoekers en de uitvoer van de agent op onveilige content. Dit is de enige controle die ook kijkt naar wat de agent heeft gezegd. Bij de uitvoer controleert het alleen de hoofdtekst van het antwoord van de agent: automatisch gegenereerde chips met voorgestelde berichten worden niet apart gecontroleerd — al worden er helemaal geen chips gegenereerd wanneer het hoofdantwoord is gemarkeerd.

Wat er gebeurt bij invoer

De ingeschakelde controles worden uitgevoerd voordat het model een antwoord schrijft.

  • Een snelle patroonherkenning voor bekende prompt-injectiezinnen kan een bericht direct blokkeren, voordat de andere controles worden uitgevoerd.
  • De overige ingeschakelde controles kunnen gelijktijdig worden uitgevoerd in plaats van na elkaar.
  • Als een ingeschakelde controle wordt geactiveerd, wordt de beurt geblokkeerd en krijgt de bezoeker het antwoord van het model nooit te zien.

De controles lezen een beperkt fragment, niet de volledige payload: alleen de eerste 8.000 tekens van het bericht van de bezoeker worden geïnspecteerd (recente geschiedenis en bijlagetekst worden apart begrensd), terwijl het volledige bericht wel bij het model terechtkomt. Een ongewoon lang bericht kan daardoor niet-geïnspecteerde content langs de invoercontroles smokkelen.

Wanneer meer dan één controle wordt geactiveerd op hetzelfde bericht, volgt de vastgelegde reden een vaste rapportagevolgorde: contentmoderatie, dan de prompt-injectieclassifier, dan de onderwerpclassifier.

Wat de bezoeker ziet bij blokkering

Als je het veld Aangepast blokkeerbericht hebt ingevuld, krijgt de bezoeker dat bericht te zien. Laat je het leeg, dan gebruikt de agent in plaats daarvan een ingebouwde standaardtekst:

  • Verzoeken buiten het onderwerp krijgen "I can only help with questions about your site name. What would you like to know?"
  • Elke andere blokkering krijgt "Sorry, I can't help with that. Is there anything else I can help you with?"

Dit veld is optioneel en beperkt tot 500 tekens.

Twee dingen om te weten over geblokkeerde beurten:

  • Ze tellen nog steeds mee voor je berichtenquota. De controle wordt uitgevoerd op een echt verzoek, dus de beurt wordt net als elke andere in rekening gebracht.
  • Ze worden opgeslagen. Geblokkeerde beurten verschijnen in Chatlogs met de guardrail-reden erbij, zodat je kunt bekijken wat er is tegengehouden.

Wat er gebeurt bij uitvoer

Contentmoderatie wordt ook één keer uitgevoerd nadat het model heeft geantwoord. Onderwerpfocus en prompt-injectiedetectie worden niet op de uitvoer uitgevoerd.

Een markering op de uitvoer trekt het antwoord niet in — de bezoeker heeft het al gezien en het blijft in het gesprek staan. Wat de markering wel doet:

  • Legt de markering vast op die beurt, zodat je die kunt bekijken in Chatlogs
  • Slaat de voorgestelde berichten over die die beurt anders zou hebben aangeboden

Er is geen blokkering van de uitvoer: antwoorden worden naar de bezoeker gestreamd voordat de controle is afgerond, dus de uitvoercontrole is een reviewsignaal, geen filter. Het verscherpen van de bronnen en instructies van de agent maakt onveilige uitvoer minder waarschijnlijk, maar kan niet garanderen dat deze nooit wordt getoond.

E-mailantwoorden

Bij e-mail worden de controles uitgevoerd vóór het opstellen en na het genereren. Bij een geblokkeerde invoer blijft het bericht staan voor menselijke beoordeling, zonder dat er een antwoord wordt gegenereerd of berichtenquotum wordt gebruikt. Bij een gemarkeerde uitvoer blijft het concept in Activiteit > E-mails > Te beoordelen staan en wordt het niet automatisch verzonden; het genereren van dat concept gebruikt wel quotum.

Deze controles gelden ook wanneer u Antwoord opstellen kiest. Handmatig verzenden voert de controles niet opnieuw uit. Controleer gemarkeerde concepten voordat je ze verzendt. Zie de e-mailgids voor de configuratie en de inboxinstellingen.

Vals-positieven

Veiligheidscontroles kunnen af en toe een legitiem verzoek blokkeren. Bekijk gemarkeerde gesprekken in Chatlogs voordat je breder gaat inschakelen. Chatlogs filteren op gesprekken die door guardrails zijn gemarkeerd, is de snelste manier om te zien of een controle te streng is voor je doelgroep.

Als een controle te veel blokkeert:

  • Schakel de controle uit. Onderwerpfocus beoordeelt elk verzoek alleen aan de hand van het openbare doel van je agent (de naam van de site) — het leest je bronnen of instructies niet, dus extra inhoud toevoegen kan niet verruimen wat het accepteert
  • Stel een vriendelijker Aangepast blokkeerbericht in, zodat de doodlopende weg toch prettig leest

Volgende stappen