Garde-fous

Exécutez des contrôles de sécurité avant et après la réponse de votre agent : focus thématique, détection d’injection de prompt et modération du contenu.

Les garde-fous sont des contrôles de sécurité qui s’exécutent avant et après que votre agent répond. Activez les contrôles que vous souhaitez, et l’agent bloque les demandes qui en sortent au lieu d’y répondre.

Une précision honnête d’entrée de jeu : les garde-fous relèvent du meilleur effort, pas d’une garantie absolue. Les contrôles de sujet, de classification d’injection de prompt et de modération du contenu font appel à un fournisseur externe ; en cas de délai dépassé ou d’erreur, l’agent répond quand même plutôt que de tomber en panne avec le fournisseur (comportement de repli ouvert, ou « fail open »). Seule la correspondance de motif d’injection de prompt intégrée fonctionne entièrement en local. Considérez les garde-fous comme un filtre robuste, pas comme une frontière de sécurité absolue.

Activer les garde-fous

  1. Accédez au tableau de bord de votre agent
  2. Cliquez sur Paramètres
  3. Sélectionnez Sécurité
  4. Ouvrez la carte Garde-fous et activez les contrôles souhaités
  5. Enregistrez

Les garde-fous sont configurés par agent. Chaque agent a ses propres paramètres — il n’existe pas de valeur par défaut à l’échelle de l’espace de travail, activez-les donc séparément sur chaque agent que vous souhaitez protéger.

Ces paramètres s'appliquent au chat et aux réponses e-mail générées. Les sections ci-dessous décrivent le comportement du chat ; consultez Réponses par e-mail pour les différences propres à l'e-mail.

Les trois contrôles

Focus thématique

Bloque les demandes sans rapport avec l’objectif public de cet agent — le contrôle évalue chaque demande par rapport au nom du site de votre agent, pas par rapport à vos sources. Utilisez-le lorsque votre agent doit rester centré sur votre produit, votre service ou votre documentation plutôt que de répondre à des questions générales.

Détection d’injection de prompt

Bloque les tentatives de remplacer vos instructions, de révéler des prompts cachés ou de forcer l’agent à utiliser ses outils.

Modération du contenu

Vérifie les entrées des visiteurs et les réponses de l’agent à la recherche de contenu à risque. C’est le seul contrôle qui examine aussi ce que l’agent a dit. En sortie, il ne vérifie que le texte de la réponse principale de l’agent : les chips de messages suggérés générés automatiquement ne sont pas vérifiés séparément — même si aucun chip n’est produit lorsque la réponse principale a été signalée.

Ce qui se passe en entrée

Les contrôles activés s’exécutent avant que le modèle ne rédige une réponse.

  • Une correspondance de motif rapide pour les formulations d’injection de prompt bien connues peut bloquer un message immédiatement, avant que les autres contrôles ne s’exécutent.
  • Les contrôles activés restants peuvent s’exécuter ensemble plutôt que l’un après l’autre.
  • Si un contrôle activé se déclenche, le tour est bloqué et le visiteur ne voit jamais la réponse du modèle.

Les contrôles ne lisent qu’un extrait borné, pas l’intégralité du contenu : seuls les 8 000 premiers caractères du message du visiteur sont examinés (l’historique récent et le texte des pièces jointes sont plafonnés séparément), tandis que le message complet parvient tout de même au modèle. Un message inhabituellement long peut donc faire passer du contenu non examiné au-delà des contrôles en entrée.

Quand plusieurs contrôles se déclenchent sur le même message, la raison enregistrée suit un ordre de priorité fixe : modération du contenu, puis le classificateur d’injection de prompt, puis le classificateur de sujet.

Ce que voit le visiteur en cas de blocage

Si vous avez renseigné le message personnalisé en cas de blocage, le visiteur reçoit ce message. Laissez-le vide et l’agent utilise un message par défaut intégré :

  • Les demandes hors sujet reçoivent "I can only help with questions about your site name. What would you like to know?" (en français, en substance : « Je ne peux vous aider que pour des questions concernant le nom de votre site. Que souhaitez-vous savoir ? »)
  • Tout autre blocage reçoit "Sorry, I can't help with that. Is there anything else I can help you with?" (en français, en substance : « Désolé, je ne peux pas vous aider avec cela. Puis-je vous aider avec autre chose ? »)

Le message personnalisé est facultatif et limité à 500 caractères.

Deux choses à savoir sur les tours bloqués :

  • Ils comptent toujours dans votre quota de messages. Le contrôle s’exécute sur une requête réelle, le tour est donc facturé comme n’importe quel autre.
  • Ils sont enregistrés. Les tours bloqués apparaissent dans les journaux de discussion avec la raison du garde-fou associée, afin que vous puissiez examiner ce qui a été détecté.

Ce qui se passe en sortie

La modération du contenu s’exécute aussi une fois après que le modèle a répondu. Le focus thématique et la détection d’injection de prompt ne s’exécutent pas en sortie.

Un signalement en sortie ne retire pas la réponse — le visiteur l’a déjà vue, et elle reste dans la conversation. Ce que fait le signalement à la place :

  • Enregistre le signalement sur ce tour afin que vous puissiez l’examiner dans les journaux de discussion
  • Ignore les messages suggérés que ce tour aurait autrement proposés

Il n’y a pas de blocage de la sortie : les réponses sont diffusées au visiteur avant la fin du contrôle, si bien que le contrôle en sortie est un signal de revue, pas un filtre. Resserrer les sources et les instructions de l’agent rend un contenu en sortie à risque moins probable, mais ne peut pas garantir qu’il ne soit jamais affiché.

Réponses par e-mail

Pour les e-mails, les vérifications s'exécutent avant la rédaction et après la génération. Un blocage en entrée laisse le message en attente de révision humaine, sans générer de réponse ni consommer de quota de messages. Un signalement en sortie conserve le brouillon dans Activité > E-mails > À examiner et empêche l'envoi automatique ; la génération de ce brouillon consomme tout de même du quota.

Ces vérifications s'appliquent aussi lorsque vous choisissez Rédiger une réponse. L’envoi manuel ne relance pas les vérifications. Relisez les brouillons signalés avant de les envoyer. Consultez le guide e-mail pour la configuration et les contrôles de la boîte de réception.

Faux positifs

Les contrôles de sécurité peuvent occasionnellement bloquer une demande légitime. Passez en revue les conversations signalées dans les journaux de discussion avant d’activer plus largement. Filtrer les journaux de discussion sur les conversations signalées par un garde-fou est le moyen le plus rapide de voir si un contrôle est trop agressif pour votre audience.

Si un contrôle bloque trop de choses :

  • Désactivez-le. Le focus thématique évalue chaque demande uniquement par rapport à l’objectif public de votre agent (le nom de votre site) — il ne lit ni vos sources ni vos instructions, donc ajouter du contenu ne peut pas élargir ce qu’il accepte
  • Définissez un message personnalisé en cas de blocage plus convivial pour que l’impasse reste agréable à lire

Étapes suivantes