Guardrails

Esegui controlli di sicurezza prima e dopo che il tuo agente risponde: focus sull'argomento, rilevamento di prompt injection e moderazione dei contenuti.

I Guardrails sono controlli di sicurezza eseguiti prima e dopo che il tuo agente risponde. Attiva i controlli che vuoi usare: l'agente bloccherà le richieste che ne restano fuori invece di rispondere.

Un avviso onesto in apertura: i Guardrails sono un tentativo di massimo impegno, non una garanzia assoluta. I controlli su argomento, classificatore di prompt injection e moderazione dei contenuti chiamano un provider esterno; se un controllo va in timeout o restituisce un errore, l'agente risponde comunque invece di bloccarsi insieme al provider (comportamento "fail open"). Solo il confronto con pattern di prompt injection integrato funziona interamente in locale. Considera i Guardrails un filtro efficace, non un confine di sicurezza assoluto.

Attivare i Guardrails

  1. Vai alla dashboard del tuo agente
  2. Fai clic su Impostazioni
  3. Seleziona Sicurezza
  4. Apri la scheda Guardrails e attiva i controlli che vuoi
  5. Salva

I Guardrails si configurano per singolo agente. Ogni agente ha le proprie impostazioni — non esiste un valore predefinito a livello di workspace, quindi attivali separatamente su ogni agente che vuoi proteggere.

Queste impostazioni si applicano alla chat e alle risposte email generate. Le sezioni seguenti descrivono il comportamento della chat; consulta Risposte email per le differenze relative alle email.

I Tre Controlli

Focus sull'argomento

Blocca le richieste non collegate allo scopo pubblico di questo agente — il controllo valuta ogni richiesta in base al nome del sito del tuo agente, non alle tue fonti. Usalo quando l'agente deve restare sul tuo prodotto, servizio o sulla documentazione invece di rispondere a domande generiche.

Rilevamento di prompt injection

Blocca i tentativi di sostituire le tue istruzioni, rivelare prompt nascosti o costringere l'agente a usare i suoi strumenti.

Moderazione dei contenuti

Controlla sia il messaggio del visitatore sia la risposta dell'agente alla ricerca di contenuti non sicuri. È l'unico controllo che esamina anche ciò che dice l'agente. In uscita controlla solo il testo della risposta principale dell'agente: i chip dei messaggi suggeriti generati automaticamente non vengono controllati separatamente — anche se non viene prodotto alcun chip quando la risposta principale riceve un flag.

Cosa Succede in Ingresso

I controlli attivati vengono eseguiti prima che il modello scriva una risposta.

  • Un rapido confronto con pattern noti di prompt injection può bloccare un messaggio immediatamente, prima che vengano eseguiti gli altri controlli.
  • I restanti controlli attivati possono essere eseguiti insieme invece che uno dopo l'altro.
  • Se un controllo attivato scatta, il turno viene bloccato e il visitatore non vede mai la risposta del modello.

I controlli leggono un estratto limitato, non l'intero payload: vengono ispezionati solo i primi 8.000 caratteri del messaggio del visitatore (la cronologia recente e il testo degli allegati sono limitati separatamente), mentre il messaggio completo raggiunge comunque il modello. Un messaggio insolitamente lungo può quindi far passare contenuto non ispezionato oltre i controlli in ingresso.

Quando più di un controllo scatta sullo stesso messaggio, il motivo registrato segue un ordine di priorità fisso: prima la moderazione dei contenuti, poi il classificatore di prompt injection, infine il classificatore dell'argomento.

Cosa Vede il Visitatore Quando Viene Bloccato

Se hai compilato il campo Messaggio personalizzato di blocco, il visitatore riceve quel messaggio. Lascialo vuoto e l'agente userà invece un messaggio predefinito integrato:

  • Le richieste fuori tema ricevono: "I can only help with questions about your site name. What would you like to know?" (in italiano, in sostanza: "Posso aiutarti solo con domande su nome del tuo sito. Cosa vorresti sapere?")
  • Ogni altro blocco riceve: "Sorry, I can't help with that. Is there anything else I can help you with?" (in italiano, in sostanza: "Mi dispiace, non posso aiutarti con questo. C'è qualcos'altro con cui posso esserti utile?")

Il campo è facoltativo e limitato a 500 caratteri.

Due cose da sapere sui turni bloccati:

  • Vengono comunque conteggiati nella tua quota di messaggi. Il controllo viene eseguito su una richiesta reale, quindi il turno viene addebitato come qualsiasi altro.
  • Vengono salvati. I turni bloccati compaiono nei Log chat con il motivo del guardrail allegato, così puoi rivedere cosa è stato intercettato.

Cosa Succede in Uscita

La moderazione dei contenuti viene eseguita anche una volta dopo che il modello ha risposto. Il focus sull'argomento e il rilevamento di prompt injection non vengono eseguiti in uscita.

Un flag in uscita non ritira la risposta — il visitatore l'ha già vista e resta nella conversazione. Ecco cosa fa invece il flag:

  • Registra il flag su quel turno, così puoi rivederlo nei Log chat
  • Salta i messaggi suggeriti che quel turno avrebbe altrimenti offerto

Non esiste un blocco dell'output: le risposte vengono trasmesse in streaming al visitatore prima che il controllo sia completato, quindi il controllo in uscita è un segnale di revisione, non un filtro. Restringere le fonti e le istruzioni dell'agente rende un output non sicuro meno probabile, ma non può garantire che non venga mai mostrato.

Risposte email

Per le email, i controlli vengono eseguiti prima della stesura e dopo la generazione. Un blocco in ingresso lascia il messaggio in attesa di revisione umana senza generare una risposta né consumare quota messaggi. Una segnalazione in uscita mantiene la bozza in Attività > Email > Da rivedere e impedisce l'invio automatico; la generazione di quella bozza consuma comunque quota.

Questi controlli si applicano anche quando scegli Prepara una risposta. L’invio manuale non ripete i controlli. Rivedi le bozze segnalate prima di inviarle. Consulta la guida email per la configurazione e i controlli della casella di posta.

Falsi Positivi

I controlli di sicurezza possono occasionalmente bloccare una richiesta legittima. Rivedi le conversazioni segnalate nei Log chat prima di attivare i controlli più ampiamente. Filtrare i Log chat per le conversazioni segnalate dai guardrail è il modo più rapido per capire se un controllo è troppo aggressivo per il tuo pubblico.

Se un controllo blocca troppo:

  • Disattivalo. Il focus sull'argomento valuta ogni richiesta solo rispetto allo scopo pubblico del tuo agente (il nome del suo sito) — non legge le tue fonti né le tue istruzioni, quindi aggiungere contenuti non può ampliare ciò che accetta
  • Imposta un Messaggio personalizzato di blocco più cordiale, così anche il vicolo cieco si legge bene

Prossimi Passi