Guardrails

Execute verificações de segurança antes e depois das respostas do seu agente: foco no tópico, detecção de injeção de prompt e moderação de conteúdo.

Guardrails são verificações de segurança executadas antes e depois de o seu agente responder. Ative as verificações que quiser, e o agente bloqueia solicitações fora desse escopo em vez de respondê-las.

Uma ressalva honesta antes de mais nada: os Guardrails são um esforço best-effort, não uma garantia absoluta. As verificações de foco no tópico, de classificação de injeção de prompt e de moderação de conteúdo chamam um provedor externo; se uma verificação expirar ou apresentar erro, o agente responde mesmo assim, em vez de cair junto com o provedor (comportamento fail open). Apenas a correspondência de padrões de injeção de prompt integrada funciona totalmente local. Trate os Guardrails como um filtro forte, não como um limite de segurança absoluto.

Ativando os Guardrails

  1. Acesse o painel do seu agente
  2. Clique em Configurações
  3. Selecione Segurança
  4. Abra o cartão Guardrails e ative as verificações que quiser
  5. Salve

Os guardrails são configurados por agente. Cada agente tem suas próprias configurações — não há um padrão para todo o workspace, então ative-os separadamente em cada agente que você quiser proteger.

Estas configurações se aplicam ao chat e às respostas de e-mail geradas. As seções abaixo descrevem o comportamento do chat; consulte Respostas por e-mail para as diferenças no e-mail.

As Três Verificações

Foco no tópico

Bloqueia solicitações que não têm relação com o propósito público deste agente — a verificação avalia cada solicitação de acordo com o nome do site do seu agente, não com as suas fontes. Use quando o seu agente deve se manter no seu produto, serviço ou documentação, em vez de responder perguntas gerais.

Detecção de injeção de prompt

Bloqueia tentativas de substituir suas instruções, revelar prompts ocultos ou coagir o agente a usar suas ferramentas.

Moderação de conteúdo

Verifica a entrada do visitante e a saída do agente em busca de conteúdo inseguro. Esta é a única verificação que também analisa o que o agente disse. Na saída, verifica apenas o texto da resposta principal do agente: chips de mensagens sugeridas gerados automaticamente não são verificados separadamente — embora nenhum chip seja gerado quando a resposta principal for sinalizada.

O Que Acontece na Entrada

As verificações ativadas são executadas antes de o modelo escrever uma resposta.

  • Uma correspondência rápida de padrões para frases conhecidas de injeção de prompt pode bloquear uma mensagem imediatamente, antes que as outras verificações sejam executadas.
  • As demais verificações ativadas podem ser executadas em conjunto, em vez de uma após a outra.
  • Se qualquer verificação ativada for acionada, o turno é bloqueado e o visitante nunca vê a resposta do modelo.

As verificações leem um trecho limitado, não o conteúdo completo: apenas os primeiros 8.000 caracteres da mensagem do visitante são inspecionados (o histórico recente e o texto de anexos têm limites separados), enquanto a mensagem completa ainda chega ao modelo. Uma mensagem incomumente longa pode, portanto, carregar conteúdo não inspecionado além das verificações de entrada.

Quando mais de uma verificação é acionada na mesma mensagem, o motivo registrado segue uma ordem fixa de prioridade: moderação de conteúdo, depois o classificador de injeção de prompt, depois o classificador de tópico.

O Que o Visitante Vê Quando é Bloqueado

Se você preencheu a Substituição de mensagem de bloqueio, o visitante recebe essa mensagem. Deixe em branco e o agente usa um padrão embutido:

  • Solicitações fora do tópico recebem "I can only help with questions about your site name. What would you like to know?" (em português, aproximadamente: "Só posso ajudar com perguntas sobre nome do seu site. O que você gostaria de saber?")
  • Qualquer outro bloqueio recebe "Sorry, I can't help with that. Is there anything else I can help you with?" (em português, aproximadamente: "Desculpe, não posso ajudar com isso. Há algo mais em que eu possa ajudar?")

A substituição é opcional e limitada a 500 caracteres.

Duas coisas para saber sobre turnos bloqueados:

  • Eles ainda contam para a sua cota de mensagens. A verificação é executada em uma solicitação real, então o turno é cobrado como qualquer outro.
  • Eles são salvos. Turnos bloqueados aparecem nos Chat Logs com o motivo do guardrail anexado, para que você possa revisar o que foi detectado.

O Que Acontece na Saída

A moderação de conteúdo também é executada uma vez depois que o modelo responde. O foco no tópico e a detecção de injeção de prompt não são executados na saída.

Uma sinalização na saída não retira a resposta — o visitante já a viu, e ela permanece na conversa. Em vez disso, a sinalização:

  • Registra a sinalização nesse turno para que você possa revisá-la nos Chat Logs
  • Pula as mensagens sugeridas que aquele turno teria oferecido

Não há bloqueio de saída: as respostas são transmitidas ao visitante antes que a verificação seja concluída, portanto a verificação de saída é um sinal de revisão, não um filtro. Restringir as fontes e instruções do agente torna uma saída insegura menos provável, mas não pode garantir que ela nunca seja exibida.

Respostas por e-mail

No e-mail, as verificações são executadas antes da redação e após a geração. Um bloqueio de entrada deixa a mensagem para revisão humana sem gerar uma resposta nem consumir cota de mensagens. Uma sinalização de saída mantém o rascunho em Atividade > E-mails > Para revisar e impede o envio automático; gerar esse rascunho ainda consome cota.

Essas verificações também se aplicam quando você escolhe Redigir uma resposta. O envio manual não executa as verificações novamente. Revise os rascunhos sinalizados antes de enviá-los. Consulte o guia de e-mail para a configuração e os controles da caixa de entrada.

Falsos Positivos

As verificações de segurança podem ocasionalmente bloquear uma solicitação legítima. Revise as conversas sinalizadas nos Chat Logs antes de ativar mais amplamente. Filtrar os Chat Logs pelas conversas sinalizadas por guardrails é a forma mais rápida de ver se uma verificação está agressiva demais para o seu público.

Se uma verificação bloquear demais:

  • Desative-a. O foco no tópico avalia cada solicitação apenas em relação ao propósito público do seu agente (o nome do site) — ele não lê suas fontes nem suas instruções, então adicionar conteúdo não pode ampliar o que ele aceita
  • Defina uma Substituição de mensagem de bloqueio mais amigável para que o beco sem saída ainda soe bem

Próximos Passos