Guardrails
Ejecuta verificaciones de seguridad antes y después de que tu agente responda: enfoque en el tema, detección de inyección de prompts y moderación de contenido.
Los Guardrails son verificaciones de seguridad que se ejecutan antes y después de que tu agente responde. Activa las verificaciones que quieras, y el agente bloqueará las solicitudes que queden fuera de ellas en lugar de responderlas.
Una advertencia honesta de entrada: los Guardrails son un esfuerzo razonable, no una garantía absoluta. Las verificaciones de tema, de clasificación de inyección de prompts y de moderación de contenido llaman a un proveedor externo, y si una verificación agota el tiempo de espera o falla, el agente responde de todos modos en lugar de quedar bloqueado junto con el proveedor (falla en modo abierto). Solo la coincidencia de patrones de inyección de prompts integrada funciona completamente en local. Trata los Guardrails como un filtro sólido, no como un límite de seguridad infranqueable.
Activar los Guardrails
- Ve al panel de tu agente
- Haz clic en Configuración
- Selecciona Seguridad
- Abre la tarjeta Guardrails y activa las verificaciones que quieras
- Guarda
Los Guardrails se configuran por agente. Cada agente tiene su propia configuración —no hay un valor predeterminado a nivel de espacio de trabajo—, así que actívalos por separado en cada agente que quieras proteger.
Esta configuración se aplica al chat y a las respuestas de correo generadas. Las secciones siguientes describen el comportamiento del chat; consulta Respuestas por correo para conocer las diferencias en el correo.
Las tres verificaciones
Enfoque en el tema
Bloquea las solicitudes que no están relacionadas con el propósito público de este agente — la verificación evalúa cada solicitud según el nombre del sitio de tu agente, no según tus fuentes. Úsala cuando tu agente deba limitarse a tu producto, servicio o documentación en lugar de responder preguntas generales.
Detección de inyección de prompts
Bloquea los intentos de reemplazar tus instrucciones, revelar prompts ocultos o forzar al agente a usar sus herramientas.
Moderación de contenido
Revisa la entrada del visitante y la salida del agente en busca de contenido no seguro. Es la única verificación que también analiza lo que dijo el agente. En la salida, solo revisa el texto de la respuesta principal del agente: los chips de mensajes sugeridos generados automáticamente no se revisan por separado, aunque no se genera ningún chip cuando la respuesta principal fue marcada.
Qué ocurre con la entrada
Las verificaciones activadas se ejecutan antes de que el modelo escriba una respuesta.
- Una coincidencia de patrones rápida para frases de inyección de prompts conocidas puede bloquear un mensaje de inmediato, antes de que se ejecuten las demás verificaciones.
- Las demás verificaciones activadas pueden ejecutarse en conjunto en lugar de una después de otra.
- Si alguna de las verificaciones activadas se dispara, el turno se bloquea y el visitante nunca ve la respuesta del modelo.
Las verificaciones leen un fragmento acotado, no el contenido completo: solo se inspeccionan los primeros 8000 caracteres del mensaje del visitante (el historial reciente y el texto de los archivos adjuntos tienen límites aparte), mientras que el mensaje completo sigue llegando al modelo. Por eso, un mensaje inusualmente largo puede llevar contenido no inspeccionado más allá de las verificaciones de entrada.
Cuando más de una verificación se dispara con el mismo mensaje, el motivo registrado sigue un orden de prioridad fijo: primero moderación de contenido, luego el clasificador de inyección de prompts y por último el clasificador de tema.
Qué ve el visitante cuando se bloquea
Si completaste el mensaje alternativo de bloqueo, el visitante recibe ese mensaje. Si lo dejas vacío, el agente usa un mensaje predeterminado integrado:
- Las solicitudes fuera de tema reciben "I can only help with questions about your site name. What would you like to know?" (en español, aproximadamente: «Solo puedo ayudarte con preguntas sobre el nombre de tu sitio. ¿Qué te gustaría saber?»)
- Cualquier otro bloqueo recibe "Sorry, I can't help with that. Is there anything else I can help you with?" (en español, aproximadamente: «Lo siento, no puedo ayudarte con eso. ¿Hay algo más en lo que pueda ayudarte?»)
El mensaje alternativo es opcional y tiene un límite de 500 caracteres.
Dos cosas que debes saber sobre los turnos bloqueados:
- Siguen contando para tu cuota de mensajes. La verificación se ejecuta sobre una solicitud real, así que el turno se cobra como cualquier otro.
- Se guardan. Los turnos bloqueados aparecen en Registros de chat con el motivo del guardrail adjunto, para que puedas revisar qué se detectó.
Qué ocurre con la salida
La moderación de contenido también se ejecuta una vez después de que el modelo responde. El enfoque en el tema y la detección de inyección de prompts no se ejecutan sobre la salida.
Una marca en la salida no retracta la respuesta —el visitante ya la vio y permanece en la conversación—. Esto es lo que hace la marca en su lugar:
- Registra la marca en ese turno para que puedas revisarla en Registros de chat
- Omite los mensajes sugeridos que ese turno habría ofrecido de otro modo
No existe bloqueo de la salida: las respuestas se transmiten al visitante antes de que finalice la verificación, por lo que la verificación de salida es una señal de revisión, no un filtro. Ajustar las fuentes e instrucciones del agente hace que una salida no segura sea menos probable, pero no puede garantizar que nunca se muestre.
Respuestas por correo
En el correo, las comprobaciones se ejecutan antes de redactar y después de generar. Un bloqueo de entrada deja el mensaje pendiente de revisión humana sin generar una respuesta ni consumir cuota de mensajes. Una marca de salida mantiene el borrador en Actividad > Correos > Por revisar e impide el envío automático; generar ese borrador sí consume cuota.
Estas comprobaciones también se aplican cuando eliges Redactar una respuesta. El envío manual no vuelve a ejecutar las comprobaciones. Revisa los borradores marcados antes de enviarlos. Consulta la guía de correo para la configuración y los controles de la bandeja de entrada.
Falsos positivos
Las verificaciones de seguridad pueden bloquear ocasionalmente una solicitud legítima. Revisa las conversaciones marcadas en Registros de chat antes de habilitarlas de forma más amplia. Filtrar los Registros de chat por conversaciones marcadas por guardrails es la forma más rápida de ver si una verificación es demasiado agresiva para tu audiencia.
Si una verificación bloquea demasiado:
- Desactívala. El enfoque en el tema evalúa cada solicitud solo contra el propósito público de tu agente (el nombre de tu sitio); no lee tus fuentes ni tus instrucciones, así que agregar contenido no puede ampliar lo que acepta
- Configura un mensaje alternativo de bloqueo más amable para que el punto muerto siga leyéndose bien