El modelo de un chatbot influye en cómo sigue las instrucciones, usa el contenido recuperado y redacta cada respuesta. No corrige fuentes deficientes ni instrucciones vagas. La pregunta útil no es qué proveedor gana en general, sino qué modelo actual responde mejor con tu contenido, tus visitantes y tus reglas.
Agentkit ofrece actualmente ocho modelos de OpenAI, Anthropic y Google. Esta guía se basa en ese catálogo activo y deja fuera los modelos retirados que ya no aparecen en el selector.
Catálogo actual de modelos
| Proveedor | Modelos disponibles en Agentkit |
|---|---|
| OpenAI | GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna |
| Anthropic | Claude Opus 5, Claude Sonnet 5, Claude Haiku 4.5 |
| Gemini 3.7 Flash, Gemini 3.1 Pro |
Los chatbots nuevos comienzan con GPT-5.6 Terra. Es una referencia práctica, no una conclusión de que Terra sea el mejor para todos los casos. Puedes cambiar de modelo sin volver a crear las fuentes ni entrenar de nuevo el chatbot.
Qué conviene comparar
Los benchmarks públicos rara vez representan el trabajo real de un chatbot para sitios web. Una evaluación útil mide lo que sí notarán tus visitantes.
| Criterio | Qué significa | Cómo probarlo |
|---|---|---|
| Fidelidad a las fuentes | La respuesta se limita a tus fuentes | Haz preguntas específicas sobre tu empresa, incluidas algunas que las fuentes no respondan |
| Seguimiento de instrucciones | El modelo respeta el tono, el alcance y las reglas de escalamiento | Prueba solicitudes directas, seguimientos e intentos de desviarlo del tema |
| Integridad | La respuesta incluye los detalles necesarios sin esconderlos | Prueba políticas, comparaciones y preguntas de varias partes |
| Calidad de la conversación | Las respuestas posteriores usan bien el intercambio anterior | Ejecuta la misma conversación de cinco a diez mensajes con cada modelo |
| Calidad del idioma | La respuesta suena natural en los idiomas que admites | Usa las mismas preguntas en cada idioma de destino |
| Tiempo de respuesta | El chat se siente ágil en tu sitio | Mide conversaciones reales en el widget, no una demo aislada del proveedor |
La recuperación, la calidad de las fuentes y las instrucciones forman parte del resultado. Mantenlas iguales al comparar modelos.
Modelos GPT-5.6
Las opciones actuales de OpenAI son GPT-5.6 Sol, GPT-5.6 Terra y GPT-5.6 Luna. Trátalas como tres candidatos de una misma familia y deja que tu conjunto de prueba determine si cambiar de nivel mejora las respuestas de forma relevante.
Empieza con Terra porque es el modelo predeterminado actual. Agrega Sol para las preguntas más difíciles sobre políticas, solución de problemas o comparaciones. Agrega Luna como otro candidato GPT-5.6 para intercambios breves y frecuentes. Son funciones dentro de la prueba, no promesas de capacidad.
Modelos Claude
Las opciones actuales de Anthropic son Claude Opus 5, Claude Sonnet 5 y Claude Haiku 4.5. Usa las mismas fuentes e instrucciones con los tres. Observa en especial los detalles sin respaldo, los rechazos, la extensión de las respuestas y la estabilidad del tono en conversaciones largas.
Incluye Opus 5 y Sonnet 5 en la lista corta para los ejemplos complejos. Haiku 4.5 aporta un tercer punto de comparación de Anthropic para intercambios sencillos. Tus propios registros deben decidir el resultado.
Modelos Gemini
Agentkit ofrece Gemini 3.7 Flash y Gemini 3.1 Pro. Algunas guías antiguas todavía mencionan versiones anteriores de Flash, así que toma el selector actual como referencia.
Compara ambos modelos con fuentes largas, preguntas multilingües y conversaciones de seguimiento si esas tareas importan en tu caso. Las palabras "Pro" y "Flash" no sustituyen una medición con la recuperación de Agentkit activa.
Cómo preparar una prueba justa
Un conjunto pequeño y fijo permite comparar rápido sin perder rigor.
- Reúne entre 20 y 30 preguntas reales de clientes. Incluye preguntas fáciles, redacción ambigua, casos sin respuesta y solicitudes que deban activar una acción o un escalamiento.
- Usa las mismas fuentes, instrucciones y acciones con cada modelo.
- Comienza con GPT-5.6 Terra y elige al menos un modelo de cada otra familia.
- Puntúa exactitud, fidelidad a las fuentes, integridad, tono y tiempo de respuesta.
- Descarta cualquier respuesta que invente un detalle del producto, aunque el resto esté bien redactado.
- Repite la prueba después de un cambio importante en las fuentes o las instrucciones.
Una lista corta práctica
Si todavía no tienes suficiente tráfico para construir un conjunto amplio:
- Conserva GPT-5.6 Terra como referencia.
- Compara Claude Sonnet 5 y Gemini 3.7 Flash con las mismas preguntas.
- Agrega GPT-5.6 Sol, Claude Opus 5 o Gemini 3.1 Pro para los ejemplos más difíciles.
- Incluye GPT-5.6 Luna o Claude Haiku 4.5 si recibes muchas preguntas breves y rutinarias.
Así obtienes evidencia sobre tu chatbot en lugar de una clasificación genérica de proveedores.
Costos y planes
Los planes de Agentkit usan cupos de mensajes y no muestran una factura por tokens separada para cada modelo. Los planes de pago incluyen ocho modelos principales, Pro añade GPT-6 Astra y Claude Fable 5.1, y el plan gratuito usa una selección más pequeña. Consulta los límites actuales en la guía de precios.
El cambio de modelo se aplica a las conversaciones futuras. Las fuentes del sitio web, los documentos, los pares de preguntas y respuestas y los fragmentos de texto permanecen iguales.
Conclusión
No existe un ganador permanente entre GPT, Claude y Gemini para todos los chatbots. El selector actual de Agentkit ofrece ocho opciones concretas. Empieza con GPT-5.6 Terra, prueba una lista corta de varios proveedores con preguntas reales y elige el modelo que cometa menos errores importantes.
Revisa las conversaciones después del lanzamiento. Si cambia el catálogo, tu contenido o las preguntas de tus clientes, vuelve a ejecutar la misma evaluación.
No se requiere tarjeta de crédito.



