O modelo de um chatbot influencia como ele segue instruções, usa o conteúdo recuperado e redige respostas. Ele não corrige fontes fracas nem instruções vagas. A pergunta útil não é qual fornecedor vence no geral, mas qual modelo atual responde melhor com o seu conteúdo, os seus visitantes e as suas regras.
O Agentkit oferece atualmente oito modelos da OpenAI, Anthropic e Google. Este guia segue esse catálogo ativo e deixa de fora modelos descontinuados que já não aparecem no seletor.
Catálogo atual de modelos
| Fornecedor | Modelos disponíveis no Agentkit |
|---|---|
| OpenAI | GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna |
| Anthropic | Claude Opus 5, Claude Sonnet 5, Claude Haiku 4.5 |
| Gemini 3.7 Flash, Gemini 3.1 Pro |
Novos chatbots começam com GPT-5.6 Terra. Ele é uma base prática de comparação, não uma conclusão de que Terra seja o melhor em todos os casos. Você pode trocar de modelo sem recriar as fontes ou treinar o chatbot novamente.
O que comparar
Benchmarks públicos raramente representam o trabalho real de um chatbot para sites. Uma avaliação útil mede o que os visitantes percebem.
| Critério | O que significa | Como testar |
|---|---|---|
| Fidelidade às fontes | A resposta permanece dentro das suas fontes | Faça perguntas específicas sobre a empresa, inclusive perguntas sem resposta nas fontes |
| Cumprimento das instruções | O modelo respeita o tom, o escopo e as regras de encaminhamento | Teste pedidos diretos, perguntas seguintes e tentativas de mudar de assunto |
| Completude | A resposta inclui os detalhes necessários sem escondê-los | Teste políticas, comparações e perguntas com várias partes |
| Qualidade da conversa | As respostas seguintes usam corretamente o diálogo anterior | Execute a mesma conversa de cinco a dez mensagens com cada modelo |
| Qualidade do idioma | A resposta soa natural nos idiomas atendidos | Use as mesmas perguntas em cada idioma de destino |
| Tempo de resposta | O chat parece ágil no seu site | Meça conversas reais no widget, não uma demonstração isolada do fornecedor |
As configurações de recuperação, a qualidade das fontes e as instruções afetam cada resultado. Mantenha tudo igual durante a comparação.
Modelos GPT-5.6
As opções atuais da OpenAI são GPT-5.6 Sol, GPT-5.6 Terra e GPT-5.6 Luna. Trate-as como três candidatas da mesma família e deixe o seu conjunto de testes mostrar se a troca de nível melhora as respostas de forma relevante.
Comece com Terra porque ele é o padrão atual. Adicione Sol para as perguntas mais difíceis sobre políticas, solução de problemas ou comparações. Adicione Luna como outro candidato GPT-5.6 para interações curtas e frequentes. Esses são papéis no teste, não garantias de capacidade.
Modelos Claude
As opções atuais da Anthropic são Claude Opus 5, Claude Sonnet 5 e Claude Haiku 4.5. Use as mesmas fontes e instruções nos três. Observe principalmente detalhes sem fonte, recusas, tamanho das respostas e estabilidade do tom em conversas longas.
Inclua Opus 5 e Sonnet 5 na seleção para exemplos complexos. Haiku 4.5 oferece um terceiro ponto de comparação da Anthropic para interações simples. Os seus próprios registros devem decidir o resultado.
Modelos Gemini
O Agentkit oferece Gemini 3.7 Flash e Gemini 3.1 Pro. Alguns guias antigos ainda mencionam versões anteriores do Flash, portanto use o seletor atual como referência.
Compare os dois modelos com fontes longas, perguntas em vários idiomas e conversas de acompanhamento se essas tarefas forem importantes. Os nomes "Pro" e "Flash" não substituem uma medição com a recuperação do Agentkit ativa.
Como criar um teste justo
Um conjunto pequeno e fixo produz resultados úteis rapidamente.
- Reúna de 20 a 30 perguntas reais de clientes. Inclua perguntas fáceis, frases ambíguas, casos sem resposta e pedidos que devem acionar uma ação ou encaminhamento.
- Use as mesmas fontes, instruções e configurações de ações em cada modelo.
- Comece com GPT-5.6 Terra e escolha pelo menos um modelo de cada outra família.
- Avalie correção, fidelidade às fontes, completude, tom e tempo de resposta.
- Rejeite qualquer resposta que invente um detalhe do produto, mesmo que o restante pareça bom.
- Repita o teste após uma grande mudança nas fontes ou instruções.
Uma seleção prática
Se ainda não houver tráfego suficiente para criar um conjunto grande:
- Mantenha GPT-5.6 Terra como referência.
- Compare Claude Sonnet 5 e Gemini 3.7 Flash com as mesmas perguntas.
- Adicione GPT-5.6 Sol, Claude Opus 5 ou Gemini 3.1 Pro para os exemplos mais difíceis.
- Inclua GPT-5.6 Luna ou Claude Haiku 4.5 se houver muitas perguntas curtas e rotineiras.
Assim você obtém evidências sobre o seu chatbot, em vez de um ranking genérico de fornecedores.
Custos e planos
Os planos do Agentkit usam cotas de mensagens e não mostram uma cobrança separada de tokens para cada modelo. Os planos pagos incluem oito modelos principais, o Pro acrescenta GPT-6 Astra e Claude Fable 5.1, enquanto o plano gratuito usa uma seleção menor. Consulte os limites atuais no guia de preços.
A troca de modelo vale para conversas futuras. As fontes do site, os documentos, os pares de perguntas e respostas e os trechos de texto permanecem iguais.
Conclusão
Não existe um vencedor permanente entre GPT, Claude e Gemini para todos os chatbots. O seletor atual do Agentkit oferece oito opções específicas. Comece com GPT-5.6 Terra, teste uma seleção de vários fornecedores com perguntas reais e escolha o modelo que cometer menos erros importantes.
Revise as conversas depois do lançamento. Se o catálogo, o conteúdo ou as perguntas dos clientes mudarem, execute a mesma avaliação novamente.
Crie o seu chatbot gratuitamente →
Não é necessário cartão de crédito.



