Il modello di un chatbot influisce sul modo in cui segue le istruzioni, usa i contenuti recuperati e formula le risposte. Non può compensare fonti scadenti o istruzioni vaghe. La domanda utile non è quale fornitore vinca in assoluto, ma quale modello attuale risponda meglio con i tuoi contenuti, i tuoi visitatori e le tue regole.
Agentkit offre attualmente otto modelli di OpenAI, Anthropic e Google. Questa guida segue il catalogo attivo ed esclude i modelli ritirati che non compaiono più nel selettore.
Il catalogo attuale dei modelli
| Fornitore | Modelli disponibili in Agentkit |
|---|---|
| OpenAI | GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna |
| Anthropic | Claude Opus 5, Claude Sonnet 5, Claude Haiku 4.5 |
| Gemini 3.7 Flash, Gemini 3.1 Pro |
I nuovi chatbot iniziano con GPT-5.6 Terra. È una base di confronto pratica, non la prova che Terra sia il modello migliore per ogni caso. Puoi cambiare modello senza ricreare le fonti o addestrare di nuovo il chatbot.
Cosa confrontare
I benchmark pubblici raramente rappresentano il lavoro reale di un chatbot per siti web. Una valutazione utile misura ciò che noteranno i visitatori.
| Criterio | Cosa significa | Come provarlo |
|---|---|---|
| Aderenza alle fonti | La risposta resta entro quanto riportato nelle tue fonti | Fai domande specifiche sull’azienda, incluse domande senza risposta nelle fonti |
| Rispetto delle istruzioni | Il modello segue tono, ambito e regole di escalation | Prova richieste dirette, domande successive e tentativi di portarlo fuori tema |
| Completezza | La risposta include i dettagli necessari senza nasconderli | Prova policy, confronti e domande composte |
| Qualità della conversazione | Le risposte successive usano correttamente gli scambi precedenti | Esegui la stessa conversazione di cinque-dieci messaggi con ogni modello |
| Qualità linguistica | La risposta suona naturale nelle lingue supportate | Usa le stesse domande in ogni lingua di destinazione |
| Tempo di risposta | La chat risulta reattiva sul tuo sito | Misura conversazioni reali nel widget, non una demo isolata del fornitore |
Le impostazioni di recupero, la qualità delle fonti e le istruzioni incidono su ogni risultato. Mantienile identiche durante il confronto.
Modelli GPT-5.6
Le opzioni OpenAI attuali sono GPT-5.6 Sol, GPT-5.6 Terra e GPT-5.6 Luna. Considerale tre candidate della stessa famiglia e lascia che il set di prova mostri se il cambio di livello migliora davvero le risposte.
Parti da Terra perché è il modello predefinito. Aggiungi Sol per le domande più difficili su policy, risoluzione dei problemi o confronti. Aggiungi Luna come altro candidato GPT-5.6 per scambi brevi e frequenti. Sono ruoli nel test, non garanzie sulle capacità.
Modelli Claude
Le opzioni Anthropic attuali sono Claude Opus 5, Claude Sonnet 5 e Claude Haiku 4.5. Usa le stesse fonti e istruzioni per tutti. Controlla soprattutto dettagli senza fonte, rifiuti, lunghezza delle risposte e coerenza del tono nelle conversazioni lunghe.
Inserisci Opus 5 e Sonnet 5 nella rosa per gli esempi complessi. Haiku 4.5 offre un terzo confronto Anthropic per gli scambi semplici. La decisione deve arrivare dai tuoi registri.
Modelli Gemini
Agentkit offre Gemini 3.7 Flash e Gemini 3.1 Pro. Alcune guide precedenti citano ancora vecchie versioni Flash, quindi usa il selettore attuale come riferimento.
Confronta entrambi i modelli con fonti lunghe, domande multilingue e conversazioni successive se queste attività contano per il tuo chatbot. Le parole "Pro" e "Flash" non sostituiscono una misura con il recupero di Agentkit attivo.
Preparare un test equo
Un set piccolo e fisso permette di confrontare rapidamente i modelli.
- Raccogli da 20 a 30 domande reali dei clienti. Includi domande facili, formulazioni ambigue, casi senza risposta e richieste che devono attivare un’azione o un’escalation.
- Usa le stesse fonti, istruzioni e azioni con ogni modello.
- Parti da GPT-5.6 Terra e scegli almeno un modello di ogni altra famiglia.
- Valuta correttezza, aderenza alle fonti, completezza, tono e tempo di risposta.
- Scarta ogni risposta che inventa un dettaglio del prodotto, anche se il resto è ben scritto.
- Ripeti il test dopo modifiche importanti alle fonti o alle istruzioni.
Una rosa pratica
Se non hai ancora traffico sufficiente per un set ampio:
- Mantieni GPT-5.6 Terra come base.
- Confronta Claude Sonnet 5 e Gemini 3.7 Flash sulle stesse domande.
- Aggiungi GPT-5.6 Sol, Claude Opus 5 o Gemini 3.1 Pro per gli esempi più difficili.
- Includi GPT-5.6 Luna o Claude Haiku 4.5 se gestisci molte domande brevi e di routine.
Così ottieni prove sul tuo chatbot invece di una classifica generica dei fornitori.
Costi e piani
I piani Agentkit usano quote di messaggi e non mostrano una fattura separata per i token di ogni modello. I piani a pagamento includono otto modelli principali, Pro aggiunge GPT-6 Astra e Claude Fable 5.1, mentre il piano gratuito usa una selezione ridotta. Consulta i limiti attuali nella guida ai prezzi.
Il cambio di modello vale per le conversazioni future. Le fonti del sito, i documenti, le coppie di domande e risposte e i frammenti di testo restano invariati.
In sintesi
Non esiste un vincitore permanente tra GPT, Claude e Gemini per tutti i chatbot. Il selettore attuale di Agentkit offre otto scelte precise. Parti da GPT-5.6 Terra, prova una rosa con più fornitori usando domande reali e scegli il modello che commette meno errori importanti.
Controlla le conversazioni dopo il lancio. Se cambiano il catalogo, i contenuti o le domande dei clienti, esegui di nuovo la stessa valutazione.
Crea il tuo chatbot gratuitamente →
Nessuna carta di credito richiesta.



