Het model achter een chatbot beïnvloedt hoe de bot instructies volgt, opgehaalde content gebruikt en antwoorden formuleert. Slechte bronnen of vage instructies kan het niet herstellen. De nuttige vraag is daarom niet welke aanbieder in het algemeen wint, maar welk huidig model het beste antwoordt met jouw content, bezoekers en regels.
Agentkit biedt momenteel acht modellen van OpenAI, Anthropic en Google. Deze gids volgt die actieve catalogus en laat ingetrokken modellen weg die niet meer in de modelkiezer staan.
De huidige modelcatalogus
| Aanbieder | Beschikbare modellen in Agentkit |
|---|---|
| OpenAI | GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna |
| Anthropic | Claude Opus 5, Claude Sonnet 5, Claude Haiku 4.5 |
| Gemini 3.7 Flash, Gemini 3.1 Pro |
Nieuwe chatbots starten met GPT-5.6 Terra. Dat is een bruikbare nulmeting, geen bewijs dat Terra altijd de beste keuze is. Je kunt van model wisselen zonder bronnen opnieuw op te bouwen of de chatbot opnieuw te trainen.
Wat je moet vergelijken
Openbare benchmarks lijken zelden precies op het werk van een websitechatbot. Een goede evaluatie meet wat je bezoekers daadwerkelijk merken.
| Criterium | Betekenis | Testmethode |
|---|---|---|
| Trouw aan bronnen | Het antwoord blijft binnen jouw bronnen | Stel bedrijfsspecifieke vragen, waaronder vragen die de bronnen niet beantwoorden |
| Instructies volgen | Het model houdt zich aan toon, bereik en escalatieregels | Test directe vragen, vervolgvragen en pogingen om van onderwerp te veranderen |
| Volledigheid | Het antwoord bevat de nodige details zonder ze te verbergen | Test beleid, vergelijkingen en vragen met meerdere onderdelen |
| Gesprekskwaliteit | Vervolgantwoorden gebruiken de eerdere uitwisseling correct | Voer met elk model hetzelfde gesprek van vijf tot tien berichten |
| Taalkwaliteit | Het antwoord klinkt natuurlijk in de talen die je ondersteunt | Gebruik dezelfde klantvragen in elke doeltaal |
| Reactietijd | De chat voelt snel op je site | Meet echte widgetgesprekken, niet een losse demo van de aanbieder |
Retrievalinstellingen, bronkwaliteit en instructies blijven onderdeel van elk resultaat. Houd ze gelijk tijdens de vergelijking.
GPT-5.6-modellen
De huidige OpenAI-opties zijn GPT-5.6 Sol, GPT-5.6 Terra en GPT-5.6 Luna. Behandel ze als drie kandidaten uit één familie en laat je testset uitwijzen of een andere laag de antwoorden merkbaar verbetert.
Begin met Terra, het huidige standaardmodel. Voeg Sol toe voor de lastigste vragen over beleid, probleemoplossing of vergelijkingen. Voeg Luna toe als extra GPT-5.6-kandidaat voor korte, veelgestelde vragen. Dit zijn rollen in de test, geen garanties over mogelijkheden.
Claude-modellen
De huidige Anthropic-opties zijn Claude Opus 5, Claude Sonnet 5 en Claude Haiku 4.5. Test ze met dezelfde bronnen en instructies. Let vooral op details zonder bron, weigeringen, antwoordlengte en een consistente toon in langere gesprekken.
Neem Opus 5 en Sonnet 5 op voor complexe voorbeelden. Haiku 4.5 geeft een derde Anthropic-vergelijkingspunt voor eenvoudige uitwisselingen. Laat je eigen chatlogboeken de keuze bepalen.
Gemini-modellen
Agentkit biedt Gemini 3.7 Flash en Gemini 3.1 Pro. Oudere handleidingen noemen nog eerdere Flash-versies. Gebruik daarom de actuele modelkiezer als bron.
Vergelijk beide modellen met lange bronpassages, meertalige vragen en vervolggesprekken als die taken belangrijk zijn. De woorden "Pro" en "Flash" vervangen geen meting met Agentkits retrieval actief.
Een eerlijke modeltest maken
Een kleine, vaste testset levert snel bruikbare resultaten op.
- Verzamel 20 tot 30 echte klantvragen. Neem makkelijke vragen, dubbelzinnige formuleringen, ontbrekende antwoorden en gevallen voor acties of escalatie op.
- Gebruik bij elk model dezelfde bronnen, instructies en actie-instellingen.
- Start met GPT-5.6 Terra en kies minstens één model uit elke andere familie.
- Beoordeel juistheid, trouw aan bronnen, volledigheid, toon en reactietijd.
- Keur elk antwoord af dat een productdetail verzint, ook als de rest goed klinkt.
- Herhaal de test na een grote wijziging aan bronnen of instructies.
Een praktische shortlist
Als je nog niet genoeg verkeer hebt voor een grote testset:
- Houd GPT-5.6 Terra als nulmeting.
- Vergelijk Claude Sonnet 5 en Gemini 3.7 Flash met dezelfde vragen.
- Voeg GPT-5.6 Sol, Claude Opus 5 of Gemini 3.1 Pro toe voor de moeilijkste voorbeelden.
- Neem GPT-5.6 Luna of Claude Haiku 4.5 op als je veel korte routinevragen krijgt.
Zo verzamel je bewijs over jouw chatbot in plaats van een algemene ranglijst van aanbieders.
Kosten en abonnementen
Agentkit-abonnementen werken met berichtlimieten en tonen geen aparte tokenrekening per model. Betaalde abonnementen bevatten acht kernmodellen, Pro voegt GPT-6 Astra en Claude Fable 5.1 toe en het gratis abonnement gebruikt een kleinere selectie. Bekijk de huidige grenzen in de prijsgids.
Een modelwissel geldt voor toekomstige gesprekken. Je websitebronnen, documenten, Q&A-paren en tekstfragmenten blijven hetzelfde.
Conclusie
Er is geen blijvende winnaar tussen GPT, Claude en Gemini voor iedere chatbot. Agentkits huidige kiezer bevat acht concrete opties. Begin met GPT-5.6 Terra, test een shortlist van meerdere aanbieders met echte vragen en kies het model dat de minste belangrijke fouten maakt.
Bekijk de gesprekken na de lancering. Verandert de catalogus, je content of het soort klantvragen, voer dan dezelfde evaluatie opnieuw uit.
Geen creditcard nodig.



