Das Modell hinter einem Chatbot beeinflusst, wie er Anweisungen befolgt, abgerufene Inhalte nutzt und Antworten formuliert. Schlechte Quellen oder unklare Anweisungen kann es nicht ausgleichen. Entscheidend ist daher nicht, welcher Anbieter allgemein gewinnt, sondern welches aktuelle Modell mit Ihren Inhalten, Besuchern und Antwortregeln am besten funktioniert.
Agentkit bietet derzeit acht Modelle von OpenAI, Anthropic und Google. Dieser Leitfaden folgt diesem aktuellen Katalog und lässt eingestellte Modelle weg, die nicht mehr in der Modellauswahl erscheinen.
Der aktuelle Modellkatalog
| Anbieter | In Agentkit verfügbare Modelle |
|---|---|
| OpenAI | GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna |
| Anthropic | Claude Opus 5, Claude Sonnet 5, Claude Haiku 4.5 |
| Gemini 3.7 Flash, Gemini 3.1 Pro |
Neue Chatbots starten mit GPT-5.6 Terra. Das ist eine brauchbare Vergleichsbasis, aber kein Urteil darüber, welches Modell für jeden Chatbot das beste ist. Sie können das Modell wechseln, ohne Quellen neu aufzubauen oder den Chatbot neu zu trainieren.
Was Sie vergleichen sollten
Öffentliche Benchmarks bilden die Arbeit eines Website-Chatbots selten genau ab. Prüfen Sie stattdessen das Verhalten, das Ihre Besucher tatsächlich erleben.
| Kriterium | Bedeutung | Testmethode |
|---|---|---|
| Quellentreue | Die Antwort bleibt bei Ihren Quellen | Stellen Sie unternehmensspezifische Fragen, darunter Fragen ohne belegte Antwort |
| Befolgen von Anweisungen | Das Modell hält Ton, Themenbereich und Übergaberegeln ein | Testen Sie direkte Fragen, Rückfragen und Versuche, das Thema zu wechseln |
| Vollständigkeit | Die Antwort enthält die nötigen Details, ohne sie zu verstecken | Testen Sie Richtlinien, Vergleiche und mehrteilige Fragen |
| Unterhaltungsqualität | Folgeantworten nutzen den bisherigen Verlauf korrekt | Führen Sie mit jedem Modell dieselbe Unterhaltung über fünf bis zehn Nachrichten |
| Sprachqualität | Antworten klingen in Ihren unterstützten Sprachen natürlich | Stellen Sie dieselben Kundenfragen in jeder Zielsprache |
| Antwortzeit | Der Chat reagiert auf Ihrer Website zügig | Messen Sie echte Widget-Unterhaltungen statt einer isolierten Anbieter-Demo |
Retrieval-Einstellungen, Quellenqualität und Anweisungen beeinflussen jedes Ergebnis. Halten Sie diese Faktoren bei allen Modellen identisch.
GPT-5.6-Modelle
Die aktuellen OpenAI-Optionen sind GPT-5.6 Sol, GPT-5.6 Terra und GPT-5.6 Luna. Behandeln Sie sie als drei Kandidaten aus derselben Familie. Ihre Testfragen zeigen, ob ein Wechsel innerhalb der Familie die Antworten spürbar verbessert.
Beginnen Sie mit Terra, weil es der aktuelle Standard ist. Nehmen Sie Sol für die schwierigsten Richtlinien-, Fehlerbehebungs- oder Vergleichsfragen in den Test auf. Ergänzen Sie Luna als weiteren GPT-5.6-Kandidaten für kurze, häufige Anfragen. Das sind Testrollen, keine Leistungsversprechen.
Claude-Modelle
Die aktuellen Anthropic-Optionen sind Claude Opus 5, Claude Sonnet 5 und Claude Haiku 4.5. Prüfen Sie alle mit denselben Anweisungen und Quellen. Achten Sie besonders auf unbelegte Details, Ablehnungen, Antwortlänge und einen gleichbleibenden Ton in längeren Unterhaltungen.
Opus 5 und Sonnet 5 gehören in die engere Auswahl für komplexe Beispiele. Haiku 4.5 liefert einen dritten Anthropic-Vergleichspunkt für einfachere Anfragen. Maßgeblich bleiben Ihre eigenen Unterhaltungsprotokolle.
Gemini-Modelle
Agentkit bietet Gemini 3.7 Flash und Gemini 3.1 Pro. Ältere Leitfäden nennen noch frühere Flash-Versionen. Verwenden Sie deshalb die aktuelle Modellauswahl als Quelle.
Vergleichen Sie beide Gemini-Modelle mit langen Quellpassagen, mehrsprachigen Fragen und Folgefragen, sofern diese Aufgaben für Ihren Chatbot wichtig sind. Die Bezeichnungen „Pro“ und „Flash“ ersetzen keinen Test mit Ihrer aktiven Retrieval-Pipeline.
Einen fairen Modelltest erstellen
Eine kleine, feste Testreihe liefert schnell belastbare Ergebnisse.
- Sammeln Sie 20 bis 30 echte Kundenfragen. Nehmen Sie einfache Fragen, mehrdeutige Formulierungen, fehlende Antworten und Fälle für Aktionen oder Übergaben auf.
- Verwenden Sie bei jedem Modell dieselben Quellen, Anweisungen und Aktionseinstellungen.
- Starten Sie mit GPT-5.6 Terra und wählen Sie mindestens ein Modell aus jeder anderen Anbieterfamilie.
- Bewerten Sie Korrektheit, Quellentreue, Vollständigkeit, Ton und Antwortzeit.
- Verwerfen Sie Antworten, die ein Produktdetail erfinden, auch wenn der übrige Text gut klingt.
- Wiederholen Sie den Test nach größeren Änderungen an Quellen oder Anweisungen.
Eine praktische Vorauswahl
Wenn noch nicht genug echte Unterhaltungen vorliegen, gehen Sie so vor:
- Nutzen Sie GPT-5.6 Terra als Ausgangsbasis.
- Vergleichen Sie Claude Sonnet 5 und Gemini 3.7 Flash mit denselben Fragen.
- Ergänzen Sie GPT-5.6 Sol, Claude Opus 5 oder Gemini 3.1 Pro für die schwierigsten Beispiele.
- Nehmen Sie GPT-5.6 Luna oder Claude Haiku 4.5 auf, wenn viele kurze Routinefragen anfallen.
So erhalten Sie Belege für Ihren Chatbot statt einer allgemeinen Anbieterrangliste.
Kosten und Tarife
Agentkit-Tarife arbeiten mit Nachrichtenkontingenten und stellen nicht für jedes Modell eine separate Token-Rechnung aus. Bezahlte Tarife enthalten acht Kernmodelle, Pro ergänzt GPT-6 Astra und Claude Fable 5.1, und der kostenlose Tarif bietet eine kleinere Auswahl. Die aktuellen Grenzen finden Sie im Preisleitfaden.
Ein Modellwechsel gilt für künftige Unterhaltungen. Ihre Website-Quellen, Dokumente, Q&A-Paare und Textausschnitte bleiben unverändert.
Fazit
Es gibt keinen dauerhaften Sieger zwischen GPT, Claude und Gemini für jeden Website-Chatbot. Die aktuelle Agentkit-Auswahl umfasst acht konkrete Modelle. Beginnen Sie mit GPT-5.6 Terra, testen Sie eine anbieterübergreifende Vorauswahl mit echten Fragen und wählen Sie das Modell mit den wenigsten folgenreichen Fehlern.
Prüfen Sie die Unterhaltungen nach dem Start. Wenn sich der Katalog, Ihre Inhalte oder die Fragen Ihrer Kunden ändern, führen Sie dieselbe Testreihe erneut aus.
Erstellen Sie Ihren Chatbot kostenlos →
Keine Kreditkarte erforderlich.



