Model chatbota wpływa na to, jak wykonuje instrukcje, korzysta z wyszukanych treści i formułuje odpowiedzi. Nie naprawi słabych źródeł ani niejasnych poleceń. Warto więc pytać nie o najlepszego dostawcę w ogóle, lecz o aktualny model, który najlepiej działa z Twoimi treściami, użytkownikami i zasadami odpowiedzi.
Agentkit oferuje obecnie osiem modeli OpenAI, Anthropic i Google. Ten przewodnik opiera się na aktywnym katalogu i pomija wycofane modele, których nie ma już w selektorze.
Aktualny katalog modeli
| Dostawca | Modele dostępne w Agentkit |
|---|---|
| OpenAI | GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna |
| Anthropic | Claude Opus 5, Claude Sonnet 5, Claude Haiku 4.5 |
| Gemini 3.7 Flash, Gemini 3.1 Pro |
Nowe chatboty zaczynają od GPT-5.6 Terra. To praktyczny punkt odniesienia, a nie dowód, że Terra będzie najlepsza w każdym przypadku. Model można zmienić bez ponownego tworzenia źródeł i trenowania chatbota.
Co porównywać
Publiczne benchmarki rzadko odpowiadają rzeczywistej pracy chatbota na stronie. Dobra ocena mierzy zachowanie widoczne dla użytkowników.
| Kryterium | Znaczenie | Sposób testowania |
|---|---|---|
| Zgodność ze źródłami | Odpowiedź nie wychodzi poza Twoje źródła | Zadawaj pytania dotyczące firmy, również takie, na które nie ma odpowiedzi w źródłach |
| Wykonywanie instrukcji | Model zachowuje ton, zakres i zasady eskalacji | Testuj pytania bezpośrednie, dalsze pytania i próby zmiany tematu |
| Kompletność | Odpowiedź zawiera potrzebne szczegóły bez ich ukrywania | Testuj zasady, porównania i pytania wieloczęściowe |
| Jakość rozmowy | Dalsze odpowiedzi prawidłowo uwzględniają wcześniejszy przebieg | Przeprowadź z każdym modelem tę samą rozmowę liczącą od pięciu do dziesięciu wiadomości |
| Jakość językowa | Odpowiedź brzmi naturalnie w obsługiwanych językach | Użyj tych samych pytań w każdym języku docelowym |
| Czas odpowiedzi | Czat działa sprawnie na Twojej stronie | Mierz prawdziwe rozmowy w widżecie, a nie osobną prezentację dostawcy |
Ustawienia wyszukiwania, jakość źródeł i instrukcje wpływają na każdy wynik. Podczas porównania nie zmieniaj tych elementów.
Modele GPT-5.6
Aktualne opcje OpenAI to GPT-5.6 Sol, GPT-5.6 Terra i GPT-5.6 Luna. Potraktuj je jako trzech kandydatów z jednej rodziny i sprawdź, czy zmiana poziomu daje istotnie lepsze odpowiedzi.
Zacznij od Terra, ponieważ jest obecnie modelem domyślnym. Dodaj Sol do najtrudniejszych pytań o zasady, rozwiązywanie problemów lub porównania. Dodaj Luna jako kolejnego kandydata GPT-5.6 do krótkich, częstych pytań. To role w teście, nie obietnice dotyczące możliwości.
Modele Claude
Aktualne opcje Anthropic to Claude Opus 5, Claude Sonnet 5 i Claude Haiku 4.5. Użyj tych samych źródeł i instrukcji. Zwracaj szczególną uwagę na szczegóły bez potwierdzenia, odmowy, długość odpowiedzi i stabilność tonu w dłuższych rozmowach.
Umieść Opus 5 i Sonnet 5 na liście modeli do złożonych przykładów. Haiku 4.5 daje trzeci punkt porównania Anthropic dla prostszych wymian. O wyborze powinny zdecydować własne zapisy rozmów.
Modele Gemini
Agentkit oferuje Gemini 3.7 Flash i Gemini 3.1 Pro. Starsze poradniki mogą nadal wymieniać wcześniejsze wersje Flash, dlatego źródłem prawdy jest aktualny selektor.
Porównaj oba modele na długich fragmentach źródeł, pytaniach wielojęzycznych i dalszych rozmowach, jeśli takie zadania są ważne. Nazwy „Pro” i „Flash” nie zastępują pomiaru z aktywnym wyszukiwaniem Agentkit.
Jak przygotować uczciwy test
Niewielki, stały zestaw testowy szybko daje użyteczne wyniki.
- Zbierz od 20 do 30 prawdziwych pytań klientów. Uwzględnij pytania łatwe, niejednoznaczne, przypadki bez odpowiedzi oraz prośby uruchamiające działanie lub eskalację.
- Użyj tych samych źródeł, instrukcji i ustawień działań dla każdego modelu.
- Zacznij od GPT-5.6 Terra i wybierz co najmniej jeden model z każdej innej rodziny.
- Oceń poprawność, zgodność ze źródłami, kompletność, ton i czas odpowiedzi.
- Odrzuć każdą odpowiedź, która wymyśla szczegół produktu, nawet jeśli pozostała część brzmi dobrze.
- Powtórz test po większej zmianie źródeł lub instrukcji.
Praktyczna lista modeli
Jeśli nie masz jeszcze dość ruchu, aby zbudować duży zestaw:
- Zachowaj GPT-5.6 Terra jako punkt odniesienia.
- Porównaj Claude Sonnet 5 i Gemini 3.7 Flash na tych samych pytaniach.
- Dodaj GPT-5.6 Sol, Claude Opus 5 lub Gemini 3.1 Pro do najtrudniejszych przykładów.
- Uwzględnij GPT-5.6 Luna lub Claude Haiku 4.5, jeśli obsługujesz wiele krótkich, rutynowych pytań.
W ten sposób otrzymasz dane o własnym chatbocie zamiast ogólnego rankingu dostawców.
Koszty i plany
Plany Agentkit korzystają z limitów wiadomości i nie wystawiają osobnego rachunku za tokeny dla każdego modelu. Płatne plany obejmują osiem podstawowych modeli, Pro dodaje GPT-6 Astra i Claude Fable 5.1, a plan bezpłatny korzysta z mniejszego wyboru. Aktualne limity opisuje przewodnik po cenach.
Zmiana modelu dotyczy przyszłych rozmów. Źródła witryny, dokumenty, pary pytań i odpowiedzi oraz fragmenty tekstu pozostają bez zmian.
Podsumowanie
Nie ma stałego zwycięzcy między GPT, Claude i Gemini dla każdego chatbota. Aktualny selektor Agentkit zawiera osiem konkretnych opcji. Zacznij od GPT-5.6 Terra, przetestuj modele różnych dostawców na prawdziwych pytaniach i wybierz ten, który popełnia najmniej istotnych błędów.
Po uruchomieniu przeglądaj rozmowy. Gdy zmieni się katalog, Twoje treści lub pytania klientów, wykonaj tę samą ocenę ponownie.
Karta kredytowa nie jest wymagana.



