聊天機器人使用的模型,會影響它遵循指示、運用檢索內容與組織回答的方式。不過,再好的模型也無法補救品質不佳的來源或含糊的指示。真正值得問的不是哪一家供應商全面勝出,而是哪個現行模型最適合你的內容、訪客與回答規則。
Agentkit 目前提供來自 OpenAI、Anthropic 與 Google 的八個模型。本指南以這份現行目錄為準,不再比較已從模型選單移除的舊模型。
目前的模型目錄
| 供應商 | Agentkit 提供的模型 |
|---|---|
| OpenAI | GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna |
| Anthropic | Claude Opus 5、Claude Sonnet 5、Claude Haiku 4.5 |
| Gemini 3.7 Flash、Gemini 3.1 Pro |
新聊天機器人預設使用 GPT-5.6 Terra。這是方便比較的起點,不代表 Terra 一定適合所有情境。你可以切換模型,不必重新建立來源或重新訓練聊天機器人。
應該比較哪些項目
公開基準測試很少能準確代表網站聊天機器人的實際工作。有效的評估應該量測訪客真正會遇到的行為。
| 評估項目 | 意義 | 測試方式 |
|---|---|---|
| 來源忠實度 | 回答不超出你的來源內容 | 詢問公司特有的問題,也加入來源沒有答案的問題 |
| 遵循指示 | 模型遵守語氣、主題範圍與轉接規則 | 測試直接要求、追問,以及試圖帶離主題的提問 |
| 完整性 | 回答包含必要細節,但不把重點埋在冗長內容中 | 測試政策、比較題與多部分問題 |
| 對話品質 | 後續回答正確運用先前的對話 | 對每個模型進行相同的五到十則訊息對話 |
| 語言品質 | 回答在支援的語言中自然易懂 | 用每種目標語言提出相同的客戶問題 |
| 回應時間 | 網站上的聊天操作順暢 | 量測小工具中的真實對話,而不是供應商的單獨展示 |
檢索設定、來源品質與指示都會影響結果。比較模型時,請讓這些條件保持一致。
GPT-5.6 模型
目前的 OpenAI 選項是 GPT-5.6 Sol、GPT-5.6 Terra 與 GPT-5.6 Luna。把它們視為同一家族的三個候選模型,再由測試集判斷切換層級是否帶來實質改善。
先用目前的預設模型 Terra。最難的政策、疑難排解或比較題,可以加入 Sol 測試。若有大量簡短且重複的問題,也可加入 Luna 作為另一個 GPT-5.6 候選模型。這些只是測試安排,不是能力保證。
Claude 模型
目前的 Anthropic 選項是 Claude Opus 5、Claude Sonnet 5 與 Claude Haiku 4.5。三者都應使用相同的來源與指示。特別檢查沒有來源支持的細節、拒絕回答的情況、回答長度,以及長對話中的語氣是否一致。
複雜範例可先比較 Opus 5 與 Sonnet 5。較簡單的對話則可加入 Haiku 4.5,形成第三個 Anthropic 比較點。最後仍應由你自己的聊天記錄決定。
Gemini 模型
Agentkit 提供 Gemini 3.7 Flash 與 Gemini 3.1 Pro。舊指南可能仍提到先前的 Flash 版本,因此請以目前的模型選單為準。
如果你的聊天機器人需要處理長篇來源、多語問題或連續追問,請用這些案例比較兩個 Gemini 模型。名稱中的「Pro」或「Flash」不能取代 Agentkit 檢索流程開啟後的實際量測。
建立公平的模型測試
一組小而固定的測試題,就能快速得到可用結果。
- 收集 20 到 30 個真實客戶問題。加入簡單問題、模糊說法、來源沒有答案的案例,以及應觸發動作或轉接的要求。
- 每個模型都使用相同的來源、指示與動作設定。
- 從 GPT-5.6 Terra 開始,再從其他供應商家族各選至少一個模型。
- 評分正確性、來源忠實度、完整性、語氣與回應時間。
- 只要回答捏造產品細節,即使其他部分寫得流暢,也應淘汰。
- 來源或指示有重大變更後,重新執行相同測試。
實用的候選清單
如果目前還沒有足夠流量建立大型測試集,可以按照以下順序:
- 保留 GPT-5.6 Terra 作為比較基準。
- 用相同問題比較 Claude Sonnet 5 與 Gemini 3.7 Flash。
- 對最難的範例加入 GPT-5.6 Sol、Claude Opus 5 或 Gemini 3.1 Pro。
- 若有許多簡短的例行問題,加入 GPT-5.6 Luna 或 Claude Haiku 4.5。
這樣得到的是你的聊天機器人證據,而不是泛用的供應商排名。
成本與方案
Agentkit 方案採用訊息額度,不會依每個模型另外顯示 token 帳單。付費方案包含 8 個核心模型,Pro 另加入 GPT-6 Astra 與 Claude Fable 5.1,免費方案則使用較小的模型選擇。最新限制請參閱定價指南。
切換模型會套用到後續對話。網站來源、文件、問答配對與文字片段都不會改變。
結論
GPT、Claude 與 Gemini 之間,沒有一個永遠適合所有聊天機器人的贏家。Agentkit 目前的選單提供八個明確選項。先用 GPT-5.6 Terra,再用真實問題測試橫跨不同供應商的候選清單,最後選擇重大錯誤最少的模型。
上線後繼續檢查對話。模型目錄、內容或客戶問題改變時,請重新執行相同評估,不要依賴舊建議。
不需要信用卡。



