Zabezpieczenia

Uruchamiaj kontrole bezpieczeństwa przed i po odpowiedzi agenta: skupienie na temacie, wykrywanie wstrzykiwania promptów i moderację treści.

Zabezpieczenia to kontrole bezpieczeństwa uruchamiane przed i po odpowiedzi agenta. Włącz wybrane kontrole, a agent będzie blokować żądania wykraczające poza nie, zamiast na nie odpowiadać.

Szczera uwaga na wstępie: zabezpieczenia działają najlepiej, jak potrafią, ale nie są absolutną gwarancją. Kontrole skupienia na temacie, klasyfikatora wstrzykiwania promptów i moderacji treści wywołują zewnętrznego dostawcę; jeśli kontrola przekroczy limit czasu lub zwróci błąd, agent i tak odpowiada, zamiast przestać działać razem z dostawcą (tzw. fail open). Tylko wbudowane dopasowanie wzorców wstrzykiwania promptów działa w pełni lokalnie. Traktuj zabezpieczenia jako silny filtr, a nie twardą granicę bezpieczeństwa.

Włączanie zabezpieczeń

  1. Przejdź do panelu agenta
  2. Kliknij Ustawienia
  3. Wybierz Bezpieczeństwo
  4. Otwórz kartę Zabezpieczenia i włącz wybrane kontrole
  5. Zapisz

Zabezpieczenia są konfigurowane osobno dla każdego agenta. Każdy agent ma własne ustawienia — nie ma jednego domyślnego ustawienia dla całego obszaru roboczego, więc włącz je oddzielnie dla każdego agenta, który ma być chroniony.

Te ustawienia dotyczą czatu i generowanych odpowiedzi e-mail. Poniższe sekcje opisują zachowanie na czacie; różnice dotyczące e-maili znajdziesz w sekcji Odpowiedzi e-mail.

Trzy rodzaje kontroli

Skupienie na temacie

Blokuje żądania niezwiązane z publicznym przeznaczeniem tego agenta — kontrola ocenia każde żądanie na podstawie nazwy witryny Twojego agenta, a nie na podstawie Twoich źródeł. Użyj tej kontroli, gdy agent ma trzymać się Twojego produktu, usługi lub dokumentacji, zamiast odpowiadać na pytania ogólne.

Wykrywanie wstrzykiwania promptów

Blokuje próby zastąpienia Twoich instrukcji, ujawnienia ukrytych promptów lub wymuszenia użycia narzędzi przez agenta.

Moderacja treści

Sprawdza dane wejściowe odwiedzającego i odpowiedzi agenta pod kątem niebezpiecznych treści. To jedyna kontrola, która analizuje również to, co powiedział agent. Przy odpowiedzi wyjściowej sprawdza tylko główny tekst odpowiedzi agenta: automatycznie generowane chipy z sugerowanymi wiadomościami nie są sprawdzane osobno — mimo to żadne chipy nie powstają, gdy główna odpowiedź została oznaczona.

Co dzieje się przy wiadomości wejściowej

Włączone kontrole uruchamiają się, zanim model napisze odpowiedź.

  • Szybkie dopasowanie wzorców dla znanych fraz wstrzykiwania promptów może natychmiast zablokować wiadomość, zanim uruchomią się pozostałe kontrole.
  • Pozostałe włączone kontrole mogą uruchamiać się razem, a nie jedna po drugiej.
  • Jeśli którakolwiek włączona kontrola się uruchomi, tura zostaje zablokowana, a odwiedzający nigdy nie zobaczy odpowiedzi modelu.

Kontrole odczytują ograniczony fragment, a nie cały ładunek: sprawdzanych jest tylko pierwszych 8000 znaków wiadomości odwiedzającego (historia rozmowy i tekst załączników mają osobno ustalone limity), podczas gdy pełna wiadomość i tak trafia do modelu. Dlatego nietypowo długa wiadomość może przenieść niesprawdzoną treść przez kontrole wejściowe.

Gdy na tę samą wiadomość reaguje więcej niż jedna kontrola, zapisany powód jest ustalany według stałej kolejności raportowania: najpierw moderacja treści, potem klasyfikator wstrzykiwania promptów, a na końcu klasyfikator tematu.

Co widzi odwiedzający po zablokowaniu

Jeśli wypełnisz pole Niestandardowa wiadomość blokady, odwiedzający zobaczy tę wiadomość. Jeśli pozostawisz je puste, agent użyje wbudowanej wiadomości domyślnej:

  • Przy pytaniach nie na temat: "I can only help with questions about your site name. What would you like to know?" (po polsku, w skrócie: „Mogę pomóc tylko w kwestiach związanych z nazwą Twojej witryny. W czym mogę pomóc?”)
  • Przy każdej innej blokadzie: "Sorry, I can't help with that. Is there anything else I can help you with?" (po polsku, w skrócie: „Przepraszam, nie mogę w tym pomóc. Czy mogę pomóc w czymś innym?”)

Pole jest opcjonalne i ograniczone do 500 znaków.

Dwie rzeczy, które warto wiedzieć o zablokowanych turach:

  • Nadal wliczają się do limitu wiadomości. Kontrola uruchamia się na rzeczywistym żądaniu, więc tura jest rozliczana tak samo jak każda inna.
  • Są zapisywane. Zablokowane tury pojawiają się w Dziennikach czatu wraz z powodem zablokowania, dzięki czemu możesz sprawdzić, co zostało wychwycone.

Co dzieje się z odpowiedzią wyjściową

Moderacja treści uruchamia się także raz po odpowiedzi modelu. Skupienie na temacie i wykrywanie wstrzykiwania promptów nie działają przy wyjściu.

Oznaczenie wyjścia nie wycofuje odpowiedzi — odwiedzający już ją widział i pozostaje ona w rozmowie. Co robi w takim razie oznaczenie:

  • Zapisuje oznaczenie przy tej turze, dzięki czemu możesz je przejrzeć w Dziennikach czatu
  • Pomija sugerowane wiadomości, które ta tura normalnie by zaproponowała

Nie ma blokowania wyjścia: odpowiedzi są przesyłane strumieniowo do odwiedzającego, zanim kontrola się zakończy, więc kontrola wyjścia to sygnał do przeglądu, a nie filtr. Zawężenie źródeł i instrukcji agenta sprawia, że niebezpieczna odpowiedź staje się mniej prawdopodobna, ale nie gwarantuje, że nigdy nie zostanie wyświetlona.

Odpowiedzi e-mail

W przypadku e-maili kontrole uruchamiają się przed przygotowaniem wersji roboczej i po wygenerowaniu. Zablokowanie wejścia pozostawia wiadomość do ręcznej weryfikacji bez generowania odpowiedzi i bez zużycia limitu wiadomości. Oznaczenie wyjścia zatrzymuje wersję roboczą w Aktywność > E-maile > Do sprawdzenia i blokuje automatyczną wysyłkę; wygenerowanie tej wersji roboczej nadal zużywa limit.

Te kontrole obowiązują również po wybraniu opcji Przygotuj odpowiedź. Ręczne wysłanie nie uruchamia kontroli ponownie. Sprawdź oznaczone wersje robocze przed wysłaniem. Konfigurację i ustawienia skrzynki odbiorczej opisuje przewodnik po e-mailu.

Fałszywe alarmy

Kontrole bezpieczeństwa mogą czasem zablokować uzasadnione żądanie. Przed szerszym włączeniem przejrzyj oznaczone rozmowy w Dziennikach czatu. Filtrowanie Dzienników czatu do rozmów oznaczonych przez zabezpieczenia to najszybszy sposób sprawdzenia, czy dana kontrola jest zbyt agresywna dla Twoich odbiorców.

Jeśli dana kontrola blokuje zbyt wiele:

  • Wyłącz ją. Skupienie na temacie ocenia każde żądanie wyłącznie względem publicznego celu Twojego agenta (nazwy witryny) — nie czyta Twoich źródeł ani instrukcji, więc dodawanie treści nie może poszerzyć tego, co jest akceptowane
  • Ustaw bardziej przyjazną Niestandardową wiadomość blokady, aby ślepy zaułek nadal dobrze brzmiał

Kolejne kroki