Źródła ze strony internetowej
Przeszukaj swoją stronę internetową, aby wytrenować agenta. Automatyczne ponowne trenowanie utrzymuje treść na bieżąco.
Źródła ze strony internetowej pozwalają trenować agenta na podstawie stron przeszukanych w Twojej witrynie. Automatycznie wyodrębniamy treść tekstową i możemy ją utrzymywać na bieżąco dzięki codziennemu automatycznemu ponownemu trenowaniu.
Dodawanie źródła ze strony internetowej
- Przejdź do zakładki Źródła swojego agenta
- Kliknij Strona internetowa
- Wpisz URL (np.
https://yoursite.com/faq) - Kliknij Dodaj link
- Poczekaj na zakończenie przeszukiwania (zwykle 10-30 sekund)
Mechanizm przeszukiwania wyodrębnia treść tekstową ze strony, usuwając nawigację, stopki i inne elementy niebędące treścią.
Co jest przeszukiwane
- Główna treść i nagłówki strony
- Tekst artykułów i akapity
- Listy i treści ustrukturyzowane
Co jest wykluczone:
- Menu nawigacyjne i stopki
- Zdjęcia i filmy (tylko tekst)
- Strony chronione logowaniem
Dodawanie wielu stron
Dodawaj adresy URL pojedynczo. Aby uzyskać pełne pokrycie, dodaj:
- Strony FAQ/Pomoc
- Dokumentację produktu
- Stronę z cennikiem
- Informacje o firmie
- Kluczowe wpisy na blogu
Wskazówka: Zacznij od 5-10 najważniejszych stron, przetestuj w Playground, a następnie dodawaj kolejne w miarę potrzeb.
Strony renderowane w JavaScript
Dla witryn z treścią renderowaną w JavaScript (React, Vue itp.) korzystamy z Jina Reader API, żeby uzyskać lepszą ekstrakcję:
- Renderuje JavaScript przed wyodrębnieniem treści
- Zwraca czysty markdown
- Obsługuje dynamiczną treść w nowoczesnych aplikacjach webowych
Jina Reader domyślnie uruchamia się jako pierwszy; jeśli nie może wyodrębnić treści, przechodzimy do tradycyjnego przeszukiwania HTML.
Automatyczne ponowne trenowanie
Plany Standard i Pro obejmują automatyczne, codzienne ponowne trenowanie źródeł ze strony internetowej. Po włączeniu:
- Twoje źródła internetowe są ponownie przeszukiwane co 24 godziny
- Zmiany treści są wykrywane automatycznie
- Agent pozostaje aktualny bez ręcznej pracy
Włącz automatyczne ponowne trenowanie
- Przejdź do zakładki Playground
- Znajdź panel źródeł treningowych
- Włącz przełącznik Automatyczne ponowne trenowanie źródeł internetowych
| Plan | Automatyczne ponowne trenowanie |
|---|---|
| Free | Niedostępne |
| Hobby | Niedostępne |
| Standard | Codziennie |
| Pro | Codziennie |
Ręczne ponowne trenowanie
Aby natychmiast zaktualizować treść lub ponownie wytrenować konkretne strony:
- Przejdź do Źródła > Strona internetowa
- Znajdź źródło, które chcesz odświeżyć
- Kliknij przycisk Trenuj ponownie
- Poczekaj na zakończenie przetwarzania
Limity linków
| Plan | Linki do stron |
|---|---|
| Free | 10 |
| Hobby | Bez limitu |
| Standard | Bez limitu |
| Pro | Bez limitu |
Rozwiązywanie problemów
"Nie udało się przeszukać strony"
- Sprawdź, czy URL jest publicznie dostępny
- Sprawdź, czy strona wymaga logowania
- Wypróbuj inną stronę ze swojej witryny
"Nie wyodrębniono żadnej treści"
- Strona może intensywnie korzystać z JavaScript (Jina Reader obsługuje większość takich stron)
- Sprawdź, czy treść nie jest ukryta w zakładkach lub akordeonach
- Upewnij się, że strona zawiera rzeczywistą treść tekstową
"Treść wydaje się nieaktualna"
- Włącz automatyczne ponowne trenowanie, aby otrzymywać aktualizacje automatycznie
- Ręcznie ponownie wytrenuj źródło
- Sprawdź znacznik czasu „Ostatnio trenowano”
Kolejne kroki
- Przetestuj w Playground, aby zweryfikować przeszukaną treść
- Dodaj źródła z dokumentów dla plików PDF/Word
- Utwórz pary Q&A dla dokładnych odpowiedzi