Website-Quellen
Crawlen Sie Ihre Website, um Ihren Agenten zu trainieren. Automatisches erneutes Training hält die Inhalte aktuell.
Mit Website-Quellen trainieren Sie Ihren Agenten, indem Seiten Ihrer Website gecrawlt werden. Wir extrahieren die Textinhalte automatisch und können sie durch tägliches automatisches erneutes Training aktuell halten.
Website-Quelle hinzufügen
- Öffnen Sie den Tab Quellen Ihres Agenten.
- Klicken Sie auf Website.
- Geben Sie eine URL ein (z. B.
https://yoursite.com/faq). - Klicken Sie auf Link hinzufügen.
- Warten Sie, bis der Crawlvorgang abgeschlossen ist (in der Regel 10–30 Sekunden).
Der Crawler extrahiert die Textinhalte der Seite und entfernt Navigation, Fußzeilen und andere Elemente ohne inhaltlichen Mehrwert.
Was gecrawlt wird
- Hauptinhalt und Überschriften der Seite
- Artikeltext und Absätze
- Listen und strukturierte Inhalte
Was ausgeschlossen ist:
- Navigationsmenüs und Fußzeilen
- Bilder und Videos (nur Text)
- Anmeldegeschützte Seiten
Mehrere Seiten hinzufügen
Fügen Sie URLs einzeln hinzu. Für eine umfassende Abdeckung sollten Sie Folgendes hinzufügen:
- FAQ-/Hilfeseiten
- Produktdokumentation
- Preisseite
- Über-uns-/Unternehmensinformationen
- Wichtige Blogbeiträge
Tipp: Beginnen Sie mit 5–10 Ihrer wichtigsten Seiten, testen Sie sie im Playground und fügen Sie bei Bedarf weitere hinzu.
Mit JavaScript gerenderte Seiten
Bei Websites mit per JavaScript gerenderten Inhalten (React, Vue usw.) verwenden wir für eine bessere Extraktion die Jina Reader API:
- Rendert JavaScript vor der Extraktion
- Liefert sauberes Markdown
- Verarbeitet dynamische Inhalte moderner Web-Apps
Standardmäßig wird zuerst Jina Reader ausgeführt; kann es keine Inhalte extrahieren, greifen wir auf einen klassischen HTML-Crawl zurück.
Automatisches erneutes Training
Die Tarife Standard und Pro beinhalten automatisches tägliches erneutes Training für Website-Quellen. Wenn diese Funktion aktiviert ist:
- Ihre Web-Quellen werden alle 24 Stunden erneut gecrawlt.
- Inhaltsänderungen werden automatisch übernommen.
- Ihr Agent bleibt ohne manuellen Aufwand aktuell.
Automatisches erneutes Training aktivieren
- Öffnen Sie den Tab Playground.
- Suchen Sie das Panel für Trainingsquellen.
- Aktivieren Sie Web-Quellen automatisch neu trainieren.
| Tarif | Automatisches erneutes Training |
|---|---|
| Free | Nicht verfügbar |
| Hobby | Nicht verfügbar |
| Standard | Täglich |
| Pro | Täglich |
Manuelles erneutes Training
Für sofortige Aktualisierungen oder um bestimmte Seiten neu zu trainieren:
- Gehen Sie zu Quellen > Website.
- Suchen Sie die Quelle, die Sie aktualisieren möchten.
- Klicken Sie auf die Schaltfläche Neu trainieren.
- Warten Sie, bis die Verarbeitung abgeschlossen ist.
Link-Limits
| Tarif | Website-Links |
|---|---|
| Free | 10 |
| Hobby | Unbegrenzt |
| Standard | Unbegrenzt |
| Pro | Unbegrenzt |
Fehlerbehebung
„Seite konnte nicht gecrawlt werden“
- Stellen Sie sicher, dass die URL öffentlich zugänglich ist
- Prüfen Sie, ob für die Seite eine Anmeldung erforderlich ist
- Probieren Sie eine andere Seite Ihrer Website aus
„Kein Inhalt extrahiert“
- Die Seite ist möglicherweise stark JavaScript-lastig (Jina Reader verarbeitet die meisten JS-Seiten)
- Prüfen Sie, ob sich Inhalte hinter Tabs oder Akkordeons verbergen
- Stellen Sie sicher, dass die Seite tatsächlich Textinhalt enthält
„Inhalt wirkt veraltet“
- Aktivieren Sie automatisches erneutes Training für automatische Aktualisierungen
- Trainieren Sie die Quelle manuell neu
- Prüfen Sie den Zeitstempel „Zuletzt trainiert“
Nächste Schritte
- Im Playground testen, um zu prüfen, ob die gecrawlten Inhalte funktionieren
- Dokumentquellen hinzufügen für PDF-/Word-Dateien
- Q&A-Paare erstellen für exakte Antworten