Website-Quellen

Crawlen Sie Ihre Website, um Ihren Agenten zu trainieren. Automatisches erneutes Training hält die Inhalte aktuell.

Mit Website-Quellen trainieren Sie Ihren Agenten, indem Seiten Ihrer Website gecrawlt werden. Wir extrahieren die Textinhalte automatisch und können sie durch tägliches automatisches erneutes Training aktuell halten.

Website-Quelle hinzufügen

  1. Öffnen Sie den Tab Quellen Ihres Agenten.
  2. Klicken Sie auf Website.
  3. Geben Sie eine URL ein (z. B. https://yoursite.com/faq).
  4. Klicken Sie auf Link hinzufügen.
  5. Warten Sie, bis der Crawlvorgang abgeschlossen ist (in der Regel 10–30 Sekunden).

Der Crawler extrahiert die Textinhalte der Seite und entfernt Navigation, Fußzeilen und andere Elemente ohne inhaltlichen Mehrwert.

Was gecrawlt wird

  • Hauptinhalt und Überschriften der Seite
  • Artikeltext und Absätze
  • Listen und strukturierte Inhalte

Was ausgeschlossen ist:

  • Navigationsmenüs und Fußzeilen
  • Bilder und Videos (nur Text)
  • Anmeldegeschützte Seiten

Mehrere Seiten hinzufügen

Fügen Sie URLs einzeln hinzu. Für eine umfassende Abdeckung sollten Sie Folgendes hinzufügen:

  • FAQ-/Hilfeseiten
  • Produktdokumentation
  • Preisseite
  • Über-uns-/Unternehmensinformationen
  • Wichtige Blogbeiträge

Tipp: Beginnen Sie mit 5–10 Ihrer wichtigsten Seiten, testen Sie sie im Playground und fügen Sie bei Bedarf weitere hinzu.

Mit JavaScript gerenderte Seiten

Bei Websites mit per JavaScript gerenderten Inhalten (React, Vue usw.) verwenden wir für eine bessere Extraktion die Jina Reader API:

  • Rendert JavaScript vor der Extraktion
  • Liefert sauberes Markdown
  • Verarbeitet dynamische Inhalte moderner Web-Apps

Standardmäßig wird zuerst Jina Reader ausgeführt; kann es keine Inhalte extrahieren, greifen wir auf einen klassischen HTML-Crawl zurück.

Automatisches erneutes Training

Die Tarife Standard und Pro beinhalten automatisches tägliches erneutes Training für Website-Quellen. Wenn diese Funktion aktiviert ist:

  1. Ihre Web-Quellen werden alle 24 Stunden erneut gecrawlt.
  2. Inhaltsänderungen werden automatisch übernommen.
  3. Ihr Agent bleibt ohne manuellen Aufwand aktuell.

Automatisches erneutes Training aktivieren

  1. Öffnen Sie den Tab Playground.
  2. Suchen Sie das Panel für Trainingsquellen.
  3. Aktivieren Sie Web-Quellen automatisch neu trainieren.
TarifAutomatisches erneutes Training
FreeNicht verfügbar
HobbyNicht verfügbar
StandardTäglich
ProTäglich

Manuelles erneutes Training

Für sofortige Aktualisierungen oder um bestimmte Seiten neu zu trainieren:

  1. Gehen Sie zu Quellen > Website.
  2. Suchen Sie die Quelle, die Sie aktualisieren möchten.
  3. Klicken Sie auf die Schaltfläche Neu trainieren.
  4. Warten Sie, bis die Verarbeitung abgeschlossen ist.
TarifWebsite-Links
Free10
HobbyUnbegrenzt
StandardUnbegrenzt
ProUnbegrenzt

Fehlerbehebung

„Seite konnte nicht gecrawlt werden“

  • Stellen Sie sicher, dass die URL öffentlich zugänglich ist
  • Prüfen Sie, ob für die Seite eine Anmeldung erforderlich ist
  • Probieren Sie eine andere Seite Ihrer Website aus

„Kein Inhalt extrahiert“

  • Die Seite ist möglicherweise stark JavaScript-lastig (Jina Reader verarbeitet die meisten JS-Seiten)
  • Prüfen Sie, ob sich Inhalte hinter Tabs oder Akkordeons verbergen
  • Stellen Sie sicher, dass die Seite tatsächlich Textinhalt enthält

„Inhalt wirkt veraltet“

  • Aktivieren Sie automatisches erneutes Training für automatische Aktualisierungen
  • Trainieren Sie die Quelle manuell neu
  • Prüfen Sie den Zeitstempel „Zuletzt trainiert“

Nächste Schritte