Websitebronnen

Crawl je website om je agent te trainen. Automatisch opnieuw trainen houdt content actueel.

Met websitebronnen train je je agent door pagina's van je website te crawlen. We extraheren automatisch tekstcontent en kunnen deze actueel houden met dagelijks automatisch opnieuw trainen.

Een websitebron toevoegen

  1. Ga naar het tabblad Bronnen van je agent
  2. Klik op Website
  3. Voer een URL in (bijv. https://yoursite.com/faq)
  4. Klik op Link toevoegen
  5. Wacht tot het crawlen is voltooid (meestal 10-30 seconden)

De crawler haalt tekstcontent uit de pagina en verwijdert navigatie, voetteksten en andere elementen zonder content.

Wat wordt gecrawld

  • Hoofdcontent en koppen van de pagina
  • Artikeltekst en alinea's
  • Lijsten en gestructureerde content

Wat wordt uitgesloten:

  • Navigatiemenu's en voetteksten
  • Afbeeldingen en video's (alleen tekst)
  • Pagina's achter een login

Meerdere pagina's toevoegen

Voeg URL's één voor één toe. Voeg voor volledige dekking het volgende toe:

  • FAQ-/Help-pagina's
  • Productdocumentatie
  • Prijspagina
  • Over ons/bedrijfsinformatie
  • Belangrijke blogposts

Tip: Begin met 5-10 van je belangrijkste pagina's, test in de Playground en voeg er indien nodig meer toe.

Pagina's met JavaScript-rendering

Voor websites met JavaScript-gerenderde content (React, Vue, enz.) gebruiken we de Jina Reader API voor betere extractie:

  • Rendert JavaScript voordat er wordt geëxtraheerd
  • Levert schone markdown op
  • Verwerkt dynamische content in moderne webapps

Jina Reader draait standaard als eerste; als er geen content kan worden geëxtraheerd, vallen we terug op een traditionele HTML-crawl.

Automatisch opnieuw trainen

Standard- en Pro-abonnementen bevatten automatisch dagelijks opnieuw trainen voor websitebronnen. Als dit is ingeschakeld:

  1. Worden je websitebronnen elke 24 uur opnieuw gecrawld
  2. Worden contentwijzigingen automatisch opgepikt
  3. Blijft je agent actueel zonder handmatig werk

Automatisch opnieuw trainen inschakelen

  1. Ga naar het tabblad Playground
  2. Zoek het trainingsbronnenpaneel
  3. Schakel Automatisch opnieuw trainen van websitebronnen in
PlanAutomatisch opnieuw trainen
FreeNiet beschikbaar
HobbyNiet beschikbaar
StandardDagelijks
ProDagelijks

Handmatig opnieuw trainen

Voor directe updates of om specifieke pagina's opnieuw te trainen:

  1. Ga naar Bronnen > Website
  2. Zoek de bron die je wilt vernieuwen
  3. Klik op de knop Opnieuw trainen
  4. Wacht tot de verwerking is voltooid

Linklimieten

PlanWebsitelinks
Free10
HobbyOnbeperkt
StandardOnbeperkt
ProOnbeperkt

Problemen oplossen

"Pagina kon niet worden gecrawld"

  • Controleer of de URL openbaar toegankelijk is
  • Controleer of de pagina een login vereist
  • Probeer een andere pagina van je site

"Geen content geëxtraheerd"

  • De pagina bevat mogelijk veel JavaScript (Jina Reader verwerkt de meeste JS-pagina's)
  • Controleer of content achter tabbladen of accordeons staat
  • Zorg dat de pagina daadwerkelijk tekstcontent bevat

"Content lijkt verouderd"

  • Schakel automatisch opnieuw trainen in voor automatische updates
  • Train de bron handmatig opnieuw
  • Controleer de tijdstempel bij "Laatst getraind"

Volgende stappen