Websitebronnen
Crawl je website om je agent te trainen. Automatisch opnieuw trainen houdt content actueel.
Met websitebronnen train je je agent door pagina's van je website te crawlen. We extraheren automatisch tekstcontent en kunnen deze actueel houden met dagelijks automatisch opnieuw trainen.
Een websitebron toevoegen
- Ga naar het tabblad Bronnen van je agent
- Klik op Website
- Voer een URL in (bijv.
https://yoursite.com/faq) - Klik op Link toevoegen
- Wacht tot het crawlen is voltooid (meestal 10-30 seconden)
De crawler haalt tekstcontent uit de pagina en verwijdert navigatie, voetteksten en andere elementen zonder content.
Wat wordt gecrawld
- Hoofdcontent en koppen van de pagina
- Artikeltekst en alinea's
- Lijsten en gestructureerde content
Wat wordt uitgesloten:
- Navigatiemenu's en voetteksten
- Afbeeldingen en video's (alleen tekst)
- Pagina's achter een login
Meerdere pagina's toevoegen
Voeg URL's één voor één toe. Voeg voor volledige dekking het volgende toe:
- FAQ-/Help-pagina's
- Productdocumentatie
- Prijspagina
- Over ons/bedrijfsinformatie
- Belangrijke blogposts
Tip: Begin met 5-10 van je belangrijkste pagina's, test in de Playground en voeg er indien nodig meer toe.
Pagina's met JavaScript-rendering
Voor websites met JavaScript-gerenderde content (React, Vue, enz.) gebruiken we de Jina Reader API voor betere extractie:
- Rendert JavaScript voordat er wordt geëxtraheerd
- Levert schone markdown op
- Verwerkt dynamische content in moderne webapps
Jina Reader draait standaard als eerste; als er geen content kan worden geëxtraheerd, vallen we terug op een traditionele HTML-crawl.
Automatisch opnieuw trainen
Standard- en Pro-abonnementen bevatten automatisch dagelijks opnieuw trainen voor websitebronnen. Als dit is ingeschakeld:
- Worden je websitebronnen elke 24 uur opnieuw gecrawld
- Worden contentwijzigingen automatisch opgepikt
- Blijft je agent actueel zonder handmatig werk
Automatisch opnieuw trainen inschakelen
- Ga naar het tabblad Playground
- Zoek het trainingsbronnenpaneel
- Schakel Automatisch opnieuw trainen van websitebronnen in
| Plan | Automatisch opnieuw trainen |
|---|---|
| Free | Niet beschikbaar |
| Hobby | Niet beschikbaar |
| Standard | Dagelijks |
| Pro | Dagelijks |
Handmatig opnieuw trainen
Voor directe updates of om specifieke pagina's opnieuw te trainen:
- Ga naar Bronnen > Website
- Zoek de bron die je wilt vernieuwen
- Klik op de knop Opnieuw trainen
- Wacht tot de verwerking is voltooid
Linklimieten
| Plan | Websitelinks |
|---|---|
| Free | 10 |
| Hobby | Onbeperkt |
| Standard | Onbeperkt |
| Pro | Onbeperkt |
Problemen oplossen
"Pagina kon niet worden gecrawld"
- Controleer of de URL openbaar toegankelijk is
- Controleer of de pagina een login vereist
- Probeer een andere pagina van je site
"Geen content geëxtraheerd"
- De pagina bevat mogelijk veel JavaScript (Jina Reader verwerkt de meeste JS-pagina's)
- Controleer of content achter tabbladen of accordeons staat
- Zorg dat de pagina daadwerkelijk tekstcontent bevat
"Content lijkt verouderd"
- Schakel automatisch opnieuw trainen in voor automatische updates
- Train de bron handmatig opnieuw
- Controleer de tijdstempel bij "Laatst getraind"
Volgende stappen
- Test in de Playground om te controleren of de gecrawlde content werkt
- Voeg documentbronnen toe voor PDF-/Word-bestanden
- Maak Q&A-paren aan voor exacte antwoorden