Drie kleine txt-bestanden die veel invloed hebben op je website
Kort samengevat (TL;DR):
In dit artikel:
Drie kleine bestanden helpen zoekmachines, AI-systemen en beveiligingsonderzoekers om goed met je website om te gaan. robots.txt bepaalt welke crawlers je website mogen bezoeken, llms.txt helpt AI-systemen om belangrijke informatie op je website te vinden en security.txt vertelt waar beveiligingsproblemen gemeld kunnen worden. Een verkeerde of verouderde inrichting kan je vindbaarheid, AI-zichtbaarheid of beveiliging in de weg zitten.
In de basis van een website kunnen een paar kleine tekstbestanden staan die je als bezoeker waarschijnlijk nooit ziet. Toch kunnen ze een belangrijke rol spelen in de vindbaarheid, AI-vindbaarheid en beveiliging van je website.
Drie bestanden zijn daarbij interessant: robots.txt, llms.txt en security.txt. Ze hebben ieder een compleet andere functie.
robots.txt, wie mag je website bezoeken?
Robots.txt bestaat al sinds de begintijd van zoekmachines. Het bestand geeft crawlers instructies over welke delen van je website ze wel en niet mogen bezoeken.
Voor een WordPress website wil je bijvoorbeeld voorkomen dat zoekmachines onnodig door technische onderdelen zoals /wp-admin/ gaan, terwijl de publieke pagina’s juist toegankelijk moeten zijn.
Een eenvoudige robots.txt kan er bijvoorbeeld zo uitzien:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://www.jouwdomein.nl/sitemap.xml
Tegenwoordig speelt robots.txt niet alleen een rol bij zoekmachines als Google en Bing. Ook AI-bedrijven hebben eigen crawlers. OpenAI maakt bijvoorbeeld onderscheid tussen OAI-SearchBot voor ChatGPT Search en GPTBot voor het verzamelen van content die gebruikt kan worden voor het trainen van modellen. Daardoor kun je ervoor kiezen om zichtbaar te zijn in ChatGPT, maar gebruik voor training te blokkeren. Dat ziet er bijvoorbeeld zou uit:
# OpenAI: zichtbaar in ChatGPT Search
User-agent: OAI-SearchBot
Allow: /
# OpenAI: ophalen wanneer gebruiker ChatGPT iets vraagt
User-agent: ChatGPT-User
Allow: /
# OpenAI: NIET gebruiken voor modeltraining
User-agent: GPTBot
Disallow: /
# Anthropic: zichtbaar voor Claude Search
User-agent: Claude-SearchBot
Allow: /
# Anthropic: ophalen wanneer gebruiker Claude iets vraagt
User-agent: Claude-User
Allow: /
# Anthropic: NIET gebruiken voor modeltraining
User-agent: ClaudeBot
Disallow: /
Wat kan er misgaan?
Een verkeerd ingestelde robots.txt kan ervoor zorgen dat belangrijke content niet goed gecrawld kan worden. Nog vervelender is wanneer een website bijvoorbeeld na ontwikkeling per ongeluk op een instelling blijft staan waarmee zoekmachines worden geweerd. Dat kan grote gevolgen hebben voor je organische vindbaarheid.
Bij Sturdy Digital controleren we dit daarom automatisch. Voor websites die wij beheren monitoren we of de website toegankelijk blijft voor indexering. Je hoeft je als klant dus geen zorgen te maken dat je website ongemerkt langdurig voor zoekmachines wordt geblokkeerd.
Best practice voor WordPress
Houd robots.txt eenvoudig. Blokkeer alleen onderdelen die crawlers niet hoeven te bezoeken en zorg dat belangrijke content, CSS, JavaScript en afbeeldingen bereikbaar blijven.
Bepaal daarnaast bewust wat je met AI-crawlers wilt doen. Je kunt bijvoorbeeld AI-zoekmachines toegang geven, terwijl je crawlers voor modeltraining blokkeert.
llms.txt, een wegwijzer voor AI
Llms.txt is veel nieuwer. Het is een voorstel uit 2024 dat in 2026 verder is doorontwikkeld. Het idee is simpel: geef AI-systemen een compacte, gestructureerde wegwijzer naar de belangrijkste informatie op je website.
Je kunt er bijvoorbeeld aangeven waar informatie staat over je organisatie, diensten, producten, expertise en documentatie.
Een llms.txt voor een WordPress website zou bijvoorbeeld kunnen beginnen met:
# Bedrijfsnaam
> Korte omschrijving van het bedrijf en zijn expertise.
## Diensten
- [Dienst A](https://www.domein.nl/dienst-a/)
- [Dienst B](https://www.domein.nl/dienst-b/)
## Kennis
- [Kennisbank](https://www.domein.nl/kennisbank/)
- [Veelgestelde vragen](https://www.domein.nl/faq/)
Belangrijk is om te realiseren dat llms.txt geen alternatief is voor robots.txt. Robots.txt bepaalt de toegang van crawlers. Llms.txt helpt AI-systemen om relevante informatie makkelijker te vinden en te begrijpen.
Wat kan er misgaan?
Op dit moment is het grootste risico vooral dat je een kans laat liggen. Llms.txt is nog geen officiële internetstandaard en ondersteuning verschilt per AI-platform.
Een llms.txt garandeert dus niet dat je vaker in ChatGPT of Claude wordt genoemd. Zie het als één onderdeel van GEO, Generative Engine Optimization.
Een slecht gevuld bestand kan bovendien verouderde of minder relevante pagina’s aanwijzen. Je wilt een AI-systeem juist helpen om snel bij je beste en meest actuele informatie uit te komen.
Best practice voor WordPress
Maak van llms.txt geen kopie van je sitemap. Selecteer juist de pagina’s die het beste uitleggen wie je bent, wat je doet en waar je expertise ligt.
Zorg daarnaast dat de informatie op die pagina’s zelf duidelijk en goed gestructureerd is. Een llms.txt kan goede content beter vindbaar maken, maar maakt slechte content niet ineens goed.
security.txt, waar meld je een beveiligingsprobleem?
Security.txt heeft weer een heel ander doel. Het is bedoeld voor securityonderzoekers die een kwetsbaarheid in je website of systemen ontdekken.
In plaats van te moeten zoeken naar een algemeen contactformulier kunnen zij in security.txt direct zien waar en hoe ze een beveiligingsprobleem verantwoord kunnen melden.
Security.txt is vastgelegd in RFC 9116 en heeft daarmee een veel formelere status dan llms.txt. De officiële locatie is:
/.well-known/security.txt
Een eenvoudig voorbeeld:
Contact: mailto:security@jouwdomein.nl
Expires: 2027-09-01T00:00:00.000Z
Canonical: https://www.jouwdomein.nl/.well-known/security.txt
Een geldig security.txt bevat minimaal contactinformatie en een verloopdatum. Daarnaast kun je met een Canonical-verwijzing aangeven waar het officiële security.txt-bestand staat. Zo weet iemand die een beveiligingsprobleem ontdekt zeker dat hij de juiste en actuele informatie gebruikt.
Wat kan er misgaan?
Zonder security.txt weet iemand die een kwetsbaarheid ontdekt mogelijk niet waar die gemeld moet worden. Een melding kan daardoor bij de verkeerde persoon terechtkomen of helemaal niet worden gedaan.
Een verouderd security.txt kan zelfs erger zijn. Een beveiligingsmelding kan dan worden verstuurd naar een e-mailadres dat niemand meer controleert. De standaard waarschuwt hier expliciet voor.
Best practice voor WordPress
Zorg voor één duidelijk bewaakt contactpunt voor beveiligingsmeldingen en publiceer dat via /.well-known/security.txt.
Controleer het bestand periodiek. Vooral het contactadres en de verplichte verloopdatum moeten actueel blijven.
Drie bestanden, drie verschillende functies
De namen lijken op elkaar, maar de bestanden lossen drie totaal verschillende problemen op.
- robots.txt bepaalt welke crawlers waar mogen komen en speelt daarmee een rol in SEO en AI-vindbaarheid.
- llms.txt helpt AI-systemen de belangrijkste informatie en pagina’s van je organisatie te vinden en te begrijpen.
- security.txt vertelt securityonderzoekers waar ze een gevonden kwetsbaarheid veilig kunnen melden.
Voor een professionele WordPress website is het daarom verstandig om niet alleen te controleren óf deze bestanden aanwezig zijn, maar vooral of ze goed zijn ingericht en actueel blijven.
Bij Sturdy Digital bewaken we voor onze klanten al automatisch dat websites toegankelijk blijven voor indexering. Daarmee voorkomen we dat een verkeerde instelling in robots.txt ongemerkt je vindbaarheid in zoekmachines in de weg zit.
