“De OpenAI-bot” blokkeren is geen beleid. Het is een onbesliste keuze, verstopt in een enkelvoud.
Achter dat enkelvoud zitten drie user-agents van OpenAI, en elk beantwoordt een andere vraag. GPTBot crawlt content die gebruikt kan worden om de basismodellen van OpenAI te trainen; wie hem weert, geeft aan dat de site niet voor die training gebruikt mag worden. OAI-SearchBot bepaalt of je pagina’s in zoekantwoorden van ChatGPT kunnen verschijnen. ChatGPT-User haalt een pagina op omdat iemand ChatGPT of een Custom GPT vroeg ernaar te kijken. De namen rijmen. De instellingen niet.
Wil je dat ChatGPT Search je openbare pagina’s vindt, maar wil je ze buiten toekomstige training houden? Dan heb je twee aparte instructies nodig. Wil je het omgekeerde, dan schrijf je het omgekeerde paar. Een regel voor ChatGPT-User beslist geen van beide vragen.
De vergelijking
| User-agent | Wat het bezoek start | Gepubliceerd doel | Wat een disallow in robots.txt doet |
|---|---|---|---|
GPTBot | Automatische crawl | Content die gebruikt kan worden om de generatieve basismodellen van OpenAI nuttiger en veiliger te maken | Geeft aan dat je content niet gebruikt mag worden om die modellen te trainen |
OAI-SearchBot | Automatische crawl voor Search | Websites tonen in de zoekfuncties van ChatGPT | Houdt je content buiten zoekantwoorden van ChatGPT; een navigatielink kan nog verschijnen |
ChatGPT-User | Een verzoek van een mens in ChatGPT of een Custom GPT | Een pagina bezoeken om dat verzoek uit te voeren | Weinig, zegt OpenAI zelf: robots.txt-regels gelden mogelijk niet, en deze agent speelt geen rol bij opname in Search |
OpenAI zegt dat de instellingen voor GPTBot en OAI-SearchBot los van elkaar staan. Zijn beide toegestaan, dan kan OpenAI één crawl voor beide doelen gebruiken. Gedeeld ophalen voegt de toestemmingen niet samen. Jij beslist nog steeds twee keer.
Dezelfde crawlerpagina noemt een vierde agent, OAI-AdsBot, die landingspagina’s controleert die als ChatGPT-advertentie zijn ingediend. Dat is een aparte taak, en die blijft buiten deze vergelijking.
Twee robots.txt-configuraties
Search aan, training uit:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
Training aan, Search uit:
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Disallow: /
Geen van beide blokken plak je blind. Volgens de robots.txt-standaard volgt een crawler de groep die hem het specifiekst noemt, en valt hij alleen terug op User-agent: * als geen enkele groep dat doet. Een padregel, een tweede groep die ook van toepassing is, een botinstelling in je CDN of een firewallregel kan de uitkomst veranderen. Test representatieve URL’s tegen het hele bestand, niet tegen het blok dat je net toevoegde. OpenAI publiceert per agent IP-reeksen. Gebruik die als je een opgegeven user-agent van een imitator wilt onderscheiden.
In ChatGPT-User zit geen verborgen afmelding voor Search. Die taak legt OpenAI bij OAI-SearchBot. Moet een pagina onbereikbaar blijven, ook als iemand een tool vraagt die op te halen? Zet die pagina dan achter toegangscontrole. robots.txt is een instructie voor crawlers, geen slot.
Wat elke wijziging niet doet
GPTBot weren haalt een pagina niet uit ChatGPT Search. Het bewijst ook niet dat wat vóór de wijziging is opgehaald, uit een getraind model is verdwenen. De instelling is een signaal voor de toekomst over trainingsgebruik. Het is geen gum die met terugwerkende kracht wist.
OAI-SearchBot weren houdt je content buiten zoekantwoorden van ChatGPT, volgens het beleid dat OpenAI publiceert. Een titel en een link kunnen nog als navigatie opduiken. Doet dat restje ertoe, lees dan de actuele richtlijnen voor uitgevers voordat je robots.txt als verwijdermechanisme behandelt.
Een regel van ChatGPT-User in je toegangslog bewijst één ding: die user-agent heeft die URL opgevraagd. Het bewijst niet dat OAI-SearchBot de pagina heeft geïndexeerd, dat de pagina ergens rankt of dat een antwoord de pagina citeerde.
Geef de wijziging daarna tijd. OpenAI zegt dat zijn zoeksystemen ongeveer 24 uur nodig kunnen hebben om een update van robots.txt te verwerken. Een test na tien minuten meet je geduld, niet je beleid.
Drie antwoorden vooraf
Schrijf drie antwoorden op voordat je het bestand opent:
- Mag deze openbare content meetellen voor de training van basismodellen?
- Mag ze in zoekantwoorden van ChatGPT verschijnen?
- Heeft de pagina echte toegangscontrole nodig als iemand een tool vraagt die op te halen?
Het eerste antwoord hoort bij GPTBot, het tweede bij OAI-SearchBot, het derde bij je authenticatieontwerp. Test daarna representatieve URL’s tegen de complete robots.txt, en lees een dag later je toegangslog.
Een citaat koop je hier niet mee. De citatiegereedheid-audit toetst of één geschikte pagina kan worden uitgelezen en gecontroleerd. Hoe je geciteerd wordt door ChatGPT behandelt het bredere bronwerk. Staat de deur open en valt je naam nog steeds niet, dan is Waarom word ik niet genoemd in ChatGPT de diagnose. The Findability Engine bezit de langere uitwerking; het boek is in productie en niet te koop.
Het crawlerbeleid bepaalt alleen welke deur openstaat.