To bots, samme virksomhed, to helt forskellige opgaver
GPTBot og OAI-SearchBot kommer begge fra OpenAI, og navnene ligner hinanden nok til, at de ofte behandles som ét og samme problem i en robots.txt-fil. Det er de ikke. GPTBot henter indhold for at bygge fremtidige modeller – et baggrundsjob, der ikke har nogen enkelt bruger, som venter på resultatet her og nu. OAI-SearchBot henter indhold, fordi det skal bruges i et svar, der skal leveres nu, på samme måde som en søgemaskine henter en side for at afgøre, om den er relevant for et hit.
Skriver du en regel som »blokér alt, der indeholder GPT«, fordi du ikke vil bidrage gratis til træning af en fremtidig model, rammer reglen som regel begge – ikke fordi du besluttede det, men fordi navneligheden gjorde det til samme linje i konfigurationen.
Den tredje kategori: brugerinitieret hentning
ChatGPT-User er hverken en trænings- eller en baggrunds-retrieval-bot. Den bruges, når en faktisk bruger midt i en samtale beder ChatGPT om at hente eller læse noget direkte fra en bestemt side. Dette er den mest direkte form for AI-trafik, der findes – et menneske venter bogstaveligt talt på netop denne side lige nu. Blokerer du den sammen med de to andre, stopper du ikke bare et baggrundsjob; du stopper en interessent midt i handlingen.
Samme mønster hos Anthropic, lidt enklere hos Google
Anthropic følger nøjagtig samme tredeling som OpenAI: ClaudeBot til træning, Claude-SearchBot til retrieval, Claude-User til brugerinitieret hentning. Google har valgt en enklere model med to bots i stedet for tre: Googlebot dækker både klassisk indeksering og retrieval-agtig hentning, mens Google-Extended udelukkende er samtykkekontakten for træning af Googles generative modeller.
| Leverandør | Træning (bygger fremtidige modeller) | Retrieval (henter til et svar nu) | Brugerinitieret hentning |
|---|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot | ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot | Claude-User |
| Google-Extended | Googlebot | — |
Den misforståelse, de fleste går i: Google-Extended og AI Overviews
Fordi Google-Extended i praksis har »AI« i navnet (den styrer brug til generative AI-produkter), antager mange, at det er kontakten, der afgør, om deres side kan dukke op i AI Overviews. Det passer ikke. Google har været tydelige om, at AI Overviews bygger på det samme underliggende søgeindeks som almindelig Google-søgning, drevet af Googlebot – ikke af samtykket i Google-Extended. Blokerer du kun Google-Extended, ændrer du ikke din tilstedeværelse i AI Overviews. Skal du væk derfra, må du i stedet styre den almindelige indeksering via Googlebot, med de konsekvenser det har for hele din klassiske søgning også.
Beslutningsmatrix: hvad vil du opnå, og hvad blokerer det faktisk
Der findes ikke ét rigtigt svar for alle websteder. Det, der findes, er fire forskellige mål og fire forskellige sæt bots at blokere for hvert af dem:
| Hvad du vil opnå | Blokér | Luk igennem |
|---|---|---|
| Mit indhold må ikke bruges til at træne fremtidige modeller, men jeg vil gerne citeres nu | GPTBot, ClaudeBot, Google-Extended | OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, Googlebot |
| Jeg vil slet ikke optræde i AI-svar – et bevidst valg | Alle AI-bots ovenfor, inklusive retrieval- og brugerinitierede varianter | Ingen – dette er et fuldstændigt fravalg, ikke et delvist |
| Jeg vil have begge dele: citeres nu og sandsynligvis også præge senere træning | Ingen navngivne, verificerede AI-bots | Alle AI-bots ovenfor |
| Jeg har begrænset serverkapacitet og vil kun stoppe useriøs/uverificeret bottrafik | Alt, der ikke består reverse DNS- eller IP-verifikation, uanset navnet i user agent-strengen | Alle officielt verificerede AI-bots, uanset hvilken af de tre roller de har |
Hvorfor navnet i user agent-strengen ikke er nok
En HTTP-forespørgsel sender en user agent-streng med, som klienten selv vælger frit – intet forhindrer et vilkårligt script i at præsentere sig som »GPTBot« uden at være det. For rene disallow-regler i robots.txt spiller dette ikke den store rolle, eftersom useriøse aktører alligevel ikke bryder sig om robots.txt. Men i det øjeblik du bygger noget, der giver kendte AI-crawlere en fordel – en rummeligere rate limit, en undtagelse i en geo-regel, adgang gennem en ellers streng WAF – skal identiteten bekræftes med reverse DNS-opslag mod forespørgslens IP-adresse eller mod leverandørens officielt offentliggjorte IP-lister. Uden den undtagelse er »giv AI-crawlere fordele« nøjagtig den samme åbning som »giv alle, der skriver det rigtige navn i et tekstfelt, fordele«.
Selvtjek: læs din robots.txt højt
Selvtjek. Åbn din robots.txt-fil, og læs hver linje højt, én ad gangen. For hver linje: ved du, hvorfor den står der, og kan nogen i organisationen huske, hvem der satte den, og hvad de forsøgte at opnå? En regel, ingen kan forklare formålet med, er ikke en bevidst beskyttelse – den er en tilfældighed, der en dag blev stående, og som nu måske koster dig synlighed i præcis de AI-svar, hvor dine købere leder efter dig.
Ofte stillede spørgsmål
Hvis jeg blokerer GPTBot, forsvinder jeg så fra ChatGPT?
Er det forkert at blokere alle AI-bots med én regel for at slippe for at tænke på dette?
Betyder det, at Googlebot ikke kan bruges til træning?
Hvordan ved jeg, at en forespørgsel, der udgiver sig for at være GPTBot, faktisk er det?
Var dette nyttigt?
