Gå til indhold
CitationLab
Tilbage til Måling og værktøjer
Stille citeringstyve

GPTBot vs OAI-SearchBot – branchens dyreste misforståelse

To bots, to helt forskellige formål. GPTBot bygger fremtidige modeller. OAI-SearchBot henter indhold, der skal citeres i et svar lige nu. De fleste, der tror, de har beskyttet deres indhold ved at blokere »AI-crawlere« under ét, har egentlig bare gjort sig usynlige.

Ved du, om dine AI-crawlere faktisk kommer igennem?Kør et gratis synlighedstjek

To bots, samme virksomhed, to helt forskellige opgaver

GPTBot og OAI-SearchBot kommer begge fra OpenAI, og navnene ligner hinanden nok til, at de ofte behandles som ét og samme problem i en robots.txt-fil. Det er de ikke. GPTBot henter indhold for at bygge fremtidige modeller – et baggrundsjob, der ikke har nogen enkelt bruger, som venter på resultatet her og nu. OAI-SearchBot henter indhold, fordi det skal bruges i et svar, der skal leveres nu, på samme måde som en søgemaskine henter en side for at afgøre, om den er relevant for et hit.

Skriver du en regel som »blokér alt, der indeholder GPT«, fordi du ikke vil bidrage gratis til træning af en fremtidig model, rammer reglen som regel begge – ikke fordi du besluttede det, men fordi navneligheden gjorde det til samme linje i konfigurationen.

Den tredje kategori: brugerinitieret hentning

ChatGPT-User er hverken en trænings- eller en baggrunds-retrieval-bot. Den bruges, når en faktisk bruger midt i en samtale beder ChatGPT om at hente eller læse noget direkte fra en bestemt side. Dette er den mest direkte form for AI-trafik, der findes – et menneske venter bogstaveligt talt på netop denne side lige nu. Blokerer du den sammen med de to andre, stopper du ikke bare et baggrundsjob; du stopper en interessent midt i handlingen.

Samme mønster hos Anthropic, lidt enklere hos Google

Anthropic følger nøjagtig samme tredeling som OpenAI: ClaudeBot til træning, Claude-SearchBot til retrieval, Claude-User til brugerinitieret hentning. Google har valgt en enklere model med to bots i stedet for tre: Googlebot dækker både klassisk indeksering og retrieval-agtig hentning, mens Google-Extended udelukkende er samtykkekontakten for træning af Googles generative modeller.

LeverandørTræning (bygger fremtidige modeller)Retrieval (henter til et svar nu)Brugerinitieret hentning
OpenAIGPTBotOAI-SearchBotChatGPT-User
AnthropicClaudeBotClaude-SearchBotClaude-User
GoogleGoogle-ExtendedGooglebot
Samme tredeling går igen hos alle tre: én bot til træning, én til hentning for et svar, og (hos OpenAI og Anthropic) én til hentning initieret direkte af en ventende bruger. Google slår retrieval og indeksering sammen i Googlebot og skiller kun træning ud som selvstændigt samtykke.

Den misforståelse, de fleste går i: Google-Extended og AI Overviews

Fordi Google-Extended i praksis har »AI« i navnet (den styrer brug til generative AI-produkter), antager mange, at det er kontakten, der afgør, om deres side kan dukke op i AI Overviews. Det passer ikke. Google har været tydelige om, at AI Overviews bygger på det samme underliggende søgeindeks som almindelig Google-søgning, drevet af Googlebot – ikke af samtykket i Google-Extended. Blokerer du kun Google-Extended, ændrer du ikke din tilstedeværelse i AI Overviews. Skal du væk derfra, må du i stedet styre den almindelige indeksering via Googlebot, med de konsekvenser det har for hele din klassiske søgning også.

Beslutningsmatrix: hvad vil du opnå, og hvad blokerer det faktisk

Der findes ikke ét rigtigt svar for alle websteder. Det, der findes, er fire forskellige mål og fire forskellige sæt bots at blokere for hvert af dem:

Hvad du vil opnåBlokérLuk igennem
Mit indhold må ikke bruges til at træne fremtidige modeller, men jeg vil gerne citeres nuGPTBot, ClaudeBot, Google-ExtendedOAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, Googlebot
Jeg vil slet ikke optræde i AI-svar – et bevidst valgAlle AI-bots ovenfor, inklusive retrieval- og brugerinitierede varianterIngen – dette er et fuldstændigt fravalg, ikke et delvist
Jeg vil have begge dele: citeres nu og sandsynligvis også præge senere træningIngen navngivne, verificerede AI-botsAlle AI-bots ovenfor
Jeg har begrænset serverkapacitet og vil kun stoppe useriøs/uverificeret bottrafikAlt, der ikke består reverse DNS- eller IP-verifikation, uanset navnet i user agent-strengenAlle officielt verificerede AI-bots, uanset hvilken af de tre roller de har
Vælg den række, der matcher det, du faktisk forsøger at opnå – ikke en generisk »blokér al AI«-regel, der træffer valget for dig, uden at du bad om det.

Hvorfor navnet i user agent-strengen ikke er nok

En HTTP-forespørgsel sender en user agent-streng med, som klienten selv vælger frit – intet forhindrer et vilkårligt script i at præsentere sig som »GPTBot« uden at være det. For rene disallow-regler i robots.txt spiller dette ikke den store rolle, eftersom useriøse aktører alligevel ikke bryder sig om robots.txt. Men i det øjeblik du bygger noget, der giver kendte AI-crawlere en fordel – en rummeligere rate limit, en undtagelse i en geo-regel, adgang gennem en ellers streng WAF – skal identiteten bekræftes med reverse DNS-opslag mod forespørgslens IP-adresse eller mod leverandørens officielt offentliggjorte IP-lister. Uden den undtagelse er »giv AI-crawlere fordele« nøjagtig den samme åbning som »giv alle, der skriver det rigtige navn i et tekstfelt, fordele«.

Selvtjek: læs din robots.txt højt

Selvtjek. Åbn din robots.txt-fil, og læs hver linje højt, én ad gangen. For hver linje: ved du, hvorfor den står der, og kan nogen i organisationen huske, hvem der satte den, og hvad de forsøgte at opnå? En regel, ingen kan forklare formålet med, er ikke en bevidst beskyttelse – den er en tilfældighed, der en dag blev stående, og som nu måske koster dig synlighed i præcis de AI-svar, hvor dine købere leder efter dig.

Ofte stillede spørgsmål

Hvis jeg blokerer GPTBot, forsvinder jeg så fra ChatGPT?
Ikke nødvendigvis. GPTBot samler data til træning af fremtidige modeller. Om ChatGPT citerer dig i et svar lige nu, afhænger i stedet af retrieval-botten OAI-SearchBot og af brugerinitieret hentning via ChatGPT-User. Blokerer du kun GPTBot og lader de to andre slippe igennem, kan du stadig blive citeret i svar, selv om du har frabedt dig at bidrage til fremtidig træning.
Er det forkert at blokere alle AI-bots med én regel for at slippe for at tænke på dette?
Det er ikke forkert, men det er et bevidst valg med en konsekvens, du bør kende: du bliver fuldstændig usynlig i AI-genererede svar, ikke bare skærmet fra træning. For nogle websteder er det det rigtige valg. For de fleste, der ønsker at blive fundet og citeret, er det en langt dyrere beslutning, end de troede, de traf, da de kopierede en generisk »disallow AI«-regel ind.
Betyder det, at Googlebot ikke kan bruges til træning?
Google har skilt samtykket til at bruge indhold til træning af deres generative AI-produkter ud i en selvstændig bot, Google-Extended, netop for at holde det adskilt fra klassisk indeksering og søgning. Googlebot selv er ikke opt-in/opt-out-mekanismen for træning – den opgave udfører Google-Extended. Blokerer du kun Google-Extended, påvirker du ikke din tilstedeværelse i almindelig Google-søgning.
Hvordan ved jeg, at en forespørgsel, der udgiver sig for at være GPTBot, faktisk er det?
User agent-strengen i en HTTP-forespørgsel er ren tekst, som afsenderen selv bestemmer – hvem som helst kan sætte den til »GPTBot« uden at være GPTBot. Skal du bygge regler, der stoler på, hvem botten er (for eksempel en rummeligere rate limit for verificerede AI-crawlere), skal du bekræfte identiteten med reverse DNS-opslag eller mod leverandørens officielt offentliggjorte IP-lister, ikke blot læse navnet i strengen.

Var dette nyttigt?

Del:

Hold deg oppdatert

Få fagartikler, produktnyheter og analyser rett i innboksen.