Gå til indhold
CitationLab
Tilbage til Måling og verktøy
Stille siteringstyver

GPTBot vs OAI-SearchBot – bransjens dyreste misforståelse

To bots, to helt forskjellige formål. GPTBot bygger fremtidige modeller. OAI-SearchBot henter innhold som skal siteres i et svar akkurat nå. De fleste som tror de har beskyttet innholdet sitt ved å blokkere «AI-crawlere» under ett, har egentlig bare gjort seg usynlige.

Vet du om AI-crawlerne dine faktisk kommer gjennom?Kjør en gratis synlighetssjekk

To bots, samme selskap, to helt forskjellige jobber

GPTBot og OAI-SearchBot kommer begge fra OpenAI, og navnene ligner nok til at de ofte behandles som ett og samme problem i en robots.txt-fil. Det er de ikke. GPTBot henter innhold for å bygge fremtidige modeller – en bakgrunnsjobb som ikke har noen enkelt bruker som venter på resultatet der og da. OAI-SearchBot henter innhold fordi det trengs i et svar som skal leveres nå, på samme måte som en søkemotor henter en side for å avgjøre om den er relevant for et treff.

Skriver du en regel som «blokker alt som inneholder GPT» fordi du ikke vil bidra gratis til trening av en fremtidig modell, treffer regelen som regel begge – ikke fordi du bestemte deg for det, men fordi navnelikheten gjorde det til samme linje i konfigurasjonen.

Den tredje kategorien: brukerinitiert henting

ChatGPT-User er verken en trenings- eller en bakgrunns-retrieval-bot. Den brukes når en faktisk bruker, midt i en samtale, ber ChatGPT hente eller lese noe direkte fra en spesifikk side. Dette er den mest direkte formen for AI-trafikk som finnes – et menneske venter bokstavelig talt på nettopp denne siden akkurat nå. Blokkerer du den sammen med de to andre, stopper du ikke bare en bakgrunnsjobb; du stopper en interessent midt i handlingen.

Samme mønster hos Anthropic, litt enklere hos Google

Anthropic følger nøyaktig samme tredeling som OpenAI: ClaudeBot til trening, Claude-SearchBot til retrieval, Claude-User til brukerinitiert henting. Google har valgt en enklere modell med to bots i stedet for tre: Googlebot dekker både klassisk indeksering og retrieval-type henting, mens Google-Extended er utelukkende samtykke-bryteren for trening av Googles generative modeller.

LeverandørTrening (bygger fremtidige modeller)Retrieval (henter til et svar nå)Brukerinitiert henting
OpenAIGPTBotOAI-SearchBotChatGPT-User
AnthropicClaudeBotClaude-SearchBotClaude-User
GoogleGoogle-ExtendedGooglebot
Samme tredeling går igjen hos alle tre: én bot til trening, én til henting for et svar, og (hos OpenAI og Anthropic) én for henting initiert direkte av en ventende bruker. Google slår retrieval og indeksering sammen i Googlebot og skiller kun ut trening som eget samtykke.

Misforståelsen de fleste går i: Google-Extended og AI Overviews

Fordi Google-Extended har «AI» i navnet i praksis (den styrer bruk til generative AI-produkter), antar mange at det er bryteren som avgjør om siden deres kan dukke opp i AI Overviews. Det stemmer ikke. Google har vært tydelig på at AI Overviews bygger på det samme underliggende søkeindeksen som vanlig Google-søk, drevet av Googlebot – ikke av samtykket i Google-Extended. Blokkerer du kun Google-Extended, endrer du ikke din tilstedeværelse i AI Overviews. Skal du bort derfra, må du i stedet styre den vanlige indekseringen via Googlebot, med de konsekvensene det har for hele det klassiske søket ditt også.

Beslutningsmatrise: hva vil du oppnå, og hva blokkerer det faktisk

Det finnes ikke ett riktig svar for alle nettsteder. Det som finnes, er fire ulike mål, og fire ulike sett med bots å blokkere for hvert av dem:

Hva du vil oppnåBlokkerSlipp gjennom
Innholdet mitt skal ikke brukes til å trene fremtidige modeller, men jeg vil gjerne bli sitert nåGPTBot, ClaudeBot, Google-ExtendedOAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, Googlebot
Jeg vil ikke figurere i AI-svar i det hele tatt – et bevisst valgAlle AI-bottene over, inkludert retrieval- og brukerinitierte varianterIngen – dette er en fullstendig opt-out, ikke en delvis en
Jeg vil ha begge deler: siteres nå og trolig også formet av senere treningIngen navngitte, verifiserte AI-botsAlle AI-bottene over
Jeg har begrenset serverkapasitet og vil bare stoppe useriøs/uverifisert bot-trafikkAlt som ikke består reverse-DNS- eller IP-verifisering, uansett navn i user-agent-strengenAlle offisielt verifiserte AI-bots, uavhengig av hvilken av de tre rollene de har
Velg raden som matcher hva du faktisk prøver å oppnå, ikke en generisk “bloker alt AI”-regel som gjør valget for deg uten at du ba om det.

Hvorfor navnet i user-agent-strengen ikke er nok

En HTTP-forespørsel sender med seg en user-agent-streng som klienten selv velger fritt – ingenting hindrer et vilkårlig skript i å presentere seg som «GPTBot» uten å være det. For rene disallow-regler i robots.txt spiller ikke dette så stor rolle, siden useriøse aktører uansett ikke bryr seg om robots.txt. Men i det øyeblikket du bygger noe som gir kjente AI-crawlere en fordel – en romsligere rate-limit, et unntak i en geo-regel, tilgang gjennom en ellers streng WAF – må identiteten bekreftes med reverse DNS-oppslag mot forespørselens IP-adresse, eller mot leverandørens offisielt publiserte IP-lister. Uten det unntaket er «gi AI-crawlere fordeler» nøyaktig den samme åpningen som «gi alle som skriver riktig navn i en tekstfelt fordeler».

Selvsjekk: les robots.txt-en din høyt

Selvsjekk. Åpne robots.txt-filen din og les hver linje høyt, én om gangen. For hver linje: vet du hvorfor den står der, og husker noen i organisasjonen hvem som satte den og hva de prøvde å oppnå? En regel ingen kan forklare formålet med, er ikke en bevisst beskyttelse – den er en tilfeldighet som en dag ble stående, og som nå kanskje koster deg synlighet i nøyaktig de AI-svarene der kjøperne dine leter etter deg.

Ofte stillede spørgsmål

Hvis jeg blokkerer GPTBot, forsvinner jeg da fra ChatGPT?
Ikke nødvendigvis. GPTBot samler data til trening av fremtidige modeller. Om ChatGPT siterer deg i et svar akkurat nå, avhenger i stedet av retrieval-boten OAI-SearchBot og av brukerinitiert henting via ChatGPT-User. Blokkerer du kun GPTBot og lar de to andre slippe gjennom, kan du fortsatt bli sitert i svar selv om du har reservert deg mot å bidra til fremtidig trening.
Er det galt å blokkere alle AI-bots med én regel for å slippe å tenke på dette?
Det er ikke galt, men det er et bevisst valg med en konsekvens du bør kjenne til: du blir fullstendig usynlig i AI-genererte svar, ikke bare skjermet fra trening. For noen nettsteder er det riktig valg. For de fleste som ønsker å bli funnet og sitert, er det en mye dyrere avgjørelse enn de trodde de tok da de kopierte inn en generisk «disallow AI»-regel.
Betyr det at Googlebot ikke kan brukes til trening?
Google har skilt ut samtykke til bruk av innhold for trening av sine generative AI-produkter i en egen bot, Google-Extended, nettopp for å holde det atskilt fra klassisk indeksering og søk. Googlebot selv er ikke opt-in/opt-out-mekanismen for trening – den jobben gjør Google-Extended. Blokkerer du kun Google-Extended, påvirker du ikke din tilstedeværelse i vanlig Google-søk.
Hvordan vet jeg at en forespørsel som utgir seg for å være GPTBot faktisk er det?
User-agent-strengen i en HTTP-forespørsel er ren tekst som avsenderen selv bestemmer – hvem som helst kan sette den til «GPTBot» uten å være GPTBot. Skal du bygge regler som stoler på hvem boten er (for eksempel en romsligere rate-limit for verifiserte AI-crawlere), må du bekrefte identiteten med reverse DNS-oppslag eller mot leverandørens offisielt publiserte IP-lister, ikke bare lese navnet i strengen.

Var dette nyttigt?

Del:

Hold deg oppdatert

Få fagartikler, produktnyheter og analyser rett i innboksen.