Reranking er det andre trinnet i hvordan en AI velger hvilke kilder som faktisk skal brukes i et svar. Etter at et raskt førstesteg har hentet inn en bred bunke mulige kilder, gir en egen, mer presis modell hver av dem en ny relevansscore og sorterer dem på nytt. Kort sagt: hentingen finner kandidatene, reranking bestemmer rekkefølgen — og bare toppen når frem til svaret.
Hvorfor hentingen deles i to trinn
Dette handler om en avveining mellom fart og presisjon. Det første søket bruker embeddings og en vektordatabase til å finne kandidater lynraskt blant millioner av dokumenter — men målet der er å ikke gå glipp av noe relevant, ikke å rangere perfekt. Derfor henter det gjerne 50–100 kandidater som ligger omtrent i riktig område. Reranking tar så bare denne lille bunken og bruker en tyngre modell på hver enkelt for å avgjøre den reelle relevansen. Å kjøre den tunge modellen på hele databasen ville vært altfor tregt; å kjøre den på 100 kandidater er overkommelig. Dette mønsteret kalles tostegs-henting.
Hvordan reranking fungerer
Rerankere er som regel cross-encodere. Der det raske vektorsøket embedder spørsmål og dokument hver for seg og sammenligner dem i etterkant, leser en cross-encoder spørsmålet og kandidatteksten samtidig og gir ut én relevansscore for paret. Fordi den ser begge tekstene på én gang, fanger den opp nyanser i sammenhengen — hvilken av to tilsynelatende like biter som faktisk svarer på det som ble spurt om. Det gjør den treg, men presis, og det er nettopp derfor den brukes til slutt, på en liten bunke. Kommersielle rerankere som Cohere Rerank er vanlige valg i produksjon.
Hvorfor det betyr noe for AI-synlighet
Her ligger den viktigste lærdommen: å bli hentet er ikke nok — du må overleve reranking. Innholdet ditt kan godt havne i den første bunken på 100 kandidater, men hvis en konkurrent svarer mer presist og direkte på selve spørsmålet, blir du sortert ned under reranking og når aldri frem til svaret. To biter kan ligge like nær spørsmålet i embedding-rommet, men rerankeren velger den som besvarer spørsmålet mest presist. Derfor er det ikke nok å være «i nærheten» av temaet — du må treffe spørsmålet.
Hvordan du selv kan bruke dette
Skriv slik at hvert avsnitt besvarer ett konkret spørsmål direkte og fullstendig, uten at leseren må lete. Legg svaret først (BLUF), bruk språket spørsmålet faktisk stilles i, og unngå å pakke det viktigste inn i lange, generelle avsnitt. Jo mer presist en chunk svarer på spørsmålet, desto bedre klarer den seg gjennom reranking. CitationLab Monitor med Chunkalyzer hjelper deg å se hvilke avsnitt som er relevante nok til å klare seg — og hvilke som blir hentet, men sortert ut. Vil du vite om innholdet ditt overlever reranking i dag? Start med en gjennomgang av AI-synligheten din.
Ofte stillede spørgsmål
Hva er reranking i RAG?
Hvorfor trengs reranking når man allerede har hentet kilder?
Hva er en cross-encoder?
Hva betyr reranking for AI-synlighet?
Begreber brugt i denne artikel
- Reranking
- Reranking er andre trinn i en RAG-pipeline, der de hentede kandidatene gis en mer presis relevansscore og sorteres på nytt før modellen svarer. Bare de høyest rangerte når frem til svaret.
- Cross-encoder
- En cross-encoder er en modell som leser spørsmål og kandidattekst samtidig og gir ut én presis relevansscore for paret. Den er tregere, men mer nøyaktig enn vektorsøk, og brukes derfor til reranking av en liten bunke kandidater.
- Tostegs-henting
- Tostegs-henting er mønsteret der et raskt førstesteg henter en bred bunke kandidater, og et tregere, mer presist andre trinn (reranking) sorterer dem på nytt før svaret genereres.
