robots.txt

robots.txt

robots.txt er en tekstfil, der fortæller søgemaskiners og andre kompatible crawlere, hvilke dele af et website de må eller ikke må crawle. Filen placeres på domænets rod og kan blandt andet bruges til at styre crawleradgang til bestemte sider eller mapper. robots.txt spiller derfor en vigtig rolle i både teknisk SEO og teknisk GEO.

Hvad er robots.txt?

robots.txt er en fil, som websites bruger til at kommunikere crawleregler til automatiserede bots. Den kan eksempelvis fortælle Googlebot, at bestemte områder af websitet ikke skal crawles. Filen ligger normalt på en adresse som https://www.eksempel.dk/robots.txt og kan indeholde forskellige regler for forskellige crawlere.

En simpel robots.txt-fil kan eksempelvis se sådan ud:

User-agent: *
Disallow: /admin/

User-agent angiver, hvilken crawler reglen gælder for. Stjernen betyder, at reglen gælder for alle crawlere, der understøtter robots.txt.

Disallow angiver den sti, crawleren ikke skal besøge. I eksemplet bliver /admin/ derfor blokeret for crawling.

En robots.txt-fil kan også indeholde andre instruktioner og en henvisning til websitets sitemap.

 

Hvorfor er robots.txt vigtigt?

robots.txt er vigtigt, fordi crawling er en central del af den proces, der gør indhold tilgængeligt for søgemaskiner. Hvis vigtige sider bliver blokeret ved en fejl, kan det skabe problemer for både crawling og efterfølgende indeksering.

På større websites kan robots.txt samtidig hjælpe med at styre, hvilke områder crawlere bruger deres ressourcer på. Det kan eksempelvis være relevant på webshops med filtreringssider, interne søgesider eller tekniske URL’er, som ikke giver værdi i søgeresultaterne.

Filen er derfor tæt forbundet med SEO og arbejdet med et websites tekniske fundament.

robots.txt er også relevant for GEO-optimering. AI-platforme og deres tilknyttede crawlere kan have deres egne user-agents, og websitets adgangsregler kan påvirke, om bestemte systemer kan hente indholdet.

 

Hvordan fungerer robots.txt i praksis?

Når en kompatibel crawler besøger et website, kan den først hente robots.txt-filen for at se, hvilke regler der gælder. Herefter kan crawleren bruge reglerne til at afgøre, hvilke URL’er den må besøge.

En robots.txt-fil kan eksempelvis indeholde:

User-agent: *
Disallow: /checkout/
Disallow: /intern-soegning/
Allow: /

Her bliver alle understøttende crawlere bedt om at undgå /checkout/ og /intern-soegning/, mens resten af websitet kan crawles.

Det er vigtigt at skelne mellem crawling og indeksering. En URL, der er blokeret i robots.txt, kan i visse situationer stadig blive kendt af en søgemaskine gennem links fra andre sider.

Hvis formålet specifikt er at holde en side ude af søgeresultaterne, bør man derfor vurdere en no-indexinstruktion. Søgemaskinen skal normalt kunne crawle siden for at opdage denne instruktion.

robots.txt bør derfor konfigureres ud fra den konkrete funktion, man ønsker at styre.

robots.txt og AI-crawlere

robots.txt er blevet endnu mere relevant i takt med, at flere AI-platforme anvender crawlere til at hente information fra websites. Virksomheder bør derfor vide, hvilke bots der har adgang til deres indhold, og hvordan deres tekniske opsætning påvirker synligheden i AI-baserede tjenester.

Det kan eksempelvis være relevant at gennemgå robots.txt i forbindelse med:

  • adgang for søgemaskinecrawlere
  • adgang for AI-crawlere
  • blokering af tekniske eller irrelevante områder
  • ændringer i websitets struktur
  • migrering til nyt CMS eller domæne
  • implementering af nye tekniske GEO-elementer

robots.txt bør ses som en del af det samlede tekniske setup. En korrekt fil skaber gode adgangsforhold for de systemer, der skal kunne finde og forstå virksomhedens indhold.

Arbejder virksomheden aktivt med synlighed i ChatGPT, Google AI Overviews, Perplexity og andre AI-platforme, bør robots.txt derfor indgå i den tekniske gennemgang sammen med øvrig AI Search-optimering.

 

Hvad må du ikke bruge robots.txt til?

robots.txt bør ikke bruges som beskyttelse af følsomt eller privat indhold. Filen er offentligt tilgængelig, og en Disallow-regel forhindrer ikke mennesker i at åbne en URL direkte.

Fortrolige områder bør beskyttes med eksempelvis login, adgangskontrol eller andre tekniske sikkerhedsforanstaltninger.

Du bør også være forsigtig med at blokere ressourcer, som søgemaskiner har brug for til at forstå siden. Hvis centrale CSS-, JavaScript- eller indholdsressourcer bliver utilgængelige, kan det gøre det sværere for crawlere at fortolke websitet korrekt.

Efter større ændringer på hjemmesiden er det derfor en god idé at kontrollere robots.txt som en del af arbejdet med teknisk SEO.

Få hjælp til teknisk SEO og GEO

En forkert robots.txt-fil kan gøre værdifuldt indhold sværere at tilgå for både søgemaskiner og AI-systemer. Hos Raney Consulting gennemgår vi crawleradgang som en del af arbejdet med teknisk SEO og som en del af vores arbejde som GEO bureau.

Vil du sikre, at Google og relevante AI-systemer har adgang til de rigtige dele af dit website, kan vi hjælpe med at gennemgå det tekniske setup og finde de områder, der bør justeres.

Book et møde

Udfyld nedenstående formular og vi vil vende tilbage til dig hurtigst muligt.

Nyhed: Få en gratis AI-search analyse

Er du nysgerrig på, hvordan din virksomhed citeres af ChatGPT, Claude og Google? Book en gratis GEO-analyse.