Skip to main content

Deluxe Media

SEO filnavn · teknisk begreb

robots.txt

robots.txt er en tekstfil i roden af et website, som fortæller crawlere, hvilke områder de må eller ikke må hente. Den er ikke en sikkerhedsbarriere.

Kort fortalt

robots.txt er en tekstfil i roden af et website, som fortæller crawlere, hvilke områder de må eller ikke må hente. Den er ikke en sikkerhedsbarriere.

I praksis

Brug filen til at styre crawling af tekniske eller overflødige områder, men test ændringerne. Sider der skal ud af Google, bør normalt have noindex eller adgangsbeskyttelse.

Typisk faldgrube

Den farlige fejl er at blokere hele sitet eller en vigtig mappe. En enkelt linje kan gøre produkter, billeder eller styles utilgængelige for Google.

En lille fil med overraskende stor rækkevidde

robots.txt ligger normalt på adressen ditdomæne.dk/robots.txt. Den indeholder regler for crawlere som Googlebot og kan fortælle, at bestemte mapper eller URL-mønstre ikke skal hentes.

Det bruges eksempelvis til tekniske områder, interne søgeresultater eller filtre, der skaber mange næsten ens URL’er. Men filen bliver ofte tillagt mere magt, end den har. Den skjuler ikke følsomme oplysninger, og den garanterer ikke, at en URL forsvinder fra Google.

Hvis noget er hemmeligt, skal det beskyttes med login eller serveradgang — ikke med robots.txt, som alle kan læse.

En URL kan i nogle tilfælde stadig blive kendt og vist uden indhold, hvis andre sider linker til den. Vil du holde en almindelig side ude af indeks, er en noindex-regel eller adgangsbeskyttelse normalt det rigtige værktøj.

Sådan læses de grundlæggende regler

En robots.txt-fil består af grupper med en user-agent og en eller flere regler. En meget enkel fil kan se sådan ud:

User-agent: * Disallow: /intern-soegning/ Sitemap: https://eksempel.dk/sitemap.xml

Stjernen betyder alle crawlere, der følger standarden. Disallow-linjen beder dem om ikke at hente den angivne mappe. Sitemap-linjen fortæller, hvor XML-sitemapet ligger.

Reglerne er følsomme over for stier og mønstre. En skråstreg det forkerte sted kan ændre rækkevidden. Derfor bør filen ikke redigeres på rutine, bare fordi et SEO-værktøj foreslår det.

Den klassiske fejl efter et stagingmiljø

På en kopi i et testmiljø ønsker man normalt ikke crawling, fordi siden er en arbejdsudgave. Nogle systemer indsætter derfor en regel, der blokerer alt:

User-agent: * Disallow: /

Hvis filen følger med over på den aktive hjemmeside, fortæller den alle crawlere, at hele websitet er lukket. Det kan ske ved en flytning eller en backup, hvor miljøspecifikke indstillinger ikke bliver gennemgået.

Det er en af de kontroller, der bør stå på enhver lanceringsliste sammen med indeksering, canonical, formularer og sitemap. På en ny hjemmeside kan få minutters kontrol forhindre ugers fejlsøgning.

Hvad der bør blokeres — og hvad der ikke bør

Tekniske URL’er, endeløse filterkombinationer og interne søgeresultater kan være kandidater. Men det afhænger af systemet. En webshop kan have parametre, som skaber mange varianter uden selvstændig værdi.

CSS, JavaScript og billeder bør normalt ikke blokeres, hvis de er nødvendige for at forstå siden. Google renderer sider og har brug for ressourcerne for at se layout og mobiloplevelse.

En anden fejl er at blokere en side i robots.txt og samtidig sætte noindex på den. Hvis Google ikke må hente siden, kan den heller ikke se noindex-reglen. Det illustrerer, hvorfor crawling og indeksering er to forskellige ting.

Test før og efter en ændring

Brug Google Search Console og URL-inspektion til at se, om en side kan crawles. Kontrollér også robots.txt direkte i browseren og gem den gamle version, før du ændrer noget.

Efter en større ændring bør de vigtigste sidetyper testes: forside, ydelser, produkter, kategorier, billeder og eventuelle landingssider. Det er ikke nok at se, at forsiden virker.

robots.txt er et præcisionsværktøj. Brugt rigtigt kan det reducere unødvendig crawling. Brugt tankeløst kan det lukke døren for de sider, virksomheden lever af.

Tre fejl der kan give unødigt bøvl

Den første er at bruge robots.txt som sikkerhed. En blokeret URL kan stadig blive kendt gennem links, og filen er offentligt tilgængelig. Fortrolige områder skal beskyttes med login og korrekte adgangsregler — ikke med en linje i robots.txt.

Den anden er at blokere CSS- eller JavaScript-filer, som søgemaskinen behøver for at se siden korrekt. Det kan gøre det sværere at forstå layout og mobilvisning. Blokér kun noget, når du ved, hvorfor det ikke skal crawles.

Den tredje er at forveksle crawl med indeksering. Vil du holde en almindelig side ude af Google, er en noindex-instruktion på siden normalt det relevante værktøj. Hvis du samtidig blokerer siden i robots.txt, kan Google ikke hente noindex-signalet.

Sådan kontrollerer du filen

Åbn /robots.txt i browseren og læs den som almindelig tekst. Kontrollér, at stierne findes, og at der ikke ligger gamle regler fra en udviklingsside. Se derefter i Google Search Console, om vigtige URL’er bliver blokeret. En kort, forståelig fil er som regel bedre end en samling regler, ingen længere tør ændre.

Efter en redesign eller flytning bør filen kontrolleres igen. Regler, der gav mening på en testserver, kan være katastrofale på det levende website. Gem derfor ændringer sammen med en kort forklaring og test de vigtigste sider umiddelbart efter publicering.

Kontakt

Blokerer robots.txt mere, end den burde?

Vi kan kontrollere reglerne mod sitemap og vigtige URL’er og sikre, at crawlerne får adgang til det rigtige — uden at åbne støj.

Få robots.txt kontrolleret
Ring eller skriv 51 20 16 95 hej@deluxemedia.dk