Skip to main content

Deluxe Media

SEO substantiv · engelsk

Crawl budget

Crawl budget er den mængde tid og kapacitet, en søgemaskine bruger på at gennemgå siderne på et website.

Kort fortalt

Crawl budget er den mængde tid og kapacitet, en søgemaskine bruger på at gennemgå siderne på et website.

I praksis

Fjern tekniske blindgyder, hold sitemap og interne links i orden, og sørg for, at serveren svarer hurtigt og stabilt.

Typisk faldgrube

At bruge tid på crawl budget på et lille website, mens de reelle problemer er tyndt indhold, noindex eller manglende interne links.

Introduktion

Crawl budget er den mængde tid og kapacitet, som en søgemaskines robotter bruger på at besøge og gennemgå sider på et website. Google beskriver det som en kombination af, hvor meget serveren kan tåle, og hvor meget Google vurderer, at det giver mening at crawle.

Crawling er ikke det samme som indeksering. En robot kan besøge en side uden at lægge den i søgeindekset. Omvendt kan en allerede indekseret side forblive synlig, selv om den ikke bliver crawlet hver dag. Crawl budget handler om opdagelse og genbesøg — ikke om en garanti for placering.

For de fleste mindre virksomhedssider er crawl budget ikke et stort problem. Har du 30 eller 100 normale sider, kan Google som regel finde rundt. Emnet bliver mere relevant på store WooCommerce-shops, kataloger, portaler og websites, der automatisk skaber tusindvis af URL-varianter.

Sådan bruger du det i praksis

Start med at sikre, at de vigtige sider kan findes gennem almindelige links. En klar intern linkbuilding er ofte mere værd end avancerede justeringer. Sider, der kun findes i et internt søgefelt eller bag et script, kan være sværere at opdage.

Hold dit sitemap rent. Det bør pege på de URL'er, du ønsker indekseret, og ikke på omdirigeringer, fejl, dubletter eller sider med noindex. Et sitemap tvinger ikke Google til at indeksere siderne, men det giver en ryddelig liste over de URL'er, der betyder noget.

Undersøg også, om filtre, sortering, kalenderfunktioner eller interne søgninger skaber næsten uendelige URL'er. En webshop kan eksempelvis lave varianter for farve, størrelse, pris, sortering og lagerstatus. Nogle skal være offentlige. Andre er bare tekniske kombinationer.

En hurtig og stabil webshop gør det lettere for både kunder og robotter at hente siderne. På en almindelig hjemmeside handler arbejdet oftere om korrekt struktur, svarstatus og indhold end om selve crawl budgettet.

Eksempel

En mindre webshop har 800 produkter, men Google Search Console viser, at robotten møder 18.000 forskellige URL'er. Årsagen er filtre, der kan kombineres på kryds og tværs. En sort læderjakke kan optræde under URL'er for sortering, størrelse, farve og prisinterval.

Virksomheden beslutter, at 1.000 produkt- og kategorisider skal kunne indekseres. Resten af filterkombinationerne bliver håndteret teknisk, så de ikke skaber nye crawlbare blindgyder. Samtidig fjernes 600 gamle URL'er fra sitemap, og 120 udgåede produkter får relevante 301-redirects.

Efter ændringen bruger Google en større del af sine besøg på de sider, virksomheden faktisk ønsker opdateret. Det betyder ikke automatisk bedre placeringer, men Search Console viser færre spildte crawlforespørgsler og hurtigere opdagelse af nye produkter.

Guiden om SEO-optimering af en hjemmeside sætter den tekniske oprydning ind i en større sammenhæng.

Faldgrube

Den største fejl er at gøre crawl budget til forklaring på alle SEO-problemer. Hvis en hjemmeside har 25 sider og ingen af dem rangerer, skyldes det sjældent, at Google mangler tid. Tjek først indhold, søgehensigt, canonical, noindex, interne links og om serveren returnerer den rigtige status.

En anden fejl er at blokere URL'er i robots.txt uden at forstå konsekvensen. Robots.txt kan stoppe crawling, men den er ikke et sikkert værktøj til at fjerne en URL fra søgeresultater. Hvis Google ikke må besøge siden, kan robotten heller ikke se et noindex-signal på siden.

Endelig kan man komme til at fjerne nyttige filter- eller kategorisider, som kunder faktisk søger efter. Teknisk oprydning skal ske med blik for forretningen, ikke kun for antallet af URL'er.

Godt at vide

Google Search Console har en crawlstatistik, hvor du kan se antal forespørgsler, downloadede data, svartider og de mest almindelige svar. Store udsving kan pege på serverfejl, ændringer i struktur eller pludseligt mange nye URL'er.

Cache og et CDN kan forbedre svartider, men de løser ikke en dårlig URL-struktur. De gør en rodet side hurtigere at hente; de gør ikke rodet mere meningsfuldt.

På et lille website skal du sjældent optimere et crawl budget. Du skal gøre det let at finde de rigtige sider og svært at fare vild i de ligegyldige.

Hvilke URL'er sluger kapacitet

Spild opstår ofte, når systemet kan danne mange adresser med næsten samme indhold. Parametre til sortering, interne søgninger, kalenderdatoer, sessioner og filtre kan skabe langt flere URL'er end redaktøren kan se i WordPress. Robotten følger links og opdager variationerne, selv om de aldrig har været tænkt som selvstændige sider.

Fejl og omdirigeringskæder bruger også forespørgsler. Hvis en gammel adresse først sender videre til en mellemstation og derefter til den endelige side, skal robotten hente flere svar. Opdatér interne links til den endelige URL, og begræns kæder, hvor det er muligt.

Kalendersider kan være særligt problematiske, hvis der findes links til næste måned uden slutdato. Robotten kan i teorien følge kalenderen mange år frem. Det samme gælder facetter i webshops, hvor hvert filter åbner nye kombinationer.

Logfiler og Search Console kan vise, hvilke URL'er robotter faktisk henter. Det er mere pålideligt end at gætte ud fra sidetallet i WordPress. En webshop med 2.000 produkter kan være teknisk ryddelig, mens et mindre katalog kan skabe hundredtusindvis af parameteradresser.

Hvornår du bør reagere

Reagér, hvis nye eller ændrede, vigtige sider bliver opdaget meget langsomt, mens Search Console viser omfattende crawling af irrelevante URL'er. Reagér også ved mange serverfejl, meget langsomme svartider eller en pludselig stigning i crawl af adresser, du ikke genkender.

Før du ændrer robots.txt eller tilføjer noindex bredt, bør URL-typerne kortlægges. Hvem bruger dem? Findes der eksterne links? Skaber de salg eller nyttig navigation? Er indholdet duplicate, eller er siden faktisk en værdifuld kategori?

Løsningen kan være bedre interne links, canonical, noindex, færre genererede varianter, oprydning i sitemap eller ændringer i selve filterfunktionen. Robots.txt er kun ét værktøj og ofte ikke det første.

Efter ændringen skal effekten følges. Ser robotten færre ligegyldige URL'er? Bliver vigtige sider opdaget hurtigere? Er serverfejl faldet? Undgå at bruge antallet af crawls som eneste mål. Færre crawls er ikke en succes, hvis nye produkter samtidig bliver overset.

På store sites er crawl budget løbende drift. På små sites er det som regel nok at holde teknikken ryddelig og sørge for, at de vigtige sider er lette at finde.

En praktisk undersøgelse af crawlspild

Start med at sammenligne de URL'er, søgemaskiner besøger, med de URL'er, du faktisk ønsker indekseret. Serverlogs giver det mest direkte billede af besøg fra crawlere, mens Google Search Console kan vise indekseringsproblemer og mønstre. På et mindre website er en fuld loganalyse sjældent nødvendig, men på store webshops og portaler kan den afsløre tusindvis af unødvendige variationer.

Gruppér URL'erne efter type: produkter, kategorier, filtre, søgninger, pagination, billeder, feeds og fejl. Se derefter efter grupper med mange besøg og lav værdi. Parametre til sortering, sessions-id'er eller interne søgesider er typiske kandidater. En enkelt URL er sjældent problemet; det er gentagelsen i stor skala, der bruger kapacitet.

Løsningen afhænger af årsagen. Nogle URL'er bør fjernes fra de interne links, andre kan samles med en canonical, og fejlende adresser kan kræve en 301-redirect eller en korrekt 404-status. En regel i robots.txt kan stoppe crawling af bestemte mønstre, men den fjerner ikke automatisk allerede kendte URL'er fra indekset. Derfor skal crawling og indeksering behandles som to beslægtede, men forskellige spørgsmål.

Tekniske ændringer skal måles bagefter

Når et filter, parameter eller URL-mønster bliver ændret, bør effekten følges over tid. Kontrollér, om antallet af crawlbare variationer falder, om vigtige sider bliver opdaget hurtigere, og om fejlkurver ændrer sig. En ændring kan se logisk ud i kode og stadig skabe nye kombinationer, hvis interne links eller JavaScript fortsætter med at generere dem.

Hold også øje med sitemap. Det bør indeholde de kanoniske sider, du vil have fundet, og ikke gamle omdirigeringer, noindex-sider eller dubletter. Et rent sitemap løser ikke hele problemet, men det sender et mere konsekvent signal om websitets ønskede struktur.

På en webshop skal udviklere, SEO-ansvarlige og redaktører ofte samarbejde. En teknisk oprydning kan påvirke navigation, filtrering og brugeroplevelse. Test derfor ændringer på et stagingmiljø og kontrollér både crawl, funktion og salgstragt før lancering.

Crawl budget er med andre ord ikke en isoleret måling, der skal maksimeres. Målet er at gøre vejen til vigtigt indhold enkel og undgå, at server og søgemaskiner bruger unødvendigt arbejde på endeløse variationer.

Kontakt

Har webshoppen fået flere URL'er end nogen kan holde styr på?

Vi hjælper med WordPress og WooCommerce, når filtre, omdirigeringer og tekniske sider er begyndt at spænde ben for strukturen.

Se vores webshopløsninger
Ring eller skriv 51 20 16 95 hej@deluxemedia.dk