Introduktion
Googlebot er navnet på Googles crawler — et automatisk program, der besøger sider, henter filer og sender oplysninger videre til Googles søgesystemer. Crawlingen er første skridt på vejen mod mulig indeksering, men et besøg er ikke en garanti for, at siden ender i søgeresultaterne.
Googlebot finder nye adresser gennem links, sitemaps og tidligere kendte URL-adresser. Når crawleren henter en side, ser den blandt andet HTML, billeder, CSS og JavaScript, så Google kan forstå indholdet og gengive siden nogenlunde som en browser.
Googlebot er ikke en menneskelig kvalitetskontrollør og heller ikke selve rangeringsalgoritmen. Den henter materialet. Andre systemer behandler, vurderer og organiserer det. Derfor kan en side godt blive crawlet uden at få trafik eller en synlig placering i SERP.
For en almindelig hjemmeside handler arbejdet sjældent om at "optimere til robotten". Det handler om at sørge for, at de sider, mennesker har brug for, også er teknisk tilgængelige og tydeligt forbundet.
Sådan bruger du det i praksis
Kontrollér først, at vigtige sider returnerer HTTP-status 200 og kan åbnes uden login. En side, der kræver kodeord eller svarer med serverfejl, kan Googlebot ikke behandle som en almindelig offentlig side.
Se derefter på robots.txt. Filen kan styre, hvilke områder crawlere må hente, men den bør bruges præcist. En bred regel som Disallow: / kan fjerne adgangen til hele sitet. Det sker jævnligt, når en stagingindstilling følger med over på produktion.
Sørg for almindelige interne links. Hvis en vigtig side kun kan nås gennem et script, et søgefelt eller en formular, er den sværere at opdage. En tydelig intern linkstruktur hjælper både Googlebot og besøgende med at finde hovedsider og undersider.
Brug URL-inspektion og indeksrapporter i Google Search Console til at se, om Google kender siden, hvornår den sidst blev crawlet, og om der er problemer med hentning eller gengivelse.
Eksempel
En køreskole lancerer fem nye afdelingssider. De ligger i sitemap, men menuen linker kun til en samlet oversigt, som indlæser afdelingerne med JavaScript efter et klik. To af siderne bliver fundet hurtigt, mens tre ikke ses i Search Console efter flere uger.
Udvikleren tilføjer almindelige HTML-links fra oversigten og fra relevante lokale sider. Samtidig opdages en fejl i robots.txt, som blokerer mappen med billeder og JavaScript. Reglen fjernes, og siderne testes igen.
Før rettelsen blev de fem sider samlet crawlet 2 gange på 30 dage. Efter rettelsen bliver de crawlet 14 gange på den næste måned. Det er et regneeksempel. Flere crawlbesøg er ikke målet i sig selv, men de viser, at Googlebot nu kan opdage og genbesøge siderne mere naturligt.
Køreskolen forbedrer også sidernes lokale indhold og title tags. Guiden om at få flere besøgende til hjemmesiden giver et bredere billede af arbejdet efter den tekniske adgang er på plads.
Faldgrube
En udbredt misforståelse er, at robots.txt kan bruges til at fjerne en side sikkert fra Google. Filen forhindrer normalt crawl, men URL-adressen kan stadig blive kendt gennem links og i visse tilfælde vises uden uddrag. Skal en side ikke indekseres, bruges normalt noindex på en side, som Googlebot må hente.
En anden fejl er at servere forskelligt indhold til Googlebot og mennesker for at påvirke placeringer. Det kaldes cloaking og kan bryde Googles spamregler. Tilpasninger for tilgængelighed, enheder eller login er noget andet, men indholdet skal have samme grundlæggende betydning.
Blokering af CSS og JavaScript kan også give et forkert billede af siden. Hvis væsentligt indhold først vises gennem script, skal Google kunne hente de nødvendige ressourcer. Ellers kan gengivelsen mangle menuer, tekst eller links.
Godt at vide
Google har flere crawlere og brugeragenter til forskellige formål, blandt andet smartphone- og desktopvarianter. Google Search arbejder primært med mobilversionen, hvilket hænger sammen med mobile-first-indeksering.
En crawler kan identificeres gennem brugeragenten, men den kan efterlignes. Hvis serveren skal give særlige adgangsregler, bør identiteten verificeres efter Googles officielle metode frem for blot at stole på teksten "Googlebot".
Crawlhyppighed er ikke en kvalitetskarakter. Store nyhedssites besøges ofte, fordi indholdet ændrer sig hele tiden. En lille håndværkerside kan klare sig glimrende med langt færre besøg. Det afgørende er, at Google kan hente ændringer, når de findes.
Crawling, rendering og indeksering
Crawling betyder, at Googlebot henter en URL og dens ressourcer. Rendering betyder, at Google forsøger at behandle siden, inklusive JavaScript, så det synlige resultat kan forstås. Indeksering betyder, at oplysninger fra siden kan gemmes i Googles indeks. De tre trin hænger sammen, men de er ikke det samme.
En HTML-side med al vigtig tekst i kilden er normalt enkel at behandle. En side, der bygger alt indhold gennem tunge scripts, kan kræve mere rendering. Google kan håndtere meget JavaScript, men det er stadig klogt at levere centrale overskrifter, links og tekster på en robust måde.
Canonical, noindex og andre signaler vurderes efter hentningen. Hvis Googlebot blokeres fra siden, kan den ikke altid se disse instruktioner. Det er en af grundene til, at robots.txt og noindex ikke bør blandes tilfældigt.
Search Console viser forskellige statusser, fordi en side kan være opdaget, crawlet og alligevel ikke indekseret. Statussen skal læses sammen med sidens kvalitet, dubletter og tekniske signaler.
Sådan opdager du crawlproblemer
Start med URL-inspektion på de vigtigste sider. Kontrollér den deklarerede og valgte canonical, seneste crawl, mobilvenlighed og om hentningen lykkedes. Brug ikke kun forsiden; test forskellige skabeloner som serviceside, blogindlæg og kontakt.
Gennemgå serverlogfiler, hvis problemet er større eller uklart. Loggen kan vise hvilke URL-adresser Googlebot faktisk anmoder om, hvor ofte og med hvilke svar. Det kan afsløre endeløse filtre, mange 404-fejl eller en server, der svarer langsomt.
En crawler på egen computer kan finde andre problemer: sider uden interne links, omdirigeringskæder, blokeringer og duplikerede adresser. Sammenlign crawlresultatet med sitemap og de sider, der faktisk skaber trafik eller salg.
På en stor webshop bør filtre, sortering og interne søgninger vurderes særskilt. De kan skabe millioner af kombinationer, selv om kunderne kun har brug for et begrænset antal kategorisider.
Googlebot og serveren
En ustabil server kan svare med 5xx-fejl eller timeouts. Hvis det sker gentagne gange, sænker Google normalt sin crawlaktivitet. Derfor hænger hosting, cache og teknisk drift sammen med muligheden for at holde indholdet opdateret i søgemaskinen.
Brug den korrekte statuskode ved vedligeholdelse. En midlertidig 503 fortæller, at siden bør prøves igen senere. En 404 siger, at ressourcen ikke findes. At returnere 404 for at begrænse trafik er et forkert signal og kan føre til, at indhold fjernes fra indekset.
Et CDN eller sikkerhedsplugin kan blokere bots ved en fejl. Kontrollér firewallregler, rate limits og botbeskyttelse, hvis Search Console pludselig viser hentefejl. Løsningen bør beskytte siden uden at afvise verificeret Googlebot.
Når en ny hjemmeside lanceres, bør adgang, statuskoder og robotsregler testes før domænet peges om. Det er en lille kontrol, der kan forhindre en stor mængde efterarbejde.
Ved lancering og flytning
En ny eller flyttet hjemmeside bør testes, som Googlebot møder den. Gennemgå robots.txt, sitemap, redirects, statuskoder og de vigtigste skabeloner, før den gamle løsning lukkes. En enkelt global noindex-indstilling fra udviklingsmiljøet kan ellers gøre hele lanceringen usynlig.
Bevar en liste over gamle URL-adresser og deres nye destinationer. Googlebot skal kunne følge direkte 301-redirects uden lange kæder. Når gamle links ender på relevante nye sider, bevares både brugerens forventning og en mere tydelig relation mellem det gamle og nye indhold.
Efter lanceringen skal serverfejl og crawlaktivitet følges tættere end normalt. Et fald i crawl kan være naturligt, men mange 5xx-fejl, pludselige blokeringer eller manglende centrale sider kræver handling. Sammenlign med den crawlrapport, der blev gemt før flytningen.
Indsend sitemap, men forvent ikke, at det fungerer som en kørekortbestilling til indekset. Almindelige interne links og stabil serveradgang er stadig det fundament, Googlebot arbejder ud fra.
Google Search Central – Sådan fungerer Google Search
Google Search Central – Crawling og indeksering
Senest opdateret