Pure-crawleren

PURE crawler danske, offentligt tilgængelige sider (HTML og PDF) til søgeindekset på purepure.app. Vi crawler kun værter, der er optaget i indekset. Vi respekterer robots.txt og noindex. Vi sælger ikke data, og vi bruger ikke siderne til at træne generative modeller.

Sådan identificerer vi os

User-Agent: Pure

Indtil september 2026 hed crawleren PUREBot. Regler i robots.txt for PUREBot gælder stadig.

Hvad vi henter

Tempo: vi tilpasser tempoet efter, hvor hurtigt din server svarer, og overholder altid et Crawl-delay i robots.txt. Offentlige myndigheder, kommuner og institutioner crawles med mindst 3 sekunder mellem forespørgsler og én forespørgsel ad gangen. Svarer din server 429 eller 503, holder vi pause og respekterer Retry-After.

Verifikation af crawleren (IP-adresser og rDNS)

Du kan verificere ægte PURE-crawlertrafik via Forward-Confirmed Reverse DNS (FCrDNS):

Se den komplette liste over vores crawler-IP-adresser og præfikser i maskinlæsbart format: /crawler-ips.json.

Sådan blokerer du Pure

Tilføj dette i robots.txt på dit site:

User-agent: Pure
Disallow: /

Du kan også sætte noindex på enkelte sider. Begge dele stopper crawleren. Betalte proxyleverandører bruges ikke til at omgå et eksplicit forbud.

Kontakt

Spørgsmål eller fjernelse: åbn et issue på github.com/aistripes/pure og skriv URL plus kort begrundelse.