Pure-crawleren
PURE crawler danske, offentligt tilgængelige sider (HTML og PDF) til søgeindekset på purepure.app. Vi crawler kun værter, der er optaget i indekset. Vi respekterer robots.txt og noindex. Vi sælger ikke data, og vi bruger ikke siderne til at træne generative modeller.
Sådan identificerer vi os
User-Agent: Pure
Indtil september 2026 hed crawleren PUREBot. Regler i robots.txt for PUREBot gælder stadig.
Hvad vi henter
- Offentlige HTML- og PDF-sider på optagne danske værter.
- Ikke sider, der er Disallow i robots.txt.
- Ikke sider med noindex (meta robots eller X-Robots-Tag).
- Ikke indlogningssider, binære filer eller svar over 2 MB.
Tempo: vi tilpasser tempoet efter, hvor hurtigt din server svarer, og overholder altid et Crawl-delay i robots.txt. Offentlige myndigheder, kommuner og institutioner crawles med mindst 3 sekunder mellem forespørgsler og én forespørgsel ad gangen. Svarer din server 429 eller 503, holder vi pause og respekterer Retry-After.
Verifikation af crawleren (IP-adresser og rDNS)
Du kan verificere ægte PURE-crawlertrafik via Forward-Confirmed Reverse DNS (FCrDNS):
- Vores crawler-IP-adresser har rDNS mod
*.w.purepure.app(for eksempel01.w.purepure.app). - Et fremadrettet DNS-opslag (A/AAAA) på værtsnavnet peger tilbage på den samme IP-adresse.
Se den komplette liste over vores crawler-IP-adresser og præfikser i maskinlæsbart format: /crawler-ips.json.
Sådan blokerer du Pure
Tilføj dette i robots.txt på dit site:
User-agent: Pure Disallow: /
Du kan også sætte noindex på enkelte sider. Begge dele stopper crawleren. Betalte proxyleverandører bruges ikke til at omgå et eksplicit forbud.
Kontakt
Spørgsmål eller fjernelse: åbn et issue på github.com/aistripes/pure og skriv URL plus kort begrundelse.