Over de Stageify-crawler

Stageify gebruikt een kleine, nette crawler die openbaar beschikbare informatie over theaterproducties, gezelschappen en voorstellingen indexeert, zodat bezoekers alles op één plek kunnen vinden. Deze pagina legt uit wat de crawler doet en hoe je hem kunt beheren.

Wat we crawlen en waarom

De crawler leest openbaar toegankelijke webpagina's waar een beheerder of een communitylid ons uitdrukkelijk naartoe heeft verwezen — bijvoorbeeld de website van een theatergezelschap of een productiepagina. We gebruiken de inhoud om onze communitygids accuraat en actueel te houden. We crawlen niet het hele open web en we verzamelen geen persoonsgegevens buiten wat al op de pagina is gepubliceerd.

Naleving van robots.txt

We respecteren robots.txt. Om onze crawler toe te staan of te blokkeren, richt je je in je robots.txt op de agentnaam "Stageify Indexer" in de User-agent-regel. We houden ons aan Disallow-regels en aan de Crawl-Delay-instructie voor die agent.

Hoe je onze crawler herkent

Onze crawler stuurt een User-Agent die Stageify, de versie en een link terug naar deze pagina identificeert, met een browser-compatibel achtervoegsel. Een typische waarde ziet er zo uit: Stageify Indexer/0.0.0 (+https://stageify.net/about-crawler) Mozilla/5.0 (compatible).

Caching en limieten

We houden ons aan de Crawl-Delay-instructie in robots.txt om het aantal verzoeken beleefd te houden, en we beperken elke pagina-download tot 5 MB. We cachen opgehaalde inhoud zodat we dezelfde pagina niet onnodig opnieuw opvragen.

Verwacht aantal verzoeken

Verzoeken worden gestuurd door acties van beheerders en de community in plaats van door continu geautomatiseerd crawlen, dus de aantallen zijn laag — doorgaans een handvol verzoeken per host per dag. We voeren nooit hoogfrequente of parallelle sweeps uit op één host.

Contact en afmelden

Wil je dat jouw inhoud wordt uitgesloten, gecorrigeerd of uit onze gids verwijderd? Mail ons op info@stageify.net en we voeren je verzoek uit. Je kunt de agent "Stageify Indexer" ook blokkeren in je robots.txt.

Zie ook