Crawler PurpleScanBot — FAQ technique
Toutes les informations utiles aux webmasters, ingénieurs sécurité ou équipes SRE pour identifier, autoriser ou diagnostiquer le trafic émis par notre crawler.
1. Qu’est-ce que PurpleScanBot ?
PurpleScanBot est le crawler opéré par PurpleScan. Il audite les sites e-commerce sur leur SEO technique, leurs en-têtes HTTP de sécurité, la conformité des bannières de consentement, la performance et les régressions de disponibilité.
Si PurpleScanBot visite votre site, c’est qu’une personne de votre organisation — ou une agence ou un partenaire technique — a enregistré le domaine sur PurpleScan. Les contrôles habituels incluent :
- Balises SEO critiques (canonical, hreflang, meta robots, données structurées).
- En-têtes HTTP de sécurité (CSP, HSTS, COOP/COEP, X-Frame-Options).
- Cookies déposés avant consentement et pixels de tracking sortants.
- Core Web Vitals et captures d’écran pour l’audit des régressions visuelles.
2. User-Agent envoyés
PurpleScanBot utilise trois chaînes de User-Agent distinctes selon le
type de requête. Toutes contiennent le jeton
PurpleScanbot (insensible
à la casse) : une simple recherche de sous-chaîne suffit donc pour
identifier notre trafic dans vos journaux ou vos règles WAF.
Desktop (Chrome headless)
Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/147.0.0.0 Safari/537.36 (compatible; PurpleScanBot/1.0; +https://www.prplscan.com/ua)
Mobile (Chrome headless, émulation Pixel 8)
Mozilla/5.0 (Linux; Android 13; Pixel 8) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/147.0.0.0 Mobile Safari/537.36 (compatible; PurpleScanBot/1.0; +https://www.prplscan.com/ua)
HTTP brut (robots.txt, sitemaps, vérifications statiques)
PurpleScanbot/1.0 (+https://www.prplscan.com/ua)
| Segment | Signification |
|---|---|
| PurpleScanBot / PurpleScanbot | Identifiant du crawler (équivalent de « Googlebot »). |
| /1.0 | Version majeure, incrémentée lors de changements de comportement susceptibles d’impacter les serveurs d’origine. |
| Chrome/147.0.0.0 | Version du moteur Chromium utilisé pour les passes de rendu complet. |
| +https://www.prplscan.com/ua | URL de référence canonique — cette page. |
3. Adresses IP d’origine
L’ensemble du trafic PurpleScanBot provient de deux adresses statiques. Nous n’utilisons aucun pool rotatif : une seule entrée d’allow-list par famille d’adresse suffit.
| Famille | Adresse |
|---|---|
| IPv4 | 51.91.78.67 |
| IPv6 | 2001:41d0:404:200::92a7 |
Le reverse DNS ne résout pas actuellement vers un nom d’hôte appartenant à PurpleScan : appuyez-vous sur la combinaison IP + User-Agent pour l’attribution.
4. Limitation du débit des requêtes
- Plafond par site : au plus 1 requête toutes les 60 secondes par site enregistré, via un limiteur à fenêtre glissante.
- Pas de dispatch parallèle : un seul crawl planifié peut être en cours à la fois pour un même site.
- Back-off automatique : en cas de réponse HTTP
429, le crawl est mis en pause pour le site concerné le temps d’une fenêtre de refroidissement. - Crawl-delay robots.txt : si votre robots.txt déclare une directive
Crawl-delay, nous la respectons en plus du plafond par site.
En pratique, la charge cumulée générée par PurpleScanBot sur une même origine reste bien en deçà d’une requête par seconde, passes desktop et mobile confondues.
5. robots.txt & sitemaps
- Nous récupérons
/robots.txtquotidiennement et mettons le résultat en cache. - Nous obéissons aux règles
Disallowassociées àUser-agent: PurpleScanbotouUser-agent: *. - Nous respectons la directive
Crawl-delaysi elle est présente. - Nous détectons automatiquement les sitemaps référencés dans robots.txt, avec repli sur
/sitemap.xmlsi aucun n’est déclaré.
Pour nous bloquer intégralement, ajoutez à votre robots.txt :
User-agent: PurpleScanbot Disallow: /
6. Fréquence de crawl
La fréquence de crawl dépend du type de page, et non de la taille du site. Les catalogues e-commerce volumineux sont échantillonnés plutôt que re-crawlés intégralement à chaque passage.
| Type de page | Fréquence |
|---|---|
| Page d’accueil | Toutes les 6 heures |
| Pages de liste de produits (PLP) | Toutes les 24 heures |
| Fiches produit (PDP) | Toutes les 72 heures (échantillonnées) |
| Autres pages | Toutes les 168 heures (une fois par semaine) |
7. Navigateur & émulation d’appareils
- Moteur : Chromium 147 en mode headless, piloté via le Chrome DevTools Protocol au travers de Selenium WebDriver.
- Profil desktop : viewport 1920 × 1080, User-Agent Windows desktop.
- Profil mobile : émulation Pixel 8 (Android 13), User-Agent mobile.
- JavaScript : activé pour les passes de rendu ; désactivé pour les requêtes statiques brutes (robots.txt, sitemaps).
- Accept-Language :
en-US,en;q=0.9par défaut.
8. Garanties d’innocuité
- PurpleScanBot ne soumet aucun formulaire, ne se connecte à aucun compte, n’interagit avec aucun panier.
- Il n’émet pas de requêtes
POST,PUTniDELETEvers des endpoints non authentifiés. - Il ne tente pas de contourner l’authentification, les paywalls ou les restrictions géographiques.
- Il ne télécharge pas de binaires arbitraires au-delà de ce qu’un vrai navigateur récupère pour rendre la page.
9. Comment nous autoriser
Si votre CDN, WAF ou solution anti-bot bloque PurpleScanBot, chacune des règles ci-dessous suffit à elle seule ; il n’est pas nécessaire de cumuler les deux.
Option A — par adresse IP
Ajoutez à votre liste d’autorisation :
51.91.78.67 2001:41d0:404:200::92a7
Option B — par User-Agent
Faites correspondre la sous-chaîne
PurpleScanbot (insensible
à la casse) dans l’en-tête
User-Agent.
(http.user_agent contains "PurpleScanbot")
et l’action Skip → all remaining custom rules & Bot Fight Mode.
10. Signaler un incident
Une question ou un signalement ? Contactez l’équipe du crawler PurpleScan à [email protected]. Merci de préciser votre domaine ainsi qu’un horodatage approximatif (avec fuseau horaire) du trafic concerné, afin que nous puissions corréler avec nos journaux de crawl. Nous répondons sous un jour ouvré.