Collecter des données publiques à grande échelle (prix, catalogues, annonces, avis) se heurte vite à deux obstacles : les sites limitent ce qu'une même adresse IP peut demander, et ils n'affichent pas le même contenu selon le pays du visiteur. Les proxies répondent à ces deux contraintes. Mal utilisés, ils produisent surtout des blocages, des données faussées et des risques juridiques. Voici ce qui fait un scraper fiable et respectueux.
Pourquoi un scraper a besoin de proxies
Un serveur identifie d'abord chaque visiteur par son adresse IP : c'est l'unité la plus simple pour mesurer son activité, donc pour la limiter. Deux raisons rendent les proxies utiles à la collecte :
- Les limites de débit par IP. Beaucoup de sites plafonnent le nombre de requêtes par adresse sur une période donnée. Au-delà, ils ralentissent, renvoient une erreur 429 ou bloquent. Répartir les requêtes sur plusieurs IP permet à chacune de rester sous ces seuils.
- La géolocalisation des contenus. Prix, devise, disponibilité, langue, résultats de recherche : beaucoup de pages changent selon le pays de l'IP. Pour collecter la version vue en France ou en Espagne, il faut une IP de ce pays.
En revanche, un proxy ne rend pas autorisé ce qui ne l'est pas, et ne vous dispense pas de limiter la charge totale imposée au site.
Choisir le type de proxy selon le volume et la cible
Le bon choix dépend du volume, de la durée des sessions et de la sensibilité du site visé. Notre comparatif des proxies ISP, datacenter, résidentiels et mobiles détaille chaque famille ; pour la collecte, retenez ceci :
- ISP dédiés pour des volumes réguliers et des sessions stables (liste de sites à surveiller, parcours avec cookies ou connexion) : l'IP est statique, rapide, et son historique est le vôtre.
- Pools à rotation pour de très gros volumes dispersés, quand chaque IP ne fait que quelques requêtes ; les adresses sont partagées et de qualité variable.
- IP mobile pour des cibles très méfiantes : partagée par de nombreux abonnés, une adresse d'opérateur mobile est difficile à bloquer sans gêner de vrais utilisateurs.
| Critère | ISP dédié | Pool à rotation | IP mobile 4G |
|---|---|---|---|
| Stabilité de l'IP | Fixe | Change en permanence | Fixe jusqu'à la rotation |
| Sessions longues | Adaptées | Limitées | Entre deux rotations |
| Très gros volumes | Selon la taille du parc | Point fort | Une seule ligne |
| Cibles très méfiantes | Réputation d'opérateur | Variable | Point fort |
| Coût prévisible | À l'IP et au mois | Souvent au volume | Au mois |
Chez Airproxy, l'IP mobile 4G est une ligne française réservée à un seul client. Vous changez d'adresse par un bouton ou par API, en une vingtaine de secondes, le temps que la ligne se reconnecte : déclenchez la rotation entre deux lots, jamais en pleine session. Notre guide sur l'IP mobile 4G, rotative ou fixe explique quand changer d'adresse.
Dimensionner son parc et répartir la charge
Raisonner en requêtes par IP et par minute
La bonne question n'est pas « combien de proxies ? », mais « combien de requêtes par minute une IP peut-elle envoyer à ce site sans dégrader le service ni vos résultats ? ». Il n'existe pas de seuil universel : il varie selon le site, le type de page, l'heure et le fait d'être connecté ou non. Mesurez-le :
- commencez à un rythme bas, avec une IP par site ;
- augmentez par paliers en surveillant les erreurs 429 et 403 et le temps de réponse ;
- retenez un rythme nettement inférieur au point où les erreurs apparaissent ;
- divisez votre volume par minute par ce rythme, puis ajoutez une réserve.
Avec des valeurs fictives : 50 pages par minute à charger et 5 requêtes par minute tenues par IP donnent 10 IP, plus une réserve. Surveillez aussi la charge totale : ce qui est anodin pour une grande plateforme peut peser lourd sur un petit site.
Faire tourner les IP proprement
- Une session, une IP. Un parcours qui dépend de cookies (connexion, panier, pagination) garde la même adresse du début à la fin ; en changer en route casse souvent la session.
- Tourner entre les tâches, pas entre les requêtes, avec un limiteur de débit par couple IP et site.
- Lisser le rythme avec des délais aléatoires, et placer les gros passages aux heures creuses du site visé.
- Ne pas recharger l'inutile : cache, requêtes conditionnelles (
If-Modified-Since,ETag) et collecte incrémentale allègent la charge.
L'espace client Airproxy exporte tous vos accès au format hôte:port:identifiant:mot de passe pour alimenter le scraper, et chaque proxy peut recevoir un alias (par site ou par tâche) qui le relie à vos journaux.
En-têtes, empreinte et blocages
Des en-têtes et une empreinte cohérents
Un site ne regarde pas que l'IP : il compare ce que votre client HTTP annonce avec ce qu'il fait. Évitez les incohérences courantes :
- un
User-Agentde navigateur avec les en-têtes par défaut d'une bibliothèque HTTP ; - un
Accept-Languagesans rapport avec le pays de l'IP ; - un agent utilisateur qui change à chaque requête dans la même session ;
- une empreinte TLS ou HTTP/2 qui trahit un autre outil que celui annoncé.
Si le site exige JavaScript, un navigateur sans interface est plus fidèle mais plus lourd pour le serveur : bloquez les ressources inutiles (images, polices, vidéos).
429, 403, captchas : ralentir, pas forcer
- 429 (trop de requêtes) : respectez l'en-tête
Retry-After, sinon espacez les essais de plus en plus (attente exponentielle), et baissez le rythme de cette IP. - 403 (accès refusé) : vérifiez vos en-têtes et l'adresse utilisée, sans réessayer en boucle. Si le refus est délibéré, arrêtez.
- Captcha : le site veut s'assurer qu'il a affaire à un humain. Réduisez la cadence ou cherchez un accès prévu pour l'automatisation ; ne le contournez pas.
- 407, connexion refusée, délai dépassé : le problème vient souvent du proxy (identifiants, format, protocole). Vérifiez l'adresse avec notre testeur de proxy.
Journalisez les codes de réponse par IP et par site, avec un coupe-circuit qui arrête la tâche au-delà d'un taux d'erreurs que vous fixez. Basculer aussitôt sur une autre IP après un blocage revient à forcer la porte : mettez l'adresse au repos.
Le cadre légal et éthique
Les proxies règlent une question technique, pas juridique. Avant de lancer une collecte, vérifiez au minimum :
- Le fichier
robots.txt, qui indique les zones que l'éditeur ne souhaite pas voir explorées. Respectez-le. - Les conditions d'utilisation : certains sites interdisent la collecte automatisée, en particulier derrière une connexion, où vous les avez acceptées.
- Le RGPD : dès que vous collectez des données personnelles (noms, profils, coordonnées, avis signés), il vous faut une base légale, une collecte limitée au nécessaire, une durée de conservation et l'information des personnes. La CNIL publie des recommandations sur le sujet.
- Les droits sur les contenus et les bases de données : analyser n'est pas republier, et extraire une partie substantielle d'une base peut porter atteinte aux droits de son producteur.
- Les API officielles : quand elles existent, elles sont en général plus stables, plus légères pour le site et plus sûres pour vous.
Les erreurs fréquentes
- Tout faire passer par une seule IP, ou changer d'IP à chaque requête en pleine session.
- Monter en cadence d'un coup, puis réessayer en boucle après un 429 ou un 403, jusqu'à transformer une limite passagère en blocage durable.
- Lancer sans tester, puis confondre une erreur de proxy avec un blocage. Notre guide pour tester un proxy liste les vérifications utiles.
- Choisir le protocole au hasard : HTTP(S) et SOCKS5 sont fournis sur le même accès Airproxy ; voyez les différences entre HTTP et SOCKS5.
- Laisser expirer le parc en pleine collecte : une location dure 30 jours. Renouvelez en un clic, ou activez le renouvellement automatique, une option jamais cochée d'office.
Pour passer à la pratique, notre guide pour utiliser un proxy en Python, Node.js et curl montre comment brancher un proxy authentifié dans un script. Les proxies ISP dédiés en France, en Espagne et en Europe sont sur la page des offres, livrés immédiatement.
Questions fréquentes
Combien de proxies faut-il pour scraper un site ?
Cela dépend du volume et du rythme qu'une IP tient sur ce site sans erreurs. Mesurez ce rythme par paliers, divisez votre volume par minute par ce rythme et ajoutez une réserve.
Un proxy rend-il le scraping légal ?
Non. Il répartit la charge et donne la bonne localisation, mais la légalité dépend des données collectées, des conditions d'utilisation du site et du RGPD.
Proxy ISP dédié ou rotatif pour le scraping ?
L'ISP dédié convient aux collectes régulières et aux sessions avec cookies. La rotation sert surtout aux très gros volumes dispersés, l'IP mobile aux cibles les plus méfiantes.
HTTP ou SOCKS5 pour un scraper ?
Les bibliothèques de scraping gèrent en général nativement le HTTP(S), qui suffit pour des pages web. SOCKS5 sert si votre outil le préfère ; les deux fonctionnent sur le même accès Airproxy.
Que faire quand un captcha apparaît ?
Ralentissez et vérifiez la cohérence de vos en-têtes. Un captcha signale que le site veut limiter l'automatisation : cherchez une API ou un accès prévu à cet effet, ne le contournez pas.
