Recopilar datos públicos a gran escala (precios, catálogos, anuncios, reseñas) choca pronto con dos obstáculos: las webs limitan lo que puede pedir una misma dirección IP, y lo que muestran depende del país del visitante. Los proxies resuelven ambas limitaciones. Mal utilizados, en cambio, generan sobre todo bloqueos, datos sesgados y riesgos legales. Esto es lo que hace que un scraper sea fiable y respetuoso.

Por qué un scraper necesita proxies

Un servidor identifica a cada visitante, ante todo, por su dirección IP: es la unidad más sencilla para medir su actividad y, por tanto, para limitarla. Hay dos razones por las que los proxies son útiles para recopilar datos:

  • Los límites de peticiones por IP. Muchas webs limitan el número de peticiones por dirección en un periodo determinado. Por encima de ese límite, ralentizan las respuestas, devuelven un error 429 o bloquean. Repartir las peticiones entre varias IP permite que cada una se mantenga por debajo de esos umbrales.
  • La geolocalización de los contenidos. Precios, moneda, disponibilidad, idioma, resultados de búsqueda: muchas páginas cambian según el país de la IP. Para recopilar la versión que se ve en Francia o en España, necesitas una IP de ese país.

Eso sí, un proxy no convierte en autorizado lo que no lo está, ni te exime de limitar la carga total que impones a la web.

Elegir el tipo de proxy según el volumen y el objetivo

La elección correcta depende del volumen, de la duración de las sesiones y de lo sensible que sea la web objetivo. Nuestra comparativa de proxies ISP, datacenter, residenciales y móviles detalla cada familia. Para recopilar datos, quédate con esto:

  • ISP dedicados para volúmenes regulares y sesiones estables (una lista de webs que vigilar, recorridos con cookies o con inicio de sesión): la IP es estática y rápida, y su historial es solo tuyo.
  • Pools rotativos para volúmenes muy grandes y dispersos, cuando cada IP solo hace unas pocas peticiones. Las direcciones son compartidas y de calidad variable.
  • IP móvil para objetivos muy desconfiados: como la comparten muchos abonados, una dirección de operador móvil es difícil de bloquear sin perjudicar a usuarios reales.
CriterioISP dedicadoPool rotativoIP móvil 4G
Estabilidad de la IPFijaCambia constantementeFija hasta la rotación
Sesiones largasAdecuadasLimitadasEntre dos rotaciones
Volúmenes muy grandesSegún el número de IPPunto fuerteUna sola línea
Objetivos muy desconfiadosReputación de operadorVariablePunto fuerte
Coste previsiblePor IP y al mesA menudo por volumenAl mes

En Airproxy, la IP móvil 4G es una línea francesa reservada a un solo cliente. Cambias de dirección con un botón o por API en unos veinte segundos, el tiempo que tarda la línea en reconectarse. Lanza la rotación entre dos lotes, nunca en mitad de una sesión. Nuestra guía sobre la IP móvil 4G, rotativa o fija explica cuándo conviene cambiar de dirección.

Dimensionar tus proxies y repartir la carga

Pensar en peticiones por IP y por minuto

La pregunta correcta no es «¿cuántos proxies necesito?», sino «¿cuántas peticiones por minuto puede enviar una IP a esta web sin degradar el servicio ni mis resultados?». No existe un umbral universal: varía según la web, el tipo de página, la hora y si has iniciado sesión o no. Así que mídelo:

  1. empieza con un ritmo bajo, con una IP por web;
  2. sube por escalones vigilando los errores 429 y 403 y el tiempo de respuesta;
  3. quédate con un ritmo claramente inferior al punto en el que aparecen los errores;
  4. divide tu volumen por minuto entre ese ritmo y añade un margen.

Con valores ficticios: si tienes que cargar 50 páginas por minuto y cada IP aguanta 5 peticiones por minuto, necesitas 10 IP, más un margen. Vigila también la carga total: lo que es insignificante para una gran plataforma puede pesar mucho en una web pequeña.

Rotar las IP correctamente

  • Una sesión, una IP. Un recorrido que depende de cookies (inicio de sesión, carrito, paginación) conserva la misma dirección de principio a fin. Cambiarla a mitad de camino suele romper la sesión.
  • Rotar entre tareas, no entre peticiones, con un limitador de ritmo para cada par de IP y web.
  • Suavizar el ritmo con pausas aleatorias, y programar las pasadas grandes en las horas valle de la web objetivo.
  • No volver a descargar lo innecesario: la caché, las peticiones condicionales (If-Modified-Since, ETag) y la recopilación incremental aligeran la carga.

El área de cliente de Airproxy exporta todos tus accesos en formato host:puerto:usuario:contraseña para alimentar el scraper, y cada proxy puede llevar un alias (por web o por tarea) que lo vincula con tus registros.

Cabeceras, huella y bloqueos

Cabeceras y huella coherentes

Una web no se fija solo en la IP: compara lo que anuncia tu cliente HTTP con lo que hace en realidad. Evita estas incoherencias habituales:

  • un User-Agent de navegador junto a las cabeceras por defecto de una biblioteca HTTP;
  • un Accept-Language que no tiene nada que ver con el país de la IP;
  • un agente de usuario que cambia en cada petición dentro de la misma sesión;
  • una huella TLS o HTTP/2 que delata una herramienta distinta de la anunciada.

Si la web exige JavaScript, un navegador sin interfaz gráfica es más fiel, pero más pesado para el servidor: bloquea los recursos innecesarios (imágenes, fuentes, vídeos).

429, 403, captchas: frenar, no forzar

  • 429 (demasiadas peticiones): respeta la cabecera Retry-After. Si no la hay, espacia cada vez más los reintentos (espera exponencial) y baja el ritmo de esa IP.
  • 403 (acceso denegado): revisa tus cabeceras y la dirección utilizada, sin reintentar en bucle. Si el rechazo es deliberado, para.
  • Captcha: la web quiere asegurarse de que trata con una persona. Reduce la cadencia o busca un acceso previsto para la automatización. No lo eludas.
  • 407, conexión rechazada, tiempo de espera agotado: el problema suele venir del proxy (credenciales, formato, protocolo). Comprueba la dirección con nuestro comprobador de proxies.

Registra los códigos de respuesta por IP y por web, con un disyuntor que detenga la tarea cuando la tasa de errores supere el umbral que tú fijes. Pasar enseguida a otra IP tras un bloqueo equivale a forzar la puerta: deja descansar esa dirección.

Los proxies resuelven una cuestión técnica, no jurídica. Antes de lanzar una recopilación, comprueba como mínimo:

  • El archivo robots.txt, que indica las zonas que el editor del sitio no quiere que se rastreen. Respétalo.
  • Las condiciones de uso: algunas webs prohíben la recopilación automatizada, sobre todo tras un inicio de sesión, donde las has aceptado.
  • El RGPD: en cuanto recopilas datos personales (nombres, perfiles, datos de contacto, reseñas firmadas), necesitas una base jurídica, una recopilación limitada a lo necesario, un plazo de conservación e informar a las personas afectadas. En España, la AEPD publica guías para cumplir el RGPD.
  • Los derechos sobre los contenidos y las bases de datos: analizar no es republicar, y extraer una parte sustancial de una base de datos puede vulnerar los derechos de su creador.
  • Las API oficiales: cuando existen, suelen ser más estables, más ligeras para la web y más seguras para ti.
Lo esencial: una recopilación responsable sigue siendo soportable para la web objetivo: un ritmo moderado, páginas autorizadas, los datos útiles y nada más. Esta guía no es asesoramiento jurídico; para un proyecto delicado, haz que un abogado valide tu planteamiento.

Errores frecuentes

  1. Pasarlo todo por una sola IP, o cambiar de IP en cada petición en mitad de una sesión.
  2. Subir la cadencia de golpe y después reintentar en bucle tras un 429 o un 403, hasta convertir un límite pasajero en un bloqueo duradero.
  3. Lanzar sin probar y después confundir un error del proxy con un bloqueo. Nuestra guía para probar un proxy recoge las comprobaciones útiles.
  4. Elegir el protocolo al azar: HTTP(S) y SOCKS5 vienen en el mismo acceso de Airproxy. Consulta las diferencias entre HTTP y SOCKS5.
  5. Dejar que los proxies caduquen en plena recopilación: un alquiler dura 30 días. Renueva con un clic o activa la renovación automática, una opción que nunca viene marcada por defecto.

Para pasar a la práctica, nuestra guía para usar un proxy en Python, Node.js y curl muestra cómo conectar un proxy con autenticación en un script. Los proxies ISP dedicados en Francia, España y Europa están en la página de ofertas, con entrega inmediata.

Preguntas frecuentes

¿Cuántos proxies hacen falta para hacer scraping de una web?

Depende del volumen y del ritmo que una IP aguanta en esa web sin errores. Mide ese ritmo por escalones, divide tu volumen por minuto entre ese ritmo y añade un margen.

¿Un proxy hace que el scraping sea legal?

No. Reparte la carga y te da la ubicación adecuada, pero la legalidad depende de los datos que recopilas, de las condiciones de uso de la web y del RGPD.

¿Proxy ISP dedicado o rotativo para el scraping?

El ISP dedicado encaja con las recopilaciones regulares y las sesiones con cookies. La rotación sirve sobre todo para volúmenes muy grandes y dispersos, y la IP móvil, para los objetivos más desconfiados.

¿HTTP o SOCKS5 para un scraper?

Las bibliotecas de scraping suelen admitir HTTP(S) de forma nativa, y basta para páginas web. SOCKS5 es útil si tu herramienta lo prefiere; los dos funcionan en el mismo acceso de Airproxy.

¿Qué hago si aparece un captcha?

Baja el ritmo y comprueba que tus cabeceras sean coherentes. Un captcha indica que la web quiere limitar la automatización: busca una API o un acceso previsto para ello y no lo eludas.