Интеграции · Средний

Прокси с ротацией IP и закреплённые сессии в Scrapy с промежуточным ПО загрузчика

Scrapy уже умеет работать с HTTP-прокси с аутентификацией. Промежуточное ПО из двадцати строк превращает синтаксис имени пользователя HodlProxy в ротацию IP для каждого запроса и закреплённые сессии для каждого элемента.

2 минуты чтения 4 раздела Обновлено Опубликовано

Самый простой вариант#

Встроенное промежуточное ПО Scrapy HttpProxyMiddleware считывает request.meta[\"proxy\"] и обрабатывает учётные данные, встроенные в URL. Задайте его в пауке, и каждый запрос будет получать новый IP-адрес на шлюзе.

spider.py
import scrapy

PROXY = "http://USER-cc-us:[email protected]:9000"

class PricesSpider(scrapy.Spider):
    name = "prices"
    start_urls = ["https://example.com/catalog"]

    def start_requests(self):
        for url in self.start_urls:
            yield scrapy.Request(url, meta={"proxy": PROXY})

    def parse(self, response):
        for href in response.css("a.product::attr(href)").getall():
            yield response.follow(href, callback=self.parse_product, meta={"proxy": PROXY})

    def parse_product(self, response):
        yield {"url": response.url, "price": response.css(".price::text").get()}

Промежуточное ПО для закреплённой сессии каждого объекта#

middlewares.py
import hashlib

class HodlProxyMiddleware:
    GATEWAY = "res.hodlproxy.com:9000"

    def __init__(self, user, password, country):
        self.user, self.password, self.country = user, password, country

    @classmethod
    def from_crawler(cls, crawler):
        s = crawler.settings
        return cls(s.get("HODLPROXY_USER"), s.get("HODLPROXY_PASS"), s.get("HODLPROXY_COUNTRY", "us"))

    def process_request(self, request, spider):
        # Закреплённая сессия при наличии ключа сессии в запросе (например, по одному на цепочку обработки товара), иначе — ротация IP
        key = request.meta.get("session_key")
        user = f"{self.user}-cc-{self.country}"
        if key:
            sid = hashlib.sha1(key.encode()).hexdigest()[:12]
            user += f"-sid-{sid}-ttl-10m"
        request.meta["proxy"] = f"http://{user}:{self.password}@{self.GATEWAY}"
settings.py
DOWNLOADER_MIDDLEWARES = {
    "myproject.middlewares.HodlProxyMiddleware": 350,   # перед HttpProxyMiddleware (750)
}
HODLPROXY_USER = "USER"
HODLPROXY_PASS = "PASS"
HODLPROXY_COUNTRY = "de"

CONCURRENT_REQUESTS = 32
CONCURRENT_REQUESTS_PER_DOMAIN = 8
AUTOTHROTTLE_ENABLED = True
AUTOTHROTTLE_TARGET_CONCURRENCY = 4.0
DOWNLOAD_TIMEOUT = 45
RETRY_ENABLED = True
RETRY_TIMES = 2
RETRY_HTTP_CODES = [403, 429, 500, 502, 503, 504, 522, 524]
COMPRESSION_ENABLED = True

Повторный запрос снова проходит через промежуточное ПО: без ключа сессии он отправляется с нового выходного узла, что и требуется после ответа 403 или 429. При наличии ключа сессии он остаётся на прежнем выходном узле, как и нужно для многоэтапной последовательности.

Как сократить расходы#

  • Scrapy не загружает изображения или скрипты, а только HTML и JSON, поэтому стоимость страницы определяется размером её HTML.
  • Включите сжатие (оно включено по умолчанию) и не используйте Splash или отрисовку в браузере, если этого не требуют данные.
  • Во время разработки включите кэширование с помощью HTTPCACHE_ENABLED = True, чтобы не платить за повторную загрузку тех же страниц при отладке селекторов.

Корректная частота запросов для каждого домена#

Пул позволяет работать как множество корректных посетителей, а не как один назойливый. CONCURRENT_REQUESTS_PER_DOMAIN и AutoThrottle поддерживают для каждой цели правдоподобную для человека частоту запросов с каждого выходного узла; политика допустимого использования запрещает любые действия, похожие на атаку.

Частые вопросы#

Нужен ли мне пакет scrapy-rotating-proxies?

При использовании шлюза — нет: ротация IP выполняется на стороне HodlProxy для каждого нового соединения. Этот пакет управляет списками статических прокси, а с res.hodlproxy.com достаточно настроить один прокси.

Как использовать разные страны для отдельных запросов?

Задайте request.meta["country"] в пауке и считывайте его в промежуточном ПО для формирования параметра -cc-; для краткости в примере используется одна настройка.

Можно начинать

Попробуйте на практике.

Создайте аккаунт, пополните баланс на $20 и вставьте конечную точку из этого руководства в свой инструмент. Срок действия оплаченного трафика не ограничен.