Самый простой вариант#
Встроенное промежуточное ПО Scrapy HttpProxyMiddleware считывает request.meta[\"proxy\"] и обрабатывает учётные данные, встроенные в URL. Задайте его в пауке, и каждый запрос будет получать новый IP-адрес на шлюзе.
import scrapy
PROXY = "http://USER-cc-us:[email protected]:9000"
class PricesSpider(scrapy.Spider):
name = "prices"
start_urls = ["https://example.com/catalog"]
def start_requests(self):
for url in self.start_urls:
yield scrapy.Request(url, meta={"proxy": PROXY})
def parse(self, response):
for href in response.css("a.product::attr(href)").getall():
yield response.follow(href, callback=self.parse_product, meta={"proxy": PROXY})
def parse_product(self, response):
yield {"url": response.url, "price": response.css(".price::text").get()}Промежуточное ПО для закреплённой сессии каждого объекта#
import hashlib
class HodlProxyMiddleware:
GATEWAY = "res.hodlproxy.com:9000"
def __init__(self, user, password, country):
self.user, self.password, self.country = user, password, country
@classmethod
def from_crawler(cls, crawler):
s = crawler.settings
return cls(s.get("HODLPROXY_USER"), s.get("HODLPROXY_PASS"), s.get("HODLPROXY_COUNTRY", "us"))
def process_request(self, request, spider):
# Закреплённая сессия при наличии ключа сессии в запросе (например, по одному на цепочку обработки товара), иначе — ротация IP
key = request.meta.get("session_key")
user = f"{self.user}-cc-{self.country}"
if key:
sid = hashlib.sha1(key.encode()).hexdigest()[:12]
user += f"-sid-{sid}-ttl-10m"
request.meta["proxy"] = f"http://{user}:{self.password}@{self.GATEWAY}"DOWNLOADER_MIDDLEWARES = {
"myproject.middlewares.HodlProxyMiddleware": 350, # перед HttpProxyMiddleware (750)
}
HODLPROXY_USER = "USER"
HODLPROXY_PASS = "PASS"
HODLPROXY_COUNTRY = "de"
CONCURRENT_REQUESTS = 32
CONCURRENT_REQUESTS_PER_DOMAIN = 8
AUTOTHROTTLE_ENABLED = True
AUTOTHROTTLE_TARGET_CONCURRENCY = 4.0
DOWNLOAD_TIMEOUT = 45
RETRY_ENABLED = True
RETRY_TIMES = 2
RETRY_HTTP_CODES = [403, 429, 500, 502, 503, 504, 522, 524]
COMPRESSION_ENABLED = TrueПовторный запрос снова проходит через промежуточное ПО: без ключа сессии он отправляется с нового выходного узла, что и требуется после ответа 403 или 429. При наличии ключа сессии он остаётся на прежнем выходном узле, как и нужно для многоэтапной последовательности.
Как сократить расходы#
- Scrapy не загружает изображения или скрипты, а только HTML и JSON, поэтому стоимость страницы определяется размером её HTML.
- Включите сжатие (оно включено по умолчанию) и не используйте
Splashили отрисовку в браузере, если этого не требуют данные. - Во время разработки включите кэширование с помощью
HTTPCACHE_ENABLED = True, чтобы не платить за повторную загрузку тех же страниц при отладке селекторов.
Корректная частота запросов для каждого домена#
Пул позволяет работать как множество корректных посетителей, а не как один назойливый. CONCURRENT_REQUESTS_PER_DOMAIN и AutoThrottle поддерживают для каждой цели правдоподобную для человека частоту запросов с каждого выходного узла; политика допустимого использования запрещает любые действия, похожие на атаку.
Частые вопросы#
Нужен ли мне пакет scrapy-rotating-proxies?
При использовании шлюза — нет: ротация IP выполняется на стороне HodlProxy для каждого нового соединения. Этот пакет управляет списками статических прокси, а с res.hodlproxy.com достаточно настроить один прокси.
Как использовать разные страны для отдельных запросов?
Задайте request.meta["country"] в пауке и считывайте его в промежуточном ПО для формирования параметра -cc-; для краткости в примере используется одна настройка.