Intégration de Proxy Scrapy
Ce guide est peut-être obsolète. Pour un guide à jour, veuillez consulter notre documentation.
What is Scrapy?
Scrapy est un framework Python pour le crawling et le scraping web, qui permet aux utilisateurs d’extraire des données structurées à partir de sites web. Il est open-source, rapide et extensible. Scrapy peut être utilisé à diverses fins, telles que l’exploration de données, la surveillance et les tests automatisés.
Scrapy integration with Bright Data proxies
Ouvrez votre IDE préféré et démarrez un nouveau projet Scrapy, tapez dans la ligne de commande :
scrapy startproject <project_name>
Cela créera un nouveau dossier avec le nom du projet, dans lequel vous ouvrirez un fichier Python.
- Accédez à votre panneau de contrôle Bright Data et cliquez sur l’icône ‘Proxies & Scraping Infra’
- Créez une nouvelle zone de Proxy en cliquant sur ‘Ajouter’, en choisissant un type de réseau, en configurant le Proxy et en cliquant sur enregistrer
- Dans l’onglet ‘Paramètres d’accès‘ de votre zone de Proxy, vous trouverez vos valeurs ‘USERNAME‘ et ‘PASSWORD‘.
- Dans votre fichier de code spider Scrapy, dans le paramètre meta de la requête, définissez la valeur ‘proxy’ comme suit, en utilisant les valeurs ‘USERNAME‘ et ‘PASSWORD‘ précédentes : “http://USERNAME:[email protected]:33335“
- Par exemple :
import scrapy
class BrightdatascrapyexampleSpider(scrapy.Spider):
name = "BrightDataScrapyExample"
def start_requests(self):
request = scrapy.Request(url="http://example.com",callback=self.parse)
request.meta['proxy'] = "http://USERNAME:[email protected]:33335"
yield request
def parse(self, response):
print(response.body)
Puis exécutez la commande suivante dans votre ligne de commande :
scrapy runspider <Pythonfilename.py>
How To Use Bright Data Proxy Manger With Scrapy
- Créez une zone de Proxy comme dans l’intégration directe ci-dessus
- Installez le Proxy Manager
- Cliquez sur ‘ajouter un nouveau port’ et configurez-le selon votre cas d’utilisation
- Dans votre fichier de code spider Scrapy, dans le paramètre meta de la requête, définissez la valeur ‘proxy’ comme suit : “http://IP:PORTNUMBER”
- L’IP de l’hôte local est 127.0.0.1 – c’est la valeur à utiliser si le gestionnaire de Proxy est installé sur votre machine. Si le gestionnaire de Proxy est installé sur un serveur externe, saisissez l’adresse IP de ce serveur
- Le port créé dans le Proxy Manager est 24XXX, par exemple 24000 – le premier numéro de port par défaut
- Par exemple :
import scrapy
class BrightdatascrapyexampleSpider(scrapy.Spider):
name = "BrightDataScrapyExample"
def start_requests(self):
request = scrapy.Request(url="http://example.com",callback=self.parse)
request.meta['proxy'] = "http://127.0.0.1:24000"
yield request
def parse(self, response):
print(response.body)
⚠️Note importante : Si vous utilisez les Proxys résidentiels de Bright Data, le Web Unlocker ou l’API SERP, vous devez installer un certificat SSL pour activer des connexions sécurisées de bout en bout vers votre ou vos sites web cibles. Il s’agit d’un processus simple, consultez https://docs.brightdata.com/general/account/ssl-certificate#installation-of-the-ssl-certificate pour les instructions.
Get proxies for Scrapy
Alimenté par une infrastructure de proxy résidentiel primée
Plus de 400M+ monthly d’adresses IP résidentielles, la meilleure technologie avec la possibilité de cibler n’importe quel pays, ville et opérateur mobile font de nos services de proxy premium le meilleur choix pour les développeurs.
Un proxy pour chaque voie de développement
Combinez réseaux, pairs et IPs pour optimiser votre flux continu de données web.
Tarification du réseau Proxy
La meilleure expérience client du secteur
De nouvelles fonctionnalités tous les jours
Pour répondre à toutes vos questions quand vous en avez besoin
Tableau de bord des performances en temps réel
Pour optimiser votre performance
Pour atteindre vos objectifs de collecte de données