Guides, tutoriels & Analyses
Découvrez les proxies résidentiels, le web scraping, les stratégies de collecte de données et les meilleures pratiques du secteur avec l'équipe Shifter.
Comment scraper des sites qui exigent une connexion : sessions, cookies et proxys sticky à l'échelle
Scraper derrière une connexion, c'est une affaire d'identité, pas de rotation. Persistez les cookies de session, épinglez chaque compte à une IP sticky propre, et restez connecté sans ban.
Pourquoi votre scraper est bloqué avant de charger la page : fingerprinting TLS et HTTP/2
IP résidentielle propre, User-Agent réel, et pourtant bloqué instantanément ? L'anti-bot fait le fingerprint de votre client HTTP à la couche TLS et HTTP/2, avant de lire votre requête.
Qu'est-ce qu'un navigateur antidétection et comment les proxys résidentiels s'y intègrent
Un navigateur antidétection donne à chaque profil sa propre empreinte d'appareil. Mais ce n'est que la moitié de l'identité, l'IP est l'autre moitié, et les deux doivent concorder.
Comment faire tourner des proxys résidentiels dans Scrapy avec un middleware personnalisé
Scrapy pose le proxy via meta, mais le piège du cache de Proxy-Authorization casse la rotation. Un middleware personnalisé qui fait tourner l'identité et réessaie sur les blocages.
Comment utiliser des proxys résidentiels dans Selenium (proxys authentifiés compris)
Selenium pose l'hôte du proxy facilement mais n'a aucun moyen intégré de passer des identifiants. Comment gérer les proxys authentifiés avec Selenium Wire, une extension, ou CDP.
Comment scraper la pagination et le scroll infini de façon fiable à l'échelle
La pagination est là où les scrapers perdent des données en silence : pages sautées, doublons, arrêt trop tôt. Comment obtenir chaque élément une fois et savoir quand c'est fini.
Comment utiliser des proxys résidentiels dans Puppeteer (avec page.authenticate)
Les proxys dans Puppeteer : le proxy va dans les args de lancement, les identifiants dans page.authenticate, rotation géo par page via un gateway, et blocage de ressources.
Surveiller un pipeline de scraping : les métriques qui vous disent qu'il casse avant vos données
Un scraper échoue en silence : le cron se déclenche, les logs disent 200, les données se gâtent. Les métriques et alertes qui l'attrapent dans le pipeline, pas au conseil.