L’intelligence sur le marché du travail ressemble à un problème de scraping mais est en réalité un problème de mesure. Le résultat est une série temporelle que quelqu’un lira comme un signal sur l’embauche, et le mode d’échec n’est pas un job qui plante. C’est un graphique qui bouge pour des raisons qui n’ont rien à voir avec le marché du travail.
Si les offres d’emploi dans une région chutent de dix-huit pour cent ce mois-ci, il y a deux explications. Les employeurs ont publié moins de postes, ou votre collecte en a manqué. Depuis l’intérieur du pipeline, ces deux cas sont indistinguables sauf si vous avez conçu le système pour les différencier. C’est ce qui sépare la construction d’un index de la simple récupération de listes, et c’est là que la plupart des panels de sites d’emploi dérivent silencieusement.
Si votre intérêt porte sur les flux de recrutement plutôt que sur la mesure agrégée, l’article complémentaire est les proxies résidentiels pour le recrutement et les données du marché de l’emploi. Celui-ci porte sur les panels.
Les lacunes de couverture ressemblent à des tendances
La propriété déterminante d’une série de marché du travail est qu’elle est comparée à elle-même au fil du temps. Les décomptes absolus comptent bien moins que la variation, ce qui signifie que tout changement dans ce que vous pouvez voir s’enregistre comme un changement dans ce qui existe.
Trois éléments modifient régulièrement la couverture sans rien modifier de réel :
Blocages partiels. Un site commence à renvoyer moins de résultats par requête, ou sert un défi sur les pages profondes d’un ensemble de résultats. Vous obtenez toujours des données, donc rien ne semble cassé, et vos décomptes chutent.
Dérive géographique. L’emplacement d’où vos requêtes semblent provenir change, et l’ensemble de résultats change avec lui. Les offres sont filtrées par proximité sur la plupart des sites, ce qui déplace directement les décomptes régionaux.
Troncature silencieuse de la pagination. Vous collectez trois pages là où vous en collectiez huit auparavant, parce que les pages suivantes sont plus défendues que la première. Le volume chute ; personne ne remarque quelles pages ont disparu.
Chacun de ces cas produit un chiffre propre, plausible et faux. Aucun ne déclenche d’erreur.
Les offres sont servies selon la localisation
Presque tous les grands sites résolvent une requête en fonction de l’endroit où ils pensent que vous êtes. Recherchez “warehouse associate” sans localisation et vous obtenez des résultats régionaux. Recherchez avec une localisation en arrivant depuis une IP à mille kilomètres de là, et vous obtenez un ensemble de résultats qui n’est ni ce qu’un candidat local voit, ni une vue nationale.
Pour un panel qui essaie de mesurer l’embauche régionale, c’est tout l’enjeu. Le signal de localisation doit être stable sur toute l’historique de la série, et il doit être cohérent entre le paramètre de localisation déclaré et l’origine apparente de la requête. Les sorties résidentielles dans les régions que vous mesurez font concorder ces deux éléments, ce qui est ce que signifie « une vue locale » sur le plan opérationnel.
Le piège associé est la discordance de locale, où l’IP indique un pays et les en-têtes du navigateur en indiquent un autre. Cette incohérence modifie les ensembles de résultats sur les sites internationaux et vaut mieux être éliminée en amont. Les détails sont dans faire correspondre géo, fuseau horaire et locale du proxy.
Concevoir le panel, puis le collecter
La discipline qui rend les données de marché du travail utilisables consiste à décider de ce qu’est le panel avant d’écrire un collecteur, puis à ne pas le modifier négligemment.
Liste de sources fixe. Un ensemble défini de sites, maintenu constant. Ajouter un site en cours de série crée un saut qui sera interprété comme une croissance de l’embauche à moins que vous ne fassiez un rétro-remplissage ou une version de la série.
Géographie fixe. Un ensemble défini de régions avec un paramètre de localisation défini pour chacune. Pas « d’où provenait la requête ».
Ensemble de requêtes fixe. Les mêmes requêtes professionnelles, exécutées de la même manière, à la même cadence.
Profondeur fixe. Un nombre déclaré de pages de résultats par requête, collectées entièrement ou marquées incomplètes. Jamais en best-effort.
Tout changement à l’un de ces éléments est un changement de méthodologie et doit être enregistré comme tel, avec un numéro de version estampillé sur chaque ligne. Les analystes peuvent travailler avec une rupture documentée dans une série. Ils ne peuvent pas travailler avec une rupture non documentée.
Configurer la couche de collecte
Avec la passerelle Shifter, la région et la session sont encodées dans les identifiants face à p.shifter.io:443 :
customer-USERNAME-country-gb-city-manchester-sid-mcr01-ttl-600:PASSWORDcountry-gb utilise le code ISO alpha-2, qui est gb plutôt que uk. city-manchester restreint la sortie à la métropole dont vous mesurez les offres. sid-mcr01 maintient une session persistante pour qu’une requête complète, incluant sa pagination, s’exécute depuis une seule IP, et ttl-600 conserve cette IP pendant dix minutes. Un identifiant de session par région et par requête, plutôt que par requête individuelle, est ce qui maintient un ensemble de résultats paginé cohérent en interne.
Si un filtre région et ville est trop étroit pour être satisfait, la passerelle renvoie 502 plutôt que de substituer une sortie voisine. Pour un panel de mesure, c’est le bon comportement : une observation manquante que vous pouvez voir vaut mieux qu’une substitution silencieuse que vous ne pouvez pas voir.
La cadence doit être régulière et sans particularité. Une collecte quotidienne ou hebdomadaire à des horaires constants, avec une concurrence modeste et un vrai backoff sur les erreurs, produit une série plus propre que des balayages agressifs, et elle est bien moins susceptible de modifier votre couverture en provoquant des défenses. Les mécanismes sont dans limitation de débit et régulation des requêtes.
La déduplication est une décision de mesure
Le même poste apparaît couramment sur plusieurs sites, sur une page carrières d’entreprise, et de nouveau deux semaines plus tard sous forme de republication. La manière dont vous résolvez cela détermine ce que votre index mesure réellement, et il n’y a pas de choix neutre.
Une approche viable est une clé composite d’employeur normalisé, de titre normalisé, de localisation et de fenêtre de date de publication, avec une décision enregistrée pour chaque fusion. Ce qui compte plus que l’algorithme spécifique, c’est que la règle soit fixe, documentée et appliquée de manière identique sur toute l’historique. Modifier la logique de déduplication rétroactivement réécrit le passé, et une série de marché du travail dont le passé change continuellement n’est pas une série.
Les republications méritent leur propre traitement. Un poste republié mensuellement est soit une vacance difficile à combler, soit une annonce permanente, et les deux sont intéressants, mais seulement si vous pouvez les distinguer d’une nouvelle demande.
Vérifier la couverture plutôt que la supposer
La pratique unique qui sépare les panels que vous pouvez défendre de ceux que vous ne pouvez pas : mesurer votre propre collecte, pas seulement les offres.
Exécutez un petit ensemble de contrôle de requêtes deux fois par fenêtre de collecte, depuis deux sorties différentes dans la même région, et comparez les décomptes de résultats. La convergence signifie que votre vue est stable. La divergence signifie que les sites répondent à quelque chose concernant vos requêtes, et la série pour cette fenêtre est suspecte.
Suivez les métriques opérationnelles en parallèle des données elles-mêmes : taux de succès par site, pages collectées par rapport aux pages attendues, et décomptes de résultats par requête au fil du temps. Une chute de vingt pour cent des offres qui coïncide avec une chute de votre propre taux de succès est une histoire de collecte, pas une histoire de marché du travail, et vous voulez savoir laquelle vous observez avant que quelqu’un ne construise une prévision là-dessus.
Pour les équipes qui ont besoin d’une base défendable sur la couche de collecte elle-même, tester la vitesse, le taux de succès et la précision de localisation des proxies couvre le côté mesure.
Rester du bon côté des données
Les offres d’emploi sont publiées pour être lues par des personnes, ce qui constitue un argument légitime pour les collecter, mais ce n’est pas illimité.
Les offres contiennent souvent des recruteurs nommés, des numéros de téléphone directs et des adresses e-mail. Ce sont des données personnelles, et un index de la demande d’embauche n’en a pas besoin. Retirez-les à l’ingestion plutôt que de les stocker en promettant de ne pas les utiliser. Agrégez ce que vous publiez, respectez les conditions déclarées de chaque site, maintenez des volumes de requêtes proportionnés, et identifiez votre trafic honnêtement là où un site propose une voie pour l’accès à la recherche.
Le cadrage général se trouve dans proxies résidentiels éthiques pour la collecte de données IA, et il s’applique ici avec plus de force, car le travail sur le marché du travail se situe plus près des individus que la plupart des collectes de données commerciales.
FAQ
De combien de régions un panel national crédible a-t-il besoin ?
Suffisamment pour qu’aucune métropole unique ne domine l’agrégat, et de manière constante depuis la première observation. Dix régions bien choisies collectées de façon identique pendant un an valent mieux que quarante collectées de manière inégale pendant trois mois.
Devrais-je collecter les champs de salaire ?
Oui, et stockez la chaîne brute à côté de votre valeur analysée. La divulgation salariale varie selon la juridiction et le site, donc une part croissante d’offres avec des données salariales est souvent un changement de politique plutôt qu’un changement de marché, et vous avez besoin du texte brut pour le distinguer.
Pourquoi ne pas utiliser un seul site avec une API publique ?
Parce que la couverture d’un seul site est l’affaire de ce seul site, et sa part des offres évolue au fil du temps. Une série à source unique mesure cette source. Que cela soit acceptable dépend de ce que vous affirmez.
Cela fonctionne-t-il pour une couverture internationale ?
Oui, avec des sorties par pays et des paramètres de locale qui correspondent. Attendez-vous à ce que les sites nationaux dominent dans la plupart des marchés, ce qui change la liste des sources plutôt que la méthode. Le contexte associé se trouve dans le cas d’usage recrutement.
En résumé
Les données de sites d’emploi deviennent de l’intelligence sur le marché du travail au moment où vous pouvez expliquer chaque mouvement de la série, y compris ceux causés par votre propre pipeline. Cela nécessite un panel fixe, une collecte géographiquement cohérente, une règle de déduplication stable et des métriques de couverture honnêtes.
Les proxies résidentiels sont l’élément qui rend la géographie réelle et reproductible, afin qu’un chiffre régional signifie ce qu’il dit. Le reste est méthodologie, et la méthodologie est ce qui rend le chiffre digne d’être cité. La planification de bande passante pour un panel de cette forme est couverte dans estimer la bande passante mensuelle des proxies résidentiels, avec les tarifs sur la page de tarification des proxies résidentiels.