Inteligência de mercado de trabalho parece um problema de scraping e na verdade é um problema de medição. O resultado é uma série temporal que alguém vai interpretar como um sinal sobre contratações, e o modo de falha não é uma tarefa que trava. É um gráfico que se move por razões que não têm nada a ver com o mercado de trabalho.
Se as vagas em uma região caem dezoito por cento neste mês, há duas explicações. Os empregadores publicaram menos vagas, ou sua coleta perdeu algumas. De dentro do pipeline, essas situações são indistinguíveis, a menos que você tenha construído o sistema para diferenciá-las. É isso que separa construir um índice de simplesmente extrair listagens, e é onde a maioria dos painéis de quadros de vagas silenciosamente dá errado.
Se seu interesse está nos fluxos de recrutamento em vez da medição agregada, o texto complementar é proxies residenciais para recrutamento e dados de mercado de trabalho. Este aqui é sobre painéis.
Lacunas de cobertura parecem tendências
A propriedade definidora de uma série de mercado de trabalho é que ela é comparada consigo mesma ao longo do tempo. Contagens absolutas importam muito menos do que a variação, o que significa que qualquer mudança no que você consegue ver é registrada como uma mudança no que existe.
Três coisas rotineiramente alteram a cobertura sem alterar nada real:
Bloqueios parciais. Um quadro de vagas passa a retornar menos resultados por consulta, ou apresenta um desafio nas páginas mais profundas de um conjunto de resultados. Você ainda recebe dados, então nada parece quebrado, e suas contagens caem.
Deriva geográfica. O local de onde suas requisições parecem se originar muda, e o conjunto de resultados muda junto. As vagas são filtradas por proximidade na maioria dos quadros, então isso move diretamente as contagens regionais.
Truncamento silencioso de paginação. Você coleta três páginas onde antes coletava oito, porque as páginas seguintes são mais fortemente defendidas do que a primeira. O volume cai; ninguém percebe quais páginas desapareceram.
Cada um desses casos produz um número limpo, plausível e errado. Nenhum deles gera um erro.
As vagas são servidas por localização
Quase todo quadro de vagas relevante resolve uma consulta com base em onde acredita que você está. Buscar “auxiliar de armazém” sem localização retorna resultados regionais. Buscar com uma localização enquanto se chega de um IP a mil milhas de distância retorna um conjunto de resultados que não é nem o que um candidato local vê, nem uma visão nacional.
Para um painel que tenta medir contratações regionais, esse é todo o jogo. O sinal de localização precisa ser estável ao longo de todo o histórico da série, e precisa ser consistente entre o parâmetro de localização informado e a origem aparente da requisição. Saídas residenciais nas regiões que você está medindo fazem essas duas coisas coincidirem, o que é o que “uma visão local” significa na prática.
A armadilha relacionada é a incompatibilidade de localidade, em que o IP indica um país e os cabeçalhos do navegador indicam outro. Essa inconsistência muda os conjuntos de resultados em quadros internacionais e vale a pena eliminá-la desde cedo. Os detalhes estão em combinando geo, fuso horário e localidade do proxy.
Projete o painel, depois colete
A disciplina que torna os dados de mercado de trabalho utilizáveis é decidir o que é o painel antes de escrever um coletor, e depois não mudar isso casualmente.
Lista fixa de fontes. Um conjunto definido de quadros de vagas, mantido constante. Adicionar um quadro no meio da série cria uma mudança abrupta que será interpretada como crescimento de contratações, a menos que você faça o backfill ou versione a série.
Geografia fixa. Um conjunto definido de regiões com um parâmetro de localização definido para cada uma. Não “de onde quer que a requisição tenha vindo”.
Conjunto fixo de consultas. As mesmas consultas ocupacionais, executadas da mesma maneira, na mesma cadência.
Profundidade fixa. Um número declarado de páginas de resultado por consulta, coletadas por completo ou marcadas como incompletas. Nunca de forma aproximada.
Qualquer mudança em qualquer um desses pontos é uma mudança de metodologia e deve ser registrada como tal, com um número de versão carimbado em cada linha. Analistas conseguem trabalhar com uma quebra documentada em uma série. Não conseguem trabalhar com uma não documentada.
Configurando a camada de coleta
Com o gateway Shifter, a região e a sessão são codificadas nas credenciais contra p.shifter.io:443:
customer-USERNAME-country-gb-city-manchester-sid-mcr01-ttl-600:PASSWORDcountry-gb usa o código ISO alpha-2, que é gb em vez de uk. city-manchester restringe a saída à região metropolitana cujas vagas você está medindo. sid-mcr01 mantém uma sessão fixa para que uma consulta completa, incluindo sua paginação, seja executada a partir de um único IP, e ttl-600 mantém esse IP por dez minutos. Um identificador de sessão por região e consulta, em vez de por requisição, é o que mantém um conjunto de resultados paginado internamente coerente.
Se um filtro de região e cidade for estreito demais para ser preenchido, o gateway retorna 502 em vez de substituir por uma saída próxima. Para um painel de medição, esse é o comportamento correto: uma observação ausente que você consegue ver é melhor do que uma substituição silenciosa que você não consegue.
A cadência deve ser estável e discreta. Coleta diária ou semanal em horários consistentes, com concorrência modesta e recuo real em caso de erros, produz uma série mais limpa do que varreduras agressivas, e é muito menos provável que altere sua cobertura ao provocar defesas. Os mecanismos estão em limitação de taxa e throttling de requisições.
Deduplicação é uma decisão de medição
A mesma vaga comumente aparece em vários quadros, na página de carreiras de uma empresa, e novamente duas semanas depois como uma republicação. Como você resolve isso determina o que seu índice realmente mede, e não há escolha neutra.
Uma abordagem viável é uma chave composta de empregador normalizado, título normalizado, localização e janela de data de publicação, com uma decisão registrada para cada agrupamento. O que importa mais do que o algoritmo específico é que a regra seja fixa, documentada e aplicada de forma idêntica em todo o histórico. Alterar a lógica de deduplicação retroativamente reescreve o passado, e uma série de mercado de trabalho cujo passado fica mudando não é uma série.
Republicações merecem tratamento próprio. Uma vaga republicada mensalmente é ou uma vaga difícil de preencher ou uma listagem permanente, e ambas são interessantes, mas só se você conseguir diferenciá-las de nova demanda.
Verifique a cobertura em vez de presumi-la
A prática única que separa painéis defensáveis de painéis que não são: medir sua própria coleta, não apenas as vagas.
Execute um pequeno conjunto de controle de consultas duas vezes por janela de coleta, a partir de duas saídas diferentes na mesma região, e compare as contagens de resultados. Convergência significa que sua visão é estável. Divergência significa que os quadros de vagas estão respondendo a algo sobre suas requisições, e a série para aquela janela é suspeita.
Acompanhe as métricas operacionais junto com os próprios dados: taxa de sucesso por quadro, páginas coletadas em relação às páginas esperadas, e contagens de resultados por consulta ao longo do tempo. Uma queda de vinte por cento nas vagas que coincide com uma queda na sua própria taxa de sucesso é uma história de coleta, não uma história de mercado de trabalho, e você quer saber qual das duas está vendo antes que alguém construa uma previsão em cima disso.
Para equipes que precisam de uma base defensável na própria camada de coleta, testando velocidade, taxa de sucesso e precisão de localização de proxy cobre o lado da medição.
Ficando do lado certo dos dados
Vagas de emprego são publicadas para que as pessoas as leiam, o que é um argumento genuíno para coletá-las, e isso não é ilimitado.
Vagas frequentemente contêm nomes de recrutadores, números de telefone diretos e endereços de e-mail. Isso é dado pessoal, e um índice de demanda de contratação não precisa disso. Remova esses dados na ingestão em vez de armazená-los e prometer não usá-los. Agregue o que você publica, respeite os termos declarados de cada quadro, mantenha volumes de requisição proporcionais, e identifique seu tráfego honestamente onde um quadro oferecer uma via para acesso de pesquisa.
O enquadramento geral está em proxies residenciais éticos para coleta de dados de IA, e ele se aplica aqui com ainda mais força, porque o trabalho de mercado de trabalho está mais próximo de indivíduos do que a maioria das coletas de dados comerciais.
Perguntas frequentes
De quantas regiões um painel nacional confiável precisa?
O suficiente para que nenhuma região metropolitana isolada domine o agregado, e de forma consistente desde a primeira observação em diante. Dez regiões bem escolhidas, coletadas de forma idêntica por um ano, superam quarenta coletadas de forma irregular por três meses.
Devo coletar campos de salário?
Sim, e armazene a string bruta junto com seu valor processado. A divulgação salarial varia por jurisdição e por quadro de vagas, então uma proporção crescente de vagas com dados salariais é frequentemente uma mudança de política, não de mercado, e você precisa do texto bruto para diferenciar.
Por que não usar um único quadro de vagas com uma API pública?
Porque a cobertura de um único quadro é o negócio de um único quadro, e sua participação nas vagas muda ao longo do tempo. Uma série de fonte única mede aquela fonte. Se isso é aceitável depende do que você está afirmando.
Isso funciona para cobertura internacional?
Funciona, com saídas por país e configurações de localidade correspondentes. Espere que quadros nacionais dominem na maioria dos mercados, o que muda a lista de fontes em vez do método. Contexto relacionado está em o caso de uso de recrutamento.
Conclusão
Dados de quadros de vagas se tornam inteligência de mercado de trabalho no ponto em que você consegue explicar todo movimento na série, incluindo aqueles causados pelo seu próprio pipeline. Isso exige um painel fixo, coleta geograficamente consistente, uma regra de deduplicação estável e métricas de cobertura honestas.
Proxies residenciais são a peça que torna a geografia real e repetível, de modo que um número regional signifique o que diz. O resto é metodologia, e metodologia é o que torna o número digno de ser citado. O planejamento de banda para um painel dessa natureza está coberto em estimando a banda mensal de proxy residencial, com tarifas na página de preços de proxy residencial.