労働市場インテリジェンスは一見スクレイピングの問題に見えるが、実際には測定の問題である。出力は誰かが採用動向のシグナルとして読む時系列データであり、失敗のパターンはクラッシュしたジョブではない。労働市場とは何の関係もない理由で動くグラフこそが失敗なのだ。
ある地域の求人が今月18パーセント減少したとすると、説明は二つ考えられる。雇用主が募集する職種を減らしたか、収集が一部を取りこぼしたかだ。パイプラインの内側からは、区別できるように作っていない限り、この二つは見分けがつかない。これがインデックスを構築することと単に求人一覧を取得することを分ける点であり、ほとんどの求人サイトパネルが静かに間違った方向に進む場所でもある。
集計測定ではなく採用ワークフローに関心がある場合は、関連記事の採用と労働市場データのためのレジデンシャルプロキシを参照してほしい。本稿はパネルについて扱う。
カバレッジの欠落はトレンドのように見える
労働市場の系列データを特徴づけるのは、時間の経過とともに自分自身と比較されるという性質である。絶対数よりも変化量の方がはるかに重要であり、これは見える範囲の変化がそのまま存在するものの変化として記録されることを意味する。
実際には何も変わっていないのに、カバレッジを変化させてしまう要因が日常的に三つある。
部分的なブロック。 ある求人サイトがクエリごとに返す結果数を減らし始めたり、結果セットの深いページでチャレンジを課したりする。それでもデータは取得できるため何も壊れていないように見え、あなたのカウントは減少する。
地理的なずれ。 リクエストの発信元と見なされる場所が変わると、結果セットもそれに応じて変わる。ほとんどの求人サイトでは求人が近接性でフィルタリングされているため、これは地域ごとのカウントに直接影響する。
サイレントなページネーションの打ち切り。 かつては8ページ収集できていたのに、後半のページの方が強く防御されているために3ページしか収集できなくなる。量は減るが、どのページが消えたのか誰も気づかない。
これらはいずれも、きれいで、もっともらしく、間違った数値を生み出す。どれもエラーを発生させない。
求人は所在地に応じて配信される
主要な求人サイトのほぼすべてが、リクエストが発信されていると判断した場所に基づいてクエリを解決する。所在地を指定せずに「倉庫作業員」を検索すれば地域の結果が得られる。所在地を指定しつつ千マイル離れたIPからアクセスすると、地元の候補者が見るものでも全国的な視点でもない結果セットが得られる。
地域別の採用動向を測定しようとするパネルにとって、これが全てである。所在地シグナルは系列データの全履歴を通じて安定していなければならず、指定された所在地パラメータとリクエストの見かけ上の発信元との間で一貫している必要がある。測定対象の地域におけるレジデンシャルの出口は、この二つを一致させるものであり、それが操作上「地元の視点」であることの意味である。
関連する落とし穴はロケールの不一致で、IPはある国を示しているのにブラウザのヘッダーは別の国を示している状態だ。この不一致は国際的な求人サイトで結果セットを変化させるため、早めに解消しておく価値がある。詳細はプロキシのジオ、タイムゾーン、ロケールの一致にまとめてある。
パネルを設計してから収集する
労働市場データを使えるものにする規律とは、コレクターを書く前にパネルが何であるかを決め、それを軽々しく変更しないことである。
固定されたソースリスト。 一定に保たれた、定義済みの求人サイト群。系列の途中でサイトを追加すると、バックフィルするかバージョン管理をしない限り、雇用成長として読まれてしまう段差が生じる。
固定された地理的範囲。 各地域ごとに定義された所在地パラメータを持つ、定義済みの地域セット。「リクエストがどこから来たか」ではない。
固定されたクエリセット。 同じ職種クエリを、同じ方法で、同じ頻度で実行する。
固定された深さ。 クエリごとに定めた結果ページ数を、完全に収集するか、不完全として記録する。ベストエフォートは決して用いない。
これらのいずれかを変更することは方法論の変更であり、そのように記録し、各行にバージョン番号を刻印すべきである。アナリストは記録された断絶があれば対応できる。記録されていない断絶には対応できない。
収集レイヤーの構成
Shifterのゲートウェイでは、地域とセッションがp.shifter.io:443に対する認証情報の中にエンコードされる。
customer-USERNAME-country-gb-city-manchester-sid-mcr01-ttl-600:PASSWORDcountry-gbはISOアルファ2コードを使用しており、ukではなくgbである。city-manchesterは求人を測定している都市圏へと出口を絞り込む。sid-mcr01はスティッキーセッションを保持し、ページネーションを含む一つの完全なクエリが単一のIPから実行されるようにし、ttl-600はそのIPを10分間維持する。リクエストごとではなく地域とクエリごとにセッション識別子を持つことが、ページ分割された結果セットを内部的に一貫させる鍵となる。
地域と都市によるフィルタが狭すぎて満たせない場合、ゲートウェイは近隣の出口で代替するのではなく502を返す。測定用パネルにとってはこれが正しい挙動だ。見えている欠測観測値の方が、見えないサイレントな代替よりも優れている。
収集の頻度は安定しており、目立たないものであるべきだ。一定の時間帯における日次または週次の収集を、適度な同時実行数と実際のバックオフエラー処理とともに行うことで、積極的な一斉収集よりもクリーンな系列が得られ、防御機構を刺激してカバレッジを変化させてしまう可能性もはるかに低くなる。仕組みの詳細はレートリミットとリクエストスロットリングにまとめてある。
重複排除は測定に関する判断である
同じ求人が複数の求人サイトや企業の採用ページに掲載され、さらに2週間後に再掲載として現れることは珍しくない。これをどう解決するかがインデックスが実際に何を測定するのかを決定づけ、中立的な選択というものは存在しない。
現実的なアプローチは、正規化された雇用主名、正規化された職種名、所在地、掲載日ウィンドウを組み合わせた複合キーを用い、各統合について判断を記録することである。特定のアルゴリズムそのものよりも重要なのは、ルールが固定され、文書化され、全履歴を通じて同一に適用されることだ。重複排除ロジックを遡って変更することは過去を書き換えることになり、過去が変わり続ける労働市場系列は系列とは呼べない。
再掲載には独自の扱いが必要だ。毎月再掲載される職種は、埋めるのが難しい欠員か、常時掲載されている求人のどちらかであり、どちらも興味深いものだが、それは新規需要と区別できる場合に限る。
カバレッジを想定するのではなく検証する
自分の収集を測定できるパネルと、そうでないパネルとを分ける唯一の実践は、求人そのものだけでなく自分の収集を測定することである。
同一地域内の異なる二つの出口から、収集ウィンドウごとに小さな制御用クエリセットを二回実行し、結果件数を比較する。一致していれば視点は安定している。乖離があれば、求人サイトがリクエストの何かに反応している証拠であり、そのウィンドウの系列は疑わしい。
運用上の指標もデータ自体と並行して追跡する。求人サイトごとの成功率、期待されたページ数に対する収集済みページ数、クエリごとの結果件数の時系列推移だ。求人数の20パーセントの減少が自分自身の成功率の低下と一致する場合、それは労働市場の話ではなく収集の話であり、それを誰かが予測モデルに組み込む前に、どちらを見ているのかを把握しておく必要がある。
収集レイヤー自体について弁明可能な基準値が必要なチームには、プロキシの速度、成功率、位置精度のテストが測定面をカバーしている。
データの扱いにおいて正しい側に立つ
求人情報は人々に読まれるために公開されており、それは収集することの正当な根拠になるが、無制限というわけではない。
求人情報にはしばしば実名の採用担当者、直通電話番号、メールアドレスが含まれる。それは個人データであり、採用需要のインデックスにそれらは必要ない。取り込み時に除去すべきであり、保存した上で使わないと約束するのではだめだ。公開するものは集計し、各求人サイトの明記された利用規約を尊重し、リクエスト量を適切に保ち、求人サイトが研究アクセス用の経路を用意している場合は自分のトラフィックを正直に識別する。
一般的な枠組みはAIデータ収集のための倫理的なレジデンシャルプロキシにまとめてあり、労働市場に関する作業はほとんどの商業データ収集よりも個人に近いところに位置するため、ここではより強く当てはまる。
FAQ
信頼できる全国規模のパネルには何地域必要か?
単一の都市圏が集計値を支配せず、最初の観測から一貫していれば十分だ。適切に選ばれた10地域を1年間一貫して収集する方が、40地域を3か月間ばらばらに収集するよりも優れている。
給与フィールドは収集すべきか?
すべきであり、生の文字列を解析済みの値と並べて保存すべきだ。給与開示は法域や求人サイトによって異なるため、給与データを含む求人の割合が増加する場合、それは市場の変化というより方針の変化であることが多く、それを見分けるには生のテキストが必要だ。
なぜ公開APIを持つ単一の求人サイトを使わないのか?
一つの求人サイトのカバレッジはその求人サイト独自のビジネスであり、求人全体に占めるシェアは時間とともに変動するからだ。単一ソースの系列はそのソースを測定しているにすぎない。それが許容できるかどうかは、何を主張しようとしているかによる。
これは国際的なカバレッジにも通用するか?
通用する。国ごとの出口と、それに一致するロケール設定を用いればよい。ほとんどの市場では全国的な求人サイトが優勢になると想定でき、それはソースリストを変えるだけで方法自体は変わらない。関連情報は採用のユースケースにある。
結論
求人サイトのデータが労働市場インテリジェンスになるのは、自分のパイプラインが引き起こした変動も含めて、系列内のあらゆる変動を説明できる時点である。それには固定されたパネル、地理的に一貫した収集、安定した重複排除ルール、そして正直なカバレッジ指標が必要だ。
レジデンシャルプロキシは、地理的側面を現実的で再現可能なものにし、地域ごとの数値が言葉通りの意味を持つようにする要素である。残りは方法論であり、方法論こそがその数値を引用する価値のあるものにする。この形のパネルの帯域幅計画については月間レジデンシャルプロキシ帯域幅の見積もりで扱っており、料金はレジデンシャルプロキシの価格ページに記載されている。