人才情报团队通常会被问到同一个问题的不同版本:这家公司实际上是如何组织的,哪里存在我们可以招聘或销售的空缺?
本能的做法是去寻找组织架构图,仿佛它是某个地方现成存放的文档。但事实并非如此。你能从公开来源构建出的,是一个结构模型,由证据拼装而成,一部分是你确知的,一部分是你推断的。这个区别很重要,因为把模型当作文档呈现,正是人才地图出错的地方。
从边界开始,而不是从来源开始
这是关于人的工作,所以约束条件应该放在前面,而不是放在最后作为一段合规文字。
可辩护的人才地图版本描述的是组织结构:存在哪些职能、层级有多深、团队大致规模、招聘正在哪里发生、技能集中在何处。它使用的是组织自己公开发布的信息。
而让团队陷入麻烦的版本则是构建个人档案:汇总具名个人的私人信息、因为技术上可见就收集联系方式、或者从条款禁止自动化的平台上抓取登录后的内容。根据GDPR及类似法规,个人数据就是个人数据,无论它是否容易找到,“它是公开的”本身并不构成合法依据。
两条实用规则能让工作保持干净。只要角色本身就能回答问题,就在角色层面收集信息,因为”存在一位平台工程总监,向基础设施部门汇报”通常就是你需要的事实,而不是谁担任这个职位。而在确实需要记录具名个人时,比如领导层页面点了名,就只保留公司在那个职业语境下自己公布的内容,其余的在采集时就全部剔除。
真正承载结构的来源
大多数公开来源的组织地图构建自六种输入,它们在信号质量上差异很大。
**招聘信息。**最强的单一来源,而且一直被低估。招聘信息经常直接说明汇报关系(“向数据副总裁汇报”)、指出团队名称、描述相邻职能,并列出团队使用的工具。招聘信息还带有日期,这使它成为关于”现在”而不是”档案上次更新时”的证据。按职能统计的招聘量是判断团队增长方向的良好代理指标。这类信息源的采集机制在招聘平台数据与劳动力市场情报中有涉及。
**公司领导层和团队页面。**对最高两个层级具有权威性,但通常对下面的层级保持沉默。在存在的地方,值得当作基准事实来对待,因为公司是有意发布的。
**新闻稿和任命公告。**对高层变动非常有效,而且附带日期。这是你能提早捕捉到重组的地方,因为新职能通常会先被宣布,才会在其他地方出现。
**监管备案文件。**国家公司注册处中的高管和董事信息,以及上市公司备案中的等同信息。范围狭窄,可靠性高,而且往往是跨子公司验证法律实体结构的唯一可核实来源。
**会议演讲和技术出版物。**演讲者名单、发表的论文和专利,将具名专家置于具名团队之中,它们揭示的是公司实际在构建什么,而不是其营销话语所说的内容。
**开源和公开技术活动。**组织层面的代码仓库和贡献模式可以指示团队构成和技术栈。应在团队层面解读,而不是作为针对个人的生产力信号。
把证据转化为结构
组装这一步是纪律性发挥作用的地方,归结为区分你观察到的内容和你推断出的内容。
**从职位名称推层级,要谨慎。**职位命名惯例因公司和国家而异。一家公司的”总监”可能对应另一家公司的”高级经理”所处的位置。应对照你自己内部的资历等级来规范化,而不是轻信字面意思,并将原始职位与规范化后的职位一并记录。
**团队规模看招聘,而不是看人数声明。**某职能连续多个季度持续的招聘量,比任何公布的数字都更能说明真实团队规模和发展轨迹。
**汇报关系只在有明确说明时才记录。**这是大多数地图放弃的纪律。如果一则招聘信息说该角色向某具名职能汇报,那是一项观察。如果你是因为职位名称看起来相邻而推断出来的,那是一项推断,必须标注为推断。
最终结构中的每一个节点都应携带三项信息:来源、观察日期和置信水平。一份把经备案核实的高管和猜测出的汇报关系呈现得一模一样的地图,终将让展示它的人难堪。
组织数据的衰减速度快于几乎任何其他数据
重组、离职和改名持续不断地发生,而这些都不会产生通知。
一份人才地图在构建完成当天是准确的,从下一天起就开始退化。应把每个节点当作带时间戳的观察,设定明确的过期阈值,按计划重新观察,而不是构建一次后就用一整年。对于快速变化的公司,一个季度就已经算长了。
由此推论,时效性应该对使用地图的人可见。一个上次确认于十一个月前的节点,应该与上周确认的节点看起来不一样。
采集层
这些来源的三个特性使传输方式变得重要。
招聘信息和注册处数据是按地理位置过滤的,因此从美国的观察点看,一家公司的德国组织可能是不可见的。如果你声称拥有国际覆盖能力,采集就必须来自那些市场。结果集是分页的,而有意思的职位很少出现在第一页。而且这些都是普通的网页,有普通的速率限制。
使用Shifter网关时,观察点和会话信息写在针对p.shifter.io:443的凭据中:
customer-USERNAME-country-de-city-munich-sid-map-4412-ttl-600:PASSWORD
country-de和city-munich将请求定位到正确的市场,sid-map-4412在整个查询过程中(包括分页)保持同一出口,ttl-600让该地址保持十分钟。每次查询使用一个会话,而不是每次请求使用一个会话,这正是保持分页结果集内部一致性的关键。
节奏应该保持平稳和适度,而不是突发式的,并在出错时采取真正的退避策略,详见速率限制与请求节流。这项工作的产品视角见招聘与人才页面,招聘方视角的配套内容是面向招聘与就业市场数据的住宅代理。
公开来源地图做不到的事
对局限性保持诚实,才使其他部分可信。
它无法证明一条无人公布的汇报关系。它看不到非正式结构,而在大多数组织中,这才是实际决定决策的东西。它无法告诉你谁掌握预算。它也不能替代与公司内部人员的一次交谈,那仍然是了解大多数关键信息的唯一途径。
它能做到的是告诉你存在哪些职能、大致规模和层级深度、招聘集中在哪里、技能聚集在何处,以及何时发生了变化。对于大多数人才情报和市场拓展方面的问题,这就是有用的部分。
常见问题
我能直接抓取一个职业社交网络来做这件事吗?
不能在登录后进行,也不能在条款禁止自动化的地方进行。这条路径也最容易产生你没有依据持有的个人数据。上面提到的来源是公开的,而登录后的个人资料信息流并非如此。
公开来源的组织架构图能达到多高的准确度?
最高两个层级通常是可靠的,因为公司会公布它们。中间层级是带有不同置信度的推断。再往下,你描述的是职能和团队规模,而不是个人,这通常已经足够。
最小可行版本是什么?
针对一家公司的招聘信息,按照你的资历等级规范化,明确说明的汇报关系记为观察,其余全部记为推断。仅凭这一点就能回答大多数结构性问题。
我如何避免持有不必要的个人数据?
在采集时就做决定,而不是在存储时。如果问题能靠角色本身回答,就不要写下姓名。作为惯例,从招聘文本中剔除联系方式,因为招聘人员的电话号码从来不是你要找的东西。
结论
用公开来源构建的组织架构图是一个带有置信水平的模型,以这种形式呈现,它确实有用。而一旦它被当作事实呈现,或者滑向收集人而不是描述结构,它就变成了一种负担。
在角色层面开展工作,为每个节点记录来源和日期,将观察与推断分开,从公司实际运营的市场采集数据,并按计划重新观察。采集层的费率见定价页面。