另类数据,即位于传统财务报表之外的网络来源信号,已成为对冲基金、资产管理公司和股票研究人员的核心输入。产品价格和库存水平、招聘发布速度、应用商店评论和排名、市场平台商品列表、促销节奏:如果解读正确且够早,这些信号会先于财报出现变化。这种优势是真实存在的,但它完全依赖于一个脆弱的假设:你收集到的数据,就是真实客户实际会看到的数据。
这个假设会悄无声息地失效。网络信号具有地理个性化特征,受到反机器人系统的防护,并且只有在数据序列长期完整且干净时才具有可交易性。如果你从一个数据中心 IP 或单一地点收集这些信号,得到的将是一幅失真且充满缺口的画面,它看起来像数据,但并不反映市场真实情况。这正是住宅代理发挥作用的地方:它们让研究团队能够像真实本地用户一样收集网络信号,而这是让另类数据真正变得可以据以投入资本的唯一方式。
另类数据收集究竟涉及什么
从本质上讲,另类数据研究是系统性地在公开网络上收集非传统信号,并将其转化为模型可以据以交易的时间序列。常见来源包括:
- 价格与库存 — 零售商和市场平台上的产品价格、折扣力度和库存水平,直接反映需求和收入情况。(这一领域与用于价格监控的住宅代理有所重叠。)
- 招聘信号 — 职位发布数量和速度,作为公司扩张或收缩的代理指标。
- 消费者情绪与互动 — 应用商店排名和评论、评分趋势,以及大规模的产品反馈。
- 市场与商品列表活动 — 公司所依赖平台上的供应、售罄率和品类变化。
- 网络存在与推广 — 定价页面变化、营销活动节奏,以及暗示战略方向的目录变动。
所有这些都取决于捕捉到在真实市场中向真实用户实际公开发布的内容。而所发布的内容,完全取决于网站认为访问者是谁。
为什么这是一个代理问题
网络来源信号的三个特性,使另类数据收集变成了一个数据质量问题,而这个问题恰恰落在代理层面上;在这个领域,数据质量就是产品本身。
信号具有地理个性化特征。 价格、库存情况、排名,乃至哪些产品存在,都因国家和地区而异。零售商向美国购物者展示的价格,与向德国购物者展示的不同;应用的排名是按各地应用商店分别计算的。如果你只从一个地点收集所有数据,那么你在为一个全球性论点建模的同时,实际上只测量了一个市场,这是一种会悄悄侵蚀信号的微妙偏差。要看到每个市场的真实客户所看到的内容,就必须从该市场进行数据收集。(城市级定位何时重要一文对区域定价商品同样适用。)
数据源会防范自动化访问。 你所抓取的零售商、市场平台和应用商店都运行着强力的反机器人系统。数据中心 IP 会被立即识别并遭到验证码、封锁,或者被展示与真实用户不同的页面,于是你记录到的是信号的机器人版本,而非真实版本。(爬虫为何会被封锁一文详细介绍了其机制。)对于交易信号而言,这比没有数据更糟,因为这是错误的数据却被当作事实呈现。
时间上的完整性至关重要。 一个可交易的信号必须是一个干净、连续的序列:同一组 SKU、商品列表或公司,以相同方式逐日测量。要在众多来源和市场中完成这项收集,需要大量的请求。如果只用少数几个 IP,就会触发速率限制,得到一个片面且带有偏差的样本,你的序列会恰好在数据源做出反制的地方出现缺口,而这些不连续性正是会破坏回测的关键所在。
以上三个问题的解决方案是一致的:使用看起来像真实本地用户的 IP,覆盖你研究论点所涉及的每一个市场,做到完整且持续的收集。
住宅代理适用于何处
住宅代理会通过真实的消费者 IP 来路由你的收集请求,因此数据源对你的响应方式,会与对待真实本地客户一样。对另类数据而言,这一点能同时带来多项好处:
真实信号,而非机器人版本。 由于住宅 IP 携带真实用户的信任度,你捕获到的是真实客户所看到的实际价格、排名和商品列表,而不是提供给可疑流量的降级或封锁版本。这就是可以据以确定仓位规模的信号,与伪装成数据的噪音之间的区别。
按市场进行地理真实的数据收集。 借助精确到国家和城市的地理定位,你可以像该市场的用户一样收集每一个信号,从美国收集美国定价,从德国收集德国库存情况,每一项都按照采集视角进行标注。这样一来,你的跨市场论点就建立在跨市场数据之上,而不是从单一地点外推得出。
完整、连续的序列。 一个庞大的轮换 IP 池能够分散请求,使你能够长期跨多个来源和市场进行测量,而不会被封锁或触发速率限制,从而保持序列连续而非充满缺口,这正是使其可回测的关键。(与用于数据收集的住宅代理相同的采集质量原则同样适用于此。)
简而言之:住宅代理把“我们碰巧抓取到的数字”变成了“真实客户在每个地方、每一天都会看到的数字”。这种可靠性正是这项工作的关键所在,因为对于资本决策而言,标准就是能够站得住脚的数据。(关于为何住宅代理在此优于数据中心代理,请参见住宅代理与数据中心代理对比。)
工作原理
在 Shifter 网关上,你可以通过在代理用户名中进行编码来定位目标市场,只需一个端点,无需管理 IP 列表:
# 以美国购物者身份收集零售商的定价信息
curl -x customer-USERNAME-country-us:PASSWORD@p.shifter.io:443 https://retailer-or-marketplace.example
# 当定价或库存情况具有地域性时,可细化到城市级别
curl -x customer-USERNAME-country-de-city-berlin:PASSWORD@p.shifter.io:443 https://retailer-or-marketplace.example
对于广泛、持续的数据收集,可在 IP 池中轮换;而当数据源需要在多步骤流程中保持一致身份时,则可以保持粘性会话。同一个网关,每次请求采用不同的定位方式,为你的数据团队所运行的任何收集和建模流程提供数据。由于 IP 池质量决定了你所获得的响应内容,了解IP 信誉有助于你保持序列的干净整洁。若要将这些信号整合成可供研究使用的面板数据,如何通过网络抓取构建数据集一文涵盖了结构化方面的内容。
负责任地使用
另类数据收集所处理的是面向公众的信息,即任何客户都能看到的价格、商品列表和排名。这使其立足于坚实的基础,但仍需负责任地进行:只收集公开数据,遵守各数据源的服务条款和速率限制,不要降低你所请求的服务的性能,并且要远离个人数据以及任何非公开的内容,这在该领域也涉及重大非公开信息和合规方面的考量。代理改变的是请求来自哪个 IP,而不是你是否应该发出这个请求;我们的可接受使用政策是关于 Shifter 上允许行为的权威依据。
常见问题
为什么另类数据需要住宅代理? 因为网络信号具有地理个性化特征,并且受到防护。如果只从一个地点或数据中心 IP 采集,你看到的只是某一个市场的数据(或者是被封锁/验证码拦截后的版本),这会使序列产生偏差或损坏。住宅代理让你能够收集到真实本地客户所看到的真实、地理真实的信号,覆盖你研究论点所涉及的每一个市场。
没有代理,抓取到的数据难道还不够好吗? 只有在数据准确且完整的情况下才够好,而没有住宅 IP 时,通常做不到这一点。数据中心采集会得到备用页面或被封锁的页面,单一地点的采集则会遗漏地理个性化信息。对于交易信号而言,这就是错误的数据,比没有数据更糟。
代理可以帮助收集哪些信号? 价格和库存、招聘和职位发布速度、应用排名和评论、市场商品列表和售罄情况,以及促销节奏,任何具有地理个性化特征或受到防护的公开网络信号都能从住宅数据收集中受益。
投资研究应使用住宅代理还是数据中心代理? 住宅代理。数据源会检测并区别对待数据中心 IP,因此数据中心代理会给你带来失真或被封锁的视图。住宅 IP 能看到真实客户所看到的真实、地理准确的数据,而这正是可交易信号所要求的标准。
收集另类数据合法吗? 另类数据通常处理的是公开信息,只要负责任地进行(遵守服务条款和速率限制,避免涉及个人数据),这在很大程度上是没有问题的。这一领域在非公开信息方面也存在合规考量。代理并不会改变基础活动本身的合法性;对于任何不确定的情况,请寻求法律和合规方面的建议。
结论
另类数据只有在数据正确的情况下才能构成优势,而网络来源的信号具有地理个性化特征、受到防护,一旦序列出现缺口就毫无价值。由于你所建模的市场无法从某个办公室的 IP 中看到,你需要像真实本地客户一样,在你交易涉及的每一个市场中完整且持续地收集数据,而这正是住宅代理所提供的:真实信号而非机器人版本、地理真实的覆盖,以及一条可供回测的完整序列。
如果你的基金或研究团队从网络构建信号,那么一个高质量的住宅代理网络就是让数据经得起检验、而不仅仅是数量众多的接入层。IP 池的质量决定了序列的完整性和干净程度,因此在评估时值得了解一下IP 信誉。定价页面提供了按 GB 计费的方案,供你针对研究论点所依赖的数据源和市场进行试用。