数据采集层

风控判断依赖证据。没有数据采集层,规则和模型都只是猜测。数据采集层的目标是把用户在系统中的关键行为转成可分析、可关联、可追踪的风险事件。

采集什么

一次登录或下单事件,至少可以采集五类信息:

类型示例
用户信息user_id、账号年龄、实名认证状态
设备信息device_id、浏览器指纹、系统版本、模拟器特征
网络信息IP、ASN、地域、代理特征
行为信息点击路径、停留时间、输入速度、请求频率
业务信息订单金额、优惠券、收货地址、支付方式

这些数据单独看可能不异常,组合起来才有判断价值。例如一个新账号、同一设备、机房 IP、连续领取优惠券,就比单个维度更可疑。

事件模型

风控事件要结构化。不要只记录一段文本日志,而要定义统一字段:

配置要点

  • 配置表达的是环境差异和运行参数,不是业务规则本身。

统一事件模型能让规则、模型、审计和回放共用同一份数据。

在线与离线

采集数据会进入两条链路:

  • 在线链路:低延迟进入实时检测,用于拦截当前请求。
  • 离线链路:进入数据仓库,用于训练模型、分析策略效果和复盘攻击。

在线链路关注毫秒级延迟和稳定性,不能塞入过重逻辑;离线链路关注数据完整性和可回溯性,可以做更复杂的分析。

隐私与合规

风控数据很敏感。设备指纹、IP、地址、手机号都需要严格控制:

  • 最小化采集,只采集风险判断必要字段。
  • 对敏感字段脱敏或加密存储。
  • 记录策略访问和数据查询审计。
  • 明确数据保留周期,过期自动删除。

数据采集层建好后,风控系统才有证据来源。下一章我们会先用规则引擎处理已知风险。