这是 Beta 探索课程,内容结构、实验步骤和示例可能会继续调整。
数据采集层
风控判断依赖证据。没有数据采集层,规则和模型都只是猜测。数据采集层的目标是把用户在系统中的关键行为转成可分析、可关联、可追踪的风险事件。
采集什么
一次登录或下单事件,至少可以采集五类信息:
| 类型 | 示例 |
|---|---|
| 用户信息 | user_id、账号年龄、实名认证状态 |
| 设备信息 | device_id、浏览器指纹、系统版本、模拟器特征 |
| 网络信息 | IP、ASN、地域、代理特征 |
| 行为信息 | 点击路径、停留时间、输入速度、请求频率 |
| 业务信息 | 订单金额、优惠券、收货地址、支付方式 |
这些数据单独看可能不异常,组合起来才有判断价值。例如一个新账号、同一设备、机房 IP、连续领取优惠券,就比单个维度更可疑。
事件模型
风控事件要结构化。不要只记录一段文本日志,而要定义统一字段:
配置要点
- 配置表达的是环境差异和运行参数,不是业务规则本身。
统一事件模型能让规则、模型、审计和回放共用同一份数据。
在线与离线
采集数据会进入两条链路:
- 在线链路:低延迟进入实时检测,用于拦截当前请求。
- 离线链路:进入数据仓库,用于训练模型、分析策略效果和复盘攻击。
在线链路关注毫秒级延迟和稳定性,不能塞入过重逻辑;离线链路关注数据完整性和可回溯性,可以做更复杂的分析。
隐私与合规
风控数据很敏感。设备指纹、IP、地址、手机号都需要严格控制:
- 最小化采集,只采集风险判断必要字段。
- 对敏感字段脱敏或加密存储。
- 记录策略访问和数据查询审计。
- 明确数据保留周期,过期自动删除。
数据采集层建好后,风控系统才有证据来源。下一章我们会先用规则引擎处理已知风险。