这是 Beta 探索课程,内容结构、实验步骤和示例可能会继续调整。
完整系统
完整的风控反作弊系统可以分成五层:
数据采集层 -> 特征层 -> 策略层 -> 决策层 -> 处置与反馈层每一层解决一个问题:有没有证据、证据如何加工、如何判断风险、如何输出动作、效果如何回流。
最终架构
一次业务请求的在线流程如下:
- 业务服务提交风险事件,例如注册、登录、领券、下单。
- 风控服务读取实时特征:设备关联账号数、IP 频率、用户历史行为。
- 名单系统先判断是否命中白名单、黑名单或灰名单。
- 规则引擎执行可解释策略。
- 风险模型输出综合风险分。
- 决策引擎合并结果,生成放行、验证、限速、审核或拒绝动作。
- 决策结果写入日志,后续用于申诉、复盘和模型训练。
离线流程则负责训练模型、分析攻击、评估策略效果和同步特征。
关键决策
- 规则还是模型:规则上线快、可解释;模型能发现隐蔽模式。两者需要组合,而不是互相替代。
- 强拦截还是分级处置:强拦截损失小但误伤高,分级处置能在用户体验和风险控制之间平衡。
- 实时判断还是离线分析:实时链路负责当前请求,离线链路负责长期学习和策略迭代。
- 名单永久生效吗:不应该。大多数实体都需要过期时间和申诉机制。
- 故障时放行还是拦截:要按业务场景分级,不能全局一刀切。
指标体系
风控系统上线后,要同时看业务指标和风控指标:
- 拦截率:命中风险并采取动作的比例。
- 误杀率:正常用户被错误处置的比例。
- 漏放率:作弊行为未被拦截的比例。
- 策略延迟:风控决策耗时。
- 申诉通过率:反映误伤和策略质量。
- 损失金额:最终业务风险是否下降。
只看拦截率会诱导系统变得过于激进。真正好的风控是降低损失,同时把正常用户影响控制在可接受范围内。
上线检查清单
- 风控事件是否覆盖核心风险场景?
- 在线特征是否有延迟、命中率和降级监控?
- 规则是否支持灰度、回滚、版本审计?
- 模型是否经过影子模式和小流量验证?
- 名单是否有来源、过期时间和申诉处理?
- 决策结果是否可解释、可追踪、可复盘?
- 高风险业务是否定义了风控故障时的降级策略?
- 是否有误伤反馈和攻击样本回流机制?
课程总结
风控反作弊系统是一套持续对抗系统。攻击者会变化,业务规则会变化,正常用户行为也会变化。系统不能只依赖某条规则或某个模型,而要形成证据采集、策略判断、实时处置和反馈学习的闭环。
当你设计风控系统时,先问四个问题:
- 我们要保护什么业务资产?
- 当前有哪些可采集证据?
- 命中风险后应该采取多重动作?
- 误伤和漏放如何被发现并回流?
能持续回答这四个问题,风控系统才具备长期演进能力。