LLM不要硬当主分类器——风险评估中大模型与传统分类器协作落地实践
LLM不要硬当主分类器——风险评估中大模型与传统分类器的协作实践
很多团队直接拿LLM做信贷违约预测——POC阶段AUC惊艳,上线频频翻车。这篇文章给出一套务实方案:LLM做非结构化文本的特征加工,传统分类器(XGBoost/LightGBM/LR)承担核心风险决策——两类模型各干各擅长的事。
文章目录
一、风控圈的一个误区
大模型浪潮之下流行一种思路:把用户信息丢给LLM,Prompt一句"判断该用户会不会违约",输出风险概率直接用于审批。
POC阶段往往很美好——测试集AUC很高、KS亮眼。推到真实业务后问题接踵而至:
| 问题 | 具体表现 |
|---|---|
| 概率校准差 | 模型输出0.7违约概率,真实坏账率只有0.3 |
| 输出漂移 | prompt或基座版本轻微改动,结果就变 |
| 幻觉 | 凭空编造风险事实,无辜用户被误拒 |
| 成本高 | 每笔申请一次GPU推理,吞吐撑不住 |
| 不可解释 | 监管要拒贷理由,"大模型说的"过不了审 |
反观传统分类器——逻辑回归、XGBoost、LightGBM——拿到结构化表格数据,CPU几分钟训练完成,原生输出概率,AUC/KS/PSI/SHAP工具链完备,线上毫秒级推理,经过十几年金融业务验证。
那LLM就没价值了?不是。它真正的位置不是"裁判",是高级"卷宗整理员"。
正确范式:LLM做非结构化数据解析与特征工厂,传统分类器做最终风险打分与业务决策。二者协作,不是互相替代。
二、能力边界:各干各擅长的
传统判别式分类器的长短板
优势:
- 训练迭代快——几十万样本、几百维特征,数分钟完成训练+交叉验证。可以高频滚动重训对抗样本漂移,试错成本极低
- 原生概率输出——AUC/KS直接算,概率校准可控。风险定价、客群划分都依赖真实可信的概率
- 可观测体系成熟——PSI稳定性、特征重要性、SHAP归因,每笔拒绝都能输出可审计的拒贷理由
- 推理成本极低——CPU毫秒级,高通量审批压力下成本可控
短板: 只能消化结构化数值。面对客服对话、审批备注、申请自述这类自由文本束手无策——传统手段靠关键词和正则,大量隐性语义风险信号被白白浪费。
LLM的长短板
优势: 语义理解——从杂乱文本中挖掘隐藏风险信号,做文本抽取、语义打分、标签生成。
短板:
- 原生目标是预测下一个token,不是分类——直接prompt输出的"概率"是派生值,校准差
- 幻觉——无中生有编造事实,风控里"假阳性幻觉"直接伤害客户
- 输出漂移——prompt/版本/输入格式轻微改动,结果变化
- 工程链路重——即使LoRA微调,数据+算力+维护成本高,线上GPU推理开销大
- 单样本归因困难——很难输出监管认可的审计依据
一张对照表
| 维度 | 传统分类器 | 原生LLM(Prompt) | 微调LLM分类头 |
|---|---|---|---|
| 训练目标 | 分类损失 | 下一个token | 分类损失 |
| 输出 | 0~1风险概率 | 自由文本 | 类别概率 |
| AUC/KS | 直接计算 | 需要后处理映射 | 可计算 |
| 幻觉风险 | 无 | 高 | 较低 |
| 推理硬件 | CPU | GPU | GPU |
| 合规可解释 | 成熟 | 难 | 较难 |
三、协作架构:LLM特征工厂 + 分类器决策
整体链路:规则引擎 → LLM文本解析 → 特征库 → 传统风控主模型 → 业务决策。
① 原始多源数据输入
结构化:征信查询、历史逾期、消费行为、设备信息
非结构化:客服聊天记录、审批员备注、用户申请自述、催收对话
② LLM模块:非结构化→结构化
LLM接收原始文本,Prompt+JSON Schema约束输出:
{
"user_self_describe_hardship": 1,
"mentioned_multi_debt_platform": 1,
"repayment_will_score": 0.2,
"extract_confidence": 0.86
}
两道防护:
- 置信度过滤——低置信字段置空,不参与建模
- 证据校验——抽取结果必须能回溯原文片段,没有证据的作废——抑制幻觉
③ 特征入库与监控
LLM产出的新特征与原有征信/行为特征合并入特征库。关键纪律:LLM生成的字段和普通风控特征完全同等对待——监控PSI、缺失率、分布漂移,不默认输出可信。
④ 传统分类器训练主模型
XGBoost/LightGBM融合原有特征+LLM语义衍生特征训练违约预测。输出标准风险概率,算AUC/KS,做时间滑窗验证。
原本KS=0.615的主模型,引入LLM挖掘的文本信号后有机会进一步抬升——LLM的价值度量单位是"主模型KS涨了多少",不是"LLM自己AUC多高"。
⑤ 业务决策与迭代
审批阈值、拒绝判定全部来自传统分类器。拒贷理由由SHAP/特征分箱输出,监管可审计。按月滚动重训——利用分类器训练快的优势快速迭代。
一个比喻
LLM是读卷宗的书记员——把乱七八糟的手写笔录整理成标准化表格;XGBoost是经验丰富的老法官——拿着全部标准化证据给出最终判决。书记员再能干,不能代替法官判案。
四、什么时候微调,什么时候只Prompt
绝大多数文本抽取场景:Prompt工程+Few-Shot,不微调。 业务文本没有大量领域黑话时,写好JSON约束+证据校验就能拿到不错的抽取效果——避免微调的数据/算力/维护三项成本。
才考虑LoRA微调的条件:
- 业务文本大量内部黑话、行业专属话术,Prompt怎么调都不稳
- 有大量高质量标注抽取样本
- 微调目标依然是文本抽取任务——不是直接微调做违约分类
强烈不推荐:直接微调LLM分类头替换XGBoost做信贷核心主评分。投入巨大、收益边际、还背着幻觉+漂移+合规三重风险。
五、落地必须踩实的四个坑
① 幻觉是头号风险
原文没提负债,LLM输出"用户自述负债高"。应对三件套:
- 输出带置信度,低置信丢弃
- 强制附原文证据片段,无证据作废
- 持续抽样人工校验——宁可漏抽,不可错编风险事实
② LLM衍生特征的PSI漂移
prompt修改、基座升级会悄无声息改变语义特征分布。LLM产出的每一列特征,和查询次数、逾期天数一样纳入PSI监控——漂移即告警。
③ 线上推理成本策略
不要每笔申请都实时调LLM:
- 存量历史文本:离线批量跑抽取,预生成特征
- 线上实时链路:只对高风险可疑样本触发LLM调用——降低GPU QPS
④ 指标不能只看离线AUC/KS
POC离线惊艳上线失效是常态。必须做跨时间验证(训练集与测试集拉开时间窗)、跨客群切片验证——评估未来样本上的真实泛化。
六、什么场景LLM可以直接做主模型
四个条件全部满足才考虑:
- 核心风险信号绝大部分藏在非结构化文本,结构化特征极少
- 有大量高质量、跨周期的业务标注样本
- 业务能承受高额GPU推理成本
- 监管宽松,有充足人力建幻觉/漂移/可解释监控体系
常规信贷违约预测,这四条很难同时达成。
七、总结
- 不要拿LLM直接做风险主分类器——离线POC好看不等于业务可用,幻觉/校准/漂移/成本/合规全是拦路虎
- LLM在风控的最大ROI路径:非结构化数据清洗+文本抽取,产出结构化语义特征
- 决策交还给传统分类器——训练快、迭代快、推理廉价、指标原生、可解释合规
- LLM衍生特征必须与普通特征同等监控——PSI/缺失率/准确性,不能无条件信任大模型输出
大模型不是用来推翻原有成熟风控体系的,是给传统模型增加新弹药——实现1+1>2。
✅ 亮点:从"POC惊艳上线翻车"的真实落差切入,给出LLM特征工厂+分类器决策的完整协作架构,四个落地坑点各配应对手段,文末四条件清单划清LLM直接做主模型的边界。适合正在评估大模型进风控链路的技术负责人。扩展方向:LLM特征工程的Prompt模板设计、SHAP归因在监管报送中的实践、特征PSI监控平台搭建。
更多推荐
所有评论(0)