LLM不要硬当主分类器——风险评估中大模型与传统分类器的协作实践

很多团队直接拿LLM做信贷违约预测——POC阶段AUC惊艳,上线频频翻车。这篇文章给出一套务实方案:LLM做非结构化文本的特征加工,传统分类器(XGBoost/LightGBM/LR)承担核心风险决策——两类模型各干各擅长的事。


一、风控圈的一个误区

大模型浪潮之下流行一种思路:把用户信息丢给LLM,Prompt一句"判断该用户会不会违约",输出风险概率直接用于审批。

POC阶段往往很美好——测试集AUC很高、KS亮眼。推到真实业务后问题接踵而至:

问题 具体表现
概率校准差 模型输出0.7违约概率,真实坏账率只有0.3
输出漂移 prompt或基座版本轻微改动,结果就变
幻觉 凭空编造风险事实,无辜用户被误拒
成本高 每笔申请一次GPU推理,吞吐撑不住
不可解释 监管要拒贷理由,"大模型说的"过不了审

反观传统分类器——逻辑回归、XGBoost、LightGBM——拿到结构化表格数据,CPU几分钟训练完成,原生输出概率,AUC/KS/PSI/SHAP工具链完备,线上毫秒级推理,经过十几年金融业务验证。

那LLM就没价值了?不是。它真正的位置不是"裁判",是高级"卷宗整理员"。

正确范式:LLM做非结构化数据解析与特征工厂,传统分类器做最终风险打分与业务决策。二者协作,不是互相替代。


二、能力边界:各干各擅长的

传统判别式分类器的长短板

优势:

  1. 训练迭代快——几十万样本、几百维特征,数分钟完成训练+交叉验证。可以高频滚动重训对抗样本漂移,试错成本极低
  2. 原生概率输出——AUC/KS直接算,概率校准可控。风险定价、客群划分都依赖真实可信的概率
  3. 可观测体系成熟——PSI稳定性、特征重要性、SHAP归因,每笔拒绝都能输出可审计的拒贷理由
  4. 推理成本极低——CPU毫秒级,高通量审批压力下成本可控

短板: 只能消化结构化数值。面对客服对话、审批备注、申请自述这类自由文本束手无策——传统手段靠关键词和正则,大量隐性语义风险信号被白白浪费。

LLM的长短板

优势: 语义理解——从杂乱文本中挖掘隐藏风险信号,做文本抽取、语义打分、标签生成。

短板:

  1. 原生目标是预测下一个token,不是分类——直接prompt输出的"概率"是派生值,校准差
  2. 幻觉——无中生有编造事实,风控里"假阳性幻觉"直接伤害客户
  3. 输出漂移——prompt/版本/输入格式轻微改动,结果变化
  4. 工程链路重——即使LoRA微调,数据+算力+维护成本高,线上GPU推理开销大
  5. 单样本归因困难——很难输出监管认可的审计依据

一张对照表

维度 传统分类器 原生LLM(Prompt) 微调LLM分类头
训练目标 分类损失 下一个token 分类损失
输出 0~1风险概率 自由文本 类别概率
AUC/KS 直接计算 需要后处理映射 可计算
幻觉风险 较低
推理硬件 CPU GPU GPU
合规可解释 成熟 较难

三、协作架构:LLM特征工厂 + 分类器决策

整体链路:规则引擎 → LLM文本解析 → 特征库 → 传统风控主模型 → 业务决策

① 原始多源数据输入

结构化:征信查询、历史逾期、消费行为、设备信息
非结构化:客服聊天记录、审批员备注、用户申请自述、催收对话

② LLM模块:非结构化→结构化

LLM接收原始文本,Prompt+JSON Schema约束输出:

{
  "user_self_describe_hardship": 1,
  "mentioned_multi_debt_platform": 1,
  "repayment_will_score": 0.2,
  "extract_confidence": 0.86
}

两道防护:

  • 置信度过滤——低置信字段置空,不参与建模
  • 证据校验——抽取结果必须能回溯原文片段,没有证据的作废——抑制幻觉

③ 特征入库与监控

LLM产出的新特征与原有征信/行为特征合并入特征库。关键纪律:LLM生成的字段和普通风控特征完全同等对待——监控PSI、缺失率、分布漂移,不默认输出可信。

④ 传统分类器训练主模型

XGBoost/LightGBM融合原有特征+LLM语义衍生特征训练违约预测。输出标准风险概率,算AUC/KS,做时间滑窗验证。

原本KS=0.615的主模型,引入LLM挖掘的文本信号后有机会进一步抬升——LLM的价值度量单位是"主模型KS涨了多少",不是"LLM自己AUC多高"

⑤ 业务决策与迭代

审批阈值、拒绝判定全部来自传统分类器。拒贷理由由SHAP/特征分箱输出,监管可审计。按月滚动重训——利用分类器训练快的优势快速迭代。

一个比喻

LLM是读卷宗的书记员——把乱七八糟的手写笔录整理成标准化表格;XGBoost是经验丰富的老法官——拿着全部标准化证据给出最终判决。书记员再能干,不能代替法官判案。


四、什么时候微调,什么时候只Prompt

绝大多数文本抽取场景:Prompt工程+Few-Shot,不微调。 业务文本没有大量领域黑话时,写好JSON约束+证据校验就能拿到不错的抽取效果——避免微调的数据/算力/维护三项成本。

才考虑LoRA微调的条件:

  • 业务文本大量内部黑话、行业专属话术,Prompt怎么调都不稳
  • 有大量高质量标注抽取样本
  • 微调目标依然是文本抽取任务——不是直接微调做违约分类

强烈不推荐:直接微调LLM分类头替换XGBoost做信贷核心主评分。投入巨大、收益边际、还背着幻觉+漂移+合规三重风险。


五、落地必须踩实的四个坑

① 幻觉是头号风险

原文没提负债,LLM输出"用户自述负债高"。应对三件套:

  • 输出带置信度,低置信丢弃
  • 强制附原文证据片段,无证据作废
  • 持续抽样人工校验——宁可漏抽,不可错编风险事实

② LLM衍生特征的PSI漂移

prompt修改、基座升级会悄无声息改变语义特征分布。LLM产出的每一列特征,和查询次数、逾期天数一样纳入PSI监控——漂移即告警。

③ 线上推理成本策略

不要每笔申请都实时调LLM:

  • 存量历史文本:离线批量跑抽取,预生成特征
  • 线上实时链路:只对高风险可疑样本触发LLM调用——降低GPU QPS

④ 指标不能只看离线AUC/KS

POC离线惊艳上线失效是常态。必须做跨时间验证(训练集与测试集拉开时间窗)、跨客群切片验证——评估未来样本上的真实泛化。


六、什么场景LLM可以直接做主模型

四个条件全部满足才考虑:

  1. 核心风险信号绝大部分藏在非结构化文本,结构化特征极少
  2. 有大量高质量、跨周期的业务标注样本
  3. 业务能承受高额GPU推理成本
  4. 监管宽松,有充足人力建幻觉/漂移/可解释监控体系

常规信贷违约预测,这四条很难同时达成。


七、总结

  1. 不要拿LLM直接做风险主分类器——离线POC好看不等于业务可用,幻觉/校准/漂移/成本/合规全是拦路虎
  2. LLM在风控的最大ROI路径:非结构化数据清洗+文本抽取,产出结构化语义特征
  3. 决策交还给传统分类器——训练快、迭代快、推理廉价、指标原生、可解释合规
  4. LLM衍生特征必须与普通特征同等监控——PSI/缺失率/准确性,不能无条件信任大模型输出

大模型不是用来推翻原有成熟风控体系的,是给传统模型增加新弹药——实现1+1>2。


✅ 亮点:从"POC惊艳上线翻车"的真实落差切入,给出LLM特征工厂+分类器决策的完整协作架构,四个落地坑点各配应对手段,文末四条件清单划清LLM直接做主模型的边界。适合正在评估大模型进风控链路的技术负责人。扩展方向:LLM特征工程的Prompt模板设计、SHAP归因在监管报送中的实践、特征PSI监控平台搭建。

更多推荐