长文详解大语言模型在表格数据上的应用:预测、生成与理解
大语言模型在表格数据上的应用:预测、生成与理解
本文为Large Language Models (LLMs) on Tabular Data: Prediction, Generation, and Understanding - A Survey文献笔记,聚焦大型语言模型(LLMs)在表格数据相关任务中的应用,涵盖预测、生成、理解三大核心方向,系统梳理了技术、数据集、指标及未来方向,为该领域研究与实践提供全面参考。
目录
必读:
- 2.2(表格压缩处理)
- 2.3(提示工程、含RAG 融合策略)
- 5.3.2(表格理解任务的QA问题、关键组件 多粒度检索设计)、5.3.3(多轮检索),即表格的 “检索预处理→检索器设计→结果融合→多轮迭代全链路技术;
次优先级:
- 2.1(序列化格式,表格转文本)
- 5.1(QA数据集)
核心目标:从文档中提取 “表格数据的检索粒度、检索器类型、序列化格式、多轮交互策略”,形成表格检索增强生成的技术方案,并基于文档提供的数据集与基线方法(如 DTR、BM25+Contriever)快速验证效果

一、引言与基础概念
1. 表格数据的核心特征与挑战
表格数据作为结构化数据的典型形式,广泛应用于金融、医疗、商业等领域,但其特性给建模带来独特挑战,具体如下:
| 特征 | 描述 | 挑战案例 |
|---|---|---|
| 异质性 | 包含分类、数值、二进制、文本等多种特征类型 | 需同时处理高基数分类特征(如用户ID)与 dense 数值特征(如收入) |
| 稀疏性 | 现实场景中常存在类别不平衡、缺失值,导致训练样本长尾分布 | 医疗临床试验数据中罕见病样本少,欺诈检测中异常交易占比低 |
| 预处理依赖性 | 预处理(归一化、编码、缺失值填充)对任务至关重要,且需适配场景 | one-hot编码可能导致维度爆炸,序数编码可能引入虚假顺序关系 |
| 上下文关联性 | 特征间存在隐性关联(如年龄与学历、法定饮酒年龄) | 回归模型中纳入高度相关特征会导致系数偏差 |
| 顺序无关性 | 样本与特征的排序不影响数据本质,与文本(词序敏感)、图像(像素位置敏感)不同 | 基于位置的CNN等模型难以直接适配表格数据 |
| 缺乏先验知识 | 无图像的空间结构、音频的时间结构等先验信息,难以捕捉特征内在关系 | 模型无法通过“相邻像素相关性”这类先验辅助学习 |
一些名词解释:
- 高基数分类特征与dense 数值特征:用户ID独一无二,会产生维度过高的稀疏矩阵,而收入具有连续数值,且变化较为密集
- 长尾分布,如果把电影按照票房从高到低排列,然后画一个统计图,就会发现这个统计图有一个高高的山峰(代表高票房的少数大片),后面跟着一条长长的尾巴(代表数量众多的低票房小众电影),这就是长尾分布。
- one-hot编码,就比如把动物园里的各种动物用数字编码记录在表格里,但要是动物园里动物特别多,有 1000 种。就会“维度爆炸”;序数编码,如记录人的职业(教师、医生、工人),如果用序数编码,就会给模型造成一种 “教师 < 医生 < 工人” 这样的错误暗示
- 系数偏差,回归模型的 “打分尺” 有个特点,它会默认 “每个特征的影响是独立的”,不会重复计算。但如果加入高度相关的特征,模型就会 “糊涂”,不知道该把 “共同影响” 分给哪个特征,导致最终的 “系数” 偏离真实值 —— 这就是系数偏差
2. 表格数据建模的传统方法与深度学习方法对比
在LLMs应用前,表格数据建模主要依赖传统方法与深度学习方法,二者各有优劣:
| 维度 | 传统方法(以GBDT为代表,如XGBoost、LightGBM) | 深度学习方法 |
|---|---|---|
| 核心优势 | 1. 性能SOTA,训练高效;2. 易调参、可解释性强 | 1. 可隐式学习特征表示,减少人工特征工程;2. 擅长处理时序等序列数据;3.对多样化的数据集有更好的泛化能力 |
| 核心局限 | 1. 对分类特征敏感,难处理序列数据;2. 难以对未见过的数据进行泛化 3. 对特征工程较为敏感 | 1. 多数场景性能仍不及GBDT;2. 训练耗时,可解释性弱;3. 小数据集上易过拟合 |
| 代表场景 | 常规分类/回归任务(如客户流失预测、信用评分) | 大样本、高分类特征占比场景(如电商用户行为预测) |
解释:
- 可隐式学习特征表示指的是机器学习模型(尤其是深度学习模型)在训练过程中自动从原始数据中提取有用的特征,而无需人工设计或干预。
- “对分类特征敏感”通常指机器学习模型或算法在处理分类特征时表现出的行为或特性。分类特征是离散的、非数值型的变量,例如性别、颜色、产品类别等。若特征工程不当,会直接导致模型性能下降
- 序列数据指具有时间或顺序依赖关系的数据,例如文本、语音、视频帧、股票价格等
- 泛化指模型在未见过的数据上表现良好的能力。
- 特征工程是机器学习流程中通过数据转换、组合或提取,将原始数据转化为更适合模型训练的特征的过程。其核心目标是提升模型性能、减少计算复杂度或增强数据可解释性。
在大语言模型出现之前,用于表格数据预测、数据合成以及表格理解:
3. LLMs的定义与核心能力
- 定义:基于Transformer架构(自回归、自编码或编码器-解码器),训练数据涵盖数亿至万亿级token,参数规模≥10亿的预训练模型,典型如GPT-3、LLaMA 2等。
- 核心 emergent 能力:
- 上下文学习(In-Context Learning):无需梯度更新,仅通过任务描述与少量示例(如1-shot、5-shot)即可处理未见过的任务,GPT-3首次展现该能力。
- 指令遵循(Instruction Following):通过零样本提示(如“请预测用户是否购买”)或指令微调,完成新任务,且模型规模越大效果越优。
- 多步推理(Multi-step Reasoning):通过思维链(Chain-of-Thought, CoT)、程序思维(Program-of-Thought)等提示策略,解决算术、常识推理等复杂任务,例如“先计算每月平均收入,再判断是否达标”。
解释:1. 在人工智能领域,emergent behavior 指算法或模型在训练中展现出设计者未明确编程的能力。例如,大型语言模型可能自发学会语法规则或推理能力。
语言模型的发展及其在表格数据建模中的应用:
二、LLMs适配表格数据的关键技术
LLMs本质是序列模型,需通过特定技术将表格数据转化为模型可处理的形式,核心技术包括序列化、表格操作、提示工程、端到端系统四大模块。
语言模型的发展及其在表格数据建模中的应用:
1. 序列化:表格转文本的核心手段
序列化是将结构化表格转化为LLMs可输入的文本格式,分为文本、嵌入、图/树三类,其中文本基方法最常用:
(1)文本序列化方法对比
| 方法 | 描述 | 示例(姓名:Helen,年龄:47) | 适用场景 |
|---|---|---|---|
| DFLoader | 用Python代码加载为Pandas DataFrame | pd.DataFrame({"name":["helen"], "age":[47]}) |
代码友好型任务(如表格数据批量处理) |
| JSON | 以行号为索引,每行表示为键值对字典 | {"0": {"name": "helen", "age": "47"}} |
需保留行结构的场景 |
| Markdown | 行用换行分隔,列用竖杠分隔 | 省略 | 最常见 |
| HTML | 用HTML表格标签表示 | <table><thead><tr><th>age</th><th>name</th></tr></thead><tbody><tr><td>0</td><td>helen</td></tr></tbody></table> |
GPT类模型(训练数据含大量网页HTML)在QA、事实验证任务中表现更优 |
| 句子模板 | 按列名-值模板转化为自然语句 | name is helen, age is 47 |
需语义理解的任务(如医疗数据的临床描述生成) |
(2)不同序列化方法的性能差异
- GPT-3.5/4对HTML格式的理解优于X分隔符(如CSV),因训练数据中网页HTML占比高,但HTML会增加token消耗;
- 手动模板(如列表、句子)在少样本分类任务中优于LLM生成的序列化描述,因LLM可能“幻觉”;
- 模型规模越大,对复杂序列化格式的适配性越强(如GPT-3(1750亿参数)优于T0(110亿参数))。
解释:
- X分隔符泛指 “具备分隔功能的符号 / 字符 / 标记” 的概念,核心作用是将不同类型、不同模块的信息或数据进行拆分,让内容结构更清晰,便于识别、读取或处理。 CSV 文件(逗号分隔值),若数据中本身包含逗号,就可能用 “|”“\t”(制表符)或其他符号作为 “X 分隔符”
- 序列化是将内存中的复杂数据结构(如对象、嵌套数组、关联关系等)转换为可传输 / 可存储的二进制或文本格式的过程;而反序列化则是其逆过程。对于包含嵌套结构、多类型数据、循环引用、二进制数据或跨语言兼容性需求的场景,简单序列化格式(如 JSON、CSV)往往无法满足需求,此时需依赖复杂序列化格式。
2. 表格操作:适配LLM上下文长度与性能
表格数据需通过操作优化输入:
- 压缩表格:
原因:一些模型的上下文长度较短,太长了LLM速度慢,提示词太长了成本会高- 截断:按最大序列长度截断输入(如保留前N行);
- 检索采样:用预先设定的约束条件,仅提取与任务相关的行、列、单元格(如QA任务中检索与问题语义相似的行);
- 补充元信息:
- 加入表格 schema(维度、度量、语义字段类型)、统计特征(均值、中位数)、文档引用(如表格来源论文),可提升任务 accuracy;
解释:schema指数据的结构化定义,明确数据的类型、格式、关系和约束,确保数据可被机器理解和交互。维度,表格中用于分类、分组、描述的字段,如时间、地区、产品类别等;度量,表格中可计算、代表具体数值含义的字段,比如 销售额、利润率;给数据 “贴细分语义标签”,如区分同是时间维度下的订单时间和发货时间。
- 加入表格 schema(维度、度量、语义字段类型)、统计特征(均值、中位数)、文档引用(如表格来源论文),可提升任务 accuracy;
- 鲁棒性挑战:LLM对表格结构扰动敏感,转置表格时准确率降至50%,但识别表头(首行/首列)的准确率达94%-97%;对抗攻击(如替换表头同义词、打乱列顺序)会显著降低Table QA模型性能。
3. 提示工程:提升LLM任务适配性
提示工程是设计输入文本以引导LLM输出符合预期的关键技术,核心策略如下:
| 策略 | 描述 | 应用案例 |
|---|---|---|
| 基础格式优化 | 任务描述清晰化,外部信息(问题、指令)置于表格前 | 表格QA中,先写“请根据表格回答:Helen的年龄是多少?”,再附Markdown表格 |
| 上下文学习(ICL) | 加入少量示例辅助模型理解任务,手动筛选示例优于随机选择 | 少样本分类任务中,1-shot比0-shot准确率高30.38%,2-shot后提升趋缓 |
| 思维链(CoT)与自一致性(SC) | CoT引导模型分步推理(如“先计算总和,再求平均”);SC采样多推理路径,选最一致结果 | 数值QA任务中,GPT-4+CoT显著优于无CoT策略;Table QA中通过多轮对话分解复杂问题 |
| 检索增强生成(RAG) | 从大规模数据中检索相关表格/单元格作为上下文输入,提升回答准确性 | 开放域Table QA中,用Dense Table Retrieval模型排序单元格相关性,再输入LLM生成回答 |
| 角色扮演 | 为LLM设定专业角色,增强领域适配性 | 金融表格分析中,提示“假设你是资深金融分析师,基于表格计算收益率” |
4. 端到端系统:连接LLM与外部工具
LLM可生成代码或指令,与数据库、Python等工具联动,构建端到端流程:
- Text-to-SQL:LLM将自然语言问题转化为SQL查询,执行后返回结果(如Zhang et al. 2023d通过SQL执行错误反馈迭代优化LLM输出,提升查询成功率);
- Python交互:LLM生成Pandas代码处理表格数据,迭代执行(如Liu et al. 2023e设计系统,允许LLM调用Python shell处理数据,最多5轮迭代);
- 无代码平台:LLM自动生成数据摘要、分析问题与查询语句,降低非技术用户使用门槛(如Liu et al. 2023c的无代码数据分析平台)。
三、LLMs在表格数据预测任务中的应用
讨论表格数据两类 —— 基于标准特征的表格数据和时间序列数据
预测是表格数据的核心任务,包括分类(如客户流失)、回归(如销售额预测)及时序预测(如股票价格),LLMs通过预处理、目标增强、微调/推理优化性能。
1. 核心数据集推荐
不同任务需选择适配的数据集,下表列出常用且推荐的数据集:
| 数据集类型 | 代表数据集 | 规模 | 适用场景 | 推荐理由 |
|---|---|---|---|---|
| 通用预测 | Combo 9 | 含9个数据集(如Bank:4.5万行×16列,California:2万行×8列) | 分类、回归任务基准 | 样本量大、特征多样,覆盖金融、医疗等领域,避免单一数据集偏差 |
| 通用微调 | Kaggle API | 169个数据集 | 大规模预训练与微调 | 数据集多样性极强,适配不同行业场景 |
| 医疗领域 | UCI ML DDX | 20个医疗相关数据集 | 疾病预测、医疗风险评估 | 半数数据集聚焦医疗,适配EHR(电子健康记录)等场景 |
| 金融领域 | FinBench | 10个数据集(训练样本2k-14万行,特征9-120个) | 信用评分、风险预测 | 针对性覆盖金融场景,样本与特征规模适配实际业务 |
2. 标准表格预测(分类/回归)的关键技术步骤
(1)预处理
- 序列化:以文本基方法为主,如“列名:值”句子模板(如“Car Brand is Land Rover. Year is 2017”),部分方法加入统计摘要(如“大排量汽车价格更高”)或LaTeX格式提升模型理解;
- 提示工程:融入任务背景(如“该任务为汽车维修欺诈预测”)、特征语义(如“Year指汽车生产年份”),部分方法用LLM生成辅助描述(如GPT-3生成数据集摘要)。
(2)目标增强
将LLM的文本输出映射为预测标签,解决输出可控性问题,常用方法如下:
| 方法 | 描述 | 示例 |
|---|---|---|
| 特殊标记分隔 | 用###、@@@等标记限定答案范围,引导LLM在标记内输出 | 预测标签格式:### Fraudulent @@@ |
| 语言化映射(Verbalizer) | 定义标签的语言化前缀,将输出映射为类别/数值 | 要求LLM输出“类别1:0.8,类别2:0.2”,再提取概率 |
| 概率校准 | 将LLM输出概率通过外部模型(如XGBoost)校准,提升准确性 | UniPredict中,将目标标签转化为带语义的类别概率分布,再校准 |
(3)推理与微调策略
- 推理-only(无微调):直接使用预训练LLM,适合数据稀缺场景,如TABLET用GPT-J、Flan-T5做零样本医疗诊断预测,但性能通常弱于微调方法;
- 微调:分为“通用预训练+任务微调”与“多数据集预训练+特定任务适配”两类:
- 代表方法:TabLLM(微调T0模型,少样本性能超GBDT)、GTL(微调LLaMA,零样本场景性能提升显著);
- 关键发现:多数据集预训练(如UniPredict用169个数据集训练GPT-2)可提升模型泛化性,小样本场景下准确率优于XGBoost。
3. 时序预测的适配技术
时序预测关注数值特征的时间依赖性,LLMs需针对性优化序列化与输入表示:
- 预处理:
- 数值编码:ZeroTS将数字按位拆分(如GPT-3拆分为多位数、LLaMA拆分为单个数字),解决传统BPE编码拆分数字导致的算术能力弱问题;
- 输入增强:Time-LLM将时序序列嵌入与词嵌入结合,加入数据集上下文、任务指令作为前缀;
- 目标增强:ZeroTS通过多采样+分位数估计生成预测范围,Time-LLM通过扁平化与线性投影处理输出;
- 评估指标:除MAE、RMSE外,常用CRPS(连续排序概率得分)捕捉分布特性,SMAPE(对称平均绝对百分比误差)适配百分比误差场景。
4. 领域特定预测应用
| 领域 | 代表方法 | 核心技术 | 评估指标 |
|---|---|---|---|
| 医疗 | MediTab | 1. GPT-3.5将表格转文本;2. 多任务微调+伪标签生成+Shapley值筛选数据;3. BioBert做分类 | AUCROC、PRAUC(适配医疗数据不平衡) |
| 金融 | FinPT | 1. 表格数据填充模板生成客户自然语言画像;2. 微调Flan-T5等模型做风险预测 | F1、AUC |
| 推荐 | CTRL | 1. 表格转文本+预训练LLM(如ChatGLM)学习语义;2. 跨模态对比学习+轻量级协同模型 | AUC、LogLoss |
四、LLMs在表格数据生成任务中的应用
表格数据生成主要用于数据增强、隐私保护(生成脱敏数据)、缺失值填充,LLMs凭借强大的生成能力成为该领域新方向。
1. 核心方法分类
LLMs生成表格数据主要基于两种语言建模范式:因果语言建模(CLM)与掩码语言建模(MLM),具体如下:
| 范式 | 代表方法 | 核心流程 | 优势 |
|---|---|---|---|
| 因果语言建模(CLM,自回归) | GReaT、REaLTabFormer、TAPTAP | 1. 表格序列化为句子(如“Age is 30, Education is Bachelor”);2. 微调GPT-2等模型;3. 生成时通过“特征名预条件”“键值对预条件”控制生成方向 | 1. 可生成符合真实分布的样本;2. 支持条件生成(如固定Age=20,生成其他特征) |
| 掩码语言建模(MLM,双向) | TabMT | 1. 随机选择列,将值掩码为[mask];2. 模型学习预测掩码值;3. 生成时逐步预测所有掩码列 | 1. 利用双向上下文,捕捉特征间关联;2. 天然支持缺失值填充(掩码概率设为1) |
2. 特殊场景方法:低数据量适配
- CLLM(Curated LLM):无需微调LLM,利用GPT-4的世界知识生成样本,通过“置信度”“不确定性”指标筛选高质量样本,适配数据稀缺场景(如小众疾病医疗数据)。
3. 生成质量评估指标
从四个维度评估合成数据质量,具体如下:
| 评估维度 | 指标 | 描述 |
|---|---|---|
| 低阶统计 | 列密度、列间相关性 | 衡量合成数据与真实数据的单特征分布、特征对关联一致性 |
| 高阶统计 | α-precision、β-recall | 评估合成数据的整体保真度(α-precision)与多样性(β-recall) |
| 隐私保护 | DCR(最近记录距离) | 中位数距离越大,合成数据与真实数据重合度越低,隐私性越强 |
| 下游任务性能 | MLE(机器学习效率) | 用合成数据训练模型,在真实数据上的测试准确率,衡量数据可用性 |
五、LLMs在表格数据理解任务中的应用
表格理解涵盖问答(QA)、事实验证(FV)、Text2SQL等任务,核心是让LLM理解表格结构与语义,完成信息提取与推理。
1. 核心数据集推荐
不同任务对应不同数据集,下表列出常用且具有代表性的数据集:
| 任务类型 | 数据集 | 规模(表格数) | 输入输出 | 数据来源 | 关键指标 |
|---|---|---|---|---|---|
| Table QA | FetaQA | 10330 | 表格+问题→自由文本答案 | Wikipedia | BLEU |
| Table QA | WikiTableQuestion | 2108 | 表格+问题→短答案 | Wikipedia | 执行准确率 |
| 事实验证(FV) | TabFact | 16573 | 表格+陈述→标签(支持/反驳) | Wikipedia | 精确匹配准确率 |
| Text2SQL | Spider | 1020 | 表格+问题→SQL | 人工标注 | 执行准确率 |
| Text2SQL | WikiSQL | 24241 | 表格+问题→SQL+答案 | 人工标注 | 执行准确率 |
| 自然语言生成(NLG) | ToTTo | 120000 | 表格→描述句子 | Wikipedia | BLEU |
2. LLM在表格理解中的核心能力与趋势
- 模型规模影响:模型参数越大,理解能力越强。
- 微调vs无微调:
- 无微调:GPT-3.5/4在零样本场景已表现出强能力(如DIN-SQL用GPT-4做Text2SQL,执行准确率超微调小模型);
- 微调:预训练于表格数据的模型(如PASTA,在120万WikiTables数据上预训练)在特定任务(如TabFact)上准确率超通用LLM;
- 数值QA优势:Flan-T5、GPT-3.5在数值推理任务(如计算平均交易金额)上表现最优,GPT-4+CoT可进一步提升复杂数值推理能力。
3. 表格QA的关键组件优化
(1)查询意图消歧
- Chain-of-command(CoC):将用户输入转化为中间指令序列,微调LLM生成指令;
- 多任务拆分:将QA拆分为“澄清需求预测(是否需追问)”“澄清问题生成”“对话式回答”,用UniPCQA模型统一建模。
(2)检索与采样
- 表格检索:用Dense Table Retrieval排序表格/单元格相关性,再输入LLM;
搜索与检索核心表
| 核心类别 | 具体说明 |
|---|---|
| 核心定位与目标 | 解决表格数据“超出LLM上下文长度”“关键信息分散”“噪声干扰”问题,从大规模表格数据中精准提取与任务(如QA、事实验证)高度相关的信息(表格/行/列/单元格),为LLM提供有效输入上下文,提升任务准确率 |
| 两大检索场景 | 1. 目标表格信息检索:定位直接支撑任务的核心数据单元,包括表格级、列级、单元格级检索; 2. 辅助信息检索:补充示例样本、跨模态证据,优化LLM对任务的理解与输出质量 |
| 表格级检索(目标信息) | - 代表方法:基于自一致性(SC)策略排序候选表格(如Dong et al. (2023)生成10组结果,选出现最频繁的top4表格);利用LLM(如ChatGPT)对表格与问题的相关性打分 - 核心作用:多表格场景下定位目标表,排除无关表格占用上下文空间 |
| 列级检索(目标信息) | - 代表方法:按“列名-问题关键词匹配度”排序;优先保留外键列(foreign key),辅助跨表关联与信息补全 - 核心作用:减少无关列对LLM的干扰,聚焦任务所需的特征维度 |
| 单元格级检索(目标信息) | - 代表方法:双编码器模型(如cTBLS的Dense Table Retrieval(DTR)模型,基于RoBERTa初始化,按单元格与查询相关性排序);Coarse System State Tracking系统(基于三元组损失训练,对单元格重要性打分) - 核心作用:在大表格中精准提取“回答问题必需的具体数值/类别”,避免LLM遗漏关键信息 |
| 示例样本级检索(辅助信息) | - 代表方法:随机选例(简单但效果差)、问题语义相似选例(基于问题嵌入相似度+kNN选top-k示例)、SQL查询相似选例(适配Text2SQL任务)、手动筛选示例(比随机选例F1高14.7,Narayan et al., 2022) - 核心作用:为LLM提供“任务演示示例”,提升少样本/零样本任务性能 |
| 跨模态证据检索(辅助信息) | - 代表方法:结合稀疏检索(如BM25)与密集检索(如Contriever、OpenAI Ada Embedding),从文本文档、知识库提取与表格相关的补充证据(Zhao et al., 2023d) - 核心作用:解决“表格信息不完整”问题,为复杂推理(数值计算、事实验证)提供额外上下文 |
| 主流检索技术组合 | 1. 稀疏检索(如BM25):高效匹配关键词,适合快速筛选; 2. 密集检索(如Contriever、OpenAI Ada Embedding):捕捉语义关联,提升匹配精度; 3. 混合检索:结合两者优势,覆盖更多相关性维度,提升检索召回率 |
| 核心研究结论 | 1. 检索质量直接影响LLM性能:Zhao et al. (2023d)验证,检索器返回的top-n相关文档质量越高,LLM在数值QA任务中的准确率提升越显著; 2. query-based采样最优:Sui et al. (2023c)对比多种表格采样方法,发现“按问题语义相似性检索行”能最大程度保留任务相关信息; 3. 多检索器融合更优:稀疏+密集检索组合可提升检索全面性,减少关键信息遗漏 |
(3)多轮交互
| 多轮任务分类 | 核心目标 | 典型案例与方法 | 关联文献/数据集 |
|---|---|---|---|
| 复杂任务拆解为子任务 | 将难以单轮完成的表格推理任务拆分为可管理的子任务,通过中间输出辅助LLM生成最终答案,提升推理精度 | 1. 两步自增强提示法:先让LLM生成表格额外知识(中间输出),再融入二次提示求最终答案; 2. 表格与问题拆解:将大表格拆为小表格、复杂问题拆为简单子问题; 3. 符号化CoT推理:LLM与Python shell交互(最多5轮),执行命令、处理数据、核验结果(基于pandas dataframe) |
Sui et al. (2023b)、Ye et al. (2023b)、Liu et al. (2023e);TabFact数据集 |
| 基于对话的应用场景 | 适配用户与LLM的交互场景(如聊天机器人),支持迭代调用LLM响应后续需求,聚焦对话式Text2SQL任务 | 对话式Text2SQL任务:基于已有数据集设计后续追问问题,实现多轮对话中的SQL生成 | SParC(Yu et al., 2019b)、CoSQL(Yu et al., 2019a);基础数据集Spider(Yu et al., 2018b) |
| 规避约束或调试错误 | 解决表格超出API输入限制的问题,或通过错误反馈迭代优化LLM生成的代码(如SQL),提升输出正确性 | 1. 多轮提示适配API输入限制:处理表格规模超出API上限的情况; 2. 错误反馈优化SQL生成:将LLM生成SQL的错误反馈至模型,迭代生成正确代码 |
Zhao et al. (2023a)、Zhang et al. (2023d) |
(4)输出评估与格式
- 若输出是数字或类别,常用F1分数或准确率来评估;
- 若为开放式回答,除了用ROUGE、BLEU等典型文本评估指标,部分论文会聘请标注人员从信息性、连贯性、流畅性维度人工评估大语言模型(LLM)的响应;
- 当LLM与Python、Power BI等程序连接时,输出不仅限于文本和代码,从文本及表格输入生成可视化内容也是热门任务。
六、局限性与未来研究方向
1. 当前核心局限性
- 数值表示缺陷:LLM原生嵌入无法有效捕捉数值内在关系,现有数字拆分编码(如LLaMA按位拆分)会增加输入维度,不适用于大样本;
- 分类特征处理难题:高基数分类特征序列化后易超token限制,且无意义字符、模糊列名会降低模型理解;
- 基准不统一:同一方法在同一数据集(如Blood数据集)上的性能报告不一致(TabLLM准确率0.70 vs UniPredict 0.66),难以公平对比;
- 偏见与公平性:LLM继承训练数据中的社会偏见,表格预测中不同子群体的公平性指标差距大于传统模型;
- 幻觉问题:LLM可能生成与事实不符的表格数据(如医疗数据中虚假诊断结果),现有审计方法(如Shapley值筛选、LLM自检查)需迭代,难以部署;
- 可解释性差:仅少数方法(如TabLLM)提供输出解释,Shapley值等解释工具在表格任务中的有效性尚未验证;
- 易用性低:多数方法需手动序列化、微调,缺乏统一 pipeline(如自动预处理+模型调用)。
2. 未来研究方向
- 优化数值与分类特征表示:设计适配表格数据的新型tokenizer,平衡数值理解与维度效率;
- 建立标准基准:统一数据集预处理、评估流程,构建跨任务基准平台;
- 缓解偏见与幻觉:探索预处理去偏、优化目标函数等方法,开发高效审计工具;
- 提升可解释性:将Shapley值、注意力可视化等工具适配表格LLM,设计领域特定解释模板(如医疗诊断的“关键特征列表”);
- 简化易用性:开发无代码平台,集成自动序列化、预处理、模型调用功能;
- 模型嫁接:借鉴HeLM模型思路,用专用编码器将表格特征映射到LLM的token嵌入空间,融合多模态知识;
- 探索表格特定行为:研究LLM对类别不平衡、顺序无关性的适配机制,挖掘表格数据独有的建模规律。
七、结论
本文系统梳理了LLMs在表格数据预测、生成、理解三大任务中的技术路线、数据集、指标与挑战,指出LLMs凭借上下文学习、多步推理等能力,为表格数据建模提供了新范式。
此外,论文的仓库https://github.com/tanfiona/LLM-on-Tabular-Data-Prediction-TableUnderstanding-Data-Generation,可供参考。
更多推荐

所有评论(0)