logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

TReB:评估大语言模型表格推理能力的综合基准

本文提出了一种全面评估大语言模型(LLMs)表格推理能力的基准TReB,包含26个子任务,覆盖6大核心技能(自然语言理解、表格理解、表格基本操作、表格计算操作、数据分析和高级数据分析)。针对现有基准在数据质量、推理模式和评估指标方面的不足,TReB构建了高质量数据集(含人工验证的5,000+表格问答对),支持三种推理模式(TCoT、PoT、ICoT),并设计了多维度评估指标。实验测试了20+先进L

#语言模型#人工智能#自然语言处理
多模态RAG驱动的激光粉末床熔融中使用大语言模型的异常检测与分类

1{ }^{1}1康涅狄格大学机械、航空航天与制造工程学院,Storrs, CT 062692{ }^{2}2康涅狄格大学计算机科学学院,Storrs, CT 062693{ }^{3}3新泽西州立大学罗格斯分校机械与航空航天工程系,Piscataway, NJ 08854邮箱: hongyi.3.xu@uconn.edu本研究提出了一种新颖的多模态检索增强生成框架,利用从文献中检索到的信息(包括

文章图片
#语言模型#分类#人工智能
FineScope : 使用SAE引导的自数据培育对领域专用大语言模型进行精确剪枝

从头开始训练大语言模型(LLMs)需要显著的计算资源,这推动了开发更小、领域专用的LLMs的兴趣,这些模型既要保持效率又要具备强大的任务性能。中型模型如LLaMA (Touvron等人, 2023b;a) 已成为领域特定适应的起点,但当在专门的数据集上测试时,它们通常会遭遇准确性的下降。我们介绍了FineScope,这是一种从更大的预训练模型中提取紧凑、领域优化的LLM框架。

文章图片
#语言模型#剪枝#人工智能
VLM-RRT:视觉语言模型引导的RRT搜索用于自主无人机导航

路径规划是自主无人飞行器(UAVs)的一项基本能力,使它们能够高效地朝目标区域导航或探索复杂环境,同时避开障碍物。传统的路径规划方法,如快速扩展随机树(RRT),已被证明是有效的,但往往面临重大挑战。这些问题包括高搜索空间复杂性、次优路径质量和收敛速度慢,在诸如灾难响应等高风险应用中尤为突出,这些情况下快速高效的规划至关重要。为了解决这些限制并提高路径规划效率,我们提出了视觉语言模型RRT(VLM

文章图片
#语言模型#无人机#人工智能
合成数据增强用于表格检测:使用自动生成的文档图像重新评估TableNet性能

本文提出了一种基于LaTeX的自动化流水线,用于生成包含多样化表格布局的两栏文档图像及其真实掩码。该合成数据增强了Marmot基准数据集,支持TableNet模型在不同分辨率(256×256和1024×1024)下的系统性能研究。实验表明,在合成测试集上,TableNet的逐像素XOR错误率分别为4.04%(256×256)和4.33%(1024×1024),在Marmot基准上最佳性能达9.18

#人工智能
注意力机制视角:探索LLM对图结构数据的处理

注意力机制是大型语言模型(LLMs)成功的关键,推动了多个领域的显著进步。然而,对于需要强调拓扑连接的图结构数据,它们在固定链接上的消息传递机制(如图神经网络GNNs所采用的机制)面前表现不足。这引发了一个问题:“在自然语言环境下,注意力机制是否对图数据失效?”受此观察的启发,我们从注意力机制的角度出发,进行了实证研究,以探索LLM如何处理图结构数据。目标是深入了解LLM在图结构上的注意力行为。我

文章图片
#人工智能
更大的语言模型是否意味着更好的推理能力?关于推理的预训练扩展规律

王欣怡*加州大学圣塔芭芭拉分校xinyi.wang@ucsb.eduWilliam Yang Wang加州大学圣塔芭芭拉分校william@cs.ucsb.eduShawn TanMIT-IBM Watson AI 实验室shawntan@ibm.comRameswar PandaMIT-IBM Watson AI 实验室rpanda@ibm.com金明宇罗格斯大学mingyu.jin@rutge

文章图片
#语言模型#人工智能#深度学习
基于基础模型的推荐系统综述:从特征增强、生成式到代理范式

推荐系统(RS)已在信息过滤和个性化内容提供中变得至关重要。传统上,RS 技术依赖于建模用户与项目之间的交互以及使用特定任务模型的内容特征。随着基础模型(FMs)的出现,如在大量数据上训练的大规模模型 GPT、LLaMA 和 CLIP,推荐范式正在被重塑。本综述全面概述了用于推荐系统的基础模型(FM4RecSys),涵盖了其在三种范式中的集成:(1)基于特征的表示增强,(2)生成式推荐方法,(3)

文章图片
#人工智能
大模型 NL2SQL 有多脆?Oracle 用 SQL2NL 扒了真相,Llama3.1-8B 改写问句准确率掉 20%!

OracleAI团队提出了一种基于SQL2NL反向构建的评测框架,专门评估NL2SQL模型对语言变体的鲁棒性。该方案通过SQL2NL模型生成语义相同但表达各异的自然语言问句,有效控制了schema对齐变量,精准测试语言变体影响。实验显示主流模型在改写问句上准确率普遍下降10-20个百分点,JOIN和ORDERBY子句对语言变体最敏感。研究还发现改写问句能改善schema对齐错误,且SQL2NL的P

#oracle#数据库
大模型调参前先看这篇!Text-to-SQL 任务里,数据集 “对不对味” 直接决定效果

这篇论文揭示了Text-to-SQL任务中训练数据与目标任务的结构对齐度对模型性能的关键影响。研究发现,通过计算训练数据与目标任务的SQL结构特征分布差异(KL对齐度)和对齐比(AR),可有效预测微调效果:当AR>1时,微调通常能提升性能;反之则可能适得其反。实验表明,像Qwen2.5-coder等预训练充分的基础模型对结构变化更稳健,而传统模型更依赖数据对齐。研究还发现少样本提示对改善结构

#sql#数据库
    共 476 条
  • 1
  • 2
  • 3
  • 48
  • 请选择