logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【AI论文】MedVLM-R1:通过强化学习激励视觉语言模型(VLMs)的医疗推理能力

MedVLM-R1是一种能够生成明确推理过程的医学VLM,它采用GRPO框架进行训练,旨在提升医学影像分析的透明度和可信度。该模型不仅提供最终答案,还通过自然语言形式详细阐述其推理过程。

文章图片
#人工智能#语言模型#自然语言处理
【AI论文】AdaCoT:基于强化学习的帕累托最优自适应思维链触发机制

大型语言模型(LLMs)在处理复杂推理任务时面临挑战,尽管思维链(CoT)提示方法显著提升了推理能力,但其不加选择地为所有查询生成冗长推理步骤,导致计算成本高昂且效率低下。为解决这一问题,研究团队提出了AdaCoT(自适应思维链)框架,使LLM能够自适应地决定何时调用CoT。AdaCoT将自适应推理视为帕累托优化问题,通过强化学习(RL)方法,特别是近端策略优化(PPO),动态控制CoT触发决策边

文章图片
#人工智能
【AI论文】Flow-GRPO:通过在线强化学习训练流匹配模型

我们提出了Flow-GRPO,这是第一种将在线强化学习(RL)集成到流匹配模型中的方法。 我们的方法使用两个关键策略:(1)ODE到SDE的转换,将确定性常微分方程(ODE)转换为等价的随机微分方程(SDE),该方程在所有时间步长上与原始模型的边际分布相匹配,从而为RL探索提供统计采样; 以及(2)一种降噪减少策略,该策略减少了训练降噪步骤,同时保留了原始推理时间步数,在不降低性能的情况下显著提高

文章图片
#人工智能
【AI论文】从评分到能力:面向金融大语言模型评估的认知诊断框架

摘要:本研究提出首个金融大语言模型认知诊断评估框架FinCDM,突破传统单一分数评估的局限。基于注册会计师考试构建的CPA-QKA数据集覆盖70个核心金融概念,由专家严格标注技能标签。采用非负矩阵协同分解方法,该框架在30个主流模型上验证了其有效性,成功揭示模型在税务、监管等领域的知识缺口,并发现模型行为聚类现象。实验表明,即使总分相近的模型在具体金融技能上存在显著差异,且语言资源不足会严重影响性

文章图片
#人工智能#金融#语言模型
【AI论文】FutureX:面向未来预测任务中大语言模型智能体的前沿动态基准测试

《FutureX:面向大语言模型智能体的动态实时预测评估基准》摘要 本研究针对大语言模型(LLM)未来预测能力评估的空白,提出首个动态实时基准测试FutureX。该基准从195个高质量网站每日采集未来导向问题,通过自动化流程避免数据污染,支持对25个LLM智能体的持续评估。研究显示:具备搜索推理能力的模型(如Grok-4、GPT-o4-mini)显著优于基础模型,但在复杂任务中仍落后人类专家40%

文章图片
#人工智能#语言模型#自然语言处理
【AI论文】废话学:以深度解读无意义内容挑战大语言模型

【摘要】本研究针对大型语言模型(LLMs)在理解"废话学"(Drivelology)这种表面无意义但隐含深层语义的语言现象时的局限性,构建了包含1200余例多语言样本的基准数据集DRIVELHUB。通过分类、生成和推理三项任务测试发现,当前最优模型DeepSeekV3在分类任务中仅达81.67%准确率,且所有模型在复杂推理任务中表现显著下降,暴露出LLMs在语用理解、文化背景解

文章图片
#人工智能#语言模型#自然语言处理
【AI论文】为扩散型大语言模型革新强化学习框架

摘要:TraceRL是一种面向扩散语言模型的轨迹感知强化学习框架,通过整合优选推理轨迹提升模型性能。该框架配备扩散机制价值模型,增强训练稳定性,并支持不同架构适配。基于TraceRL开发的TraDo系列模型在数学推理任务中表现优异,其中TraDo-8B-Instruct在MATH500测试上准确率达87.4%,超越Qwen2.5-7B和Llama3.1-8B等自回归模型。研究还首创了长思维链扩散模

文章图片
#人工智能#语言模型#自然语言处理
【AI论文】驾驭不确定性:面向长周期大语言模型(LLM)智能体的熵调制策略梯度法

【摘要】本研究针对长周期任务中基于大语言模型的智能体面临的信用分配难题,提出熵调制策略梯度(EMPG)框架。该框架通过分析策略梯度与熵的内在关联,创新性地利用步骤级不确定性动态调整学习信号:放大自信正确动作的更新,惩罚自信错误,并减弱不确定步骤的干扰。实验表明,EMPG在WebShop等三项挑战性任务中显著提升性能(如ALFWorld任务成功率提高8.1%),同时增强训练稳定性。研究揭示了LLM策

文章图片
#人工智能#语言模型#自然语言处理
【AI论文】视觉拼图式微调可提升多模态大语言模型性能

摘要:本研究提出VisualJigsaw框架,一种自监督微调方法,旨在增强多模态大语言模型(MLLMs)的视觉理解能力。通过将视觉输入分割、打乱并让模型以自然语言生成正确排列顺序,该框架构建了通用排序任务,无需标注数据或额外视觉生成组件。实验验证了该方法在图像、视频和3D数据上的有效性,显著提升了模型的细粒度感知、时序推理和空间理解能力。研究为视觉中心前置任务设计提供了新思路,揭示了自监督学习在M

文章图片
#人工智能#语言模型#自然语言处理
【AI论文】TruthRL:通过强化学习激励大语言模型(LLM)输出真实内容

摘要:TruthRL提出了一种强化学习框架,通过三元奖励机制(区分正确答案、幻觉和拒绝回答)优化大语言模型的真实性。实验表明,该方法在四个知识基准测试中显著降低28.9%的幻觉率,提升21.1%真实性,并在不同模型上保持稳定性。研究揭示了传统准确性优化与不确定性识别的矛盾,而TruthRL通过平衡二者实现了更可靠的回答生成。未来工作将优化奖励设计并扩展多模态应用。

文章图片
#人工智能#语言模型#自然语言处理
    共 535 条
  • 1
  • 2
  • 3
  • 54
  • 请选择