
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
金融市场中的大模型智能体,即便能够引述监管规则,依然可能提交违反可执行约束的交易订单,或是误读监控证据。本文提出ReguSim——一套受控金融合规仿真环境,以及ReguBench——带目标标记的监管监控评测基准。二者将四类关键信息解耦:模型口头推理陈述、尝试执行的动作、执行层强制拦截结果、监控可获取的证据。基于DeepSeek V4 Pro、Gemini 3.5 Flash开展交易智能体实验:即便

本文提出StartupBench,一个基于市场验证AI产品构建的智能体评测基准,旨在评估模型完成真实端到端业务任务的能力。该基准通过系统调研AI初创企业产品、深度用户访谈和专家标注,收集了97个跨6大领域的真实工作流任务,涵盖医疗、金融、法律等专业场景。每个任务包含细粒度评分细则,全面评估交付物质量。实验结果显示,当前最强模型的任务完整成功率仅约30%,主要失败源于复杂指令遵循和领域知识不足。St

本文提出Wyvern框架,一种生成可溯源多模态技术报告的智能体系统。针对当前生成式AI存在的事实无法溯源和幻觉问题,Wyvern通过模块化多智能体协作,实现文本、图表、表格与参考文献的统一整合。核心创新包括图片自动筛选排版流水线和原子声明校验修正模块,显著提升内容可信度。实验表明,在87%场景下用户认为其生成图表信息量更优,63%-100%场景中报告实用性更强;自动化指标显示引用召回率最高提升2.

本文提出Wyvern框架,一种生成可溯源多模态技术报告的智能体系统。针对当前生成式AI存在的事实无法溯源和幻觉问题,Wyvern通过模块化多智能体协作,实现文本、图表、表格与参考文献的统一整合。核心创新包括图片自动筛选排版流水线和原子声明校验修正模块,显著提升内容可信度。实验表明,在87%场景下用户认为其生成图表信息量更优,63%-100%场景中报告实用性更强;自动化指标显示引用召回率最高提升2.

本文介绍了一种基于GPU加速的Agent-Based Modeling (ABM)方法,用于癌症治疗计算机模拟。该研究采用FLAME GPU 2框架,通过CUDA C++和Python的混合架构,实现了无需详细动力学参数化即可重现生物涌现行为的能力。系统将分子建模为球体,遵循Stokes-Einstein扩散方程,并通过结构化JSON文件定义模型。在两个案例研究中验证了方法的有效性:Dabrafe
本文提出代理式过程策略优化(APPO),改进现有代理式强化学习方法的信用分配机制。研究发现关键决策点广泛分布于序列中,而不仅限于工具调用边界。APPO创新性地引入细粒度分支得分(BS)机制,结合标记熵和策略似然增益来精准定位有效决策点,并采用过程级优势缩放优化信用分配。在13个基准测试中,APPO将基线性能平均提升近4分,同时保持计算效率和可解释性。该方法为提升大语言模型代理的多轮工具调用能力提供
摘要:本文提出GS-Agent多智能体框架,通过结合生成式模型与物理引擎,实现自然语言驱动的四维物理世界构建。该系统将任务分解为实体管理(3D资产生成、材质调参、运动控制)和渲染配置(相机/灯光调度),三类智能体通过仿真反馈协同优化。实验表明,相比Sora2等文生视频模型,GS-Agent在物理一致性、文本对齐度和可控性上显著领先,支持刚体/流体/可变形体交互及电影级渲染,为内容创作与具身AI仿真

摘要:本研究通过8周纵向观察分析LLM Agent运行时的静默故障(Silent Failures),提出五类故障机制分类:环境怪癖、设计失配、错误吞没、级联幻觉和操作盲区。核心发现包括:1)70%故障依赖人工发现,自动化测试几乎无效;2)LLM特有的"类失败"现象,将错误转化为流畅叙事;3)审计作为回归引擎可阻断87%已知错误;4)三层因果链结构(触发→放大→隐藏)。研究建议采用五支柱防御框架,
本文探索在边缘计算环境下使用小语言模型(SLM)实现虚拟智能体的思考与记忆机制。研究基于认知具身智能体架构(CEAA),在NVIDIA Jetson Orin NX边缘设备上部署不同规模的Qwen2.5系列模型进行实验。结果表明,1.5B参数的SLM在路由任务中达到85.4%准确率,在记忆任务中实现72.8%召回率,展现了边缘设备运行认知流程的可行性。3B模型虽性能更优,但延迟显著增加。该研究为虚

本文探索在边缘计算环境下使用小语言模型(SLM)实现虚拟智能体的思考与记忆机制。研究基于认知具身智能体架构(CEAA),在NVIDIA Jetson Orin NX边缘设备上部署不同规模的Qwen2.5系列模型进行实验。结果表明,1.5B参数的SLM在路由任务中达到85.4%准确率,在记忆任务中实现72.8%召回率,展现了边缘设备运行认知流程的可行性。3B模型虽性能更优,但延迟显著增加。该研究为虚








