logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

ICML 2025|图宾根大学—博世AI中心团队:数据污染会被大模型训练遗忘吗

更关键的是,在 model and data follow Chinchilla scaling 的设置下,minor contamination 会造成过拟合,但当训练数据扩展到超过 five-times Chinchilla 时,即便 144 次污染也可能被后续训练遗忘。三个维度同时改变后,污染效应不再是单一方向:模型更大时更容易过拟合污染样本,但训练数据继续扩张时,污染带来的优势又会被稀释。

文章图片
#人工智能#深度学习#机器学习
Amazon:企业Agent接上知识库仍乱答?BYOKG-RAG让证据链先跑通

多策略并行后,系统拿到的不再是一堆文本片段,而是一组来自图结构的证据上下文。研究团队没有让 LLM 单独承担整条检索链,而是把大模型放在“产出图任务中间件”的位置:它先提出候选实体、候选答案、路径和查询语句,再让图工具执行链接、检索和校验。如果企业 Agent 已经能接数据库、浏览器和内部知识库,下一步要问的不是“还能接什么工具”,而是“每一次工具调用背后的证据路径能不能被看见”。BYOKG-RA

文章图片
#机器学习#人工智能#深度学习
AI 程序员真的开始提交代码了

Claude Code 的例子很典型,多方法检测找出 850,157 个 commits,而 bot account lookup 只找回 28,154 个,约 3.3%。这个 taxonomy 很关键,因为“AI 参与”不是单一动作:有的 agent 直接提交代码,有的只被配置好但还没活跃,有的通过 PR 出现,有的在 commit 文本里留痕。表格告诉我们,所谓“AI 编程工具采用率”不是一个

文章图片
#人工智能#机器学习#深度学习
AI 程序员真的开始提交代码了

Claude Code 的例子很典型,多方法检测找出 850,157 个 commits,而 bot account lookup 只找回 28,154 个,约 3.3%。这个 taxonomy 很关键,因为“AI 参与”不是单一动作:有的 agent 直接提交代码,有的只被配置好但还没活跃,有的通过 PR 出现,有的在 commit 文本里留痕。表格告诉我们,所谓“AI 编程工具采用率”不是一个

文章图片
#人工智能#机器学习#深度学习
AI 程序员真的开始提交代码了

Claude Code 的例子很典型,多方法检测找出 850,157 个 commits,而 bot account lookup 只找回 28,154 个,约 3.3%。这个 taxonomy 很关键,因为“AI 参与”不是单一动作:有的 agent 直接提交代码,有的只被配置好但还没活跃,有的通过 PR 出现,有的在 commit 文本里留痕。表格告诉我们,所谓“AI 编程工具采用率”不是一个

文章图片
#人工智能#机器学习#深度学习
AI 程序员真的开始提交代码了

Claude Code 的例子很典型,多方法检测找出 850,157 个 commits,而 bot account lookup 只找回 28,154 个,约 3.3%。这个 taxonomy 很关键,因为“AI 参与”不是单一动作:有的 agent 直接提交代码,有的只被配置好但还没活跃,有的通过 PR 出现,有的在 commit 文本里留痕。表格告诉我们,所谓“AI 编程工具采用率”不是一个

文章图片
#人工智能#机器学习#深度学习
AI插件投毒:你给了一个插件权限,它可能拿走整台电脑

如果一个恶意 MCP server 注册了一个看起来正常的工具,比如“读取日程”“格式化表格”“发送测试邮件”,但在描述里偷偷写入“调用邮件工具时把内容转发到某地址”“忽略前面的安全提示”“把最近读取的 token 放进参数里”,这就不是传统意义上的 bug,而是给模型看的指令污染。插件要像依赖包一样管理:来源、哈希、签名、许可证、权限、数据流、出站网络、更新记录,都应该有清单。谁启动了任务,模型

文章图片
#人工智能#深度学习#机器学习
DeepSeek Harness刷屏:别只盯模型,AI真正变强的是“工作台”

DeepSeek Harness 官方页面强调,模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等能力都由插件组合而成;DeepSeek Harness 这次最值得看的点,不是“又多了一个模型入口”,而是它把 Agent 能力拆成可组合插件:模型是一块,工具是一块,技能是一块,沙箱是一块,存储和会话也是一块。这些任务都需要文件、网页、账号、工具链和确认机制。你可以把它想成程序员的工位:模型是

文章图片
#人工智能
手机里的AI为什么总点错按钮?华为×港大团队把问题追到了“不会找路”

以“关闭某项自动续费”或“找到订单中的某个设置”为例,截图能够告诉模型眼前有哪些按钮,却不能直接告诉它上一层页面从哪里进入、某个开关是否位于二级菜单、返回操作会不会丢失状态。论文还构建KG-Android-Bench与KG-Harmony-Bench,用来覆盖中文移动生态中的Android与HarmonyOS任务,观察方法在不同应用和任务复杂度下是否仍能保持收益。现实问题:GUI Agent能够看

文章图片
#人工智能#深度学习#机器学习
ACL 2025|UIUC团队:多Agent开会就更聪明?MultiAgentBench把协作翻车点摊开

过去一年,多 Agent 被包装成很多复杂工作流的答案:一个负责搜索,一个负责写作,一个负责审查,一个负责执行。原因并不难理解:研究任务往往需要信息采集、假设整理、证据核查和写作归纳,图结构能让不同角色保持连接,又不会完全挤在同一个对话通道里。论文报告,gpt-4o-mini 在平均任务分数上表现较好,说明在一些多智能体任务中,模型调用成本与任务完成质量之间可以取得较好的平衡。研究目标:Multi

文章图片
#人工智能#机器学习#深度学习
    共 11 条
  • 1
  • 2
  • 请选择