logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

AI 程序员真的开始提交代码了

Claude Code 的例子很典型,多方法检测找出 850,157 个 commits,而 bot account lookup 只找回 28,154 个,约 3.3%。这个 taxonomy 很关键,因为“AI 参与”不是单一动作:有的 agent 直接提交代码,有的只被配置好但还没活跃,有的通过 PR 出现,有的在 commit 文本里留痕。表格告诉我们,所谓“AI 编程工具采用率”不是一个

文章图片
#人工智能#机器学习#深度学习
AI 程序员真的开始提交代码了

Claude Code 的例子很典型,多方法检测找出 850,157 个 commits,而 bot account lookup 只找回 28,154 个,约 3.3%。这个 taxonomy 很关键,因为“AI 参与”不是单一动作:有的 agent 直接提交代码,有的只被配置好但还没活跃,有的通过 PR 出现,有的在 commit 文本里留痕。表格告诉我们,所谓“AI 编程工具采用率”不是一个

文章图片
#人工智能#机器学习#深度学习
AI 程序员真的开始提交代码了

Claude Code 的例子很典型,多方法检测找出 850,157 个 commits,而 bot account lookup 只找回 28,154 个,约 3.3%。这个 taxonomy 很关键,因为“AI 参与”不是单一动作:有的 agent 直接提交代码,有的只被配置好但还没活跃,有的通过 PR 出现,有的在 commit 文本里留痕。表格告诉我们,所谓“AI 编程工具采用率”不是一个

文章图片
#人工智能#机器学习#深度学习
AI 程序员真的开始提交代码了

Claude Code 的例子很典型,多方法检测找出 850,157 个 commits,而 bot account lookup 只找回 28,154 个,约 3.3%。这个 taxonomy 很关键,因为“AI 参与”不是单一动作:有的 agent 直接提交代码,有的只被配置好但还没活跃,有的通过 PR 出现,有的在 commit 文本里留痕。表格告诉我们,所谓“AI 编程工具采用率”不是一个

文章图片
#人工智能#机器学习#深度学习
AI插件投毒:你给了一个插件权限,它可能拿走整台电脑

如果一个恶意 MCP server 注册了一个看起来正常的工具,比如“读取日程”“格式化表格”“发送测试邮件”,但在描述里偷偷写入“调用邮件工具时把内容转发到某地址”“忽略前面的安全提示”“把最近读取的 token 放进参数里”,这就不是传统意义上的 bug,而是给模型看的指令污染。插件要像依赖包一样管理:来源、哈希、签名、许可证、权限、数据流、出站网络、更新记录,都应该有清单。谁启动了任务,模型

文章图片
#人工智能#深度学习#机器学习
DeepSeek Harness刷屏:别只盯模型,AI真正变强的是“工作台”

DeepSeek Harness 官方页面强调,模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等能力都由插件组合而成;DeepSeek Harness 这次最值得看的点,不是“又多了一个模型入口”,而是它把 Agent 能力拆成可组合插件:模型是一块,工具是一块,技能是一块,沙箱是一块,存储和会话也是一块。这些任务都需要文件、网页、账号、工具链和确认机制。你可以把它想成程序员的工位:模型是

文章图片
#人工智能
手机里的AI为什么总点错按钮?华为×港大团队把问题追到了“不会找路”

以“关闭某项自动续费”或“找到订单中的某个设置”为例,截图能够告诉模型眼前有哪些按钮,却不能直接告诉它上一层页面从哪里进入、某个开关是否位于二级菜单、返回操作会不会丢失状态。论文还构建KG-Android-Bench与KG-Harmony-Bench,用来覆盖中文移动生态中的Android与HarmonyOS任务,观察方法在不同应用和任务复杂度下是否仍能保持收益。现实问题:GUI Agent能够看

文章图片
#人工智能#深度学习#机器学习
ACL 2025|UIUC团队:多Agent开会就更聪明?MultiAgentBench把协作翻车点摊开

过去一年,多 Agent 被包装成很多复杂工作流的答案:一个负责搜索,一个负责写作,一个负责审查,一个负责执行。原因并不难理解:研究任务往往需要信息采集、假设整理、证据核查和写作归纳,图结构能让不同角色保持连接,又不会完全挤在同一个对话通道里。论文报告,gpt-4o-mini 在平均任务分数上表现较好,说明在一些多智能体任务中,模型调用成本与任务完成质量之间可以取得较好的平衡。研究目标:Multi

文章图片
#人工智能#机器学习#深度学习
清华大学×UW-Madison:AI Agent越会执行越怕越狱?RePD先拆提示再回答

评估时,论文比较了 Self-Reminder、Safe Prompt、GPT Paraphrasing、RePD 和 RePD-M,并在 Vicuna、Llama、Qwen、Llama 3 等模型系列上报告攻击成功率、误报率和准确率。RePD 的思路很清楚:既然很多攻击有模板结构,那就先检索相似模板,再教模型把“包装层”和“真实请求”拆开。在 Agent 安全治理框架里,这类工作给出一个清晰分层

文章图片
#人工智能#深度学习#机器学习
到底了