logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

AgentScope Java 2.0 正式发布:内置生产级 Harness,助力智能体迈向分布式企业场景

AgentScope 框架推出已经有两年的时间了。我们在上半年发布了 2.0 版本,2.0 版本主要的一个核心能力,就是把 Harness 整套方案内置到了框架里面。这也意味着我们面向的场景,主要是企业级的分布式智能体这样一个场景。本文主要从三部分来给大家介绍。第一部分是大家都关心的 2.0 主要有哪些核心能力。有一些开发者包括企业内已经非常重度地用 AgentScope 1.0 构建了很多生产级

OpAgent:登顶WebArena的多模态Web GUI Agent

最终,集成了所有优化的 OpAgent 整体框架(使用 Gemini-3-Pro 作为部分模块后端,Qwen2.5-VL-MFT 作为 Grounder ),在 WebArena 上达到了 71.6% 的成功率,刷新了该基准的 SOTA 记录,并登顶排行榜。对比 RL 优化前后的模型在不同 Pass@K 下的表现,可以看到随着尝试次数 K 的增加,RL优化后模型的性能优势愈发明显,Pass@5 的

#多模态
当 AI Agent 接管手机:移动端如何进行观测

最近,基于 AI Agent 的各种手机助手在社交媒体上爆火,它能够通过 AI 自动操作手机完成下单、比价、搜索等复杂任务。用户只需说一句"帮我找最便宜的 iPhone",AI 就能自动打开购物 App、搜索商品、对比价格并完成下单。这种"AI 接管手机"的场景,让很多人看到了未来人机交互的新形态。转换率虚高:AI 自动下单会对转换率数据造成干扰,导致业务决策误判用户路径分析失效:AI 操作的路径

当 AI Agent 接管手机:移动端如何进行观测

最近,基于 AI Agent 的各种手机助手在社交媒体上爆火,它能够通过 AI 自动操作手机完成下单、比价、搜索等复杂任务。用户只需说一句"帮我找最便宜的 iPhone",AI 就能自动打开购物 App、搜索商品、对比价格并完成下单。这种"AI 接管手机"的场景,让很多人看到了未来人机交互的新形态。转换率虚高:AI 自动下单会对转换率数据造成干扰,导致业务决策误判用户路径分析失效:AI 操作的路径

当 AI Agent 接管手机:移动端如何进行观测

最近,基于 AI Agent 的各种手机助手在社交媒体上爆火,它能够通过 AI 自动操作手机完成下单、比价、搜索等复杂任务。用户只需说一句"帮我找最便宜的 iPhone",AI 就能自动打开购物 App、搜索商品、对比价格并完成下单。这种"AI 接管手机"的场景,让很多人看到了未来人机交互的新形态。转换率虚高:AI 自动下单会对转换率数据造成干扰,导致业务决策误判用户路径分析失效:AI 操作的路径

为什么 AI Agent 重新爱上了文件系统(Filesystems)

大家开始编写 aboutme.md 文件,来充当可移植的身份描述 ------ 你的偏好、你的技能、你的工作风格,全都放在一个文件里,这个文件可以在不同应用间流转,无需任何人去对接 API。而是说:你的数据、你的上下文、你的偏好、你的技能、你的记忆 ------ 以一种你拥有的格式存在着,任何智能体都能读取,不会被锁死在某个特定的应用里。他指出,Claude Code 之所以有效,是因为它运行在你

#人工智能#文件系统
本地跑 Gemma 4 替代 Claude Code?M4 Max 实测告诉你为什么行不通

这次实测最大的收获,不是验证了"本地模型能不能替代 Claude Code",而是更清晰地看到了云端大模型和本地推理之间的真实差距——尤其是在上下文容量和处理速度这两个维度上。Claude Code 的产品设计从一开始就深度绑定了云端超长上下文的能力,光系统提示就接近 3 万 Token。这不是当前任何 26B 级别的本地模型能优雅承载的。也许等本地模型的上下文窗口和推理速度再跨上一个台阶,这条路

Vibe Coding AI 编程实践

因此,在本次 AI 浪潮刚刚掀起的时候,无论是出于为产出负责的原则,还是源自对 AI 提效的不信任,对于 Vibe Coding 我都是较为抗拒的。理论层面上,在现阶段,以及可预见的相当长一段时间的近未来内,不管人工智能的能力和表现形式发展到什么程度,它的根基仍然是概率模型——换句话说,LLM 的输出结果不是基于理性思考的推理,而是基于概率链的猜测。生成的照片和视频从最早的“鬼画符”变得以假乱真,

#人工智能
破局“数据孤岛”:北京人形具身智能全栈数据底座解密

在具身智能研发的一线,让开发者们最头疼的往往不是底层算法的推倒重来,而是数据基建的极度匮乏。现阶段,行业普遍面临获取成本高昂、长尾场景极难覆盖、数据与单一机器人硬件(本体)重度绑定的系统性难题。单点产品(单一的数据集或仿真库)固然能解决局部问题,但在向通用大模型演进的过程中,开发者需要的是一套能够运转起来的“数据飞轮”。北京人形机器人创新中心(以下称北京人形)率先落地了一套面向具身智能的大规模数据

    共 25 条
  • 1
  • 2
  • 3
  • 请选择