logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

The 2nd Workshop on Multi-Modal Reasoning for Agentic Intelligence第二届多模态智能推理研讨会MMRAgI CVPR

然而,此类代理的现有实现通常仅限于处理文本输入,从而忽略了视觉和听觉模态提供的丰富且互补的信息。至关重要的是,多模态推理系统的可解释性和鲁棒性仍然是尚未解决的基础性问题,直接影响着可靠的现实世界应用(例如,科学人工智能代理、仿生机器人)的部署。本次研讨会主要聚焦于从增强多模态感知和推理的角度推进基于MFM的智能体的发展。由于 CVPR 2026 对非存档接收没有严格的截止日期,我们决定将提交截止日

#人工智能
HELM:弥补 VLA 的记忆缺口、验证缺口与恢复缺口,形成 Agentic 系统

本文提出 HELM——一个模型无关的通用框架,通过三个核心组件应对这些缺陷:基于 CLIP 索引关键帧提取任务关键历史的片段记忆模块,能够从观察、动作、子目标及记忆条件化上下文中预判动作失败的习得状态验证器,以及执行回滚与重规划的增强控制器。整个流程你可以想象成:VLA 还是那个 VLA,但它现在不是"看到就动"了,而是要先"翻翻笔记"(EMM),再"想想对不对"(SV),错了就"倒车重来"(HC

#人工智能#深度学习#算法
Computer-Use Agent训练新范式!阿里通义提出ToolCUA,实现GUI与工具自主择优动态切换

ToolCUA的发布,标志着计算机操作智能体从“能点按”向“会选择”迈出了关键一步。它不再盲目地依赖GUI动作,也不会毫无节制地调用工具,而是学会了在二者之间。

#人工智能
什么叫agent中的harness engineering, 和传统的agent设计模式有什么异同 可控、可复用、可验收

它本质上是一种系统工程/基础设施工程视角。Harness engineering = 把 agent 从“会做题的模型”变成“可治理的生产系统”的那层工程。如果你愿意,我下一条可以继续给你展开:“ReAct / Plan-Execute / Supervisor / Reflection / Harness 之间的分层关系图”,我可以直接按 AI agent 面试口径给你讲。

#设计模式
可算有个视频Agent做短剧能不剪辑直出100集了,还有不限速Seedance2.0 商汤Seko

可以自己选生图模型,然后也可以自己上传视频里面会用到的主体,然后还可以选整个视频想要的制作风格,最近很火的邵氏电影,胡金铨武侠,怪谈漫画风格等等等都有,接下来Seko会给你直接设计好每一个分镜的提示语,然后你可以一键转成视频,也可以一个一个镜头去确认它的提示语,编辑提示语,觉得是一切都OK了之后再单个镜头生成。打开默认视图,还可以进行剪辑,可以增删镜头,剪辑每个镜头的时长,然后最后拼成一个自己想要

#人工智能
[智能运维]阿里云正式发布 RCA Benchmark,业界首个面向 Agentic Ops 的根因分析开源基准体系

项目创新引入四层结构化真值体系,摒弃传统单一根因标签模式,从故障类型、归一化实体、因果传播链路到关键证据节点完成标准化定义,配套定因、定界、过程三维加权评分框架,按 40%、30%、30% 权重核算综合得分,近七成评分依托故障类型拓扑语义距离、实体拓扑距离做确定性量化计算,从故障语义匹配、拓扑定位精度、诊断证据与因果逻辑完整性多维度分级判定,从机制上规避随机命中带来的评估偏差,全程规则透明、结果可

#运维#阿里云#开源
Agent Harness,硅谷爆火的全新AI技术框架

Harness将与领域本体深度结合,将行业本体的规则、约束直接内置到Harness的校验层,实现业务规则的机器可执行化,进一步提升Agent在垂直行业的确定性与合规性,这也是金融、政务等强监管场景的核心发展方向。,子Agent的工作内容不会污染主Agent的核心上下文,大幅提升token效率;违规行为的自动拦截与告警;:未来将出现专门的HaaS厂商,提供开箱即用的、针对不同垂直场景的Harness

#人工智能
蛋白质生产成本直降40%!GPT-5自主实验室颠覆生物制造

整个系统形成了完整的闭环工作流程:GPT-5设计实验方案,经Pydantic模型验证确保科学合理性后,由机器人系统执行实验,产生的数据再反馈给AI进行分析和学习。更重要的是,在自动化实验室环境中,试剂成本成为主要限制因素,这与AI优化降低成本的目标高度一致。传统蛋白质生产依赖细胞培养,过程复杂且成本高昂,而无细胞蛋白质合成CFPS技术虽然避免了活细胞的限制,避免了整个细胞培养的复杂性,但其优化过程

#人工智能
vla训练为什么要Domain Randomization

vla训练为什么要Domain RandomizationVLA(Vision-Language-Action)训练里用Domain Randomization(域随机化,DR)训练环境搞得“变化很大”依赖真正稳定的任务语义尤其是做时,Domain Randomization 几乎是最经典的手段之一。

#数据库#人工智能
DeepMind果蝇登上Nature!强化学习再立功!AI模拟飞行,逼真到腿毛颤抖!

(k) 半透明可视化几何体的底视图,浅蓝箭头指示关节:立方体为6自由度自由关节(模拟器中自由质心运动所需,非果蝇内在自由度),箭头为铰链关节(指向正向旋转方向),三铰链关节组等效形成球关节。由于仅凭这些2D关键点的位置,无法明确推断出所有身体自由度(DoFs)的3D姿态,因此研究者采用了一种正则化的逆运动学方法,推断出所有自由度的完整3D飞行器姿态轨迹的近似值。它能沿着复杂的自然飞行轨迹移动,比如

#人工智能
    共 1430 条
  • 1
  • 2
  • 3
  • 143
  • 请选择