
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文提出的ACTIONENGINE框架通过利用可更新的状态机图作为记忆,将GUI交互转变为确定性的图遍历,从而实现了程序化规划。现有的GUI代理通常通过逐步调用视觉语言模型(MLLM)来完成任务,这种方式在每一步都需要进行推理和行动,导致计算成本高、延迟大,并且由于缺乏对之前访问页面的持久记忆,准确性也受到限制。这个状态机图无法覆盖所有情况(不同客群看到的UI可能是不同的),且UI发生更新的时候,
策略网络(Actor):输出动作分布的参数(连续动作空间为例)nn.ReLU(),nn.ReLU(),nn.Linear(hidden_dim, action_dim) # 输出动作均值(方差单独初始化)self.log_std = nn.Parameter(torch.zeros(action_dim)) # 动作方差的对数return dist.Normal(mean, std) # 返回正态
截断:只保留到“最后一次满足已完成前缀的检查点”为止的那段轨迹(确保留下的都是干净的、被验证过的正确片段)。任务修复/重写:把已经完成的子任务从原 DAG 路径里删掉,只保留未完成的后半段,形成“剩余任务指令 Irem”,并把“剩余任务 + 已验证前缀轨迹”作为一个训练样本保存。直观理解做对的部分留下来当标准答案;做错之后的部分不硬喂给模型;同时把“后续没做完的目标”单独生成一个新任务,方便后续继
符号含义pTp_TpT教师模型(Teacher)的概率分布pθSp_\theta^SpθS学生模型(Student)的概率分布,θ\thetaθ是可学习参数xxx输入序列yy1y2yLyyy1y2...yLy输出序列,共LyL_yLy个词元yny_{<n}yn第nnn个词元之前的所有词元(即前缀)VVV词汇表,共MMM个词元词元级散度定义(即衡量两个模型在序列yyyDpT∥pθSy
简单来说,SDFT 的核心思想是**“让模型自己教自己”**。由于现在的大语言模型都具备很强的“上下文学习能力(In-context Learning)”——只要你在提示词里给它看个好例子,它立马就能照猫画虎给出高质量回答。SDFT 就是利用了这个特点来搞训练。角色扮演(老师与学生)在训练时,把同一个大模型老师模型(Teacher):给它输入“问题” + “专家提供的完美示范(Demonstrat
策略网络(Actor):输出动作分布的参数(连续动作空间为例)nn.ReLU(),nn.ReLU(),nn.Linear(hidden_dim, action_dim) # 输出动作均值(方差单独初始化)self.log_std = nn.Parameter(torch.zeros(action_dim)) # 动作方差的对数return dist.Normal(mean, std) # 返回正态
本文提出的ACTIONENGINE框架通过利用可更新的状态机图作为记忆,将GUI交互转变为确定性的图遍历,从而实现了程序化规划。现有的GUI代理通常通过逐步调用视觉语言模型(MLLM)来完成任务,这种方式在每一步都需要进行推理和行动,导致计算成本高、延迟大,并且由于缺乏对之前访问页面的持久记忆,准确性也受到限制。这个状态机图无法覆盖所有情况(不同客群看到的UI可能是不同的),且UI发生更新的时候,
截断:只保留到“最后一次满足已完成前缀的检查点”为止的那段轨迹(确保留下的都是干净的、被验证过的正确片段)。任务修复/重写:把已经完成的子任务从原 DAG 路径里删掉,只保留未完成的后半段,形成“剩余任务指令 Irem”,并把“剩余任务 + 已验证前缀轨迹”作为一个训练样本保存。直观理解做对的部分留下来当标准答案;做错之后的部分不硬喂给模型;同时把“后续没做完的目标”单独生成一个新任务,方便后续继
论文在 Section 6 “Design Implications”中先给出 5 个面向未来“记忆增强 GUI agent”的架构方向,并在 Appendix A.8.4 将其扩展为更可执行的建议清单,并明确这些建议来自 Section 6 的失败模式分析与实证结果(如 Section 5.2)。同时在 Appendix A.8.1 给出更细的失败模式定义与代表性轨迹案例(Figures 9–1







