logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

打断不是听到声音就闭嘴:语音 Agent 的话权状态怎样真正收敛

文章摘要 本文探讨了语音交互系统中打断机制的完整实现路径。作者指出,真正的自然打断不是简单的VAD检测,而需要经历六个收敛阶段:从候选事件检测到物理停止,再到历史修复的状态链。关键点包括: VAD事件不等于话权决策,需要结合多维度证据; 重叠声音应分类为竞争性打断、听者附和、旁人语音和环境声四种类型; 完整打断流程包含六个状态阶段,每个阶段都需要独立确认; 系统需要区分生成、发送、缓冲和播放四个进

文章图片
#语音识别#人工智能#AI +1
同一个模型为什么在不同 Agent 里表现不同:模型与 Harness 的责任边界

本文探讨了同一AI模型在不同Agent系统中表现差异的原因,重点分析了模型与外围系统(Harness)的责任边界问题。文章指出,模型表现差异的核心在于四个方面:观察空间(输入信息)、动作空间(可用工具)、反馈语义(执行结果)和状态管理(任务进度)。作者提出五步诊断法来准确定位问题:1)检查模型是否获得完整信息;2)验证可用工具是否合适;3)确认反馈是否准确;4)核查状态管理;5)在前四项无误时再考

文章图片
#AI#ChatGPT
让不同大模型共享一个 Agent:Pi 如何统一 Provider 与 Context Handoff

文章摘要(149字): Pi AI 提出多模型 Agent 的核心挑战在于实现跨模型的任务连续性,而非简单聚合 API。其架构通过三层抽象(Provider、Model、API Implementation)分离运行时归属、能力描述与协议实现,确保模型切换时保留可执行上下文。关键设计包括:动态/静态模型目录互补、惰性加载 Provider 以减少开销、统一流式事件合同,以及组合式认证管理。该方案强

文章图片
#人工智能#AI
从 DeepSeek Harness 看:Tool 注册成功,为什么还不等于安全可用

工具出现在 Tool 列表中,只说明模型知道其名称和参数,并不代表 Provider 已装载、参数经审批、Sandbox 覆盖网络进程,或失败后外部资源已回滚。文章拆解了完整执行链:模型 Schema → 参数冻结 → pre-execute 决策(allow/deny/ask)→ 审批 → monotonic guards(只能拒绝或维持,不能翻转为允许)→ execute wrapper →

文章图片
#人工智能#AI
Pi Agent Loop 源码解析:Context、Streaming、Tool Calling、Steering 与停止条件

本文解析了 Pi Agent Loop 的核心机制,基于 v0.82.1 版本源码。Pi 的 Agent Loop 并非简单的 while 循环,而是需要处理多种复杂场景,包括消息转换、流式响应、工具调用验证、串并行执行、转向控制、后续处理以及终止条件等。文章详细拆解了 Agent Loop 的四层消息边界、状态管理机制、prompt()调用流程,并重点分析了其独特的双层循环设计(工具转向循环+后

文章图片
#人工智能#AI
DeepSeek 把 Agent Core 也插件化了:Harness 的真正赌注

DeepSeek Harness 通过将 Agent 核心功能插件化,实现了高度模块化的 AI Agent 开发架构。其核心创新在于模型适配器、Agent 循环、会话日志、工具注册等核心组件都采用 Cordis 插件系统管理,使开发者能够灵活组合不同功能模块。这种设计减少了代码分支和核心复制需求,但同时也带来了插件图管理、接口契约定义等新挑战。目前仍处于开发者预览阶段,官方警告可能存在兼容性破坏,

文章图片
#AI#DeepSeek
Pi Agent 为什么不内置 MCP:工具发现与上下文成本的真实争议

本文探讨了AI助手Pi未内置MCP(模型调用协议)的深层原因,揭示了工具集成的复杂性。文章指出,单纯接入MCP协议并不能自动解决上下文管理、token消耗、权限治理等问题,而CLI方案同样面临隐性成本。作者提出应当区分协议规范与宿主策略,并通过五维成本模型(发现/上下文/结果/治理/运维)评估不同集成方案。Pi采用"小核心+扩展"架构,将标准化成本转移给扩展层,在保持核心简洁的同时允许团队按需选择

文章图片
#人工智能#AI
Pi Agent 为什么不内置 MCP:工具发现与上下文成本的真实争议

本文探讨了AI助手Pi未内置MCP(模型调用协议)的深层原因,揭示了工具集成的复杂性。文章指出,单纯接入MCP协议并不能自动解决上下文管理、token消耗、权限治理等问题,而CLI方案同样面临隐性成本。作者提出应当区分协议规范与宿主策略,并通过五维成本模型(发现/上下文/结果/治理/运维)评估不同集成方案。Pi采用"小核心+扩展"架构,将标准化成本转移给扩展层,在保持核心简洁的同时允许团队按需选择

文章图片
#人工智能#AI
打断不是听到声音就闭嘴:语音 Agent 的话权状态怎样真正收敛

文章摘要 本文探讨了语音交互系统中打断机制的完整实现路径。作者指出,真正的自然打断不是简单的VAD检测,而需要经历六个收敛阶段:从候选事件检测到物理停止,再到历史修复的状态链。关键点包括: VAD事件不等于话权决策,需要结合多维度证据; 重叠声音应分类为竞争性打断、听者附和、旁人语音和环境声四种类型; 完整打断流程包含六个状态阶段,每个阶段都需要独立确认; 系统需要区分生成、发送、缓冲和播放四个进

文章图片
#语音识别#人工智能#AI +1
VLA 落地先签动作合同:从视觉语言输入到可执行控制指令

文章摘要 本文探讨视觉语言动作模型(VLA)在实际机器人系统中的落地问题,指出模型能输出动作张量并不意味着可直接控制机器人。关键挑战在于建立完整的动作接口合同,包括输入时序对齐、动作语义定义、执行安全协议等。文章系统分析了五类动作表示方法(关节动作、末端Delta Pose、离散Token、连续Action Chunk、技能调用)的特点与适配要求,提出动作表示、生成头和控制频率的三层架构,并给出跨

文章图片
#AI#ChatGPT
    共 108 条
  • 1
  • 2
  • 3
  • 11
  • 请选择