logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

机器人策略 90% 与 92%:为什么两个百分点通常不足以证明更

90% 与 92% 不是"2 个百分点",而是一组带实验设计和不确定性的证据。100 次对 100 次通常不足以证明这种小差异——配对场景、层级任务结构和预先定义的最小关心差异才决定统计方法。RoboLab v4 每个策略每项任务只运行 10 次 episode;论文附录直接给出量级:单任务成功率在 p≈0.9 时 95% 区间半宽约 19pp,即使增到 100 次在同一成功率附近仍约 6pp。作

文章图片
#人工智能#深度学习#AI
删掉邮箱后,Agent Trace 仍可能泄露什么:一条可重放脱敏流水线

删掉邮箱后,Trace 仍可能通过工具结果/内部文档/secret/准标识符组合泄密;删得过多又会破坏失败重放。真正的问题不是把更多字符串替换成 ***,而是做可验证转换——删掉不该进入评测资产的内容,同时保留失败复现需要的实体关系、状态变化、工具 Schema、判定条件。风险在 Trace 生成时就出现。OpenAI Agents SDK tracing 默认启用。关闭一个开关不会机械清空其他副

文章图片
#人工智能#AI#深度学习
RoboLab 解读:机器人策略评测为什么不能只看二元成功率

同一 90% 可能隐藏完全不同的机器人——A 简单抓取稳定但无法处理空间关系;B 完成大部分步骤只在最后放置阶段失败。压缩成同一数字时,能力结构/失败位置/轨迹质量/统计不确定性会同时丢失。NVIDIA RoboLab(v4 / RSS 2026 / arXiv 2604.09860v4)把任务型机器人评测放入 Isaac Lab 高保真模拟:120 任务 / 平均 2.02 子任务 / 9.0

文章图片
#人工智能#深度学习#AI
Claude 已经给文本加水印了吗?真正缺的不是声明,而是逐模型状态

Claude 文本水印已入正式产品制度,但现有主力模型的逐项覆盖状态仍无法从公开资料审计。Fable 5/Opus 5/Sonnet 5/Haiku 4.5 四个主力全早于 8-2,截至 8-26 帮助页没逐模型清单,模型目录无 watermark_supported 字段。"supported Claude models" 这个限定词决定工程判断能否成立。一份声明三种状态:制度已启动(已签 EU

文章图片
#人工智能#AI#ChatGPT
Claude 已经给文本加水印了吗?真正缺的不是声明,而是逐模型状态

Claude 文本水印已入正式产品制度,但现有主力模型的逐项覆盖状态仍无法从公开资料审计。Fable 5/Opus 5/Sonnet 5/Haiku 4.5 四个主力全早于 8-2,截至 8-26 帮助页没逐模型清单,模型目录无 watermark_supported 字段。"supported Claude models" 这个限定词决定工程判断能否成立。一份声明三种状态:制度已启动(已签 EU

文章图片
#人工智能#AI#ChatGPT
机器人接入 AI 连续语音后,端云架构要改什么?

连续语音进入机器人后,声音停止 ≠ 播放/任务/动作同时停止。系统拆三平面:媒体、交互控制、物理动作。五类身份 + trace_id:session/utterance/response/playback/task/action;服务端 sent_at ≠ 用户听见,客户端 received_at ≠ 播放完成,端侧 played_until_ms 是软件进度代理而非声学真值。动作生命周期独立:p

文章图片
#机器人#人工智能#架构 +1
机器人接入 AI 连续语音后,端云架构要改什么?

连续语音进入机器人后,声音停止 ≠ 播放/任务/动作同时停止。系统拆三平面:媒体、交互控制、物理动作。五类身份 + trace_id:session/utterance/response/playback/task/action;服务端 sent_at ≠ 用户听见,客户端 received_at ≠ 播放完成,端侧 played_until_ms 是软件进度代理而非声学真值。动作生命周期独立:p

文章图片
#机器人#人工智能#架构 +1
DeepSeek Harness:一次 Prompt 如何变成 Turn、Step 与工具事件

这篇文章探讨了DeepSeek Harness中Agent处理用户Prompt的完整生命周期,将其分解为Turn、Step、工具执行等关键阶段。核心观点包括: 消息处理流程分为多层级:Inbox接收输入→Turn建立执行边界→Step处理模型请求→工具批次执行→Session记录可重放事实 Turn代表执行边界,可能包含多个Step(模型往返)或没有Step(如被拒绝时) Step对应单次模型请求

文章图片
#人工智能#AI#DeepSeek
DeepSeek Harness、Codex、Claude Code、LangGraph 应该怎么选:先判断你缺的是产品、底盘还是工作流

本文探讨了如何根据实际需求选择合适的AI开发工具:DeepSeek Harness、OpenAI Codex、Claude Code和LangGraph。文章指出这些工具处于不同层级,分别对应可直接使用的Coding Agent产品(Codex/Claude Code)、可深度重组的Agent Runtime(DeepSeek Harness)和显式编排的工作流框架(LangGraph)。 选择建

文章图片
#人工智能#AI#DeepSeek
DeepSeek Harness、Codex、Claude Code、LangGraph 应该怎么选:先判断你缺的是产品、底盘还是工作流

本文探讨了如何根据实际需求选择合适的AI开发工具:DeepSeek Harness、OpenAI Codex、Claude Code和LangGraph。文章指出这些工具处于不同层级,分别对应可直接使用的Coding Agent产品(Codex/Claude Code)、可深度重组的Agent Runtime(DeepSeek Harness)和显式编排的工作流框架(LangGraph)。 选择建

文章图片
#人工智能#AI#DeepSeek
    共 127 条
  • 1
  • 2
  • 3
  • 13
  • 请选择