logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

机器人 / 物理 Agent Harness 综合分析与对比:从「更强的模型」到「更好的系统」

路线一:分层编排(Hierarchical Orchestration)——已成事实标准。几乎所有新系统都采用"慢脑决策 + 快脑执行"的两层甚至三层架构。差异只在:决策者是否冻结(HumanCLAW/RPent 冻结,RoboClaw 用 ICL)、执行者是否学习(RoboClaw 的 VLA 训练,RPent 的 VLA 冻结)。这条路线已从"学术选项"变为"工业默认"。路线二:基元/技能化接

#人工智能#机器学习#深度学习
[源码阅读] 阿里SOFA服务注册中心MetaServer(3)

SOFARegistry 是蚂蚁金服开源的一个生产级、高时效、高可用的服务注册中心。本系列将带领大家一起分析其MetaServer的实现机制。本文为第三篇,介绍MetaServer如何基于raft实现了数据一致性。因为篇幅限制,本文不会涉及Raft 和 JRaft 的原理和实现,只是讲解如何基于 JRaft 的具体实现。

#微服务
机器人模型(WM / WAM / VLA)综合分析与对比:从「看」到「想」再到「做」

路线一:三层/分层协同(Hierarchical Composition)——已成工程事实标准。π0.7(LLM→BAGEL→VLA)与 τ₀-VLA(高层规划→低层执行)分别示范了"工具分工式"和"思考预算式"两种分层。差异只在:高层是否训练(π0.7 的 70B 规划器需微调,τ₀-VLA 的 Proposal/Value/Reflective 都训练)、世界模型放哪(条件 vs 评估)、接口

#机器学习#深度学习#人工智能
[Agent Memory / 强化学习] MemPO源码学习笔记 —(1)— 总体

目标是训练一个强化学习智能体代理(Agent),通过交互学习获得有用的记忆能力,从而在部分可观察的环境中利用历史信息更好地完成任务。MemPO 的环境不是独立的外部模拟器,而是一个紧耦合在训练循环中的异步 Agent Loop。用 SGLang 停止词 模拟 “环境暂停 → 注入观测 → 继续” 的交互用 response_mask 区分 “agent 行为” 和 “环境反馈”在循环中原地收集记忆

#学习#人工智能#机器学习 +1
【OpenClaw具身硬件】ZeroClaw 源码阅读笔记(4)--- 代码执行

ZeroClaw 不是 “附加” IoT 功能,而是从底层设计为边缘 IoT+AI Agent 的运行时,硬件控制、IoT 协议、低功耗部署都是原生核心能力,适合快速搭建带自然语言交互的智能物联网系统。在SOP.tomlMQTTpayload 会被转发到 SOP 事件 payload(),然后显示在步骤上下文中。SOP.toml[sop]description = \"生成每日运营摘要\"SOP.

#microsoft#人工智能#机器学习 +2
【OpenClaw具身硬件】ZeroClaw 源码阅读笔记(4)--- 代码执行

ZeroClaw 不是 “附加” IoT 功能,而是从底层设计为边缘 IoT+AI Agent 的运行时,硬件控制、IoT 协议、低功耗部署都是原生核心能力,适合快速搭建带自然语言交互的智能物联网系统。在SOP.tomlMQTTpayload 会被转发到 SOP 事件 payload(),然后显示在步骤上下文中。SOP.toml[sop]description = \"生成每日运营摘要\"SOP.

#microsoft#人工智能#机器学习 +2
[源码解析] 模型并行分布式训练Megatron (1) --- 论文 & 基础

NVIDIA Megatron 是一个基于 PyTorch 的分布式训练框架,用来训练超大Transformer语言模型,其通过综合应用了数据并行,Tensor并行和Pipeline并行来复现 GPT3,值得我们深入分析其背后机理。

#深度学习
【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 ----(3)算法篇(RLPD)

配置启用:在中设置正则化组合:配合 Dropout 和权重衰减获得最佳效果超参数调整:层归一化后可以使用更大的学习率针对性优化:根据任务类型(视觉/状态)调整正则化强度性能监控:添加统计信息验证层归一化的实际效果在 SERL 框架中,这种实现方式既保持了代码的简洁性,又充分利用了 Flax/JAX 的模块化优势,是提高 Critic 网络训练稳定性和性能的有效手段。

#机器人#算法#机器学习 +1
【机器人 / 强化学习】HIL-SERL 算法篇:HG-DAgger 与 RLPD —— 从模仿到超越的训练双阶段

是一条完整的能力进化链。HG-DAgger 解决的是"如何安全、高效地获取高质量纠正数据",RLPD 解决的是"如何利用这些数据超越人类表现"。HG-DAgger 和 RLPD 共享相同的干预接口(SpaceMouse 拦截、env.step 的 intervene_action 通道),但处理数据的策略截然不同——一个用监督学习模仿人类,一个用强化学习优化回报。奖励信号的两种角色。

#机器人#算法#人工智能 +1
【OpenClaw具身硬件】ZeroClaw 源码阅读笔记(3)— RAG

HardwareRag是一个轻量的本地RAG索引,HardwareRag是适用于外设场景的实用离线RAG层,用于把硬件datasheet(.md/.txt,带可选PDF支持)切片、解析pin别名,并基于关键字把相关片段与别名注入到agent/LLM的上下文中,能显著提高L LM在硬件控制与解释上的可靠性。这种设计完美体现了ZeroClaw"零开销、零妥协“的核心理念,既保持了AI助手的强大能力,又

#jvm#java#深度学习 +2
    共 206 条
  • 1
  • 2
  • 3
  • 21
  • 请选择