logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

开源人形机器人 RL 框架 Humanoid-Gym 论文解读:零样本 Sim2Real,从原理到本地部署

本文介绍了开源人形机器人强化学习框架Humanoid-Gym,该框架实现了零样本仿真到真实(Sim2Real)迁移,无需真实微调即可直接部署。通过域随机化、五分量奖励函数、高并行训练和Sim2Sim验证等关键技术,该框架在多种真实场景下实现了稳定的双足行走。文章详细说明了本地部署流程,包括环境配置、训练和评估步骤,并讨论了其适用场景与局限性。Humanoid-Gym作为完全开源的项目,已成为人形机

文章图片
#开源#机器人#机器学习
开源 TTRL 论文解读:用多数投票当奖励信号在无标签测试数据上跑 GRPO,Qwen2.5-Math-7B AIME 2024 pass@1 提升 211%

清华大学PRIME实验室提出的TTRL(Test-Time Reinforcement Learning)是一种在无标注数据上进行强化学习的新方法,解决了传统RLVR(Reinforcement Learning with Verifiable Rewards)依赖标准答案的局限性。TTRL通过多数投票(majority voting)从模型自身采样中提取伪标签作为奖励信号,驱动GRPO(Grou

文章图片
#机器人#机器学习
开源双臂模仿学习Aloha ACT 论文解读

这篇论文提出了一种低成本的双臂精细操作框架ALOHA,结合基于Transformer的动作分块策略(ACT),实现高精度双手机器人控制。核心创新包括: 硬件层面:使用商用机械臂(单台$5600)和3D打印夹爪搭建低成本遥操作系统ALOHA,仅需4个普通USB摄像头。 算法层面:提出ACT方法,通过动作分块(预测100步动作序列)和时序集成技术,将50条人类演示转化为成功率80-90%的策略,无需力

文章图片
#机器学习#机器人#开源
Claude Fable 5 / Mythos 5测评

Anthropic 在 2026 年 6 月 9 日发布了 Claude Fable 5 和 Claude Mythos 5。三天后,Anthropic 又发了一篇声明,说美国政府要求暂停所有用户访问 Fable 5 和 Mythos 5,理由涉及对 Fable 5 的潜在越狱担忧。这个节奏很反常,也让本期测评不能只看榜单。

文章图片
#功能测试
开源 RL 框架 SWITCH 论文解读:用两个边界 token 把潜空间推理拉回 GRPO 训练,Qwen3-8B 在 MATH-500 上 79.3% / GSM8K 89.2%

SWITCH 用一对 `<swi>/</swi>` 边界 token,把 Coconut 风格的潜空间推理重新接回 on-policy GRPO 训练;在 Qwen3-8B 上 MATH-500 拿到 79.3%、GSM8K 89.2%,论文 + 代码 + LoRA 权重 + 数据集全开源。

文章图片
#开源#机器人#机器学习
开源代码模型 Kimi K2.7-Code 首发测评:代码能力暴涨 21.8%,推理 token 反而少了 30%

2026-06-12,月之暗面发布并开源了最新代码模型 Kimi-K2.7-Code。同一天,小米开源了 MiMo Code,摩尔线程开源了 MusaCoder——三款国产开源代码模型同一天发布,这不是巧合。我用了一个下午深度体验 K2.7-Code,结论是:它是三款里最均衡的开源通用代码模型,也是目前国产开源模型里最值得日常切换的选择。

文章图片
#功能测试
开源 Agentic RL 框架 Search-R1 论文解读:base LLM 用 RL 从零学会搜索策略,Qwen2.5-7B 七数据集平均提升 41%

本文介绍了Search-R1,一种通过强化学习(RL)训练大型语言模型(LLMs)自主调用搜索引擎进行推理的方法。与传统的基于提示或RAG的方法不同,Search-R1让模型在RL训练中自行学习何时搜索、搜索什么以及如何处理搜索结果。核心方法包括多轮搜索交互、检索标记掩蔽(Retrieved Token Masking)和基于最终答案的奖励函数。实验显示,该方法在多个QA数据集上显著优于基线模型(

文章图片
#开源#机器学习#机器人
开源 RL 框架 SWITCH 论文解读:用两个边界 token 把潜空间推理拉回 GRPO 训练,Qwen3-8B 在 MATH-500 上 79.3% / GSM8K 89.2%

SWITCH 用一对 `<swi>/</swi>` 边界 token,把 Coconut 风格的潜空间推理重新接回 on-policy GRPO 训练;在 Qwen3-8B 上 MATH-500 拿到 79.3%、GSM8K 89.2%,论文 + 代码 + LoRA 权重 + 数据集全开源。

文章图片
#开源#机器人#机器学习
开源代码模型 Kimi K2.7-Code 首发测评:代码能力暴涨 21.8%,推理 token 反而少了 30%

2026-06-12,月之暗面发布并开源了最新代码模型 Kimi-K2.7-Code。同一天,小米开源了 MiMo Code,摩尔线程开源了 MusaCoder——三款国产开源代码模型同一天发布,这不是巧合。我用了一个下午深度体验 K2.7-Code,结论是:它是三款里最均衡的开源通用代码模型,也是目前国产开源模型里最值得日常切换的选择。

文章图片
#功能测试
开源代码模型 Kimi K2.7-Code 首发测评:代码能力暴涨 21.8%,推理 token 反而少了 30%

2026-06-12,月之暗面发布并开源了最新代码模型 Kimi-K2.7-Code。同一天,小米开源了 MiMo Code,摩尔线程开源了 MusaCoder——三款国产开源代码模型同一天发布,这不是巧合。我用了一个下午深度体验 K2.7-Code,结论是:它是三款里最均衡的开源通用代码模型,也是目前国产开源模型里最值得日常切换的选择。

文章图片
#功能测试
    共 11 条
  • 1
  • 2
  • 请选择