
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文介绍了开源人形机器人强化学习框架Humanoid-Gym,该框架实现了零样本仿真到真实(Sim2Real)迁移,无需真实微调即可直接部署。通过域随机化、五分量奖励函数、高并行训练和Sim2Sim验证等关键技术,该框架在多种真实场景下实现了稳定的双足行走。文章详细说明了本地部署流程,包括环境配置、训练和评估步骤,并讨论了其适用场景与局限性。Humanoid-Gym作为完全开源的项目,已成为人形机

清华大学PRIME实验室提出的TTRL(Test-Time Reinforcement Learning)是一种在无标注数据上进行强化学习的新方法,解决了传统RLVR(Reinforcement Learning with Verifiable Rewards)依赖标准答案的局限性。TTRL通过多数投票(majority voting)从模型自身采样中提取伪标签作为奖励信号,驱动GRPO(Grou

这篇论文提出了一种低成本的双臂精细操作框架ALOHA,结合基于Transformer的动作分块策略(ACT),实现高精度双手机器人控制。核心创新包括: 硬件层面:使用商用机械臂(单台$5600)和3D打印夹爪搭建低成本遥操作系统ALOHA,仅需4个普通USB摄像头。 算法层面:提出ACT方法,通过动作分块(预测100步动作序列)和时序集成技术,将50条人类演示转化为成功率80-90%的策略,无需力

Anthropic 在 2026 年 6 月 9 日发布了 Claude Fable 5 和 Claude Mythos 5。三天后,Anthropic 又发了一篇声明,说美国政府要求暂停所有用户访问 Fable 5 和 Mythos 5,理由涉及对 Fable 5 的潜在越狱担忧。这个节奏很反常,也让本期测评不能只看榜单。

SWITCH 用一对 `<swi>/</swi>` 边界 token,把 Coconut 风格的潜空间推理重新接回 on-policy GRPO 训练;在 Qwen3-8B 上 MATH-500 拿到 79.3%、GSM8K 89.2%,论文 + 代码 + LoRA 权重 + 数据集全开源。

2026-06-12,月之暗面发布并开源了最新代码模型 Kimi-K2.7-Code。同一天,小米开源了 MiMo Code,摩尔线程开源了 MusaCoder——三款国产开源代码模型同一天发布,这不是巧合。我用了一个下午深度体验 K2.7-Code,结论是:它是三款里最均衡的开源通用代码模型,也是目前国产开源模型里最值得日常切换的选择。

本文介绍了Search-R1,一种通过强化学习(RL)训练大型语言模型(LLMs)自主调用搜索引擎进行推理的方法。与传统的基于提示或RAG的方法不同,Search-R1让模型在RL训练中自行学习何时搜索、搜索什么以及如何处理搜索结果。核心方法包括多轮搜索交互、检索标记掩蔽(Retrieved Token Masking)和基于最终答案的奖励函数。实验显示,该方法在多个QA数据集上显著优于基线模型(

SWITCH 用一对 `<swi>/</swi>` 边界 token,把 Coconut 风格的潜空间推理重新接回 on-policy GRPO 训练;在 Qwen3-8B 上 MATH-500 拿到 79.3%、GSM8K 89.2%,论文 + 代码 + LoRA 权重 + 数据集全开源。

2026-06-12,月之暗面发布并开源了最新代码模型 Kimi-K2.7-Code。同一天,小米开源了 MiMo Code,摩尔线程开源了 MusaCoder——三款国产开源代码模型同一天发布,这不是巧合。我用了一个下午深度体验 K2.7-Code,结论是:它是三款里最均衡的开源通用代码模型,也是目前国产开源模型里最值得日常切换的选择。

2026-06-12,月之暗面发布并开源了最新代码模型 Kimi-K2.7-Code。同一天,小米开源了 MiMo Code,摩尔线程开源了 MusaCoder——三款国产开源代码模型同一天发布,这不是巧合。我用了一个下午深度体验 K2.7-Code,结论是:它是三款里最均衡的开源通用代码模型,也是目前国产开源模型里最值得日常切换的选择。








