
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
传统上,高难度的无人机特技飞行(Aerobatic flight)被视为顶尖人类飞手的专属领域。然而,近期发表于《科学·机器人学》(Science Robotics)的一篇论文,为实现无人机全自主、高机动性特技飞行提供了突破性框架。该研究由浙江大学高飞教授团队主导,提出了一套完整的自主系统,使无人机能够在障碍物密布的复杂环境中,自主生成并执行专业飞手级别的复杂特技动作组合。

然而,当前的视觉语言模型大多采用为特定场景设计的离散文本“思维链”(Chain-of-Thought, CoT),这种方式本质上是对视觉信息的高度抽象和符号化压缩,可能导致时空关系的模糊和细粒度信息的丢失。大量的实验结果表明,FSDrive在轨迹规划、未来帧生成和场景理解等多个任务上均取得了优异的性能,展现了其在推动自动驾驶技术向更高阶的视觉推理迈进方面的巨大潜力。模型的决策不仅基于当前的视觉输入

TrajBooster 框架直面双足人形机器人 VLA 模型训练中的数据稀缺痛点,提出了一种以末端执行器轨迹为核心的跨形态知识迁移方案。通过“真实轨迹提取→仿真重定向→双阶段微调”的创新流程,它成功地将来自轮式机器人的海量数据转化为双足机器人的高效训练资源。该方法不仅大幅降低了对昂贵同形态数据的依赖,更显著提升了模型的动作空间理解力、泛化能力和零样本迁移能力,为双足人形机器人的实用化按下了“加速键

未来的改进方向可以考虑引入物理约束或运动学先验,来规范化从一个状态到另一个状态的运动轨迹,解决极端运动下的参数学习问题。目前的主流方法通常是“两步走”:先分别重建物体在打开和关闭两种状态下的三维模型,然后再去比对这两个模型,猜测部件是如何运动的。实验证明,这种方法不仅显著提升了重建的精度,还能成功处理多达20个部件的复杂物体,远超以往方法的处理能力。,特别是在处理拥有大量运动部件的复杂物体时。,每

学习真实世界中的机器人操作是一项极具挑战性的任务,尤其是在演示数据有限的情况下。现有方法通常依赖仿真增强数据或预设的抓取模块,这些方法不仅难以克服“仿真到现实”的差异,也缺乏可扩展性。虽然大规模模仿学习预训练的视觉-语言-动作 (Vision-Language-Action, VLA) 模型展现了通用潜力,但在数据稀缺场景下如何高效地将这些通用策略适配于特定任务,仍是一个待解决的难题。为应对此挑战

当前主流VLA模型的训练范式存在根本局限,尤其是对于以 π₀ 和 π₀.₅ 为代表的流式模型,其潜力远未被完全挖掘。监督微调(SFT)的瓶颈:SFT是当前VLA模型训练的基石,但它高度依赖大规模、高质量的专家演示数据。这类数据的采集成本高昂、周期漫长。更重要的是,通过SFT训练出的模型容易对演示轨迹产生过拟合,当面对训练数据中未见过的新任务或长序列任务时,性能会急剧下降,且模型无法通过与环境的动态

从FSD的端到端革命到Optimus的技术路线迭代,特斯拉始终遵循“多路径探索→最优解聚焦”的逻辑。Gen3的关节与手部革新,本质是在“仿生理想”与“量产现实”间寻找平衡——而这种以研发停滞换取技术确定性的选择,或许正是人形机器人从实验室走向工厂的必经之路。

从 2025 年 MSSP 的这些顶尖成果来看,智能运维的核心命题已经发生了质变:我们不再追求堆叠模型层数,而是如何让 AI 真正理解机械物理本质,在变幻莫测的工厂环境中提供确定性的答案。机械设备的故障诊断,过去主要依赖振动信号、频谱分析、包络谱、小波变换、经验模态分解等传统方法。今天,我们精选了 10 篇 MSSP 2025 年最具代表性的研究论文,带您梳理智能运维正在发生的五大核心趋势。今天,
标题:Global Logic and Local Search: Dual-Stream Multimodal In-Context Learning for Verifiable Industrial Anomaly Detection传统AOI擅长分类、定位和分割,但碰到缺件、错装、颜色顺序、部件数量、装配拓扑这类规则型问题,往往还要额外堆规则。多模态大模型虽然能读图、读SOP,却容易把反光

来源 Boosting Vision-Language Models Towards Cross-Domain Incremental Object Detection作者 Xu Wang, Zihan Lin, Yixin Zhang, Zilei Wang产线最怕的不是模型不会,而是。新品导入、换线换型、相机更换、光照漂移、料号切换、缺陷库持续扩容,。连续 fine-tuning 容易灾难性遗







