logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

达摩院Lingshu-Cell:离散扩散架构驱动的细胞世界模型

摘要   在计算生命科学领域,构建“虚拟细胞”以模拟生物细胞系统对外部干预的反应,一直是核心科研问题。通过构建高精度的计算模型,研究人员能够在数字空间内预测药物或基因干预后的细胞转录特征,从而极大加速疾病机制研究与药物筛选的进程。尽管现有的单细胞基础模型在学习静态细胞表征方面表现优异,但在精准刻画细胞状态的概率分布以及模拟受扰动后的动态演化过程上,仍面临较大挑战。   为突破这

文章图片
达摩院 ICLR'26|变长视觉Token调度加速大模型3D影像理解

作者|方承煜,阿里巴巴达摩院实习生   摘要   多模态大语言模型在临床视觉问答任务中具有良好的应用前景,但在扩展到三维成像时会受到高计算成本的限制。以往方法通常依赖二维切片或固定长度的Token压缩,这会破坏3D数据的连续性,并掩盖细微病灶等关键信息。   我们提出一个使用可变长度Token序列表征三维医学数据的框架。它引入了指令条件的Token调度机制和代理梯度传

文章图片
达摩院 ICRA'26|从“预测世界”到生成动作:RynnVLA-001基座模型用人类操作视频突破机器人数据瓶颈

作者|黄思腾,阿里巴巴达摩院算法专家   摘要   Vision-Language-Action (VLA) 模型被视为通向通用机器人智能的必经之路,因为它首次将“看见环境、理解指令、生成动作”统一到同一框架中,使机器人有望像大模型理解世界一样理解任务,并在开放环境中完成更灵活的泛化与交互。相比传统为单一任务、单一场景定制的控制范式,VLA展现出跨任务迁移、自然语言驱动操作以及

文章图片
达摩院 CVPR'26|遇到视角变化就“犯迷糊”?STAR-R1框架让模型看得懂、对得准、想得透

作者|李宗钊,阿里巴巴达摩院实习生   摘要     图表1:与仅依赖监督微调的方法相比,STAR-R1能更系统地建立跨视角目标对应关系,从而在多视角空间推理任务中给出更准确答案。   近年来,多模态大模型(MLLM)在图像理解、视频理解和通用问答等任务上持续取得突破,但在一个关键能力上,距离人类仍有明显差距——多视角空间推理(multi-view spat

文章图片
亲手操作机械臂3步开发具身智能,FAIR plus 2026 等你来战!

由深圳市机器人协会主办,首个聚焦机器人开发与二次开发的专业展会——FAIR plus 2026机器人全产业链接会,将于4月22日-24日在深圳会展中心(福田)盛大启幕!   如此硬核的盛会,怎能少得了重磅玩家?DAMO开发者矩阵 × 魔搭社区 重磅登陆!   现场,你将亲身体验:用一台电脑+一个千元级机械臂,完成从AI模型训练到物理世界交互的完整链路! (达摩院及矽递科技联合打

文章图片
达摩院 CVPR'26|攻克多模态推理训练的梯度消失难题!方差感知采样让强化学习不再"躺平"

作者|冷思聪,阿里巴巴达摩院实习生   摘要   多模态推理模型的强化学习训练中,梯度消失是一个被广泛承认却缺乏系统解决的根本性问题。多模态推理的方法及资源MMR1从第一性原理出发,严格证明了奖励方差为策略梯度幅度提供下界,并据此提出Variance-Aware Sampling(VAS)策略,仅通过改变数据采样方式即可稳定训练过程。配合大规模开源数据,MMR1-7B在五大推理

文章图片
达摩院 CVPR'26 Highlight|鱼头还是人头?让概念瓶颈模型真正"认对地方"

作者|涂丹阳,阿里巴巴达摩院算法工程师;刘洋,阿里巴巴达摩院实习生   摘要   阿里巴巴达摩院联合浙江大学、UNSW Sydney的研究团队提出了全新的可解释视觉框架——目标感知概念瓶颈模型(OA-CBM)。该工作揭示了现有VLM驱动CBM在细粒度概念定位中的两大根本缺陷,并通过语义一致性与目标一致性的双重约束,实现了兼顾空间精度与推理可信度的概念瓶颈框架。实验表明,该模型在

文章图片
    共 152 条
  • 1
  • 2
  • 3
  • 16
  • 请选择