logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

虚拟角色的 AI 未来:从肖像编辑到三维生成,技术如何重塑数字人生态|达摩链接

人体动画风格迁移在计算机图形和动画领域应用广泛,这里的风格迁移包括了两个步骤,第一步是从内容中分离动画角色的动作风格,第二步是将这种风格迁移到另一个动作上,从而创造出高质量、指定风格的动画内容。对此,团队开发了一种新的分离图像中头发边界的方法,以及男性秃头图像的构建方法,用来生成有发和秃头的训练配对数据。经过对比发现,该方法生成的睫毛蒙版是业内最接近真值的,优于RenderEyelashNet的结

文章图片
#人工智能
迈向高真实感数字人:3D高斯建模与智能交互技术解析|达摩链接

具体来说,用于训练的每一个样本视频都要提取人体信息,并利用同一时刻的多视点视频图像来学习空间信息,确保视角和空间的一致性;在这一领域,团队的第一个工作是动画化高斯建模,核心思想是对单帧人物图像参数化建模,将人物图像投影出正面和背面,用正面和背面的每一个像素定义一个 3D 高斯球,之后通过 3D 高斯球的优化来逼近拍摄的图像。该方法在人头的 3D 模型上优化模型顶点的 3D 高斯球,数字模型学习人头

文章图片
#3d
面向具身智能:开源 IP 视觉芯片新突破

该框架分为三个步骤,第一步同样是用代理拟合不可微的 ISP,但这里使用了一种更适合 ISP 的,基于 RRDB 的代理模型,可以避免之前使用的模型的降采样带来的性能损失;该模型将图像的合成和分解步骤引入到扩散中,即在推理步骤中,将中间迭代生成的图像分解为 MSCN 和 色调,用最原始的 MSCN 替换中间图像的 MSCN,从而确保图的纹理结构保持不变。通过这套系统的实践发现,自动驾驶场景中过亮的图

文章图片
#人工智能
达摩院Lingshu-Cell:离散扩散架构驱动的细胞世界模型

摘要   在计算生命科学领域,构建“虚拟细胞”以模拟生物细胞系统对外部干预的反应,一直是核心科研问题。通过构建高精度的计算模型,研究人员能够在数字空间内预测药物或基因干预后的细胞转录特征,从而极大加速疾病机制研究与药物筛选的进程。尽管现有的单细胞基础模型在学习静态细胞表征方面表现优异,但在精准刻画细胞状态的概率分布以及模拟受扰动后的动态演化过程上,仍面临较大挑战。   为突破这

文章图片
达摩院 ICLR'26|变长视觉Token调度加速大模型3D影像理解

作者|方承煜,阿里巴巴达摩院实习生   摘要   多模态大语言模型在临床视觉问答任务中具有良好的应用前景,但在扩展到三维成像时会受到高计算成本的限制。以往方法通常依赖二维切片或固定长度的Token压缩,这会破坏3D数据的连续性,并掩盖细微病灶等关键信息。   我们提出一个使用可变长度Token序列表征三维医学数据的框架。它引入了指令条件的Token调度机制和代理梯度传

文章图片
达摩院 ICRA'26|从“预测世界”到生成动作:RynnVLA-001基座模型用人类操作视频突破机器人数据瓶颈

作者|黄思腾,阿里巴巴达摩院算法专家   摘要   Vision-Language-Action (VLA) 模型被视为通向通用机器人智能的必经之路,因为它首次将“看见环境、理解指令、生成动作”统一到同一框架中,使机器人有望像大模型理解世界一样理解任务,并在开放环境中完成更灵活的泛化与交互。相比传统为单一任务、单一场景定制的控制范式,VLA展现出跨任务迁移、自然语言驱动操作以及

文章图片
达摩院 CVPR'26|遇到视角变化就“犯迷糊”?STAR-R1框架让模型看得懂、对得准、想得透

作者|李宗钊,阿里巴巴达摩院实习生   摘要     图表1:与仅依赖监督微调的方法相比,STAR-R1能更系统地建立跨视角目标对应关系,从而在多视角空间推理任务中给出更准确答案。   近年来,多模态大模型(MLLM)在图像理解、视频理解和通用问答等任务上持续取得突破,但在一个关键能力上,距离人类仍有明显差距——多视角空间推理(multi-view spat

文章图片
亲手操作机械臂3步开发具身智能,FAIR plus 2026 等你来战!

由深圳市机器人协会主办,首个聚焦机器人开发与二次开发的专业展会——FAIR plus 2026机器人全产业链接会,将于4月22日-24日在深圳会展中心(福田)盛大启幕!   如此硬核的盛会,怎能少得了重磅玩家?DAMO开发者矩阵 × 魔搭社区 重磅登陆!   现场,你将亲身体验:用一台电脑+一个千元级机械臂,完成从AI模型训练到物理世界交互的完整链路! (达摩院及矽递科技联合打

文章图片
    共 155 条
  • 1
  • 2
  • 3
  • 16
  • 请选择