logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

跨芯片 AI 算子库 FlagGems 正式加入PyTorch 基金会生态项目体系

2025年北京智源大会 · PyTorch Day China 论坛上,PyTorch 基金会执行董事 Matt White 宣布高性能通用 AI 算子库 FlagGems 项目获得批准,正式加入 PyTorch 生态项目体系。Pytorch基金会于6月26日在推特上进行了官方宣布。作为唯一支持多种AI芯片架构的算子库,FlagGems 的加入加速了 PyTorch 实现“的技术创新。

#人工智能#pytorch#python
智源发布原生多模态世界模型Emu3 实现图像、文本、视频大一统

下一token预测已在大语言模型领域实现了 ChatGPT 等突破,但是在多模态模型中的适用性仍不明确,多模态任务仍然由扩散模型(如Stable Diffusion)和组合方法(如结合 CLIP视觉编码器和LLM)所主导。2024年10月21日,智源研究院正式发布原生多模态世界模型Emu3。该模型只基于下一个token预测,无需扩散模型或组合方法,即可完成文本、图像、视频三种模态数据的理解和生成。

文章图片
#人工智能
十问具身智能

王仲远:具身智能和无人驾驶不同之处在于无人驾驶整体上是特定的场景,但是具身智能尤其具身机器人要解决的场景数特别多,比如有家庭的场景、流水线的场景,场景的数量多到一定程度之后,数据采集是否容易成为现实,现在研究上有很多基于仿真数据进行模型训练、机器人训练。第三,语义可达,比如,拿苹果是为了榨汁。今天很多人形机器人的强化学习,也是主要在仿真世界进行的,但是未来当这样机器人充分在我们世界中存在,有车这样

文章图片
#人工智能
智源 RoboBrain-X0 开源,打破机器人跨本体泛化困境

RoboBrain-X0 的设计理念正是如此:模型首先将复杂任务(如“整理桌面”)分解为与具体机器人“身体”解耦的通用语义动作序列,并通过统一映射机制,将“意图”高效转译为多种机器人可直接执行的动作。该模型具备零样本泛化能力,完成简单的 pick&place 任务,同时只需在目标任务上进行少量样本微调,即可展现出强大的跨本体适配性,进行复杂任务的拆解和执行。现实世界充满了多样性与不确定。不同的机器

文章图片
#开源#机器人
具身智能从此「边听边说」,智源研究院开源原生全双工语音大模型RoboBrain-Audio

【转载自:机器之心】语音交互作为人机通信的关键接口,长期以来受限于高延迟、低自然度的交替式对话架构。为突破这一瓶颈,北京智源人工智能研究院联合 Spin Matrix 与新加坡南洋理工大学,正式发布 RoboBrain-Audio(FLM-Audio) —— 首个支持 “自然独白 + 双训练范式” 的原生全双工语音对话大模型。在一段自然对话音频中,用户连续提出多个不同问题,并多次在模型回答过程中打

文章图片
#人工智能
从云端到终端,从大模型到机器人:智源众智FlagOS 1.5引领开放计算生态迈向成熟

9月26-27日,在北京举办的首届FlagOS开放计算开发者大会上,北京智源人工智能研究院(简称“智源研究院”)携手18个共创团队、超过60个全球生态合作伙伴,正式发布开源大模型智算基座“众智FlagOS 1.5”,已经支持了16家厂商超过20多款芯片,作为一个面向多种AI芯片的统一开源系统软件栈,众智FlagOS 1.5的发布标志着全球人工智能底层技术生态正迈向一个以“开放计算”为核心理念的协同

#机器人
智源多模态大模型登Nature,生成式人工智能路线统一到自回归

就此,智源提出了Emu3,基于“预测下一个词元”的全新多模态模型,将图像、文本和视频统一离散化到同一个表示空间中,并从零开始,在多模态序列混合数据上联合训练一个单一的 Transformer。在此研究基础上,悟界·Emu3.5进一步通过大规模长时序视频训练,学习时空与因果关系,展现出随模型与数据规模增长而提升的物理世界建模能力,并观察到多模态能力随规模扩展而涌现的趋势,实现了“预测下一个状态”的范

文章图片
#人工智能#回归#数据挖掘
智源悟界·Emu3.5:开启多模态世界大模型新纪元

DiDA 将传统的串行逐 token 生成过程,转变为一个多步并行的预测过程,在不牺牲性能的前提下,将每张图片的推理速度提升了近 20 倍,首次使自回归模型的生成效率媲美顶尖的闭源扩散模型。作为悟界·Emu 系列的最新成员,Emu3.5 延续了将图像、文本和视频等多模态数据统一建模的核心思想,并实现了从“下一Token 预测”(Next-Token Prediction)到“下一状态预测”(Nex

文章图片
#人工智能
智源多模态大模型登Nature,生成式人工智能路线统一到自回归

就此,智源提出了Emu3,基于“预测下一个词元”的全新多模态模型,将图像、文本和视频统一离散化到同一个表示空间中,并从零开始,在多模态序列混合数据上联合训练一个单一的 Transformer。在此研究基础上,悟界·Emu3.5进一步通过大规模长时序视频训练,学习时空与因果关系,展现出随模型与数据规模增长而提升的物理世界建模能力,并观察到多模态能力随规模扩展而涌现的趋势,实现了“预测下一个状态”的范

文章图片
#人工智能#回归#数据挖掘
智源全面开源RoboBrain 2.0与RoboOS 2.0:刷新10项评测基准,多机协作加速群体智能

RoboBrain 2.0以卓越的多模态感知、精细的空间推理及强大的长时规划能力,赋能机器人在具身环境中进行交互推理、多智能体协作及高效任务规划,助力复杂物理场景的智能感知与决策。通过这一阶段的训练,模型能够生成推理链,支持复杂任务的逐步推理和决策,从而在具身情境中实现更高效、更准确的推理和规划能力。:整合标准视觉问答、区域级查询、OCR视觉问答及多轮视觉对话,优化语言表达的多样性与语义一致性,通

文章图片
#开源#人工智能
    共 50 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择