logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

开启AI短剧新纪元!SkyReels-V1/A1双剑合璧!昆仑万维开源首个面向AI短剧的视频生成模型

身份失真:现有方法在动画生成过程中难以保持人物身份的稳定性,导致身份信息泄露或扭曲。背景不稳定:动画生成时背景容易出现抖动或不一致的现象。面部表情不真实:特别是在仅头部动画的场景中,面部表情缺乏真实感。全身动画的挑战:当动画扩展到全身时,现有方法容易产生视觉伪影或不自然的动作。身份与运动融合的困难:现有方法难以在保持身份一致性的同时,实现细腻的表情和动作生成。给定输入视频序列和参考肖像图像,从视频

文章图片
阿里巴巴重磅开源EasyAnimate!基于DiT的长视频制作生态系统

人工智能在文本、图像和声音的创意内容生成方面已经决定性地扩展了其应用范围。在视觉领域,扩散模型被广泛用于图像生成和修改。开源项目如Stable Diffusion在文本转图像方面取得了显著进展。然而,在视频生成方面,当前模型仍面临一些挑战,如质量欠佳、视频长度有限以及运动不自然,这表明该技术还有很大的进步空间。一些开创性的研究在利用Stable Diffusion方法进行视频合成方面取得了进展,重

文章图片
#人工智能#计算机视觉#AIGC +1
2张显卡即可20FPS流式生成!SoulX-LiveAct开启“小时级”实时数字人交互新时代

不一致的学习信号:现有的大多数强制策略在传播样本级表示时,扩散状态不匹配,导致学习信号不一致和收敛不稳定。推理效率限制:历史表示无限制增长且缺乏结构,阻碍了缓存状态的有效重用,严重限制了推理效率,无法实现真正无限的视频生成。

文章图片
#人工智能#AIGC#视频生成
一张照片,开口说话!阿里等最新音视频对齐技术FantasyTalking:打造超写实可控数字人!

阿里等发布FantasyTalking,通过单张照片+音频,实现与输入音频对应的、包含背景和上下文对象(而不仅限于肖像本身)的连贯全局运动,并能够构建精确对齐的唇部运动视频。

文章图片
#视频生成#音视频
华为诺亚等发布MagicDrive3D:自动驾驶街景中任意视图渲染的可控3D生成

这种创新的方法使得生成过程易于控制,并且可以获取静态场景,从而实现高质量的场景重建。通过大量实验验证,MagicDrive3D框架在生成符合道路地图、3D边界框和文本描述的高度真实感的街景方面表现出色,如下图1所示,展示了生成的相机视图可以增强鸟瞰图(BEV)分割任务的训练,为场景生成提供全面的控制,并能够为自动驾驶仿真创建新颖的街景。通过在 FRONT 相机上增加 4 个不同的装置,并添加渲染视

文章图片
#人工智能#自动驾驶#计算机视觉 +1
看Diffusion模型如何提升端到端自动驾驶的能力

自动驾驶(AD)领域近年来取得了显著进展,得益于车队收集的大规模数据集。这一数据爆炸提供了宝贵的训练资源。然而,一个关键问题出现了:收集到的数据往往存在对有利天气条件的偏向,比如晴朗和晴空万里。Waymo Open Dataset 和 BDD100K等数据集都表明了这一点,其中相当大一部分样本属于这一类别。这种不平衡影响了模型在分割和规划任务中的性能,尤其是在遇到像雨天或多云这样不太常见的场景时。

文章图片
#自动驾驶#人工智能#机器学习 +3
入门必读!多模态大语言模型的演变全回顾!(视觉定位、图像生成、编辑、理解)

注意力算子和Transformer架构的引入使得我们可以创建大规模的,能够处理各种模态的模型。这一进步主要归因于算子的多功能性和架构的适应性。最初,它们主要应用于语言模型,但很快就扩展到支持视觉处理骨干,并最终用于集成多种模态的模型。随着复杂的大语言模型的激增,尤其是它们在上下文学习方面的能力的进步,鼓励研究人员将这些模型的范围扩大到多种模态,既作为输入又作为输出。这种扩展促使了像GPT-4V和G

文章图片
#人工智能#AIGC#多模态
CVPR`24 | 无需微调,超越SPAE!V2L-Tokenizer:图像描述/重建/去噪多项SOTA!

在自然语言处理(NLP)领域,通过部署大语言模型(LLMs),如GPT、PaLM和LLaMA,已经取得了显著的进步。为了解决需要结合文本和视觉理解的复杂挑战,学者们正在扩展现成LLMs的能力。这种增强涉及整合额外的视觉处理组件,以促进对视觉内容的理解或从文本生成图像。随后,这些改进的模型会使用各种多模态数据集进行额外的再训练或微调,以使视觉潜在空间与语言潜在空间对齐。然而,这种精炼过程通常需要大量

文章图片
#人工智能#AIGC
一文回顾生成式AI的发展:GANs、GPT、自编码器、扩散模型和Transformer系列

回顾生成式AI的发展:GANs、GPT、自编码器、扩散模型和Transformer系列,涵盖了从文本生成和音乐创作,图像创建,视频制作,代码生成,甚至科学工作等各种任务。

文章图片
#人工智能#transformer
2万字长文看透基于扩散模型的图像编辑理论和实践!(中科院&南科大&苹果&Adobe)

如何利用去噪扩散模型进行高质量的图像生成和编辑。系统地分类和评估扩散模型在图像编辑中的应用。

文章图片
    共 137 条
  • 1
  • 2
  • 3
  • 14
  • 请选择