logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

字节跳动发布豆包视频生成模型

火山引擎正式发布豆包视频生成模型 PixelDance 和 Seaweed,两款大模型均基于 DiT 架构,主要面向企业市场。字节跳动正式宣告进军 AI 视频生成领域,目前除了发布的演示外,没啥特别多的信息,不过可以关注字节的“即梦 AI” 公众号,发“内测”俩字来获取申请表单链接。我看好多人说比肩Sora,确实和Sora一样都用不上,要我说不如开源模型 Cog 来的实在,起码能用上。

文章图片
#人工智能
字节豆包团队推出 SeedEdit:强大的图像编辑模型

是由字节豆包团队推出的图像编辑工具,它能够根据任何文本提示修改现有图像,并保持一致性。该工具支持多种功能,如局部替换、几何变换、重新打光、风格更改、表情编辑、文字替换、姿势修改以及局部擦除等。从演示视频和官方提供的演示来看,效果非常强大,你们可以。不过,我看了下代码实现,发现它调用了字节的 API,但目前这个 API 还没有公开申请的地方,期待后续的开放。

文章图片
#人工智能#图像处理
flux-lora-collection:Flux LoRA 大集合

由 XLabs-AI 训练的 Flux LoRA 大集合,包括福瑞、MJv6、动漫、迪士尼、风景、艺术共 6 个 LoRA 模型。

文章图片
#LoRA#人工智能
Sora 开源替代:OpenSora 1.2

是一个 Sora 的开源替代, 昨天正式发布了。该项目与另一个 Sora 开源替代。现在可以在 HF 上。

文章图片
#人工智能#AIGC#AI作画
阿里开源 OmniAvatar:音频驱动数字人模型

NVIDIA 推出的 Describe Anything Model (DAM)[3] 是一款多模态大语言模型,它能够为图像或视频中的特定区域生成详细描述,支持通过点击、框选、涂鸦或遮罩等多种交互方式指定目标区域。OmniAvatar[1] 是阿里开源的一款基于 Wan 2.1 的音频驱动数字人模型。从目前已有的开源数字人模型来看,OmniAvatar 的表现算是相当出色了。EasyEdit[2]

文章图片
#人工智能
阿里发布 EchoMimicV2:从数字人头到数字人的飞跃

功能从数字人头扩展到了数字人。只需输入一张图片、一段手势视频和一段音频,即可生成数字人。支持中英文驱动,画面稳定性非常好。群里之前有佬友在寻找开源数字人方案,这不就来了吗?主要用于生成数字人头。

文章图片
#人工智能
HeyGen: 半身数字人 Avatar 3.0

发布 Avatar 3.0 主要改进了脚本理解能力、面部表情和语音语调,还新增了唱歌能力。

文章图片
#人工智能
ComfyUI 数字人头对口型

能够让我们将其结合到 Comfyui 中,最低只需 6GB VRAM,安装环境比较麻烦,不过 README 中有中文介绍。来自阿里的通过音频匹配对应口型生成视频的一个技术,,也能实现类似的效果。还有一个类似的节点,

文章图片
#人工智能
ComfyUI 高级实时数字人脸表情编辑

是一个用于实时编辑人脸的插件,包括如下功能:其中的表情编辑功能支持:

文章图片
#ComfyUI#人工智能
EmoTalk3D: 3D 虚拟数字人头合成技术

能够根据语音创建出可以表达不同情感的 3D 数字人头,保持口型同步,并支持从任何角度观看。从演示的效果来看不是特别自然,目前也只公开了论文,代码正在路上,数据集也没有正式发布。

文章图片
#人工智能#3d
    共 154 条
  • 1
  • 2
  • 3
  • 16
  • 请选择