
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Parler-TTS是一个由 Hugging Face 推出的开源文本转语音(TTS)项目。Parler-TTS不仅提供了高保真的语音合成能力,还允许用户根据特定说话者的风格(如性别、音调、说话风格等)来定制声音,从而生成听起来更加自然和个性化的语音。虽然Parler-TTS提供了高质量的语音合成,但其设计上考虑了效率和资源消耗,使其成为一个轻量级的解决方案,适合各种应用场景。

Tora是由阿里团队推出的一种基于轨迹导向的扩散变换器(Diffusion Transformer, DiT)技术的AI视频生成框架。Tora在生成过程中可以接受多种形式的输入,包括文字描述、图片或物体移动的路线,并据此制作出既真实又流畅的视频。通过引入轨迹控制机制,Tora能够更精确地控制视频中物体的运动模式,解决了现有模型难以生成具有精确一致运动的问题。Tora采用两阶段训练过程,首先使用密集

Hunyuan3D-1.0是腾讯混元团队开发的首个同时支持文字、图像转3D的大模型,可以基于文本描述或单张图像生成3D模型。Hunyuan3D-1.0采用了多视图生成和多视图重建两阶段的方法,能够从不同视角捕捉对象的纹理和几何信息。在多视图生成阶段,Hunyuan3D-1.0模型采用自适应CFG技术,为不同视角和时间步设置不同的CFG尺度值,以平衡生成控制和多样性。

Segment Anything Model 2 (SAM2) 是由Meta公司发布的先进图像和视频分割模型。作为Segment Anything Model (SAM) 的后续产品,SAM2 展示了在图像和视频综合对象分割方面的显著进步。SAM 2支持多种类型的提示输入,如点、边界框或掩码等, 提高了用户的交互性和模型的灵活性。除了技术上的突破,SAM2的应用前景也非常广泛。例如,在医学图像分割

OmniGen是一个由北京人工智能研究院的研究人员提出的专为统一图像生成而设计的新型扩散模型。OmniGen 采用了变分自动编码器(VAE)与预训练的大规模Transformer模型相结合的设计,VAE负责从输入图像中提取连续的视觉特征,而Transformer则根据这些特征及给定条件生成最终的输出图像。OmniGen可以接受自由形式的多模态交错文本和图像作为输入,使用Phi-3分词器处理文本数据

Ovis是由阿里国际AI团队开发的一款多模态大模型,它在图像理解任务上达到了SOTA水平。Ovis能够处理和理解多种不同类型的数据输入,如文本、图像等,与大型语言模型相比,它在处理非文本数据方面有显著优势。Ovis模型的特点包括创新的架构设计、高分图像处理能力、全面的数据优化、卓越的模型性能,以及全部开源可商用的优势。Ovis在数学推理问答、物体识别、文本提取和复杂任务决策等方面展现出色表现,例如

Qwen2-Audio是由阿里巴巴集团研发的一款大型音频语言模型。Qwen2-Audio应用技术包括多模态输入处理、预训练与微调、注意力机制、条件文本生成、编码器-解码器架构以及Transformer架构。Qwen2-Audio支持直接语音输入和多语言文本输出,具备语音聊天和音频分析两大功能,并支持超过8种语言,包括中文、英语、粤语、法语等。

EchoMimic是一个由蚂蚁集团开发的AI项目,主要用于生成高质量的数字人像动画。这个项目特别之处在于它能够根据人像的面部特征和音频内容来帮助人物“对口型”,即让静态的照片或者图像中的角色看起来像是在说话或唱歌,生成的视频效果既稳定又自然。EchoMimic项目通过音频驱动和面部标志点驱动的结合,解决了传统方法中存在的不稳定性和不自然性的问题。EchoMimic通过深度学习模型,实现了音频和面部

Emu3是由北京智源人工智能研究院推出的一款原生多模态世界模型。Emu3模型的特点在于它能够处理和理解多种类型的数据,包括文本、图像以及视频,并且在这些不同模态之间实现统一的输入和输出。Emu3的核心是下一个token预测,属于一种自回归方法,模型被训练预测序列中的下一个元素,无论是文本、图像还是视频。为了处理大规模的数据集,Emu3采用了张量并行、上下文并行和数据并行相结合的方法,以便有效地利用

Qwen2-Audio是由阿里巴巴集团研发的一款大型音频语言模型。Qwen2-Audio应用技术包括多模态输入处理、预训练与微调、注意力机制、条件文本生成、编码器-解码器架构以及Transformer架构。Qwen2-Audio支持直接语音输入和多语言文本输出,具备语音聊天和音频分析两大功能,并支持超过8种语言,包括中文、英语、粤语、法语等。








