logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Qwen-Multiple-Angles - 角色/产品多视角速成 一张图搞定96种相机角度 ComfyUI+WebUI双模式 一键整合包下载

Qwen-Multiple-Angles 是一款多角度生成的插件(LoRA),让你在编辑图片时,可以像摄影师一样精确控制“拍摄角度”,比如前视、侧视、俯视、仰视,还能选择远近距离。批量生成:上传需要生成的图像,选择模型(GGUF模型体积更小,效果比Diffusion差,适合笔记本用户),设置起始角度,即开始和结束的角度数值;单次生成:上传需要生成的图像,选择模型(GGUF模型体积更小,效果比Dif

文章图片
#AI作画
MiniMax-Music3:AI 音乐革命来了,输入一句话,让 AI 从零创作一整首歌,不会写歌也能当音乐人

它不只是生成一小段背景音乐,而是重点针对“完整歌曲”的生成,最长可以做到约 5 分钟,并且尽量保持歌曲前后风格、旋律、节奏和人声的一致性。,可以将它发送给大模型,比如DeepSeek,豆包,千问等,然后输入你需要的音乐风格和主题歌词,等待大模型完成,将生成的描述和歌词填入对应文本框即可。双击启动进入WebUI,输入音乐描述(比如风格、情绪、人声特点、乐器编排等等)和歌词,设置相关参数(时长等),运

文章图片
#人工智能#音视频
黑森林实验室发布Flux3 多模态模型 首次支持 20 秒原生音视频同步生成

此外,公司联合Mimic Robotics开发了适用于机器人领域的视频动作模型Flux-mimic,目前已在奥迪工厂开展生产任务测试。通过打破单一模态的信息局限,Flux3正加速推动AI向具备感知与行动能力的物理世界“世界模型”演进。在720p分辨率、10秒片段的早期测试中,Flux3展现出强劲竞争力,性能超越Luma Ray3.2(93%胜率)与Runway Gen-4.5(77%胜率),并在与

文章图片
#音视频#人工智能#计算机视觉
OvisOCR2:AI文档识别新星,精准识别文字、表格、公式

OvisOCR2 是一款超级实用的文档识别(OCR)AI模型,你给它一张文档页面照片或扫描件(比如论文、合同、报告、表格、带公式的书页等),它就能一键按正常阅读顺序,输出干净的 Markdown 格式内容。端到端处理:不像传统 OCR 要先切图、再识别、再拼起来,它直接“看一眼整页”就输出完整结构,效果更自然、顺序更准。基于 Qwen3.5 开发,通过真实数据 + 合成数据 + 多阶段训练(SFT

文章图片
#人工智能
Krea2 V6版:更强的一致性和保真度 一键人物场景重塑,保真脸部,自由换装换环境

你给它一张图片 + 一句普通话指令(比如“把这个人放到夜市里拍照”),它就会按照你的要求修改图片,同时尽量保持没让你改的部分不变,尤其是人物的长相、衣服细节、痣、皮肤纹理等都能很好保留。它不像一些通用AI那样只追求“像真照片”,而是特别擅长理解和控制各种艺术风格,让生成的图片更有创意、更漂亮、更符合设计师的审美。人物编辑建议 1024+个人创意/娱乐:把自己的照片(或AI生成的人物)放到各种场景中

文章图片
#人工智能#计算机视觉#深度学习
LongCat-Video-Avatar-1.5 - 一句话生成口型同步、动作稳定的数字人 说话/唱歌 视频 一键整合包下载

想象一下:你给它一张照片(真人、动漫人物甚至动物),配一段录音(可以是中文或英文),再加点文字描述(如“一个女孩在咖啡店微笑说话”),它就能生成一段嘴巴同步说话、表情自然、全身动作稳定的短视频。相关参数设置页面有说明,视频时长由num segments控制,为(93/25)时长的倍数,具体换算为:93/25=3.7,num segments就设置为2,大概7秒左右,以此类推。支持单人和双人两种生成

文章图片
#音视频
Step-Audio-EditX - 智能音频编辑助手,支持说话音频情感编辑、语音克隆、音频降噪 支持50系显卡 一键整合包下载

副语言标签:Breathing(呼吸声)、Laughter(笑声)、Suprise-oh(惊讶-哦)、Confirmation-en(确认-嗯)、Uhm(嗯哼)、Suprise-ah(惊讶-啊)、Suprise-wa(惊讶-哇)、Sigh(叹息声)、Question-ei(疑问-诶)、Dissatisfaction-hnn(不满-哼)支持标签:[呼吸声]、[笑声]、[惊讶-哦]、[确认-嗯]、[思

文章图片
#音视频#人工智能
GLM-ASR - 最强中文及方言语音识别利器 语音识别 语音转文字 支持50系显卡 一键整合包下载

因视频转写效率不如直接音频转写,故新增视频转音频功能,如果是视频文件,建议先将视频转换为音频,再进行转写操作。GLM-ASR 是智谱AI开源的一个语音识别模型,虽然体积小,只有1.5B的参数量,但识别速度快、准确率高,在中文和方言识别上表现非常突出,尤其擅长处理低音量、嘈杂环境下的语音,比很多同类模型更稳健。GLM-ASR 支持 17 种语言,包括日、英、法、德、俄、西等主流语言,甚至连加泰罗尼亚

文章图片
#语音识别#人工智能
CosyVoice3 - 跨语言、会方言、懂情绪的智能配音工具 文本转语音 语音克隆 支持50系显卡 一键整合包下载

CosyVoice 3 是阿里巴巴团队推出的一款新一代语音合成模型,它能在没有额外训练的情况下,用多种语言和方言生成自然、富有情感的语音,声音效果接近真人。CosyVoice 3 只需3秒录音,就能让你的声音无缝切换语种、方言与情绪——中、粤、日、英、开心、愤怒......9 种通用语言、18种方言,通通搞定!自然语言控制:上传参考音频,输入需要合成的文字内容,支持喜怒哀乐等多种情感控制,支持十几

文章图片
#人工智能#语音识别
MimicMotion - 一张图片实现视频跳舞,腾讯开源照片跳舞模型 本地一键整合包下载

近期,腾讯联合上海交通大学开源了一个可控视频生成框架:MimicMotion,类似阿里的全民舞王,只需要上传一张照片,然后再上传一段人物的舞蹈或者动作视频,就可以生成以照片中人物为原型的动作或者舞蹈视频了。

文章图片
#人工智能#音视频
    共 110 条
  • 1
  • 2
  • 3
  • 11
  • 请选择