logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Qwen-Image-2.1:统一图像生成与编辑模型,原生支持透明图生成,设计电商内容创作好帮手

Qwen-Image-2.1 是一个“小巧但全能”的图像模型,把生成、透明图处理、多参考图编辑、局部精准修改都整合在一起,特别适合需要高效出图和灵活编辑的设计、电商和内容创作场景。图像编辑选项卡“自定义尺寸”参数,默认关闭,即编辑后的图像保持“参考图1”的尺寸,如果开启,则支持自定义编辑后的尺寸,请手动设置,建议参考或接近“参考图1”的尺寸,否则会出问题。更高级的采样器通常所需步数较少。启动Web

文章图片
#计算机视觉#AI作画
CosyVoice - 阿里最新开源语音克隆、文本转语音项目 支持情感控制及粤语 本地一键整合包下载

CosyVoice专注自然语音生成,支持多语言、音色和情感控制,支持中英日粤韩5种语言的生成,效果显著优于传统语音生成模型。

文章图片
#人工智能#音视频
超详细提示词教程|玩转Wan2.2

想让 Wan2.2 生成你心中的画面?关键在提示词怎么写。本文将带你掌握文生视频 Prompt 写作技巧,建议收藏+关注!提示词公式提示词用来描述视频中所包含的内容和运动过程,它是控制视频画面内容与效果的关键因素。提示词描述越完整、精确和丰富,生成视频的品质越高,且越贴近期望生成的内容。为了帮助你更快上手,我们针对不同的使用需求提供了两种典型公式:基础公式适用于初次尝试AI视频的新用户,及将AI视

文章图片
#人工智能
Viggle-Animate:视频角色替换神器,一帧重绘就能精准替换视频角色,动作跟得牢、速度还超快

你只需要两样东西:一段原始视频(驱动视频)、从这段视频里抽出一帧,用图像编辑工具把里面的角色“画”成你想要的样子(比如换成另一个人、动物、机器人、飞机等),模型就会自动把整段视频里的角色都替换成你画的那个新角色,同时完整保留原来的动作、镜头运动和时序。和同类角色动画生成软件不同,Viggle-Animate的参考图需要把你的角色重绘到驱动视频的某一帧上(相同背景、接近的姿态和站姿),再用它作为参考

文章图片
#音视频#人工智能
腾讯混元Dit-业内首个支持中文的AI绘画大模型,他来了!附本地一键包下载

5月14日,腾讯旗下混元文生图大模型(下称:混元DiT,Scalable Diffusion Models with Transformers)宣布全面升级并对外开源,目前已在 Hugging Face 平台及 Github 上发布,包含模型权重、推理代码、模型算法等完整模型,可供企业与个人开发者免费商用。腾讯混元文生图负责人卢清林表示,混元DiT开源的价值有两方面,一方面这是业内首个中文原生Di

文章图片
#AI作画
Audio8-ASR:小身材大能力,超轻量多语言语音识别模型 一键语音转SRT字幕

今天分享的 Audio8-ASR 基于Audio8-ASR-0.1B超轻量模型打包制作,支持无显卡设备一键快速转写,并将结果转写成txt和srt字幕文件,同时支持一键批量转写,离线不联网,无隐私安全隐患,并且支持中文、英文、法语、德语、日语、韩语、粤语等 7 种语言。支持热词(Hotword):不需要重新训练,就能在识别时临时加强某些关键词的识别准确率(比如人名、品牌、专业术语)。多语言支持:能识

文章图片
#语音识别#人工智能
HY-MT1.5 - 无需联网,本地离线实时翻译神器 支持33国语言互译 支持50系显卡 一键整合包下载

今天分享的是基于 HY-MT1.5-1.8B模型打包,体量适中(18亿参数),但翻译效果接近更大的商业模型,支持 33 种语言和多种方言,特点是速度快、质量高,还能在边缘设备上实时部署,非常适合跨语言交流和应用场景。模型保存在ckpts目录下,如不会使用命令下载的,可手动下载所有文件,在ckpts目录新建 一个目录,比如 HY-MT1.5-7B,将下载的模型和配置文件放置到该目录,启动软件后手动切

文章图片
#人工智能
爱翻译 V1 - 无需联网,本地离线AI大模型翻译神器 支持33国语言互译 支持50系显卡 一键整合包下载

今天分享的是基于 HY-MT1.5-1.8B模型打包,体量适中(18亿参数),但翻译效果接近更大的商业模型,支持 33 种语言和多种方言,特点是速度快、质量高,还能在边缘设备上实时部署,非常适合跨语言交流和应用场景。模型保存在ckpts目录下,如不会使用命令下载的,可手动下载所有文件,在ckpts目录里新建 一个目录,比如 HY-MT1.5-7B,将下载的模型和配置文件放置到该目录,启动软件后手动

文章图片
#机器翻译
FireRedTTS3:从克隆到设计再到编辑,支持24语+21方言,让语音创作更自由

简单说,它就像一个“能克隆声音、能按描述造声音、还能像改文档一样改语音”的全能语音工具,特别适合需要高质量、多语言、可控语音的应用场景。支持24种语言(包括中文、英语、日语、韩语、阿拉伯语、西班牙语、俄语、泰语、越南语等),以及21种中文方言(如四川话、上海话、粤语、闽南话、河南话、湖南话等)。不需要参考音频,直接用自然语言描述想要的声音,例如:“一个年轻女性的温柔嗓音,语速稍慢,带一点俏皮”。语

文章图片
#语音识别#人工智能
Qwen-Multiple-Angles - 角色/产品多视角速成 一张图搞定96种相机角度 ComfyUI+WebUI双模式 一键整合包下载

Qwen-Multiple-Angles 是一款多角度生成的插件(LoRA),让你在编辑图片时,可以像摄影师一样精确控制“拍摄角度”,比如前视、侧视、俯视、仰视,还能选择远近距离。批量生成:上传需要生成的图像,选择模型(GGUF模型体积更小,效果比Diffusion差,适合笔记本用户),设置起始角度,即开始和结束的角度数值;单次生成:上传需要生成的图像,选择模型(GGUF模型体积更小,效果比Dif

文章图片
#AI作画
    共 117 条
  • 1
  • 2
  • 3
  • 12
  • 请选择