logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

腾讯混元Dit-业内首个支持中文的AI绘画大模型,他来了!附本地一键包下载

5月14日,腾讯旗下混元文生图大模型(下称:混元DiT,Scalable Diffusion Models with Transformers)宣布全面升级并对外开源,目前已在 Hugging Face 平台及 Github 上发布,包含模型权重、推理代码、模型算法等完整模型,可供企业与个人开发者免费商用。腾讯混元文生图负责人卢清林表示,混元DiT开源的价值有两方面,一方面这是业内首个中文原生Di

文章图片
#AI作画
HY-MT1.5 - 无需联网,本地离线实时翻译神器 支持33国语言互译 支持50系显卡 一键整合包下载

今天分享的是基于 HY-MT1.5-1.8B模型打包,体量适中(18亿参数),但翻译效果接近更大的商业模型,支持 33 种语言和多种方言,特点是速度快、质量高,还能在边缘设备上实时部署,非常适合跨语言交流和应用场景。模型保存在ckpts目录下,如不会使用命令下载的,可手动下载所有文件,在ckpts目录新建 一个目录,比如 HY-MT1.5-7B,将下载的模型和配置文件放置到该目录,启动软件后手动切

文章图片
#人工智能
爱翻译 V1 - 无需联网,本地离线AI大模型翻译神器 支持33国语言互译 支持50系显卡 一键整合包下载

今天分享的是基于 HY-MT1.5-1.8B模型打包,体量适中(18亿参数),但翻译效果接近更大的商业模型,支持 33 种语言和多种方言,特点是速度快、质量高,还能在边缘设备上实时部署,非常适合跨语言交流和应用场景。模型保存在ckpts目录下,如不会使用命令下载的,可手动下载所有文件,在ckpts目录里新建 一个目录,比如 HY-MT1.5-7B,将下载的模型和配置文件放置到该目录,启动软件后手动

文章图片
#机器翻译
FireRedTTS3:从克隆到设计再到编辑,支持24语+21方言,让语音创作更自由

简单说,它就像一个“能克隆声音、能按描述造声音、还能像改文档一样改语音”的全能语音工具,特别适合需要高质量、多语言、可控语音的应用场景。支持24种语言(包括中文、英语、日语、韩语、阿拉伯语、西班牙语、俄语、泰语、越南语等),以及21种中文方言(如四川话、上海话、粤语、闽南话、河南话、湖南话等)。不需要参考音频,直接用自然语言描述想要的声音,例如:“一个年轻女性的温柔嗓音,语速稍慢,带一点俏皮”。语

文章图片
#语音识别#人工智能
Qwen-Multiple-Angles - 角色/产品多视角速成 一张图搞定96种相机角度 ComfyUI+WebUI双模式 一键整合包下载

Qwen-Multiple-Angles 是一款多角度生成的插件(LoRA),让你在编辑图片时,可以像摄影师一样精确控制“拍摄角度”,比如前视、侧视、俯视、仰视,还能选择远近距离。批量生成:上传需要生成的图像,选择模型(GGUF模型体积更小,效果比Diffusion差,适合笔记本用户),设置起始角度,即开始和结束的角度数值;单次生成:上传需要生成的图像,选择模型(GGUF模型体积更小,效果比Dif

文章图片
#AI作画
MiniMax-Music3:AI 音乐革命来了,输入一句话,让 AI 从零创作一整首歌,不会写歌也能当音乐人

它不只是生成一小段背景音乐,而是重点针对“完整歌曲”的生成,最长可以做到约 5 分钟,并且尽量保持歌曲前后风格、旋律、节奏和人声的一致性。,可以将它发送给大模型,比如DeepSeek,豆包,千问等,然后输入你需要的音乐风格和主题歌词,等待大模型完成,将生成的描述和歌词填入对应文本框即可。双击启动进入WebUI,输入音乐描述(比如风格、情绪、人声特点、乐器编排等等)和歌词,设置相关参数(时长等),运

文章图片
#人工智能#音视频
黑森林实验室发布Flux3 多模态模型 首次支持 20 秒原生音视频同步生成

此外,公司联合Mimic Robotics开发了适用于机器人领域的视频动作模型Flux-mimic,目前已在奥迪工厂开展生产任务测试。通过打破单一模态的信息局限,Flux3正加速推动AI向具备感知与行动能力的物理世界“世界模型”演进。在720p分辨率、10秒片段的早期测试中,Flux3展现出强劲竞争力,性能超越Luma Ray3.2(93%胜率)与Runway Gen-4.5(77%胜率),并在与

文章图片
#音视频#人工智能#计算机视觉
OvisOCR2:AI文档识别新星,精准识别文字、表格、公式

OvisOCR2 是一款超级实用的文档识别(OCR)AI模型,你给它一张文档页面照片或扫描件(比如论文、合同、报告、表格、带公式的书页等),它就能一键按正常阅读顺序,输出干净的 Markdown 格式内容。端到端处理:不像传统 OCR 要先切图、再识别、再拼起来,它直接“看一眼整页”就输出完整结构,效果更自然、顺序更准。基于 Qwen3.5 开发,通过真实数据 + 合成数据 + 多阶段训练(SFT

文章图片
#人工智能
Krea2 V6版:更强的一致性和保真度 一键人物场景重塑,保真脸部,自由换装换环境

你给它一张图片 + 一句普通话指令(比如“把这个人放到夜市里拍照”),它就会按照你的要求修改图片,同时尽量保持没让你改的部分不变,尤其是人物的长相、衣服细节、痣、皮肤纹理等都能很好保留。它不像一些通用AI那样只追求“像真照片”,而是特别擅长理解和控制各种艺术风格,让生成的图片更有创意、更漂亮、更符合设计师的审美。人物编辑建议 1024+个人创意/娱乐:把自己的照片(或AI生成的人物)放到各种场景中

文章图片
#人工智能#计算机视觉#深度学习
LongCat-Video-Avatar-1.5 - 一句话生成口型同步、动作稳定的数字人 说话/唱歌 视频 一键整合包下载

想象一下:你给它一张照片(真人、动漫人物甚至动物),配一段录音(可以是中文或英文),再加点文字描述(如“一个女孩在咖啡店微笑说话”),它就能生成一段嘴巴同步说话、表情自然、全身动作稳定的短视频。相关参数设置页面有说明,视频时长由num segments控制,为(93/25)时长的倍数,具体换算为:93/25=3.7,num segments就设置为2,大概7秒左右,以此类推。支持单人和双人两种生成

文章图片
#音视频
    共 112 条
  • 1
  • 2
  • 3
  • 12
  • 请选择