
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
5月14日,腾讯旗下混元文生图大模型(下称:混元DiT,Scalable Diffusion Models with Transformers)宣布全面升级并对外开源,目前已在 Hugging Face 平台及 Github 上发布,包含模型权重、推理代码、模型算法等完整模型,可供企业与个人开发者免费商用。腾讯混元文生图负责人卢清林表示,混元DiT开源的价值有两方面,一方面这是业内首个中文原生Di

今天分享的是基于 HY-MT1.5-1.8B模型打包,体量适中(18亿参数),但翻译效果接近更大的商业模型,支持 33 种语言和多种方言,特点是速度快、质量高,还能在边缘设备上实时部署,非常适合跨语言交流和应用场景。模型保存在ckpts目录下,如不会使用命令下载的,可手动下载所有文件,在ckpts目录新建 一个目录,比如 HY-MT1.5-7B,将下载的模型和配置文件放置到该目录,启动软件后手动切

今天分享的是基于 HY-MT1.5-1.8B模型打包,体量适中(18亿参数),但翻译效果接近更大的商业模型,支持 33 种语言和多种方言,特点是速度快、质量高,还能在边缘设备上实时部署,非常适合跨语言交流和应用场景。模型保存在ckpts目录下,如不会使用命令下载的,可手动下载所有文件,在ckpts目录里新建 一个目录,比如 HY-MT1.5-7B,将下载的模型和配置文件放置到该目录,启动软件后手动

简单说,它就像一个“能克隆声音、能按描述造声音、还能像改文档一样改语音”的全能语音工具,特别适合需要高质量、多语言、可控语音的应用场景。支持24种语言(包括中文、英语、日语、韩语、阿拉伯语、西班牙语、俄语、泰语、越南语等),以及21种中文方言(如四川话、上海话、粤语、闽南话、河南话、湖南话等)。不需要参考音频,直接用自然语言描述想要的声音,例如:“一个年轻女性的温柔嗓音,语速稍慢,带一点俏皮”。语

Qwen-Multiple-Angles 是一款多角度生成的插件(LoRA),让你在编辑图片时,可以像摄影师一样精确控制“拍摄角度”,比如前视、侧视、俯视、仰视,还能选择远近距离。批量生成:上传需要生成的图像,选择模型(GGUF模型体积更小,效果比Diffusion差,适合笔记本用户),设置起始角度,即开始和结束的角度数值;单次生成:上传需要生成的图像,选择模型(GGUF模型体积更小,效果比Dif

它不只是生成一小段背景音乐,而是重点针对“完整歌曲”的生成,最长可以做到约 5 分钟,并且尽量保持歌曲前后风格、旋律、节奏和人声的一致性。,可以将它发送给大模型,比如DeepSeek,豆包,千问等,然后输入你需要的音乐风格和主题歌词,等待大模型完成,将生成的描述和歌词填入对应文本框即可。双击启动进入WebUI,输入音乐描述(比如风格、情绪、人声特点、乐器编排等等)和歌词,设置相关参数(时长等),运

此外,公司联合Mimic Robotics开发了适用于机器人领域的视频动作模型Flux-mimic,目前已在奥迪工厂开展生产任务测试。通过打破单一模态的信息局限,Flux3正加速推动AI向具备感知与行动能力的物理世界“世界模型”演进。在720p分辨率、10秒片段的早期测试中,Flux3展现出强劲竞争力,性能超越Luma Ray3.2(93%胜率)与Runway Gen-4.5(77%胜率),并在与

OvisOCR2 是一款超级实用的文档识别(OCR)AI模型,你给它一张文档页面照片或扫描件(比如论文、合同、报告、表格、带公式的书页等),它就能一键按正常阅读顺序,输出干净的 Markdown 格式内容。端到端处理:不像传统 OCR 要先切图、再识别、再拼起来,它直接“看一眼整页”就输出完整结构,效果更自然、顺序更准。基于 Qwen3.5 开发,通过真实数据 + 合成数据 + 多阶段训练(SFT

你给它一张图片 + 一句普通话指令(比如“把这个人放到夜市里拍照”),它就会按照你的要求修改图片,同时尽量保持没让你改的部分不变,尤其是人物的长相、衣服细节、痣、皮肤纹理等都能很好保留。它不像一些通用AI那样只追求“像真照片”,而是特别擅长理解和控制各种艺术风格,让生成的图片更有创意、更漂亮、更符合设计师的审美。人物编辑建议 1024+个人创意/娱乐:把自己的照片(或AI生成的人物)放到各种场景中

想象一下:你给它一张照片(真人、动漫人物甚至动物),配一段录音(可以是中文或英文),再加点文字描述(如“一个女孩在咖啡店微笑说话”),它就能生成一段嘴巴同步说话、表情自然、全身动作稳定的短视频。相关参数设置页面有说明,视频时长由num segments控制,为(93/25)时长的倍数,具体换算为:93/25=3.7,num segments就设置为2,大概7秒左右,以此类推。支持单人和双人两种生成








