
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
这是一款基于Qwen3-ASR-1.7B大模型的本地语音识别工具,主要功能包括: 支持批量音视频转文字,自动区分说话人并导出带时间轴的TXT/SRT/字幕文件 可选AI翻译生成双语字幕,以及AI自动总结,支持单文件或文件夹批量处理 要求Win10/11系统,识别结果包含纯文本、标准字幕、双语字幕和结构化总结四种输出格式 特色在于离线环境下实现说话人分离和自动总结,适合会议记录、视频字幕制作等场景,

阿里Qwen3-TTS是一款支持10种语言的多功能语音合成系统,具备音色克隆、音色设计和9种预设音色功能。该系统采用自研12Hz编解码器和离散多码本架构,支持流式生成(首包延迟97ms)和自然语言指令控制。整合包优化了低端显卡支持,提供预设音色合成、自定义音色设计、音色克隆及多人对话四大功能模块,支持中英日韩等语言,适用于有声读物、游戏配音等场景。
MOSS-TTS-Nano是由MOSI.AI与OpenMOSS开发的开源多语言语音合成系统,具有0.1B参数量,支持CPU/GPU运行。核心采用AudioTokenizer+LLM架构,支持20种语言合成和语音克隆功能,可通过参考音频模仿说话人音色。系统提供PyTorch和ONNX两种推理后端,ONNX版更适合CPU环境部署,体积更小效率更高。软件支持实时流式解码、文本正则化处理、参数调节等功能,
VoxCPM是一款由OpenBMB团队开发的开源TTS语音合成系统,最新版本VoxCPM2采用Tokenizer-Free的端到端扩散自回归架构,支持48kHz高音质输出和30种语言(包括多种汉语方言)。该系统具备零样本克隆、音色设计、语境感知等核心功能,用户可通过自然语言描述定制声音或基于参考音频克隆音色。本次更新特别增加了多人对话语音合成功能,支持最多5个角色自动拼接成长音频,大幅提升有声书、
Chatterbox是由ResembleAI开发的开源TTS模型,支持零样本音色克隆和多语言语音合成。本文介绍了一款整合包,优化了UI并新增多人对话和实时语音功能。该工具支持23种语言,通过3-10秒音频即可克隆音色,提供10余项参数调节,并内置音频水印技术。整合包包含单段合成、多人对话和实时合成三种模式,支持最多5人对话场景。
AI实时语音对话系统是一款集成语音识别(ASR)、大语言模型(LLM)和语音合成(TTS)的交互软件,支持端到端的自然语音对话。系统特点包括:全链路实时处理(流式传输、低延迟)、7种多语言AI角色(可自定义)、智能语音处理(VAD检测、降噪)、兼容OpenAI API标准、可视化三栏界面。适用于外语练习、日常聊天等场景,支持本地化部署保障隐私。

XianyuAutoAgent是一款专为闲鱼平台设计的智能客服解决方案,通过大语言模型实现全天候自动回复。核心功能包括:1)智能识别买家意图(价格/技术咨询等),采用多AI专家协作生成专业回复;2)提供可视化WebUI管理API密钥、Cookie及提示词,支持实时日志监控;3)独创人工接管模式,通过发送句号切换人工/自动服务;4)内置安全防护机制,过滤敏感信息并支持模拟人工输入延迟。
这是一款基于Qwen3-ASR-1.7B大模型的本地语音识别工具,主要功能包括: 支持批量音视频转文字,自动区分说话人并导出带时间轴的TXT/SRT/字幕文件 可选AI翻译生成双语字幕,以及AI自动总结,支持单文件或文件夹批量处理 要求Win10/11系统,识别结果包含纯文本、标准字幕、双语字幕和结构化总结四种输出格式 特色在于离线环境下实现说话人分离和自动总结,适合会议记录、视频字幕制作等场景,

一款专为AI视频创作者设计的本地化离线工具,可自动将视频转化为结构化提示词。该工具通过三层智能抽帧算法(场景检测+光流采样+去重处理)提取关键帧,并基于Qwen3.5模型从8个维度(主体/动作/镜头/风格等)进行多模态分析,输出适配即梦AI等平台的标准化提示词。支持4种模型规格(0.8B-9B)本地推理,采用vLLM+Gradio架构,确保数据安全。核心优势在于全流程自动化处理,帮助创作者快速复用

阿里Qwen3-TTS是一款支持10种语言的多功能语音合成系统,具备音色克隆、音色设计和9种预设音色功能。该系统采用自研12Hz编解码器和离散多码本架构,支持流式生成(首包延迟97ms)和自然语言指令控制。整合包优化了低端显卡支持,提供预设音色合成、自定义音色设计、音色克隆及多人对话四大功能模块,支持中英日韩等语言,适用于有声读物、游戏配音等场景。







