
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
全驱数字人API是一站式AI数字人视频生成接口,整合图片数字人图生视频、数字人像生成、虚拟人驱动、唇形同步、对口型播报、2D/3D数字人生成、分身合成等核心能力,支持真人形象复刻、智能口播、动态肢体与面部微调,可广泛应用于短视频制作、虚拟播报、数字分身、AI营销视频、智能解说等场景。接口支持自定义视频比例、分辨率,搭配音频自动完成唇形匹配与动态渲染,提供任务提交、任务查询、回调通知全流程能力,适配
image_url=https://#/1/190000.jpg&prompt=数字人自然口播,嘴型匹配说话动态&ratio=9:16&task_id=cgt-20260705185852-rgvmw。image_url是stringhttps://#/1/190000.jpg人物照片URL。不传则默认:“数字人自然口播,嘴型匹配说话动态,头部轻微微动,呼吸肩动自然,面部稳定无扭曲,柔和慢镜头运镜
自有GPU算力支撑高并发,支持私有化、源码交付,适配无人直播、虚拟客服、线下大屏、中小开发者轻量化项目。行业商业化头部,短视频、24小时无人直播、交互数字人全套API,融媒体、知识博主使用广泛,支持SDK私有化部署。多类型数字人API,2D/3D、照片克隆、实时交互,支持私有化,适合新闻主播、AI讲师、企业播报。依托电商生态,虚拟主播、电商数字人API成熟,适配直播带货、店铺讲解视频,端云协同稳定
模型选择与下载:推荐选用开源的无限时长数字人模型(如 SadTalker-lite、D-ID 开源版、ChatTTS+LivePortrait 组合),从 Hugging Face 或 GitHub 下载模型权重(需注意模型许可协议),将权重文件放入本地指定目录。无限时长生成:在界面中上传长文本 / 长音频(无时长限制),模型会自动分帧渲染数字人口型、表情与动作,再通过拼接算法生成完整的长时长数字
ratio是string画面比例<br>可选:16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3<br>默认:16:916:9。"status": "pending", // 状态: pending, processing, completed, failed。"url": "/video.mp4", // 结果文件下载地址。"status": "completed", //
以本文研究的接口为例,其核心功能为 数字人形象训练 ,即用户通过上传包含人脸的视频文件,调用后台算法完成面部特征提取、动作建模及语音同步等训练流程,最终生成可交互的数字人模型。| video_url| 是| string| https://*/1/1.mp4| 训练视频的网络地址,需满足MP4/MOV格式、小于5GB、单人脸等技术要求。
123数字人API接口提供数字人视频合成服务,支持通过音频和视频模板生成播报内容。核心功能包括任务提交(需提供音频URL和可选视频模板)和状态查询,返回视频URL等结果。参数要求包括接口密钥、音频文件(≤90分钟/2G)等,视频需满足≤3GB、mp4/mov格式等技术标准。接口返回结构包含状态码、任务ID和视频地址等信息,适用于虚拟主播、教育等多场景应用。
默认 zh-CN (中文),支持 en-US (英语)、ja-JP (日语)、ko-KR (韩语) 等。费用说明:该接口按量计费,单价为 0.1元/分钟(视频时长),首次注册通常有免费额度(如10分钟),请留意账户余额。注意编码:请求头中明确要求了 charset:utf-8,请确保你的请求库或代码没有覆盖此设置,避免中文乱码。taskId: 任务ID,可用于轮询查询结果(如果是异步任务)。par
支持mp3、mp4、wav、webm、aac、flac、m4a、mov、mkv、ogg、opus、amr、avi、flv、mpeg、wma、wmr等十余种音视频格式,全网任意短视频分享链接直接传入URL即可解析;默认自动检测音频语种,覆盖主流商用语种:中文zh、英文en、日语ja、粤语yue、韩语ko、德语de、法语fr、俄语ru,跨境短视频、海外素材文案提取无压力。4. 基础元数据:taskId







