准确率对比

豆包 > 讯飞 > FireRedASR(开源)

基础对比

平台语种免费时长并发费用个人评价
豆包中英+5种方言企业20小时默认10,可付费扩容2.4~4元/小时4颗星(比较推荐)
讯飞中英+202种方言个人5小时/企业50小时50路2~4.95元/小时1颗星(不推荐)

功能对比

平台格式语种热词领域角色分离
豆包pcm / wav / ogg / mp3中英支持不支持
讯飞wav/pcm/opus中英支持16个支持

1. 豆包——火山引擎

链接地址:https://console.volcengine.com/ark/region:ark+cn-beijing/model/detail?Id=seedasr-streaming
支持的语种:中英+202种方言
免费时长:企业20小时
费用:2~4.95元/小时
并发:10,可付费扩容
技术文档:https://www.volcengine.com/docs/6561/1354869
Python 代码示例:见技术文档Demo一节
个人测试:

  1. 有三种模式,我选择的是流式异步,历史结果比较稳定。
  2. 确定性结果有延迟(可能不是传统的VAD方式)
    豆包
    在这里插入图片描述
    并发费用
    并发模型

2. 讯飞开放平台

链接地址:https://www.xfyun.cn/services/rtasr
支持的语种:中英+202种方言
免费时长:个人5小时/企业50小时
费用:2~4.95元/小时
并发:50路
技术文档:https://www.xfyun.cn/doc/spark/asr_llm/rtasr_llm.html
Python 代码示例:https://openres.xfyun.cn/xfyundoc/2025-09-04/17baba3c-bd3c-478f-a1a1-633bcbdb8286/1756977383723/rtasr_llm_demo.zip
个人测试:

  1. 虽然是实时语音撰写,但是从结果来看是类似大模型语音识别,历史结果会变动,工程化实现的实时效果。
  2. 每一句的结尾是没有标点的,会在第二句结束的时候把第一句的标点补上。
  3. 实测如果15s左右没有收到新的识别结果返回,也会自动断开连接。
    介绍
    收费
    结果展示:
    在这里插入图片描述
    文档细节:
    自动断开

更多推荐