logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

CSLU: Spelled and Spoken Words数据集介绍,官网编号LDC2006S15

CSLU: Spelled and Spoken Words(LDC2006S15)是由美国俄勒冈健康与科学大学的口语理解中心(CSLU)构建、语言数据联盟(LDC)于 2006 年发布的英文电话语音数据集,核心用于拼写识别、语音识别、说话人验证等语音技术研究,聚焦 “拼写 - 朗读” 并行语音数据,适配语音交互场景的鲁棒性测试需求。

#算法#数据结构#人工智能 +2
West Point Company G3 American English Speech数据集介绍,官网编号LDC2005S30

West Point Company G3 American English Speech(LDC96S36)是美国西点军校 G3 连队构建、LDC 于 1996 年发布的美式英语朗读语音数据集,核心为 24 名美国英语母语者(G3 连队学员)录制的约 10.5 小时高保真语音,含 6000 + 句孤立词 / 短语 / 连续句,标注含正字法转录与发音词典,适配声学模型训练、说话人识别、军事语音技术

#语音识别#算法#python +2
Russian through Switched Telephone Network (RuSTeN)数据集介绍,官网编号LDC2006S34

Russian through Switched Telephone Network(RuSTeN)是 LDC 于 2006 年发布的俄语电话语音数据集(编号 LDC2006S34),核心用于俄语电话语音识别(ASR)系统的训练与评估,数据源于真实公共交换电话网(PSTN)通话,包含音频、文本及元数据,适配鲁棒性语音技术研发场景。

#数据结构#语音识别#python +2
Middle East Technical University Turkish Microphone Speech v 1.0数据集介绍,官网编号LDC2006S33

Middle East Technical University Turkish Microphone Speech v 1.0 数据集是由中东技术大学(Middle East Technical University,METU)创建,语言数据联盟(LDC)于 2006 年发布,编号为 LDC 2006S33。

#算法#数据结构#人工智能 +2
West Point Korean Speech数据集介绍,官网编号LDC2006S36

West Point Korean Speech 是由美国西点军校(USMA)外语系与技术强化语言学习中心(CTELL)构建、LDC 于 2006 年发布的韩语语音数据集(编号 LDC2006S36),核心用于韩语语音识别(ASR)与语言学习课件研发,包含母语者与非母语者的朗读语音及文本标注,适配军用与教育领域的语音技术开发场景。

#语音识别#数据结构#算法 +2
CSLU: Multilanguage Telephone Speech Version 1.2数据集介绍,官网编号LDC2006S35

CSLU: Multilanguage Telephone Speech Version 1.2 是由美国俄勒冈健康与科学大学口语理解中心(CSLU)构建、LDC 于 2006 年发布的多语种电话语音数据集(编号 LDC2006S35),核心用于多语种电话语音识别(ASR)、语言识别与鲁棒性算法研发,数据源自真实电话信道,覆盖 21 种语言,适配低资源语种语音技术冷启动与跨语种模型训练。

#语音识别#数据结构#算法 +2
Voicemail Corpus Part I数据集介绍,官网编号LDC98S77

Voicemail Corpus Part I(又称 IBM Voicemail Corpus Part I)是由 IBM 采集发布的英语语音邮件专用基准数据集,核心用于语音邮件的 ASR、语音摘要与口语理解建模,以真实语音邮件的单声道独白为特色,覆盖自然口语中的停顿、修正、填充词等非流利特征。

#语音识别#人工智能#数据结构 +3
Buckwalter Arabic Morphological Analyzer Version 1.0数据集介绍,官网编号LDC2002L49

Buckwalter Arabic Morphological Analyzer Version 1.0(BAMA 1.0)是 Tim Buckwalter 开发的经典阿拉伯语形态分析工具 / 数据集,核心用于无变音阿拉伯语文本的形态歧义消解、词法分析与词性标注,是阿拉伯语 NLP 早期研究的基础资源,被广泛用于阿拉伯语树库(ATB)构建与形态分析模型训练。

#python#java#算法 +2
West Point Arabic Speech数据集介绍,官网编号LDC2002S02

West Point Arabic Speech(常称 West Point Arabic Speech Corpus,LDC 目录编号 LDC2002S06)是 LDC 发布的现代标准阿拉伯语(MSA)语音识别专用语料库,由美国西点军校主导构建,核心用于阿拉伯语语音识别模型训练、声学建模与方言适配研究,是早期 MSA 语音资源的标杆。

#算法#python#java +2
    共 26 条
  • 1
  • 2
  • 3
  • 请选择