RM Isolated and Spelled Word Data(LDC 目录号LDC96S39)是语音处理领域经典的英文孤立词与拼写词语音数据集,隶属于 “Resource Management(RM)” 系列资源,核心服务于孤立词语音识别模型的训练、测试与算法验证,尤其适配早期统计语音识别与现代基础语音信号分析场景,以下从基础信息、数据特性、应用场景及获取方式展开详细说明:

基础信息

类别详情
官方名称RM Isolated and Spelled Word Data
发布主体与时间由 LDC(语言数据联盟)发布,属于 RM 系列数据集的延伸版本,发布时间聚焦 1990 年代语音技术快速发展期
数据类型英文语音数据(WAV/SPHERE 等标准音频格式)+ 人工文本标注
语言与场景语言为英语,场景聚焦 “孤立词独立发音” 与 “词汇字母拼写朗读”,无复杂对话或连续语音语境
配套文档提供数据使用说明、说话人元数据(如性别、口音标注)、音频 - 文本对齐规则等技术文档(可通过 LDC 官网下载)

更多推荐