West Point Heroico Spanish Speech数据集介绍,官网编号LDC2006S37
·
West Point Heroico Spanish Speech 是由美国西点军校(USMA)外语系与技术强化语言学习中心(CTELL)联合墨西哥军事学院(Heroico Colegio Militar)构建、LDC 于 2006 年发布的西班牙语语音数据集(编号 LDC2006S37),核心用于西班牙语语音识别(ASR)、发音建模与语言学习应用开发,包含母语者与非母语者的朗读及提示语音与文本标注,适配军用与教育领域的语音技术研发。
核心基础信息
| 项目 | 详情 |
|---|---|
| 官网编号 | LDC2006S37 |
| 发布机构 | USMA+CTELL、墨西哥军事学院(构建);LDC(发布 / 分发) |
| 发布时间 | 2006 年 |
| 语种 | 西班牙语(含墨西哥西班牙语等口音) |
| 数据类型 | 朗读语音、提示语音、文本转录、标注元数据 |
| 核心用途 | 西班牙语 ASR 训练 / 测试、发音评估、语言学习课件开发 |
| 格式 | 音频(WAV,16kHz 16 位单声道)、文本(UTF-8 转录文件)、标注文件 |
数据采集与规模
- 采集场景:分两地采集,墨西哥军事学院(Heroico)与西点军校(USMA),桌面麦克风录制,环境可控,音频质量稳定。
- 数据规模
- 总语音 utterances 约 19,000 条,有效语音时长约 16.5 小时。
- Heroico 子语料:约 11.8 小时,来自墨西哥军事学院学员,含朗读与提示语音。
- USMA 子语料:约 2.2 小时,含 1.2 小时非母语者(美国陆军语言学家)与 1 小时母语者(西班牙母语者)朗读语音,均为脚本朗读内容。
- 对齐子集:Heroico 子语料中 1 小时数据与 USMA 子语料使用相同提示脚本,适配跨场景对比实验。
- 说话人分布:共 120 名说话人,覆盖多性别、多年龄段,含墨西哥西班牙语口音与非母语口音,兼顾语言内与语言间多样性。
技术特点与优势
- 双场景数据:两地采集,含墨西哥西班牙语口音与非母语口音,适配多场景语音技术研发。
- 脚本对齐设计:部分数据共享提示脚本,跨子语料对比实验结果更可靠。
- 发音建模适配:标注适配发音评估,助力语言学习应用开发。
- 标注质量可靠:遵循 LDC 标准标注流程,多轮校对,转录准确率高。
更多推荐
所有评论(0)