
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
2001 NIST Speaker Recognition Evaluation Corpus(LDC 目录编号 LDC2002S34)是 NIST 主导、LDC 发布的经典说话人识别评测基准数据集,核心用于会话式电话语音(CTS)场景的说话人检测与验证任务,为早期说话人识别系统提供统一评测标准与训练 / 测试数据划分,是 GMM - UBM 等经典模型的核心评测资源。
West Point Heroico Spanish Speech 是由美国西点军校(USMA)外语系与技术强化语言学习中心(CTELL)联合墨西哥军事学院(Heroico Colegio Militar)构建、LDC 于 2006 年发布的西班牙语语音数据集(编号 LDC2006S37),核心用于西班牙语语音识别(ASR)、发音建模与语言学习应用开发,包含母语者与非母语者的朗读及提示语音与文本标
CSLU: Names Release 1.3 是由俄勒冈健康与科学大学口语理解中心(CSLU)构建、LDC 于 2009 年发布的英文姓名语音数据集(编号 LDC2006S39),核心用于姓名语音识别(ASR)、发音词典生成与说话人验证系统研发,包含大规模孤立姓名朗读语音及文本、发音标注,适配人名识别与口语交互场景的模型训练与评测。
2004 Spring NIST Rich Transcription (RT-04S) Development Data(LDC2007S11)是 LDC 为 NIST RT-04S 会议语音识别评测发布的开发数据集,核心用于多通道会议语音的端点检测、说话人分离与识别、丰富转录模型训练 / 调参,含约 28.7 小时会议语音、多通道录音与完整标注转录,2007 年发布。
Greybeard 数据集是一个主要用于自然语言处理(NLP)领域的基准数据集,特别针对对话系统和问答系统的评估。该数据集的设计目的是为了测试模型在复杂对话上下文中的理解和推理能力。长上下文依赖性:Greybeard 的设计强调了对长对话历史的理解需求,这使得模型必须能够有效地追踪并理解整个对话流程才能给出准确的回答。Greybeard 数据集通常包含多轮对话记录,这些记录来源于真实世界的对话场景
1999 年发布的葡萄牙语新闻专线文本数据集,全称为 Portuguese Newswire Text,与之前提到的博阿齐奇大学 2016 年版是两个不同的资源,前者为 LDC 官方发布的早期葡语新闻语料,后者是后续开源的更大规模数据集。
2001 NIST Speaker Recognition Evaluation Corpus(LDC 目录编号 LDC2002S34)是 NIST 主导、LDC 发布的经典说话人识别评测基准数据集,核心用于会话式电话语音(CTS)场景的说话人检测与验证任务,为早期说话人识别系统提供统一评测标准与训练 / 测试数据划分,是 GMM - UBM 等经典模型的核心评测资源。
Korean-English Treebank Annotations(韩英树库标注数据集)是面向韩英双语的句法树库资源,以词法、句法与语义标注为核心,支撑句法分析、机器翻译、跨语言 NLP 模型开发与评测,主流包括 Penn Korean Treebank(PKT)、KAIST Treebank 及 UD Korean Treebank 等衍生标注集,以下从核心定位、典型版本、标注体系、获取与应
Multiple-Translation Arabic (MTA) Part 1(LDC2003T18)是 LDC 发布的阿拉伯语 - 英语翻译评测基准数据集,核心用于机器翻译多参考评估、翻译质量评测算法研发与模型调优,适配统计与神经机器翻译的性能验证场景。
Multiple-Translation Arabic (MTA) Part 2(LDC2005T05)是 LDC 于 2005 年发布的现代标准阿拉伯语(MSA)多译文平行语料库,核心为法新社(AFP)阿拉伯语新闻文本 + 3 组独立人工英译,适配机器翻译评估、翻译质量自动度量与模型优化,是阿拉伯语 - 英语翻译评测的经典基准资源LDC。







