
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
耿雪龙,徐天翼,魏坤,穆秉甡,薛鸿飞,王贺,李泱泽,郭鹏程,戴宇航,李龙豪,邵明辰,谢磊大语言模型(LLM)在人工智能领域扮演着重要角色,特别是在理解和生成人类语言的能力方面表现突出。研究人员利用LLM的优势,探索将其与语音识别(ASR)等技术相结合的可能性,并已在多个应用场景中取得显著成效。ASR是同时依赖于声学和语言建模的任务,常用的语言模型包括n-gram和神经网络语言模型(NNLM)[1]

本论文中,我们提出了基于统一跨模态注意力机制的音视频多模态语音识别系统,借助视觉模态中的唇部动作信息提升嘈杂环境下的语音识别性能。在文中,我们还提出了音视频同步性感知训练的策略,既显著缓解了音画不同步对系统性能的负面影响,也能直接用作音视频偏移量的预测任务。此外,我们设计的启发式的模态间注意力对齐方案能够显著降低多模态交互的计算复杂度,并带来进一步的性能增幅。

开发者的本地化语音识别、视频翻译和配音工具是一套功能强大的解决方案,非常适合各种音频和视频内容处理需求。无论您是需要转录会议、为视频添加字幕、翻译和配音内容,还是探索其他音频和视频相关任务,开发者的工具都可以帮助您提高效率并获得令人惊叹的结果。我们支持 Microsoft、Google、DeepL、百度和其他领先的翻译引擎,以及 EdgeTTS、OpenAI-tts 和 Elevenlabs 等流

由希尔贝壳、理想汽车、西工大音频语音与语言处理研究组、新加坡南洋理工大学、天津大学、WeNet开源社区、微软、中国信通院等单位发起的“车载多通道语音识别挑战赛”(ICMC-ASR)将作为IEEE声学、语音与信号处理国际会议(ICASSP2024)的旗舰赛事,正式启动。

ISCSLP 2022 将于今年 12月11 - 14日在新加坡举办,会议采用线下和线上相融合的方式,会议上将举办本次竞赛的 Session 和颁奖环节。

本论文中,我们提出了基于统一跨模态注意力机制的音视频多模态语音识别系统,借助视觉模态中的唇部动作信息提升嘈杂环境下的语音识别性能。在文中,我们还提出了音视频同步性感知训练的策略,既显著缓解了音画不同步对系统性能的负面影响,也能直接用作音视频偏移量的预测任务。此外,我们设计的启发式的模态间注意力对齐方案能够显著降低多模态交互的计算复杂度,并带来进一步的性能增幅。

GPT4Free是一个由开发者Xtekky在GitHub上发布的开源项目,它可以免费地使用GPT-3.5、GPT-4、llama、gemini-pro、bard、claude等多种大模型。截止到当前(2024.1.30)已经有52.2k star,可见其受欢迎程度。

目前很多大模型如雨后春笋般涌现出来,都有点心慌了。冷静下来还是需要一个个去识别哪些对自己有用。

模数共振”是人工智能进入“以数据为中心”新时代的新产物,包含一系列新技术、新理论、新企业、新服务。本次研讨会由工信部科技司指导,中国人工智能产业发展联盟数据委员会联合中国信息通信研究院人工智能研究所、人工智能智库网络共同举办,来自中国信通院、联通、华为、海天瑞声、中化农业、中国电信、中国电子云、浪潮云洲、科大讯飞、砺英数智、希尔贝壳、库帕思、景联文、晴数智慧、张江数学研究院等机构及企业的领导和专家

摘要:WenetSpeech-Chuan是首个大规模多维标注的川渝方言语音语料库,包含10,000小时来自9大领域的语音数据,并配有ASR转录、说话人属性、情感等多维度标注。针对川渝方言语音技术发展受限的问题,研究团队提出完整的Chuan-Pipeline处理框架,创新性地采用LLM-GER转录方法提升方言识别准确率15%。实验表明,基于该数据集训练的模型在ASR和TTS任务中性能超越现有SOTA








