
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
2017年初,Google 提出了一种新的端到端的语音合成系统——Tacotron。Tacotron打破了各个传统组件之间的壁垒,使得可以从配对的数据集上,完全随机从头开始训练。本文是来自喜马拉雅FM音视频工程师马力的投稿,他手把手式的介绍了Tacotron的使用方法,帮助你快速上手。文 / 马力语音合成(Text to Speech Synthesis)是一种将文本转化为自然语音输出的技术,在各
5月6日 19:30,我们邀请到了中国电信研究院新技术所 机器视觉标准与应用研究部主任张园详细介绍VCM、DCM等标准组织机器视觉编码标准化工作最新进展、技术创新思路。一同探讨面向机...
Photo by Lukas from Pexels语音技术的进步,让机器合成的声音不再顿挫、冰冷,在自然度和可懂度等方面取得了不错的成绩,但当前合成效果在合成音的表现力上,特别是语气和...
语音合成(TTS)是语音AI平台的基础设施,而声码器则决定着其中的声学模型以及合成质量。喜马拉雅FM音视频高级工程师 马力在LiveVideoStack线上交流分享中详细...
将激光雷达与相机结合,再通过深度学习的方式获得场景的3D模型——Ouster首席执行官在博客中介绍了相机OS-1,并装有激光雷达。LiveVideoStack对原文进行了...
本文整理自LiveVideoStack线上分享第三季,第五期,由清华大学计算机系网络技术研究所博士生王莫为为大家介绍近些年ABR算法的发展,探讨基于机器学习的ABR算法的优劣势,并结合AiTrans比赛分析其在直播场景中的应用问题。文/王莫为整理/LiveVideoStack大家好,我是来自清华大学计算机系的博士生王莫为,导师是崔勇教授,本次分享的主题是机器学习...
”“音视频+无限可能”是一扇 LiveVideoStackCon面向新兴领域开启的大门,在移动互联网红利消失、内卷的局面下,智能车、制造、金融、医疗、出海等新兴领域还在迫切追寻新技术带来的增值。在“音视频+无限可能”,提前看到新机会、新案例、新实践。8月5日-6日,LiveVideoStackCon 2022 上海站,和你一同开启通向未来的大门。圆桌论坛:AI与音视频技术...
直播与短视频业务的兴起,代表了一种内容交互方式的变化,更加追求强交互,这种变化催化了很多技术和架构的转型,由传统的传输、存储优先演进为计算与智能。本文是由360人工智能研究院视频大数据组技术负责人陈强在LiveVideoStackCon 2017上的演讲整理而成,分享了深度学习在视频业务中的一些实践案例,并由点及面介绍了相应的实现架构、算法与应用。演讲 / 陈强整理 / LiveVideoStac
LiveVideoStackCon2022上海站大会邀请到了复旦大学微电子学院的范益波老师和和大家一同探讨了针对新一代视频编码标准VVC的芯片设计和思考。
大约1400多天前,LiveVideoStackCon首次来到深圳。和今年一样,那一年我们也交付了三场大会,只不过今年的第一场北京站其实是2022年延期而来。那一年非常疲惫,也非常幸运。如果不是2019年有过第一次,大概率今年也不会来深圳了,这可能是无法弥补的遗憾。正如大家感受到的一样,多媒体生态的困局投射在每一名从业者身上。你不可能改变行业的急转直下,正如不可能改变当初千播大战、疫情点燃整个行业







