logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

RTC中实时编码器Libvpx:vp9-svc的优化实践

本文分析了国内实时互动和视频会议产品主要采用H.264/HEVC而非VP9的原因,并提出了VP9-SVC的优化方案。H.264/HEVC凭借硬件兼容性、产业链成熟度和编码实时性占据优势,而VP9在免专利费和可伸缩编码(SVC)方面的优势未能转化为实际竞争力。文章详细探讨了libvpx编码器的性能瓶颈,指出其在运动估计、残差计算、码率控制等方面的冗余问题,并提出了五项优化路径:块级SAD缓存池、残差

#实时音视频#人工智能#webrtc
长视频转码的正确姿势

逆变换采样,快速找到编码甜点,2pass分段转码,并行,压缩率提升一倍以上

#音视频
WebRTC音频处理3A模块的现状与局限

WebRTC音频处理模块近两年以维护性更新为主,核心算法(如AEC3回声消除、ANS噪声抑制、AGC增益控制)未出现颠覆性突破,主要优化包括API适配、构建系统升级及实验性功能(如AEC3细粒度配置)。尽管在语音通话场景表现稳定(如AEC3双滤波器提升鲁棒性,ANS分级降噪保护高频细节),但视频会议中仍存在结构性缺陷:音频保真度牺牲、无法灵活关闭处理模块、端到端延迟过高、复杂噪声抑制不足,以及跨平

#webrtc#音视频
windows平台音频ai-aec高级回声消除demo

本demo主要基于深度学习的aec回声消除开发,用神经网络更精确区分回声与近端语音,减少误判。在线性滤波后用神经网络做精细化的残余回声抑制。笔记本环境测试, CPU: AMD Ryzen 5 7640HS w/ Radeon 760M Graphics (4.30 GHz)自带测试case: near_end.wav 和 far_end.wav。从效果和性能全面超越webrtc aec3.

#windows#音视频#人工智能
windows平台音频ai-ns的vs2022工程和demo

本demo主要基于rnnoise开源项目改造,可用于webrtc的瞬态和非稳态噪声的抑制。默认使用rnnoise_data大模型,开启了avx2优化,cpu单线程运行.自带测试case: audio_in_with_noise_48k.wav 和 speech_with_car_noise_48k.wav。参考rnnoise_demo.c文件,也可以更改命令行参数配置。windows平台音频ai-

#音视频
新兴通话场景中音频3A技术的升级路径

我们这前讨论过webrtc中3A技术现状与局限,现在AI agent语音交互技术,公共场景的智能对话机器人,娱乐互动等实时交互热门技术落地离不开音频3A能力的支持。WebRTC 的 3A(AEC 回声消除、AGC 自动增益控制、ANS 噪声抑制)音频处理模块虽然已经非常成熟,但在多个新兴通话场景中仍存在。后续我会进一步展开某个具体方向,比如 AI-AEC、AI-NS抑制的实时推理优化进行分享,还有

#音视频#语音识别#人工智能
实时互动与会议视频技术的浅见

公司经营不善,拖欠半年工资,接下来会陆续把各功能的demo,性能测试,视频处理效果进行展示。720p30svc-L3T3 1.2mbps~1.5mbpsi7-1270 cpu机器单线程跑320fps。i7-1270 cpu机器 1920x1080p > 3840x2160p单线程单帧耗时10ms左右。i7-1270 cpu机器 3840x2160p单线程单帧耗时15ms左右。这两年在小公司做视频会

#音视频#实时互动
到底了