艾杨,中国科学技术大学语音及语言信息处理国家工程研究中心副研究员。主要研究方向包括语音编码、语音增强、语音合成、音频质量评价等,在语音技术领域知名期刊和会议上发表论文70余篇,其中第一作者/通讯作者论文近60篇。目前主持国家自然科学基金和安徽省自然科学基金等科研项目,参与战略性先导科技专项、国家重点研发计划等项目多项。
在获奖方面,2024年入选"小米青年学者",获得Interspeech 2024离散语音挑战赛(Discrete Speech Challenge)声码器赛道冠军(第一完成人)以及第十八届全国人机语音通讯学术会议最佳论文奖(通讯作者)等。
近年来,神经网络语音编解码器在低码率语音压缩、实时语音通信和端侧语音存储等场景中展现出重要应用价值,但如何在更低码率下保持较高的语音重构质量仍是一项具有挑战性的课题。本报告将围绕低码率神经网络语音编解码方法展开介绍,主要包括整体编解码框架设计和量化策略改进两个方面。
首先,本报告将介绍团队提出的超低码率神经网络语音编解码器FMelCodec,该方法以梅尔谱为建模对象,构建了"编码—精炼—重构"的整体框架,通过单码本离散编码、条件流匹配谱精炼和声码器重构,在码率低至250 bps的条件下实现高质量语音重建。
其次,本报告将介绍团队围绕量化策略改进提出的两种低码率神经网络语音编解码方法。一种是面向流式语音通信场景的VoCodec,该方法根据浊音和清音在语音感知中的不同重要性,自适应分配量化资源,从而在保持语音质量的同时降低整体码率。另一种是面向残差向量量化神经语音编解码器的AKDQ,该方法利用相邻语音帧之间的时序冗余,将语音帧划分为关键帧和差分帧,并通过因果码率调度机制实现更加高效的自适应量化。