李楠,天津师范大学计算机与信息工程学院讲师,天津大学计算机科学与技术专业工学博士。曾赴日本北陆先端科学技术大学院大学(JAIST)攻读双学位,博士期间获国家留学基金委资助赴新加坡国立大学开展联合培养。主要研究方向包括语音增强、语音端点检测、远场语音识别、语音去混响及听觉感知计算,重点关注听觉机理启发的低复杂度语音处理方法。
已在Expert Systems with Applications、Speech Communication、ICASSP、INTERSPEECH等期刊和会议发表论文16篇,其中第一作者论文7篇、通讯作者论文1篇,并作为主要发明人申请发明专利5项。曾获Intel神经形态深度噪声抑制挑战赛Top 2、音频深度合成检测挑战赛Top 4及方言识别挑战赛算法精英奖等荣誉。
复杂声学环境中的背景噪声会降低语音质量与可懂度,并影响语音识别、人机交互和助听设备的使用体验。本报告围绕人类听觉系统感知和处理含噪语音的过程,介绍一系列融入听觉感知机理的语音增强方法。
报告首先探讨如何模拟听觉编码、听觉掩蔽和上下文感知机制,实现复杂噪声环境下的语音端点检测;随后介绍噪声与语音双流信息感知框架,讨论如何利用环境噪声和目标语音的先验信息辅助语音增强;最后介绍结合耳蜗频率选择特性与基音感知机制的谐波补偿听觉感知网络,以兼顾语音质量、听觉自然度和模型效率。
本报告将重点讨论如何将生理听觉机制转化为可学习的计算模型,以及生物启发方法在智能终端、语音通信和助听设备中的应用前景。