教程报告

空间多模态听觉感知:面向真实复杂场景的说话人定位与提取
发布时间:2026/7/23 22:12:44
钱馨园
照片
钱馨园
北京科技大学 · 副教授

钱馨园,北京科技大学计算机与通信工程学院副教授,主要研究方向为智能语音技术、多模态(视听觉)人机交互。博士毕业于英国伦敦玛丽女王大学计算机专业,2020 年至 2022 年于新加坡国立大学担任博士后研究员,曾在意大利 FBK 研究所、香港中文大学(深圳)从事研究工作。已在国际顶级会议及期刊上发表论文 80 余篇,担任多个国际会议/期刊的程序委员/客座编辑(如 IROS, ICASSP, ECAI, TCE 等)。主持或参与国家自然科学基金青年项目、北京市自然科学基金面上项目、科技创新 2030-新一代人工智能重大专项、北京市自然科学基金联合项目、CCF-腾讯犀牛鸟项目、深圳大数据研究院项目、新加坡人机交互项目及华为技术合作项目等。获评 ACM 新星奖(北京)、北京市"高创计划"青年托举人才、北京市图象图形学会最美女科技工作者。

真实世界中的人机交互场景通常充满混响、强噪声和多说话人干扰,单纯依赖单模态音频信号进行空间听觉感知面临极大的鲁棒性挑战。本教程聚焦于"空间多模态听觉感知"这一前沿方向,系统性地探讨如何有机融合视觉空间信息(如摄像机捕获的场景几何与面部动态)与多麦克风阵列音频信号,以突破传统机器听觉的性能瓶颈。

首先,我们将阐述三维声源定位(3D SSL)在复杂声学环境中的最新进展,重点解析视听觉深层特征交叉注意力机制如何解决非视距与强遮挡条件下的定位鲁棒性问题。其次,本教程将深入剖析多模态目标说话人提取(TSE)技术,讲解如何利用视觉线索在音频中精准锁定并分离特定发言人。最后,我们将结合国家战略规划与多模态人机交互的需求,探讨三维空间视听觉推理的未来演进趋势。通过本教程,听众将构建起从物理建模、跨模态表示学习到实际场景部署的完整知识架构。