随着人工智能、大模型和具身智能技术的快速发展,语音交互正逐步从静态、单人、近场环境走向开放、复杂、动态的真实场景。人机交互、智能家居、智能座舱、智能机器人、混合现实等新兴应用,对语音处理算法提出了更高要求:不仅需要"听得到、听得清",更需要准确感知动态声学环境,区分和理解多声源之间的空间关系,实现真实场景下稳定、鲁棒的语音感知能力。
麦克风阵列作为空间声学信息获取的重要载体,能够提供丰富的时空信息,是动态声场建模、空间音频分析和鲁棒语音感知的重要基础。近年来,传统阵列信号处理不断与深度学习、大模型和生成式人工智能相融合,在高精度声场重建、动态声源感知、语音增强、声源分离等方向取得了重要进展。与此同时,随着自监督预训练方法、多模态基础模型的发展,如何将阵列观测信息、空间声学理论和数据驱动模型有机结合,构建具有环境理解能力的新一代空间语音智能系统,已成为国际语音与声学领域的重要研究热点。
本议题聚焦动态场景下基于麦克风阵列的声场建模与语音感知,围绕动态空间声场建模与仿真、多源声学感知、空间音频生成以及鲁棒语音处理等关键问题展开交流,重点关注物理模型与数据驱动方法的融合、多模态信息协同建模以及空间音频基础模型的发展,促进阵列信号处理、语音处理、人工智能及相关应用领域的深度交叉。
本议题旨在搭建国内相关领域专家学者交流合作的平台,推动动态声场建模、空间音频感知以及鲁棒语音处理等关键技术的发展,为机器人、智能终端、智能会议、数字人及具身智能等新一代智能交互应用提供理论基础与关键技术支撑。议题具有重要的科学意义和应用价值:在科学层面,议题探讨的"物理机理+数据驱动"融合范式,能有效弥补深度学习方法在可解释性与物理一致性上的短板,为计算声学与人工智能的交叉融合开辟新路径;在应用层面,这些核心技术对于满足国防通信、智能家居、医疗健康、具身智能等关键领域的迫切需求具有重要意义,也可为其他领域相关技术的发展与持续进步提供有益参考。
钱彦旻(上海交通大学):yanminqian@sjtu.edu.cn
黄公平(武汉大学):gongpinghuang@whu.edu.cn
张王优(上海交通大学):wyz-97@sjtu.edu.cn
白仲鑫(武汉大学):18392387962@163.com