Speech Interaction + Affective Large Models: From Discriminative Affective Recognition to Generative Affective Understanding
借助多模态大模型丰富的词表以及多模态感知能力,将判别式情感识别向细粒度、可解释生成式情感理解过渡,涵盖 EMER、OV-MER、AffectGPT、EmoPrefer 和 AffectGPT-RL 等前沿工作。
Spatial Multimodal Auditory Perception: Speaker Localization and Extraction for Real-World Complex Scenes
系统探讨如何有机融合视觉空间信息与多麦克风阵列音频信号,涵盖三维声源定位、多模态目标说话人提取及三维空间视听觉推理等前沿方向。
Controllable Generation: Conditional Diffusion, Bridge, and Guidance Methods for Audio Generation and Editing
介绍以扩散模型为基础的音频生成与编辑方法,涵盖扩散模型基础理论、跨模态一致性训练与推理、桥类模型及音频超分、内容转换等高效内容处理方向。
Speaker Privacy Protection for Deepfake Speech: Voice Anonymization and Watermarking
聚焦语音匿名化和语音水印两项关键技术,系统介绍其基本原理、代表性方法、技术发展历程及当前挑战,从源头降低语音被用于深度伪造生成的风险。
Robust Dialogue Intelligence: Perception and Expression of Human-Computer Voice Interaction in Complex Scenarios
聚焦复杂场景下人机语音交互核心技术瓶颈,构建"鲁棒感知-精准理解-共情表达"的完整对话智能技术体系,涵盖多模态感知与拟人化对话生成技术。
Call for Tutorial Proposals
诚挚邀请国内外专家学者提交教程报告提案。大会欢迎涵盖会议相关研究领域的高质量教程,特别鼓励与大会主题密切相关、具有前沿性、交叉性和应用价值的各类新兴研究方向的提案。