教程报告

NCMMSC 2026 教程报告 | Tutorials
教程一

语音交互+情感大模型:从判别式情感识别迈向生成式情感理解

Speech Interaction + Affective Large Models: From Discriminative Affective Recognition to Generative Affective Understanding

借助多模态大模型丰富的词表以及多模态感知能力,将判别式情感识别向细粒度、可解释生成式情感理解过渡,涵盖 EMER、OV-MER、AffectGPT、EmoPrefer 和 AffectGPT-RL 等前沿工作。

报告人
连政
教程二

空间多模态听觉感知:面向真实复杂场景的说话人定位与提取

Spatial Multimodal Auditory Perception: Speaker Localization and Extraction for Real-World Complex Scenes

系统探讨如何有机融合视觉空间信息与多麦克风阵列音频信号,涵盖三维声源定位、多模态目标说话人提取及三维空间视听觉推理等前沿方向。

报告人
钱馨园
教程三

操控生成:面向音频生成与编辑的条件扩散、桥、与引导方法

Controllable Generation: Conditional Diffusion, Bridge, and Guidance Methods for Audio Generation and Editing

介绍以扩散模型为基础的音频生成与编辑方法,涵盖扩散模型基础理论、跨模态一致性训练与推理、桥类模型及音频超分、内容转换等高效内容处理方向。

报告人
陈泽华
教程四

面向深度伪造语音的话者隐私保护:语音匿名化与水印

Speaker Privacy Protection for Deepfake Speech: Voice Anonymization and Watermarking

聚焦语音匿名化和语音水印两项关键技术,系统介绍其基本原理、代表性方法、技术发展历程及当前挑战,从源头降低语音被用于深度伪造生成的风险。

报告人
陈丽萍
教程五

鲁棒对话智能:复杂场景下人机语音交互感知与表达

Robust Dialogue Intelligence: Perception and Expression of Human-Computer Voice Interaction in Complex Scenarios

聚焦复杂场景下人机语音交互核心技术瓶颈,构建"鲁棒感知-精准理解-共情表达"的完整对话智能技术体系,涵盖多模态感知与拟人化对话生成技术。

报告人
刘瑞
征集中

教程报告提案征集

Call for Tutorial Proposals

诚挚邀请国内外专家学者提交教程报告提案。大会欢迎涵盖会议相关研究领域的高质量教程,特别鼓励与大会主题密切相关、具有前沿性、交叉性和应用价值的各类新兴研究方向的提案。

教程报告主席
雪巍 王帅 曹梦雪