围绕低码率神经网络语音编解码,介绍超低码率编解码器FMelCodec的整体框架,以及面向流式通信的VoCodec和残差向量量化的AKDQ两种改进量化策略。
围绕指令跟随语音生成与非语言发声评测,介绍MINT-Bench多语言指令跟随评估与NVV-SuperBench中英双语45类非语言发声评测基准,分析当前模型副语言控制能力短板。
依托患者自然对话语音实现认知损伤非侵入式检测,围绕病理语音特征提取与跨模态融合建模,阐述端到端老年认知健康智能诊断技术体系。
围绕人类听觉系统感知处理含噪语音的过程,介绍融入听觉感知机理的语音增强方法,涵盖听觉掩蔽端点检测、噪声语音双流感知框架与谐波补偿听觉感知网络。
聚焦"一带一路"语言互通需求,介绍"万卷·丝路"多模态小语种语料库建设与关键技术,探讨高质量多模态语料构建路径及企业出海等场景落地经验。
聚焦音乐声学与深部神经动力学,利用颅内脑电考察音乐物理特性对多巴胺奖赏回路的影响,构建虚拟脑架构以头皮EEG推断深部奖赏状态,探索音乐干预情绪障碍的数字疗法路径。
面向构音及认知障碍语音精准识别挑战,探讨预训练语音基础模型迁移难题,介绍模型融合、离散token表征、半监督学习与自适应建模等障碍语音专用技术方法。
介绍小红书dots团队语音合成进展,涵盖开源全连续自回归TTS模型dots.tts、统一语音表征HoliTok,以及支持文本情感韵律停顿编辑的细粒度语音编辑模型dots.tts.edit。
展示音频推理与情感化生成突破,涵盖Audio-DeepThinker渐进式推理音频模型、PhyAVBench物理常识评测、EmoSteer-TTS细粒度情感操控及AudioGenie多智能体框架。
以藏语卫藏方言为对象,围绕语言学知识挖掘与端到端声学建模,从语音结构剖析、文本特征分析、韵律预测到声学建模等维度,探讨低资源藏语语音合成关键技术。
NCMMSC 2026青年论坛面向国内外青年学者公开征集报告提案,欢迎围绕语音与语言智能、多模态交互、情感认知计算、音频音乐处理等前沿方向分享最新研究进展。