薛浏蒙,南京大学智能科学与技术学院准聘助理教授。主要研究方向为智能语音,语音、音乐与音频理解与生成;情感语音生成和交互等。博士毕业于西北工业大学,曾在京东AI Lab、腾讯AI Lab、微软开展研究工作。此后,在香港中文大学(深圳)和香港科技大学从事博士后研究。
作为联合发起人推出综合性音频生成与可视化平台,牵头主导开发统一音频理解与生成指令数据集Audio-FLAN,一度位列Hugging Face Dataset Trending第二,下载量超过十万余次,下载单位包括Google、Meta、Nvidia、字节跳动、腾讯、阿里巴巴、剑桥、牛津、清华、ETH Zurich AI Center、LAION等国内外顶尖科技公司和知名高校研究组。参与Llasa、Spark-TTS、YuE、AudioX等语音、音乐与音频生成大模型研究。相关成果发表于ACL、ICLR、ICASSP、INTERSPEECH、IEEE/ACM TASLP、Neural Networks等高水平会议与期刊,相关工作受到Apple、Amazon等国际知名科技公司研究团队的关注与引用。
参与组织ISCSLP 2026和IEEE SLT 2024国际会议;MLC-SLM@INTERSPEECH 2026、SmartGlasses@SLT2026、LLM4MA Workshop@ISMIR 2025、CoVoC@ISCSLP 2024等学术挑战赛,长期担任ACL、ACM MM、ICASSP、INTERSPEECH、IEEE/ACM TASLP、Speech Processing Letters、Speech Communication等会议和期刊审稿人。
近年来,语音生成技术在音质、自然度和说话人相似度方面取得了显著进展,但真实的人类口语交流远不止"把文字读出来"。同一句话可以因为语气、情感、口音、说话风格,以及笑声、哭声、叹气等非语言发声而传达完全不同的态度、情绪和交互意图。
面向这一问题,本报告将围绕指令跟随语音生成与非语言发声评测工作展开:首先介绍 MINT-Bench 如何从多语言指令跟随的角度,系统评估文本转语音模型对音色、情感、口音、场景化表达、组合控制以及文本之外声音信息的响应能力;随后介绍 NVV-SuperBench 如何进一步聚焦非语言发声,构建中英双语 45 类非语言发声体系,并评估模型是否能够生成指定类型的笑、哭、叹气、咳嗽、呼吸等发声,是否能放在合适位置,是否足够清晰可感知,同时不破坏语音自然度和音质。
报告将结合多个开源和商业语音生成系统的评测结果,分析当前模型在"内容正确"之外仍面临的核心挑战:内容一致性不等于指令跟随能力,整体音质不等于副语言控制能力,而复杂组合指令、低信噪比口腔类声音以及长时情感类发声仍是当前系统的明显短板。最后,报告将结合正在推进的社区评测任务设计,讨论如何通过开放数据、统一任务设置、基线系统和可复现评测协议,将非语言发声从零散的模型展示推进为可比较、可复现、可持续发展的研究问题,进一步支撑面向自然人机交互的下一代语音生成与语音理解系统。