青年论坛

音频推理与拟人情感化语音生成技术进展
发布时间:2026/8/19 13:35:56
NCMMSC 2026 青年论坛 - 刘李
刘李
照片
刘李
香港科技大学(广州) · 副研究员、博导

刘李目前是香港科技大学(广州)的副研究员、博导。她在法国格勒诺布尔阿尔卑斯大学GIPSA-lab获得博士学位。曾担任加拿大Ryerson University的博士后研究员。她的主要研究方向是语音处理、音视频理解与生成以及可信人工智能等。她目前以第一作者或通讯作者身份在这些领域已发表学术论文75篇,其中包括此领域顶级期刊和会议TPAMI, TASLP, NeurIPS等。

她现担任国际IEEE机器学习信号处理委员会MLSP Member Nominations & Election分会主席。她曾担任2022年语音信号处理顶会ICASSP的Local Chair (China site)。她获得了广东省青年拔尖人才以及深圳市海外高层次人才-孔雀人才称号。作为项目负责人,她主持国自然面上项目、国自然重点项目课题、国自然青年项目、广东省面上项目、广东省区域联合基金-青年基金项目、2024 CCF-腾讯犀牛鸟项目、2023/2025腾讯AI Lab犀牛鸟专项计划、2025年度CCF-快手大模型探索者基金2022阿里巴巴创新研究计划项目、2022以及2024腾讯公益创投计划等。

她曾在2017年荣获法国Sephora Berribi数学与计算机领域女性科学家奖、IEEE Multimedia Signal Processing Rising Star Runner-up Award以及2024年CCF-腾讯犀牛鸟项目卓越奖。她团队文章获得2024年第16届国际社会机器人学会议ICSR最佳学生论文提名奖、CVPR 2025 CV4Animals Workshop杰出论文以及2022/2023深圳市科协人工智能优秀论文奖。她团队在2026国际语音顶会Interspeech音频推理挑战赛中获得单模型赛道冠军和Agent赛道季军(18个国家和地区的156支队伍)。

本次报告将系统展示团队在音频认知推理与拟人情感化语音生成领域的前沿突破。我们提出了Audio-DeepThinker,通过渐进式推理感知强化学习,首次实现大型音频语言模型结构化思维链的自主涌现,在多项深层推理基准上荣登榜首。

在此基础上,我们构建了PhyAVBench,这是全球首个面向物理常识的音视频生成评测平台,并独创对比物理响应评分机制,推动生成模型从"视听同步"迈向"物理可解释"的新高度。在情感化生成方向,我们研发了EmoSteer-TTS,首次实现无需训练、激活级细粒度情感操控的语音合成,为可控人机交互开辟全新范式。

进一步地,团队推出了AudioGenie,一个统一的多智能体协作框架,打通文本、图像、视频到语音、音效、音乐、歌曲等多类型音频的生成闭环。上述工作共同构筑了从音频逻辑推理到情感智能生成的完整技术体系,为下一代具身智能、多模态交互与物理世界模拟奠定了关键理论与应用基础。