教程报告

操控生成:面向音频生成与编辑的条件扩散、桥、与引导方法
发布时间:2026/7/23 22:13:48
陈泽华
照片
陈泽华
清华大学 · 博士后

陈泽华博士现为清华大学计算机系博士后,获"水木学者"计划资助,入选国家级博士后人才专项。此前博士毕业于英国帝国理工学院电气与电子工程系、任生数科技(Vidu)音频模态负责人。在概率生成模型(如扩散模型、桥类模型)及其在音-视频生成、健康监测等方面的应用持续开展研究工作,以第一或通讯作者(含共同)在 Nature Machine Intelligence, NeurIPS, ICML 等期刊与会议发表论文近 20 篇,其中多篇文章录取 CVPR, ACL, ACM MM, ICASSP 等会议 Highlight 或 Oral,文生音频工作 AudioLDM 单篇已获引用 1200 余次。

扩散模型(Diffusion Models)及其延展框架在内容生成领域已体现出强大的数据分布拟合能力,在音频、视觉、文本等多个模态的前沿生成系统中均成为核心组件。本课程将介绍以扩散模型为基础的音频生成与编辑方法,包含扩散模型的基础理论,及其面向可扩展、高可控、与多任务建模等方面的理论与实践方法,如在文本-音频(Text-Audio)、视频-音频(Video-Audio)跨模态一致性上的训练与推理探索。

并涵盖其延展框架,桥类模型(Bridge Models)基础,及其在高效内容处理,如音频超分(Any-to-192 kHz Audio Super-Resolution)、内容转换(Image-to-Image or Audio-to-Audio Translation)等方向的近期探索。