郑达硕士毕业于上海交通大学,导师为俞凯教授;曾搭建了业界领先的大规模中文语音识别系统yitu-asr;在小红书dots语音团队进行文本和多模态的模型研发工作。目前在进行全双工语音方向的研究。
王翰坤是上海交通大学跨媒体语言智能实验室 (X-LANCE) 博士生,导师为俞凯教授;本科毕业于哈尔滨工业大学。目前在小红书dots语音团队实习。他的主要方向为语音表征与合成,在 ICASSP, Interspeech, SLT, AAAI 等旗舰会议和期刊发表论文 10 余篇,并担任 ICASSP, Interspeech 等会议的审稿人。
李波含于 2024 年获得上海交通大学计算机科学与技术专业(ACM班)工学学士学位,目前在上海交通大学攻读博士学位,导师为俞凯教授。目前在小红书dots语音团队实习。他的研究方向主要为语音合成与理解。他已在语音与语言处理及机器学习领域的多个顶级会议上发表论文,包括 ICASSP、Interspeech、NeurIPS 和 AAAI 等。
本报告主要对小红书dots团队的语音探索进展进行展开。主要分成三个部分:连续表征自回归语音合成dots.tts,其依赖的生成理解统一的语音表征HoliTok,以及在dots.tts之上构建的统一细粒度语音编辑模型dots.tts.edit。
dots.tts 是一个开源的 2B 参数的全连续端到端自回归 TTS 基础模型。它利用语义化 AudioVAE(HoliTok),既保留了连续语音细节,又保持了模型生成的稳定性。在 Seed-TTS-Eval 的中英零样本音色复刻评测上,dots.tts 取得最佳平均结果。CFG-aware MeanFlow 把 16 步带 CFG 的教师轨迹蒸馏为区间平均速度,推理时仅需 2 至 4 次单分支函数评估。dots.tts还支持1T1A的双流模式,为全双工的duplex模式提供了低延迟的语音输出能力。
HoliTok 将 48 kHz 语音编码为 25 Hz、128 维连续表征。该模型采用渐进式训练策略,在保持信号级重建保真度的同时,维持表征空间良好可学习性并引入了语义信息。我们构建了一个统一的 AR+DiT 模型,用于同时进行语音合成与语音识别的的下游建模。同一表征序列既支持面向生成的任务,也支持统一的生成-理解下游任务。
dots.tts.edit 以连续自回归 dots.tts 为基础模型,输入源语音和以转写文本为锚的结构化指令,直接定位需要编辑的文本片段或停顿边界,统一完成文本、情感、韵律、停顿和组合编辑。实验证明,无需复杂的语义编码器等额外模块,不大幅改造基础模型骨干,就能把连续自回归 TTS 基座模型改造为适用于统一细粒度语音编辑的模型。