连续自回归的dots.tts:小红书开源语音合成模型「基座」

连续自回归的dots.tts:小红书开源语音合成模型「基座」
2026年08月13日 10:03 机器之心Pro

机器之心发布

语音合成这条赛道,最近越来越像早期的大语言模型:模型一个比一个强大,底层路线却远没有收敛。

  • 有人选择非自回归的扩散,一次并行生成整段声音,但是这种方法只适合离线使用;

  • 有人沿用大语言模型最熟悉的方式,把语音压成离散 Token,再逐个自回归预测,但是语音毕竟不是一个一个的词,这样的做法会有一个无法打破的天花板。

小红书 dots 团队和上海交通大学 X-LANCE 实验室这次合作开源的 dots.tts,走的是另一条路线:不用离散 token,而是在连续隐空间中进行自回归生成

它是一个 20 亿参数、全连续、端到端的自回归 TTS 基础模型。整条生成链路不依赖离散声学 Token:模型直接在连续隐空间中,以自回归方式逐个声学块建模,再把连续隐变量还原成波形。

  • 最稳最像:Seed-TTS-Eval 三个子集上,平均准确度和平均说话人相似度达到 SOTA;

  • 可扩展基座:支持音色微调、任务微调,例如 dots.tts.edit 就直接沿用 dots.tts 基座模型,支持文本、情绪、韵律和停顿四类编辑,指令执行率和局部保持率在 doteBench 上整体领先;

  • 全量开源:预训练、自纠正对齐、MeanFlow 四步、两步和单步,以及 1T1A 双流共六个检查点;同时开放训练、推理、微调、蒸馏代码,采用 Apache 2.0 许可;

  • 交互优先:天然支持流式输出,配合双工对话系统还可以使用 1T1A 的双流模式;

  • 推理友好:1T1A 双流模式音频首包低至 54.4 毫秒;使用 SGLang Omni 引擎最高支持 16 路并行推理;

先看模型表现

Seed-TTS-Eval 是语音生成领域常见的零样本声音克隆评测。模型只拿到一小段训练时未见过的参考语音,再用同一个人的声音说出新文本。

它主要测试两件事:

  • 第一,准确度:即内容有没有说对。英语用 WER,中文用 CER,数值越低越好。

  • 第二,相似度:即声音像不像同一个人。SIM 衡量生成音频和参考音频在说话人表征上的相似度,数值越高越好。

dots.tts SOAR 版本在中文、英文和中文困难集上的 WER/CER 分别为 0.94%、1.30% 和 6.60%,SIM 分别为 81.0、77.1 和 79.5

把三个子集取平均后,它的平均 SIM 为 79.2,平均 WER/CER 为 2.95%;dots.tts 拿到了最佳平均音色相似度和最佳平均内容准确度。

图 1|Seed-TTS-Eval 上的平均 WER 与平均 SIM 分布。横轴越靠左内容越准,纵轴越靠上音色越像,dots.tts 位于左上角。

表 1|Seed-TTS-Eval 零样本克隆核心结果。约 3 秒参考音频,由评测集自带的 ASR 与 WavLM-SV 打分;基线取自各自论文或默认配置的开源版本。

在 MiniMax-Speech 的 24 语种测试中,dots.tts 自纠正对齐版本的平均说话人相似度达到 83.9,高于表中其他系统;dots.tts 的不同版本在 24 种语言中拿下 19 个语种的单项 SIM 第一,并在另外 2 个语种并列第一。

在偏表现力的 EmergentTTS-Eval 上,以 gpt-4o-mini-tts 为基准做两两对比,dots.tts SOAR 版本拿到表中最高的句法复杂度得分 65.7%,高于所有闭源系统;dots.tts Base 版本则取得开源系统中最好的情绪表现力得分 72.7%

图 2|EmergentTTS-Eval 总体胜率对比。红色为 dots.tts,紫色为闭源系统,蓝色为开源系统,虚线为 50% 基准线。

下面几个音频取自这几个测试集

seed-tts-eval 困难文本

参考音频:由于对球没有很好的控制力,我通常打直球。

生成音频:喇嘛与哑巴 打南边来了个哑巴,腰里别了个喇叭;打北边来了个喇嘛,手里提了个獭犸。提着獭犸的喇嘛要拿獭犸换别着喇叭的哑巴的喇叭;别着喇叭的哑巴不愿拿喇叭换提着獭犸的喇嘛的獭犸。不知是别着喇叭的哑巴打了提着獭犸的喇嘛一喇叭;还是提着獭犸的喇嘛打了别着喇叭的哑巴一獭犸。喇嘛回家炖獭犸;哑巴嘀嘀哒哒吹喇叭

多语言克隆西班牙语

参考音频:El Instituto Acton, un Tintag libertario conservador cristiano estadounidense, lleva su nombre.

生成音频:Mi padre suspiró, amparado en aquella sonrisa triste que le perseguía como una sombra por la vida.

跨语言克隆英文 - 中文

参考音频:Which is what has brought us to this point in the first place.

生成音频:那我来给大家推荐一款 T 恤,这款呢真的是超级好看,这个颜色呢很显气质,而且呢也是搭配的绝佳单品,大家可以闭眼入,真的是非常好看,对身材的包容性也很好,不管啥身材的宝宝呢,穿上去都是很好看的。推荐宝宝们下单哦。

语言表现力

参考音频:没必要和那些大师的作品比较吧。

生成音频:哎呀你得知道啊,要把知识硬塞到那些学生的脑瓜子里去,啧啧,说真的,实在是件乏味得要死的苦差事,你说是不是嘛。不过呢,要是偶尔能遇上个心有灵犀的聪明孩子,哎嘿,你只要稍微点拨一下下,他就能豁然贯通了,哇,真的太神奇了。嘿嘿嘿,我跟你讲,这时候呀,这世上绝对再没有比教书更让人心仪的事情了,哈哈哈哈,你说对吧?

音色克隆,其实是自回归 TTS 基模最自然的一场考试

我们为什么主要用音色克隆的方式来评价 TTS 模型呢?其实音色克隆是自回归 TTS 基模的一场基础能力的考试

自回归是 dots.tts 的第一个核心方向选择。这也是今天文本大模型的生成方式。文本大模型靠预测下一个 Token 学习语言,TTS 大模型则在目标文本、参考音频和已经生成的声学历史的条件下,预测下一个声音片段,再把刚生成的片段加入历史,继续向后生成。

对语音模型来说,几秒参考音频就像一段 “声音提示词”。里面包含这个人的音色、语速、音高走势、停连和韵律。模型结合另一段新文本,一步步预测 “这个人接下来会怎样把这句话说出来”,最终得到的,恰好就是这个声音在新内容上的延续。

这也解释了 zero-shot 的克隆能力为什么重要。它表面上在考 “给几秒声音,能不能克隆”,实际上同时检查了 TTS 基模的几项基本功:是否理解参考音频,是否准确说出新文本,是否在逐步生成中保持说话人身份和韵律,以及面对困难文本时是否仍然稳定。

所以,dots.tts 在三个子集上拿到最低平均 WER/CER 和最高平均 SIM,说明它具备了很强的未来预测能力的基础能力:内容说得准,声音保持得住,逐步生成也足够稳定。

连续表示,把音色里容易被量化抹掉的细节留下来

再看 dots.tts 的另一个核心选择方向:直接在连续隐空间中建模声音,跳过离散 Token 量化。

声音天然是连续的。一个人的身份分布在频谱质感、气声与鼻音、音高的细微起伏、音节时长、停顿方式和语速变化等大量细节中。这些特征共同构成了 “这个人究竟是怎样说话的”。

离散表示会把连续变化映射到有限词表中的编号,训练和推理可以沿用语言模型成熟的 Token 预测范式。量化也会形成信息瓶颈:不同的声音细节可能落入同一个编号,编码时丢失的信息很难由后续模型重新恢复。

重建评测把这种差距直接呈现了出来。四种离散表征的 PESQ-NB 为 2.40—2.92,SIM 为 0.68—0.85;三种主要连续表征的 PESQ-NB 达到 3.99、4.23 和 4.09,SIM 达到 0.963、0.950 和 0.969。在 PESQ、STOI、SIM 和重建后的 WER 上,连续表征整体拉开了明显差距。

其中,SIM 的差别尤其直观。离散方案的最高值为 0.85,dots.tts VAE 达到 0.969。这组指标衡量语音经过编码和解码后,说话人身份还能保留多少。隐空间上重建的表现就是自回归模型能够达到的上限。

这里 MingTok-Audio 使用更密的 50 Hz 潜变量序列,在 PESQ 和 STOI 上取得最高结果。这也证明了信息量更大的连续表征,可以获得更强的上限。

dots.tts VAE 面向 48 kHz 语音,将连续序列压缩到 25 FPS,仍取得 4.09/3.95 的 PESQ、0.973 的 STOI、0.969 的 SIM 和 4.14% 的 WER,在声音信息和自回归序列长度之间取得了平衡。

表 2|LibriSpeech test‑other 测试集上的语音重建性能。FPS 表示底层表征的时间帧。粗体标记每列中最佳的非先知(non‑oracle)结果。“‑” 表示该指标由对应文献给出。

dots.tts 对一段带回声的参考音频的模仿,更容易让人听出这种表示上限所在。在参考声音带有明显的空间反射和尾音衰减的情况下,生成音频中延续了说话人的基础音色,也保留了回声带来的距离感和空间感。

声学特点克隆

参考音频:「祂的承诺兑现后,布洛妮娅… 我们就不必再穷尽此生守护一片废土。你和我,我们会亲眼见证新世界从废墟中升起。

生成音频:听好了,这场仗我赢了。你的底牌、后路、人脉,全在我手里。现在,带着你那份不甘,乖乖退场吧!

连续自回归的难点:细节越多,误差越容易积累

自回归模型会把已经生成的声音作为后续条件。连续隐变量缺少离散码本的量化约束,前一步的微小偏差会进入下一步历史,并在逐块生成中继续向后传播。

句子一长,这些偏差就可能积累成啸叫声或导致音色漂移,甚至出现文本错位。连续表示保留的细节越丰富,模型需要长期维持的声学状态也越复杂。

一旦解决这个问题,连续自回归就能把两类能力接在一起:自回归大模型的大规模预训练、上下文学习和天然流式生成,以及连续表示对音色、韵律和声学细节的高保真保留。

dots.tts 的答案:先让连续表示变得适合自回归

dots.tts 从 AudioVAE 的语义化训练入手。第一阶段建立高质量波形重建能力,并通过正则约束塑造更平滑、低噪的连续隐空间。第二阶段继续保留重建目标,同时加入 WavLM 帧级表征对齐,以及 ASR、情绪和说话人识别等多任务监督。

这些监督给连续隐空间增加了更清晰的结构:ASR 对应语音内容,情绪任务对应表达方式,说话人任务对应声音身份,高保真重建继续保存局部声学细节。模型由此获得一份信息完整、同时更容易组织和预测的连续语音表示。

团队给 AudioVAE 的语义化连续表征起了一个名字叫 HoliTok ,意思是全面的表征。团队用 HoliTok 做了验证:用同一个模型同时训练 ASR 和 TTS,用 HoliTok 同时服务语音理解和生成。HoliTok 是唯一无需额外优化技巧就能直接稳定完成统一建模的方案;加入因果 Semantic Encoder 后,ASR 和 TTS 的表现进一步提升。这说明,语义化 VAE 直接影响连续表征的可学习性,也决定它能否同时承载理解与生成。

第二阶段训练得到的编码器随后直接作为因果 Semantic Encoder。每生成一段新的连续语音,它都会提取稳定的语义历史,供后续自回归步骤继续使用。高方差的局部声学变化留在连续声学路径中,长程反馈则沿着更紧凑的语义摘要向后传递。

Semantic Encoder 只读取已经生成的声音,可以随着音频逐段更新。AudioVAE 决定声音中有多少信息能够保留下来,Semantic Encoder 负责把这些信息整理成稳定的历史。两者共同降低连续误差在长程生成中的累积,也让连续表示的高保真上限能够被自回归模型持续利用。

图 3|dots.tts 整体架构。文本经 BPE 直接进入 LLM,因果 Semantic Encoder 把已生成的 VAE 潜变量压成语义历史回灌,AR 流匹配头在 48 kHz AudioVAE 的连续隐空间中逐块去噪,全链路没有离散声学 Token。

从无奖励的自纠正对齐,到四步、两步和单步生成

在基础模型已经达到 SOTA 水平的情况下,团队又把目光投向了后训练和推理加速。力求实现性能指标与工程实用价值的进一步提升。

团队先参考 SOAR 的思路,对 DiT 模块进行无奖励的自纠正对齐。训练时,模型会沿自己的预测向前走一步,构造真实推理中可能出现的偏离状态,再学习把这些状态拉回干净的语音目标。这个阶段不依赖奖励模型或额外声学教师,重点修复预训练与多步推理之间的误差累积;完成自纠正对齐后的 SOAR 检查点,也成为后续低步数蒸馏的教师。

连续潜变量的生成需要沿着速度场逐步求解。MeanFlow 将教师在一段时间区间内的生成轨迹蒸馏成平均速度,让学生一次跨过更大的求解区间;同时把分类器自由引导融入蒸馏目标,减少每个声学块所需的网络前向次数。

MeanFlow 在四步生成下效果稳定,但继续压缩到双步和单步后,生成质量会明显下降。为此,团队引入简化一致性模型(sCM),约束生成轨迹上不同时间点的预测保持一致,得到稳定的双步模型。当 sCM 已经建立起较强的低步数生成能力后,团队进一步采用奖励感知的分布匹配蒸馏(Reward-Aware DMD),在对齐教师生成分布的同时引入语音质量奖励,并结合双时间尺度更新策略(TTUR)稳定训练,最终得到自然、清晰且音色一致的高质量单步模型。本次双步和单步模型也一并开源可用。

交互友好,推理友好

在交互场景,对 TTS 的延迟非常敏感。想要降低延迟,要么用小模型,要么需要让语音可以尽早开始输出。

dots.tts 天然支持流式输出。完整文本先作为前缀输入,模型随后逐步生成音频块;

面向 LLM 实时输出播报的情况,dots.tts 进一步支持 1T1A 双流模式。上游语言模型输出第一个文本 Token 开始,语音侧就可以开始生成音频,最大程度地降低延迟。1T1A 双流进一步打通文本生成和语音生成,适合实时语音 Agent、双工交互等场景。

在 1T1A 的场景下,LLM 开始输出后,最快 54.4ms 就可以输出音频首包。

值得指出的是,SGLang-Omni 团队已经支持了 dots.tts 的推理,并且优化了模型的吞吐;在 SGLang-Omni 提供的测试报告中,使用 Seed-TTS-Eval EN 测试集,单卡最高可以跑 16 路,具体性能如下:

这次开源,给出了一套可继续训练的完整路径

这次 dots.tts 的开源完整度,也很值得单独拿出来说。

仓库目前开放了六个检查点,覆盖基础训练、稳定性增强、低步数生成和双流交互。

开发者可以通过 CLI、Python API 或流式接口进行文本合成和零样本声音克隆。仓库还提供微调入口、训练配置、数据清单格式和 MeanFlow 蒸馏脚本,覆盖了从调用到继续训练的完整路径。

对于研究者,这意味着连续自回归路线可以被直接复现和拆解;对于产品团队,则意味着可以选择自己趁手的模型进行使用,也可以可以继续做领域音色适配、流式服务和延迟优化。

dots.tts.edit:基座之上,向精确编辑扩展

语音编辑是一项同时考验理解与生成能力的任务:模型不仅要结合源语音、文本和编辑指令,理解 “改什么、怎么改、在哪里改”,还要生成符合目标的语音,并尽可能保持未指定区域的内容、说话人特征和声学连贯性。

利用 dots.tts 连续自回归架构,将文本条件与连续语音潜表示纳入统一的条件生成框架的特点;团队继续探索了语音的精确编辑能力,训练了 dots.tts.edit。在其中,源文本、源语音、编辑指令和目标文本共同构成模型的上下文,由同一模型生成编辑后的目标语音。这使语音编辑成为检验该架构是否具备统一承载语音理解与生成能力潜质的代表性任务。

它支持四类操作:替换、插入或删除文字;改变整句或局部片段的情绪;调节指定片段的音高与语速;在文字边界插入、延长或缩短停顿。多项操作可以组合在同一条指令中,并通过一次生成完成。这样一来,dots.tts 的能力从 “用一个声音说出新文本”,继续扩展到 “只修改声音里被指定的部分”。

为系统评测精确语音编辑能力,团队构建了双语评测套件 doteBench,从指令遵循、局部保持和整体音频质量三个维度进行评估。当前冻结版本共包含 2,081 个案例:其中 1,841 个单项编辑案例,覆盖文本、情绪、韵律和停顿;另有 240 个组合编辑案例,要求模型在一次生成中完成多项编辑。

doteBench 同时检查三个方面:目标指令是否执行,未编辑区域是否保持,完整音频是否自然。文本编辑看目标区域和保留区域的 WER/CER;情绪、韵律和停顿分别检查目标属性的变化;WDTW-Dur、WDTW-F0 和 SpkSim 则衡量未编辑部分在时长、音高和说话人身份上的保持程度。

在论文评测的开源模型中,dots.tts.edit 在五类任务上取得了整体领先的指令跟随和局部保持表现:

表 2|dots.tts.edit 在 doteBench 上的关键结果表 2|dots.tts.edit 在 doteBench 上的关键结果

与此同时,dots.tts.edit 在 Seed-TTS-Eval 上的识别错误率和说话人相似度仍与 dots.tts 基座接近,说明同一个连续自回归生成器可以在保留零样本合成能力的基础上,继续扩展精确编辑能力。

开源 “基座” 的意义:让语音能力沿同一套模型继续生长

dots.tts 这次开源的核心价值,落在 “基座” 两个字上。

这个基座首先要有足够扎实的基本能力,还要能够适配不同的推理与交互需求。更重要的是,能力可以继续在这套基座上扩展。

六个检查点,以及训练、推理、微调和蒸馏代码的完整开放,让这种扩展不只发生在团队内部。研究者可以继续验证连续自回归路线,开发者可以做领域适配、低延迟部署和新的控制任务,产品团队也可以把它接入语音 Agent、创作工具和双工对话系统。

从声音克隆到实时交互,再到精确编辑,dots.tts 给出的已经是一套可以持续训练、蒸馏和扩展的开源语音合成基础设施。这正是语音合成大模型 “基座” 应有的形态。

新浪科技公众号
新浪科技公众号

“掌”握科技鲜闻 (微信搜索techsina或扫描左侧二维码关注)

创事记

科学探索

科学大家

苹果汇

众测

专题

官方微博

新浪科技 新浪数码 新浪手机 科学探索 苹果汇 新浪众测

公众号

新浪科技

新浪科技为你带来最新鲜的科技资讯

苹果汇

苹果汇为你带来最新鲜的苹果产品新闻

新浪众测

新酷产品第一时间免费试玩

新浪探索

提供最新的科学家新闻,精彩的震撼图片