淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作

淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作
2026年10月02日 09:30 机器之心Pro

TaoMate-H3 是由阿里巴巴 TaoLive AIGC 团队研发的音视频联合流式生成模型。基于 MiniMax H3,TaoMate-H3 将三步 LoRA 推理与自回归生成相结合,能够根据文本描述,连续生成包含人物对白、歌声或环境音的视频,支持分钟级续写,以及 480p、768p、1080p 级横竖屏输出。

与整段视频反复去噪的生成方式相比,TaoMate-H3 以小片段为单位推进,每个片段仅需三步去噪,无需等待整段视频完成生成。这一方式显著缩短了首段内容的产出时间,也为直播讲解、虚拟角色表演和交互式视频应用提供了新的技术基础。

目前,TaoMate-H3 推理代码与 LoRA 权重已正式开放。开发者可通过 GitHub 和 Hugging Face 下载体验,在此基础上开展应用开发与流式生成研究。以下是本次发布的演示效果。

  • 开源代码: github.com/TaoLiveAIGC/TaoMate-H3

  • 模型权重: huggingface.co/TaoLiveAIGC/TaoMate-H3

什么是 TaoMate-H3?

TaoMate-H3 面向需要持续生成声音与画面的创作场景。用户可以用一条提示词描述完整场景,也可以按段安排台词、动作和情节;模型在保留历史上下文的基础上继续生成,使相邻段落共享人物、声音和场景信息。

这次发布主要围绕三个核心能力展开。

  • 三步流式生成,降低等待时间

通过少步 LoRA,TaoMate-H3 将每个小片段的去噪过程压缩为三步。模型优先完成当前片段,再生成后续内容,无需等待整个视频完成去噪。对于需要及时反馈的内容生产,这种逐段产出方式有助于缩短等待,并为边生成边播放提供基础。

  • 音视频联合生成,丰富人物与场景表现

TaoMate-H3 在同一生成过程中处理声音与画面,既支持人物讲话、歌唱和角色对白,也支持海浪、车辆运动、爆炸等环境与动作音效。声音参与模型的生成过程,为口型、表情和动作提供时间上的配合。

  • 分钟级连续续写,支持分段内容编排

借助持续更新的音视频 KV 缓存和分段音频引导,模型能够跨越提示词边界延续前面的内容。创作者可以逐段调整讲解重点或表演内容,组织更完整的商品介绍和角色叙事。

应用效果

  • 电商讲解:从商品展示到完整介绍

商品介绍通常包含外观展示、功能细节和使用场景等多个环节。TaoMate-H3 支持用分段提示词编排这些内容,在连续镜头中推进讲解,适用于商品短视频、选品介绍和品牌内容制作。

本次展示包含一分钟的竖屏背包介绍,以及横屏木梳讲解。两组案例呈现了不同画幅下的人物口播与商品展示效果,其中背包视频保留了完整的一分钟生成结果。

背包讲解

木梳讲解

围绕同一件商品,创作者还可以针对不同人群调整讲解内容,例如突出通勤收纳、旅行携带或日常使用等需求。分段编排让卖点顺序与台词节奏更容易控制,也便于制作不同版本的商品内容。

  • 演唱与角色表演:声音、表情和动作共同呈现

除了商品口播,TaoMate-H3 还支持包含歌声与音乐的表演场景。窗边演唱案例展示了写实人物的歌唱过程,将旋律、口型和身体动作组织在同一段视频中。

窗边演唱

  • 动漫对白:拓展风格化角色创作

音视频联合生成同样适用于动漫内容。在月夜少女与白狐的案例中,风格化的人物、场景与角色对白共同构成了一个短剧情片段。创作者可以通过提示词设定角色形象、环境氛围与台词,再逐段推进故事情节。

月夜少女与白狐

  • 环境与特效:让场景拥有自己的声音

TaoMate-H3 的生成范围还包括没有人物对白的场景。日落海岸案例以海浪和环境原声表现空间氛围;电影爆炸案例则将人物运动、建筑爆炸与冲击音效结合起来,呈现更强烈的视听节奏。

日落海岸与海蚀拱门

人物向前,身后建筑爆炸

这些案例覆盖了商品讲解、人物演唱、动漫对白、风景与电影特效等不同内容类型。模型提供横竖画幅和多档分辨率,便于适配移动端内容与横屏展示。

TaoMate-H3 整体流程

从提示词到最终视频,TaoMate-H3 的推理流程主要包含四个环节:

  • 分段组织内容:根据目标时长读取提示词序列,确定每个段落的场景、动作和声音描述。

  • 准备音频引导:为当前段落生成音频去噪轨迹,并利用上一段尾部的声音信息衔接音色与语气。

  • 联合流式生成:将段落拆成小片段,每个片段执行三步音视频去噪,并持续更新历史 KV 缓存。

  • 解码输出:生成的 latent 通过 VAE 解码为画面与声音,完成媒体输出。公开推理入口会自动运行整套流程并保存最终视频。

其中,latent 是模型生成过程中使用的音视频压缩表示。模型先在这一表示空间中完成生成,再通过解码得到可观看、可收听的内容。

TaoMate-H3 关键技术

  • 三步 LoRA:减少每个片段的生成开销

TaoMate-H3 通过少步 LoRA 适配,将流式推理压缩到三个去噪区间。在当前五秒提示词配置下,每个段落分为四个 chunk,主体 chunk 约为 1.4 秒,尾部片段较短。模型依次完成这些片段,并利用历史上下文继续生成。

三步更新沿 0→16→33→49 的时间状态推进。每个片段完成后,模型基于最终生成的音视频状态更新 KV 缓存,供下一片段使用。少步生成减少了反复迭代的计算量,分块处理则使模型能够更早产出第一段内容。

Self Forcing:面向连续续写的自回归训练

在训练阶段,TaoMate-H3 采用 Self Forcing 的自回归训练思路,让模型以自身生成的历史片段为条件,继续生成后续内容。这使训练过程能够接触实际续写中的历史状态,缓解仅依赖真实历史训练所带来的训练与推理分布差异。

https://arxiv.org/pdf/2506.08009https://arxiv.org/pdf/2506.08009

这一训练方式与少步推理、KV 缓存共同构成了流式续写的基础:模型既学习当前片段的生成,也学习如何利用此前的输出延续人物、动作和场景。

  • 音视频 KV 缓存:支持长视频连续记忆

为维持长视频的一致性,TaoMate-H3 持续复用音视频 KV 缓存,将已生成内容的上下文传递给后续片段。人物状态、近期动作和声音信息因此能够随时间延续,在切换提示词时仍参与后续生成。

缓存采用「起始视觉参照 + 近期音视频上下文」的组织方式。起始参照保留人物与场景的初始信息,近期上下文随生成进度滚动更新,使模型能够跟随最新的动作与声音继续创作。

这种方式将历史缓存控制在固定规模内,避免其占用随视频时长不断增长,为分钟级连续生成提供了稳定的上下文支持。

  • 连续时间编码:改善跨提示词衔接

在长视频中,提示词可以变化,媒体时间线仍需连续。TaoMate-H3 使用全局连续的 RoPE 位置编码,随音视频进度移动当前文本的时间坐标,并将文本右边界对齐到当前媒体的起点,使新提示词对应正在生成的内容。

切换提示词时,系统保留已有音视频 KV,同时区分新生成内容与编解码所需的尾部上下文。历史内容仅用于衔接,不重复生成。针对长时间续写中的亮度和色调变化,模型还以首个片段的视觉统计为参照,对后续视频 latent 进行均值与方差对齐,减轻画面观感的漂移。

  • 音频轨迹引导:稳定台词节奏与音色

流式生成将视频拆成了短片段,但一句台词的停顿、语速和结束位置需要在完整段落内安排。TaoMate-H3 在内部先准备覆盖当前提示词段落的音频去噪轨迹,再将对应时间位置的音频 latent 用于引导各个小片段,使局部生成始终具有段落级的声音参照。

三次去噪更新分别对齐音频轨迹中的三个状态,最终音频 latent 与引导轨迹的干净终点保持一致。音频引导贯穿生成过程,有助于稳定台词的展开节奏,减少短片段续写时的重复起句。

为衔接不同段落的音色与语气,系统将上一段最后约一秒的干净音频作为只读参考。新音频在这一参考下继续生成,参考本身保持不变;最后统一解码各段音频 latent,得到连续的声音输出。

性能表现

在同一台 8 × NVIDIA H20 96 GB 机器上,我们对原版 MiniMax H3 与 TaoMate-H3 进行了测试,输出均为 480 × 864、十秒视频。

TaoMate-H3 的纯 DiT 计算耗时由 169.572 秒降至 14.810 秒,加速 11.45 倍;首段最终 latent 的就绪时间由 170.052 秒缩短至 6.148 秒,加速 27.66 倍。首段 latent 就绪对应模型完成第一段生成、可交给 VAE 解码的时间。

在上述十秒配置下,TaoMate-H3 共生成八个小片段,执行 24 次生成前向和 8 次 KV 更新。单机八卡采用 TP2 × Ulysses4 并行,并结合高效注意力、算子融合及部分线性层的选择性低精度计算,降低推理开销。

这些优化既提升了整段内容的生成效率,也缩短了首段内容的产出时间,为分块解码、播放和交互应用开发提供了基础。

快速体验

  • 环境与硬件

项目支持 Linux、Python 3.10/3.11、CUDA 12.8 与 PyTorch 2.8,提供单机 4 卡或 8 卡推理入口。已验证的运行配置为 8 × H20 96 GB,完整安装步骤见仓库 README。

  • 运行示例

  • 获取代码:git clone https://github.com/TaoLiveAIGC/TaoMate-H3.git cd TaoMate-H3

按照 README 完成环境安装和 MiniMax H3 基础权重下载后,即可运行仓库内的十秒示例。TaoMate-H3 LoRA 权重会在首次使用时自动下载:

python -m taomate_h3 \  --model-root models/MiniMax-H3 \  --prompt-json examples/prompts_10s.json \  --duration 10 \  --resolution 768x1376 \  --gpus 8 \  --output outputs/demo_10s

结果保存在 outputs/demo_10s/video.mp4 。替换提示词文件即可修改场景、台词与动作;通过时长和分辨率参数,可以进一步生成更长的视频或切换横竖画幅。

  • 开源与后续计划

本次发布包含推理代码、LoRA 权重及示例提示词,欢迎开发者下载体验,也欢迎围绕流式推理、音视频生成和应用集成与我们交流。

项目基于 MiniMax H3,遵循 MiniMax H3 Community License。感谢 MiniMax H3 及相关开源工具的贡献者。

团队仍在持续优化推理速度,进一步缩短首段内容与后续响应的等待时间。我们也计划在不久的将来陆续发布并开源新的 FL2AV 流式模型,进一步拓展到 Ref2AV,并同步开放相应权重,支持更丰富的音视频创作方式。

期待与社区一起推进音视频流式生成,让这项技术走进更多实际的创作场景。

新浪科技公众号
新浪科技公众号

“掌”握科技鲜闻 (微信搜索techsina或扫描左侧二维码关注)

创事记

科学探索

科学大家

苹果汇

众测

专题

官方微博

新浪科技 新浪数码 新浪手机 科学探索 苹果汇 新浪众测

公众号

新浪科技

新浪科技为你带来最新鲜的科技资讯

苹果汇

苹果汇为你带来最新鲜的苹果产品新闻

新浪众测

新酷产品第一时间免费试玩

新浪探索

提供最新的科学家新闻,精彩的震撼图片