字节发布音视频全双工大模型 SeedRealtime

字节发布音视频全双工大模型 SeedRealtime
2026年08月05日 12:30 市场资讯

  新浪科技讯 8月5日午间消息,字节跳动正式推出原生音视频全双工大模型 SeedRealtime。目前,SeedRealtime 已在豆包 App 全量上线。

  作为走向全模态交互的关键一步,SeedRealtime 用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。

  据介绍,SeedRealtime实现了三项核心突破:

  音视频联合理解:原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义,也能准确理解视觉中的时序指代,让所见、所闻与所说融为一体。 

  主动的交互能力:具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时(如关键目标出现)主动提醒,并能调用工具融入表达,让交互从被动响应升级为主动协作。

  流畅的交互节奏:能够实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应;同时具备较强的抗干扰能力,能分辨旁人闲聊与背景噪声,不因干扰误触发,保持沟通的流畅连贯。

  字节Seed团队发文表示,端到端人工评测结果显示,相比级联模型,SeedRealtime 的音视频对话节奏问题减少了一半,模型对说话时机的把握更加自然,“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少;同时,单次对话能够完整、顺畅交流的概率也有明显提升。

海量资讯、精准解读,尽在新浪财经APP

责任编辑:郭建

VIP课程推荐

加载中...

APP专享直播

1/10

热门推荐

收起
新浪财经公众号
新浪财经公众号

24小时滚动播报最新的财经资讯和视频,更多粉丝福利扫描二维码关注(sinafinance)

股市直播

  • 图文直播间
  • 视频直播间

7X24小时

  • 08-10 宇树科技 688836 --
  • 08-10 绿控传动 301655 --
  • 08-07 频准激光 688826 --
  • 08-05 恒兴股份 920107 16.02
  • 08-03 杰理科技 920138 18.86
  • 新浪首页 语音播报 相关新闻 返回顶部