字节跳动 SeedRealtime 音视频全双工大模型发布:支持边看、边听、边说,已上线豆包

2026-08-05 12:12 IT之家 - 汪淼

IT之家 8 月 5 日消息,字节跳动 Seed 今日宣布推出原生音视频全双工大模型 SeedRealtime走向全模态自然交互。

SeedRealtime 用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。它实现了以下三项核心突破:

  • 音视频联合理解:原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义,也能准确理解视觉中的时序指代,让所见、所闻与所说融为一体。

  • 主动的交互能力:具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时(如关键目标出现)主动提醒,并能调用工具融入表达,让交互从被动响应升级为主动协作。

  • 流畅的交互节奏能够实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应;同时具备较强的抗干扰能力,能分辨旁人闲聊与背景噪声,不因干扰误触发,保持沟通的流畅连贯。

端到端人工评测结果显示,相比级联模型,SeedRealtime 的音视频对话节奏问题减少了一半 —— 模型对说话时机的把握更加自然,“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少;同时,单次对话能够完整、顺畅交流的概率也有明显提升。

目前,SeedRealtime 已在豆包 App 全量上线,在业界率先实现了音视频全双工技术的规模化落地。将豆包 App 更新至最新版本,在对话框内选择“打电话”,进入视频通话界面体验即可。

IT之家附项目主页地址:

https://seed.bytedance.com/seedrealtime

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家包含外链的文章均包含本声明。

文章价值:
人打分
有价值 还可以 无价值
置顶评论
    热门评论
      文章发布时间太久,仅显示热门评论
      全部评论
      一大波评论正在路上
        取消 发送
        分享成功

        长按关注IT之家公众号
        阅读更多精彩文章

        查看更多原创好文
        软媒旗下人气应用

        如点击保存海报无效,请长按图片进行保存分享