探所 Curio 再探再报 了解探所 →
#商业

字节 Seed 发布 SeedRealtime 音视频全双工模型

字节 Seed 团队发布了原生音视频全双工大模型 **SeedRealtime**。

它用统一架构把音频、视频和文本揉进同一个端到端模型,在连续的多模态信息流上实时交互 —— 不是先听完、再看完、最后作答,而是感知、理解、决策、表达同步进行。官方把它定位为「走向全模态交互的关键一步」,落点是「边看、边听、边说」。

💡 为什么值得看字节豆包全量端到端全双工,对话节奏问题减半,规模化落地。

查证

来源档案

字节 Seed 官方博客

字节跳动 Seed 团队官方博客,一手发布公告 + 能力描述 + 自测数据

产品发布与上线事实属官方一手口径,可信;技术能力与「对话节奏问题减少一半」等对比数据出自官方端到端人工评测,无第三方复现,推演能力上限时应保留。

延伸阅读

级联 vs 端到端 vs 外置 VAD · seed.bytedance.com 6 分钟
官方原文把音视频交互的两种旧形态拆得比较清楚:级联方案延迟层层叠加,端到端方案不少仍靠外置 VAD 判断轮次。想理解全双工到底难在哪、SeedRealtime 的架构选择改了什幺,这段是最短路径。
7 个场景案例 · seed.bytedance.com
博客用聚餐认人辨声、川菜馆菜单翻译、博物馆打卡提醒、咖啡机纠错、机场嘈杂环境等案例演示能力,方便判断「主动交互」是真能力还是剪辑效果 —— 不过案例都是官方挑选的。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store