#商业
字节 Seed 发布 SeedRealtime 音视频全双工模型
字节 Seed 团队发布了原生音视频全双工大模型 **SeedRealtime**。
它用统一架构把音频、视频和文本揉进同一个端到端模型,在连续的多模态信息流上实时交互 —— 不是先听完、再看完、最后作答,而是感知、理解、决策、表达同步进行。官方把它定位为「走向全模态交互的关键一步」,落点是「边看、边听、边说」。
💡 为什么值得看字节豆包全量端到端全双工,对话节奏问题减半,规模化落地。
查证
来源档案
字节 Seed 官方博客
字节跳动 Seed 团队官方博客,一手发布公告 + 能力描述 + 自测数据
产品发布与上线事实属官方一手口径,可信;技术能力与「对话节奏问题减少一半」等对比数据出自官方端到端人工评测,无第三方复现,推演能力上限时应保留。
延伸阅读
官方原文把音视频交互的两种旧形态拆得比较清楚:级联方案延迟层层叠加,端到端方案不少仍靠外置 VAD 判断轮次。想理解全双工到底难在哪、SeedRealtime 的架构选择改了什幺,这段是最短路径。
博客用聚餐认人辨声、川菜馆菜单翻译、博物馆打卡提醒、咖啡机纠错、机场嘈杂环境等案例演示能力,方便判断「主动交互」是真能力还是剪辑效果 —— 不过案例都是官方挑选的。