#AI
HelixWorld 补上世界模型的声音短板
世界模型过去两年的进度集中在画面:可自由探索、实时交互的视觉场景已经把帧率、时长、稳定性卷得差不多,但声音一直是短板——「有画无声,不成世界」。现在 **HelixWorld 1.0** 把这个缺口补上了。
这是 Noiz AI 联合香港科技大学、清华大学、CMU、Google DeepMind 等机构研究员发布的**实时可交互音视频世界模型**。关键不在多一条音轨,而在画面与声音由同一套 Transformer 原生联合生成:用户每走一步、转个身,画面和 48kHz 立体声声场同步响应,离多远、踩什幺材质、从哪个方向来都会改变声音。据称支持 **24 FPS 实时生成**,权重与代码将在接下来几周完全开源。
💡 为什么值得看首个可实时交互的音视频世界模型,声画同源生成、24FPS 加 48kHz 立体声,几周内完全开源。
查证
来源档案
量子位(QbitAI)
中文科技媒体,对国内及国际 AI 前沿动态的一手编译与报道
单源媒体报道,非官方一手公告;HelixWorld 的技术参数与开源时间表未在文中附官方链接佐证,建议以官方 GitHub 仓库发布为准。技术细节详实但与官方口径的核对留待开源落地。
延伸阅读
画面与声音由原生 Transformer 联合生成、随动作同步响应,是 HelixWorld 区别于「事后配音」方案的核心设计,值得细看其与现有世界模型的能力对照表。
团队组建于 2025 年底、成员来自 Meta/Google/Dolby/清华,开源项目累计超 5 万 GitHub Stars;篇幅末段交代了开源与商业化的取舍逻辑。