探所 Curio 再探再报 了解探所 →
#AI

HelixWorld 补上世界模型的声音短板

世界模型过去两年的进度集中在画面:可自由探索、实时交互的视觉场景已经把帧率、时长、稳定性卷得差不多,但声音一直是短板——「有画无声,不成世界」。现在 **HelixWorld 1.0** 把这个缺口补上了。

这是 Noiz AI 联合香港科技大学、清华大学、CMU、Google DeepMind 等机构研究员发布的**实时可交互音视频世界模型**。关键不在多一条音轨,而在画面与声音由同一套 Transformer 原生联合生成:用户每走一步、转个身,画面和 48kHz 立体声声场同步响应,离多远、踩什幺材质、从哪个方向来都会改变声音。据称支持 **24 FPS 实时生成**,权重与代码将在接下来几周完全开源。

💡 为什么值得看首个可实时交互的音视频世界模型,声画同源生成、24FPS 加 48kHz 立体声,几周内完全开源。

查证

来源档案

量子位(QbitAI)

中文科技媒体,对国内及国际 AI 前沿动态的一手编译与报道

单源媒体报道,非官方一手公告;HelixWorld 的技术参数与开源时间表未在文中附官方链接佐证,建议以官方 GitHub 仓库发布为准。技术细节详实但与官方口径的核对留待开源落地。

延伸阅读

声画同源生成架构 · qbitai.com 8 分钟
画面与声音由原生 Transformer 联合生成、随动作同步响应,是 HelixWorld 区别于「事后配音」方案的核心设计,值得细看其与现有世界模型的能力对照表。
开源时间与团队背景 · qbitai.com 5 分钟
团队组建于 2025 年底、成员来自 Meta/Google/Dolby/清华,开源项目累计超 5 万 GitHub Stars;篇幅末段交代了开源与商业化的取舍逻辑。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store