#AI
寒序科技发布 uHBM 与 uLPU 推理架构
寒序科技公布 uHBM 与 uLPU 推理计算架构,成为国内首家把 MRAM 磁存储与计算单元深度集成的芯片公司。其思路是让模型权重长期驻留在 Persistent MRAM 阵列中,在同一颗 Compute-Memory Die 内完成矩阵-矢量运算,系统只传递低维激活矢量,绕开 Decode 阶段逐 Token 反复搬移数十亿权重的问题。
关键数字:首代 uHBM 片内权重读出带宽设计值最高 24 TB/s;面向 4B 多模态主干模型的 uLPU Decode 性能目标超过 2000 Tokens/s。需要强调,这两个数字目前都是架构设计值,完整性能、功耗与模型兼容性要等首代工程产品流片实测后才能确认。公司称验证芯片 SpinPU-ED01 已回片,接下来的目标是把架构做成可量产产品。
💡 为什么值得看MRAM 集成芯片设计值:24TB/s 带宽、2000Tokens/s,未实测。
查证
来源档案
寒序科技发布通稿(经 BAAI Hub 转述)
企业官方发布内容,由北京智源人工智能研究院的 Hub 平台转述
官方一手口径,但数字均为厂商自报的设计值而非实测,需要保留这个不确定性
延伸阅读
看验证芯片 SpinPU-ED01 的实测数据与两年量产路线,判断这条路离商用还有多远