#AI
Mostik 用隐状态桥接大小模型
成立仅 4 个月的初创 Mostik(俄语意为“小桥”)公开了其核心发现:让一个模型的隐藏状态通过一个小型训练过的桥模块直接传给另一个模型,接收方直接使用这些内部状态,全程不产生文本,两个模型权重完全冻结。
公开演示中,发送方是云端 753B 的 GLM-5.2,接收方是手机端可跑的 4B Qwen-3.5——大模型只做预填充、不做解码,文本全部由小模型生成。
💡 为什么值得看4B 模型近 753B 表现,推理成本降至约二十分之一。
查证
来源档案
量子位
中文科技媒体,原创深度报道,采写自团队宣传与公开演示
单源报道,数据来自团队自述且比赛未结束、技术细节未公开;主体技术路线与人物信息可信,具体性能数字属单方说法,需等比赛结果或论文佐证
延伸阅读
正文详细对比了桥方案与传统文本接力的性能-算力权衡,并解释为什幺大模型的隐藏状态里装着“未说出口”的深层计算
团队称桥可让教师内部状态更早进入学生训练,并用于给大模型增加新技能而不重训,正文给出了早期观察