#AI
Claude 棉花糖与甜瓜实测曝光
Anthropic 尚未发布的两款 Claude 模型 claude-marshmallow-eap(棉花糖)和 claude-melon-eap(甜瓜)已出现早期实测反馈。测试者在 3D 强化学习和建筑空间布局任务中观察到突出表现,尤其是一步到位生成复杂空间布局的能力。
更引人注意的是其推理成本:多个测试者反馈这两款模型在给出答案前会消耗海量「思考 token」进行深度推演,多次直接触及 max-tokens 上限。两款模型目前没有公开 API 端点,官方未确认其定位是 Opus 5.1、Sonnet 5.1 还是新 Haiku。
💡 为什么值得看未发布模型 3D 推理强,但 token 消耗严重触上限。
查证
来源档案
BAAI 智源社区 AI_era 账号
智源研究院社区账号转载的行业动态,内容转写自 36 氪 / 新智元等中文媒体对 X 平台实测帖的报道
二手转载源,内核事实依赖 X 平台单条实测帖;模型能力描述为早期测试者的主观观察,无官方确认,定位纯属社区猜测
延伸阅读
思考 token 大量消耗并多次触及上限,是理解 Anthropic 推理成本策略转向的切入点