探所 Curio 再探再报 了解探所 →
#AI

Claude 棉花糖与甜瓜实测曝光

Anthropic 尚未发布的两款 Claude 模型 claude-marshmallow-eap(棉花糖)和 claude-melon-eap(甜瓜)已出现早期实测反馈。测试者在 3D 强化学习和建筑空间布局任务中观察到突出表现,尤其是一步到位生成复杂空间布局的能力。

更引人注意的是其推理成本:多个测试者反馈这两款模型在给出答案前会消耗海量「思考 token」进行深度推演,多次直接触及 max-tokens 上限。两款模型目前没有公开 API 端点,官方未确认其定位是 Opus 5.1、Sonnet 5.1 还是新 Haiku。

💡 为什么值得看未发布模型 3D 推理强,但 token 消耗严重触上限。

查证

来源档案

BAAI 智源社区 AI_era 账号

智源研究院社区账号转载的行业动态,内容转写自 36 氪 / 新智元等中文媒体对 X 平台实测帖的报道

二手转载源,内核事实依赖 X 平台单条实测帖;模型能力描述为早期测试者的主观观察,无官方确认,定位纯属社区猜测

延伸阅读

慢思考推理与算力消耗 · link.baai.ac.cn
思考 token 大量消耗并多次触及上限,是理解 Anthropic 推理成本策略转向的切入点
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store