探所 Curio 再探再报 了解探所 →
#AI

TypeSafe 发布 Jev:不输出文本的决策模型

TypeSafe AI 上周发布 Jev,属新一类「System One 模型」:输入文本,输出类别概率、置信度与评分。它不收输出费,输入价 $0.042 / 百万 token,低于 GPT-5 Nano 的约 $0.05。

用法是拼一个 state 对象连同若干问题发给 API 并行求值,分是非题、选择题、打分题三类。官方文档说它在数字、日期和对抗性内容上表现不佳。

Simon Willison 认为它适合一切可写成分类的任务,自己拿它做检索重排。他的保留意见是黑箱更彻底:只回一个浮点数,用输入计价换掉推理痕迹,评估与消偏实验因此更必要。

💡 为什么值得看Simon Willison 实测纯概率模型,带火 6 个开源复刻。

查证

来源与可信度

· TypeSafe AI 上周发布 Jev,称其为第一代 System One 模型:输入文本,输出类别概率、置信度与评分。 [1][3]
孤证 · Jev 按输入 token 计价,输出免费,首个模型输入价 $0.042 / 百万 token,低于 OpenAI GPT-5 Nano 的 $0.05。 [1]
孤证 · Jev 支持三类问题:是非题(Noul / 伯努利)、给定选项的选择题、以及带描述等级的打分题。 [1]
· 发布两天内社区出现至少 6 个复刻项目,并有 JevBench 基准用来比较同类决策模型。 [1][2]

延伸阅读

黑箱与偏见 · simonwillison.net 8 分钟
Willison 的 Bay Area 城市打分实验说明浮点分数会藏偏见,想做真正评估的人值得细读这段。
复刻模型对比 · latent.space 10 分钟
盘点各复刻的路由、参数量与自测 benchmark 差异,判断这条路线能不能自己搭。
中文圈背景 · link.baai.ac.cn 3 分钟
给出发布者身份与平台集成名单的中文转述,可与英文源对照核实。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中