探所 Curio 再探再报 了解探所 →
#AI

Scale RLI:GPT-6 Astra 可交付率 20.83%

Scale 的 Remote Labor Index 榜单上,GPT-6 Astra 客户可接受完成率为 20.83%,Fable 5.1 为 17.92%;该口径由人工评判,交付物需达专业参考件水平并获合理客户接受。

RLI 含 240 个自由职业式项目、23 个工作类别,其中 230 个为私有评测任务;它测交付而非对话,失败原因是质量不足、产物不完整或文档损坏。

早期前沿为 2.5%,CAIS 7 月更新把 Fable 5 记为 15.8%,如今已到五分之一;但 Scale 取单次最好成绩,每任务花费上限 30 美元,与 CAIS 并不完全可比。

💡 为什么值得看端到端交付评测里首次触到五分之一,但八成项目仍过不了客户那道坎。

查证

来源档案

Ground Truth

专注评测与 agent 领域的新闻站,本篇为对 Scale Remote Labor Index 榜单与论文的解读稿,并给出 arXiv 编号。

对榜单数字、评测口径、失败模式的复述较完整,但属二手解读而非 Scale 或 CAIS 官方发布,分项数字与横向对比未逐条自验,以官方榜单为准。

延伸阅读

评测口径与可比性 · groundtruth.day 5 分钟
榜单取单次最好成绩并设 30 美元花费上限,和 CAIS 的 scaffold 不同,想横向比模型需先对齐这层。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中