#AI
Scale RLI:GPT-6 Astra 可交付率 20.83%
Scale 的 Remote Labor Index 榜单上,GPT-6 Astra 客户可接受完成率为 20.83%,Fable 5.1 为 17.92%;该口径由人工评判,交付物需达专业参考件水平并获合理客户接受。
RLI 含 240 个自由职业式项目、23 个工作类别,其中 230 个为私有评测任务;它测交付而非对话,失败原因是质量不足、产物不完整或文档损坏。
早期前沿为 2.5%,CAIS 7 月更新把 Fable 5 记为 15.8%,如今已到五分之一;但 Scale 取单次最好成绩,每任务花费上限 30 美元,与 CAIS 并不完全可比。
💡 为什么值得看端到端交付评测里首次触到五分之一,但八成项目仍过不了客户那道坎。
查证
来源档案
Ground Truth
专注评测与 agent 领域的新闻站,本篇为对 Scale Remote Labor Index 榜单与论文的解读稿,并给出 arXiv 编号。
对榜单数字、评测口径、失败模式的复述较完整,但属二手解读而非 Scale 或 CAIS 官方发布,分项数字与横向对比未逐条自验,以官方榜单为准。
延伸阅读
榜单取单次最好成绩并设 30 美元花费上限,和 CAIS 的 scaffold 不同,想横向比模型需先对齐这层。