#AI
AI 完成自由职业任务比例从 2.5% 跃升至 16.1%
Remote Labor Index (RLI) 由 Center for AI Safety 与 Scale Labs 联合开发,衡量 AI agent 在真实自由职业项目上的专业交付质量。它涵盖 3D 与 CAD、建筑、平面设计、视频动画、音频、数据分析和 Web 应用等领域,包含 240 个项目、总价值 14.4 万美元,由人工评估者与专业人员金标准对比。最新结果显示,Anthropic 的 Fable 5 模型在可评估的 218 个项目中实现 16.1% 的自动化率(即 AI 交付质量不亚于人类专业的项目占比),约为第二名 Opus 4.8(8.3%)的两倍,GPT-5.5 为 6.3%。对比八个月前基准刚发布时最优 agent 的自动化率仅 2.5%,上一代最佳成绩(Opus 4.6 搭载 Claude Cowork 框架)为 4.17%,前沿在不到八个月内翻了两番多。在最差假设下,Fable 5 因美国政府限制未能完成的 22 个项目全部失败,其自动化率仍可达 14.6%,超过所有其他模型。评测还揭示关键限制:用 AI 裁判替代人工评估远远高估模型表现,GPT-5.5 的 AI 评分几乎虚高三倍。CAIS 指出原因在于当前 AI 不擅长打开专业软件、操作并像付费客户那样下判断,这正是它所评估的任务。RLI 目前仍坚持人工评审。
💡 为什么值得看Remote Labor Index 首次量化 AI 在真实商业项目上的自动化进展,八个月翻四倍,速度值得追踪。