IBM 发布 ScarfBench 评测 AI 迁移 Java
IBM Research 今日正式发布 ScarfBench(Self-Contained Application Refactoring Benchmark),一个用于评估 AI agent 在企业级 Java 框架间迁移任务上的开源基准。基准涵盖 34 个经专家验证的企业 Java 应用,横跨 Spring、Jakarta EE、Quarkus 三大生态,产生 102 种框架实现变体与 204 个定向迁移任务,包含约 15.1 万行代码及 1,331 个行为测试。与现有代码生成 benchmark 不同的是,ScarfBench 要求迁移结果必须真机编译、容器化部署并通过行为一致性断言,而非简单对照参考实现。 IBM 团队使用 5 个前沿 coding agent 进行了评测,结果显示即便最强 agent 在聚焦层迁移上的行为测试通过率也仅为 15.3%,完整应用迁移行为成功率更只有 12.2%;204 个任务中仅 1 个实现了完全行为等价。分析发现 agent 普遍在编译、部署、测试阶段跨步骤失败,且自我报告准确度不可靠——Claude Code 自称 29/30 构建成功,实际仅 22 个真正通过。迁移过程呈现迭代式依赖解析特征,agent 反复在配置与 Web/数据库层之间跳转,环境与构建工具(Docker 缓存、Maven wrapper)引发大量非代码层面故障。 ScarfBench 提供完整数据集、排行榜与评估基础设施,已通过 arXiv(2605.06754)和 GitHub 开源。