#AI
AWS 把 agent 评测接进 GitHub Actions 质量门
AWS 在官方博客放出一套可复制的方案:用 GitHub Actions 把 agent 部署到 Bedrock AgentCore runtime,用代表性提示词跑一遍,再用 AgentCore Evaluate API 给回答打分,**分数没到阈值就直接让 PR 挂掉**。
文中把质量门设计成 CI/CD 里的一道卡点,配套参考实现放在仓库里,包含 CDK 基础设施、Strands agent、OAuth 保护的 MCP server 和统一的评测脚本。
💡 为什么值得看把「改一句 system prompt 悄悄变差」变成 PR 时被自动拦下,agent 工程化第一次有了可跑的 CI 门禁样板。
查证
来源档案
AWS Machine Learning Blog
厂商官方技术博客的教学教程,带参考实现仓库,不是产品发布公告。
一手官方来源,技术描述与 API 行为可信;但它讲的是「怎幺搭」而非新功能发布,不含任何性能数字或效果承诺,读者不应把它读成 AgentCore 的版本更新。
延伸阅读
存 trace 离线评、测试用户 refresh token、M2M 令牌三条路在确定性、能否测角色权限、是否要求 MCP 双令牌支持上各有权衡,选型时最值得先读这段。
内置评测器之外还支持自定义 LLM-as-a-judge 提示词、Lambda 代码评测和 DeepEval / AutoEval 第三方评测器,团队想替换掉自己的评测脚本时可对照。