Anthropic在2026年7月6日公开阿尔伯塔省政府使用Claude Code开展大规模安全审查的案例。官方文章称,团队让约50个Agent并行检查约4.66亿行代码,在约20小时内完成一轮评估,并由工程师审核修复结果。资料核验日期为2026年8月9日。本文只拆解公开案例中的方法,不把案例数字当成其他组织的承诺。

先看结论:大规模代码审查的关键是分工、证据和人工批准
阿尔伯塔案例把规则引擎、Claude Code、测试和工程师审批串成一个闭环。Agent负责快速浏览、定位和生成候选修复,工程师负责确认风险、测试结果和上线影响。对于拥有大量遗留系统的组织,这种协作方式比单次聊天更容易形成可审计流程。
| 环节 | 案例中的做法 | 可迁移的控制点 |
|---|---|---|
| 范围盘点 | 覆盖省政府维护的应用和代码仓库 | 建立资产清单、负责人、语言和部署环境 |
| 初筛 | 先用规则引擎标记已知模式 | 将静态规则与Agent分析分开记录 |
| 深入审查 | Agent复核告警并指出文件与行号 | 保存证据、上下文、置信度和复现步骤 |
| 修复上线 | 生成修复和测试,工程师审批后交付 | 分支、回归测试、四眼审批和回滚 |

案例流程可以怎样复现?
- 建立仓库分组:按业务敏感度、技术栈、生产影响和维护团队划分批次。
- 先跑规则检查:用现有静态扫描器生成可追踪的告警编号,避免让模型从无结构的结果开始。
- 让Agent补充上下文:要求它定位调用链、配置、测试缺口和可复现条件,并保留原始证据。
- 让Agent提出修复:修复要进入隔离分支,新增测试时注明覆盖的风险。
- 安排人工批准:安全、开发和业务负责人共同确认修复不会破坏关键服务。
为什么并行Agent需要统一协议?
并行执行可以缩短首轮扫描时间,但也会带来重复告警、上下文不一致和结果难以合并的问题。统一输入格式、告警编号、证据字段、输出目录和停止条件,才能把多Agent结果汇总到同一审查台账。

从案例中提炼的安全边界
Anthropic关于Agent隔离的工程文章强调,文件系统、网络和凭据边界共同决定代理的影响范围。安全审查环境应尽量使用脱敏代码和最小权限;生产凭据不能直接放入Agent工作区。需要下载依赖或访问内部服务时,采用批准的代理和域名白名单,并把例外记录在案。
适用条件
- 组织拥有可分批处理的代码资产、版本控制和自动化测试。
- 安全团队能够定义告警级别、修复标准、审批责任和回滚流程。
- Agent运行环境可以与生产凭据、真实用户数据和部署权限隔离。
限制与风险
- 案例由Anthropic公开,数据和效果没有经过站点独立复核,不能直接外推。
- Agent可能漏掉业务逻辑漏洞,也可能提出会引入新问题的修复。
- 遗留系统的构建、测试和部署链路常常不完整,自动化审查需要先补工程基础。
- 大规模并行任务会增加日志、成本和结果治理负担,建议从高价值小批次开始。
FAQ
小团队也能采用阿尔伯塔的做法吗?
可以从一个仓库、一个风险类型和一个隔离分支开始。先建立“告警—证据—修复—测试—审批”记录,再逐步增加并行度。
让Agent自动修复漏洞安全吗?
自动生成补丁可以加快尝试,但上线前仍需要人工查看差异、复现漏洞、运行回归测试并评估业务影响。
必须使用很多Agent才有效吗?
并行数量取决于仓库规模、限额和团队治理能力。任务较小或测试不足时,少量Agent更容易控制质量。
