【ADR】如何为企业级 AI 助手装上“安全监控”?Uber 开源了一套防御方案
这是一款由 Uber 开源的企业级 AI 代理安全系统,旨在帮助组织监控并保护面向员工(如 AI 编码助手)和面向客户(如 AI 客服)的 AI 代理,防止它们执行不安全或恶意的操作。
主要功能与特性
- 全方位的可观测性:能够捕获 AI 代理的意图、工具使用情况和执行追踪,支持在 macOS、Linux 和 Windows 上的 7 种以上 AI 编码工具及内部自动化代理,让你清晰了解 AI 正在做什么以及为什么这么做。
- 企业级安全基准测试:提供包含 300 多个任务、133 个 MCP 服务器的测试基准,覆盖了 17 种已知的代理攻击技术,帮助在真实企业条件下评估 AI 代理的安全性。
- 高效的风险行为检测:采用双层架构设计,结合高召回率的初步筛查与针对可疑会话的深度代理推理,精准识别 AI 代理的异常或危险行为。
- 不安全操作预防:具备在造成实际损害前拦截不安全操作的能力(注:该预防组件暂未包含在当前的开源版本中,后续会发布)。
快速安装与使用示例
你可以通过以下命令快速拉取代码并配置检测环境:
git clone https://github.com/uber/ADR
cd ADR/Detection
uv sync
export ANTHROPIC_API_KEY="..." OPENAI_API_KEY="..."
配置好 API 密钥后,系统默认会使用其内置的双代理检测器。如果需要进行无需密钥的快速烟雾测试,可以添加 --detector llamafirewall 参数运行。更完整的评估工作流(如解压基准数据、运行检测器、绘制图表等),可查阅项目目录下的 docs/REPRODUCIBILITY.md 文档。
适用场景与目标用户
这个项目非常适合已经或计划在企业内部大规模部署 AI 编码助手(如 Cursor、Claude Code、Codex 等)或 AI 客服代理的公司。目标用户主要是企业安全工程师、AI 基础设施开发者以及关注 AI 代理安全的研究人员。它能够帮助安全团队在享受 AI 带来效率提升的同时,有效管控 AI 代理可能引发的数据泄露、提示词注入或越权操作等风险。
总结
总体而言,这套系统为日益普及的 AI 代理提供了一套从观测、测试到检测的完整安全闭环,且已在大型企业的生产环境中得到验证,相关论文也被 MLSys 2026 接收,具有很高的实战参考价值。不过,当前开源版本暂未包含核心的“预防”拦截组件以及部分离线红队测试引擎,建议访问其主页获取更详细信息。
