WebMCP

Alexandra Klepper
Alexandra Klepper
François Beaufort
François Beaufort
Kasper Kulikowski
Kasper Kulikowski

发布时间:2026 年 5 月 18 日,上次更新时间:2026 年 10 月 7 日

WebMCP 是一项 Web 标准提案,旨在帮助您为 AI 智能体构建和公开结构化工具。WebMCP 提供 JavaScript 并注释 HTML 表单元素,以便代理确切了解如何与网页功能互动,从而支持用户体验。这可以显著提高代理执行的性能和可靠性。

AI 智能体是一项较新的技术。它们可以帮助人类用户更好地完成高度复杂的技术性任务。WebMCP 在完成代理任务方面具有更高的准确性,可以作为渐进式增强功能添加。

说明类视频 Web 扩展程序 Chrome 状态 目的
GitHub 源试用 源试用 查看 实验意向

为何选择 WebMCP?

WebMCP 提供了一套交互规则,可弥合 Web 应用与智能体之间的差距,从而提高效率、可靠性和任务完成度。 网站会声明元素(例如按钮或字段)的用途,这样一来,元素就能按预期使用,而无需代理审核元素来了解其用途。

这比促动更可靠,因为促动可能涉及许多步骤,并且每个步骤都可能被智能体以不同的方式解读。

在左侧,代理会抓取 DOM。在右侧,智能体调用了一个工具。您可以在我们的预约演示中自行体验。

网站可以通过定义 tool 来分享明确的用途,例如搜索或购买。工具会在网页上以可见方式执行,因此用户可以放心地相信任务会按预期完成。这样一来,您的品牌和以人为本的设计选择也会保持不变。

WebMCP 支持:

  • 发现:一种标准方式,用于让网页向代理注册工具,例如 checkout 或 filter_results。
  • JSON 架构:明确定义输入和预期输出,以减少幻觉或误解。
  • 状态:对当前网页上下文的共同理解,以便智能体了解哪些资源可用于实时采取行动。

我们的目标是构建任何具有智能体功能的浏览器都可以实现并从中受益的 API,以便您的用户更轻松地完成任务。您可以在 GitHub 上查看此流程。

使用场景

您可以通过多种方式在网络上使用 WebMCP。例如:

  • 帮助客户获得支持。如果您向客户提供软件,则可能需要复杂的支持流程来解决各种不同的问题。您可以使用 WebMCP 帮助客服人员更快地找到正确的表单,并使用用户提供的信息填写字段。
  • 改进旅行预订。帮助客服人员以更少的步骤预订复杂的多城市和多乘客行程。

某些操作可能属于敏感操作,例如进行购买。您可以添加一条命令,请求用户通过确认对话框进行互动。

从实际意义上讲,您的工具可以完成以下任务:

  • 填写结构化表单:构建 submit_application 工具,帮助客服人员将从与用户的对话中收集的数据正确映射到表单字段。例如,您可以区分某个字段是需要全名,还是需要单独的名字和姓氏。
  • 以人为本的界面中的支持代理互动:某些字段是为人类用户设计的,但代理可能无法理解。您可以构建一个 date_pick 工具,以便在预订或活动预订中实现复杂的日期和时间选择。
  • 更快速的应用调试:您可以在开发者设置页面上构建 run_diagnostics 工具,以便代理触发修复,否则这些修复会隐藏在嵌套菜单后面。

您的使用场景是否未列出?或者,您是否有想要分享的 WebMCP 创意?在 GitHub 上提出问题并参与讨论。

开始使用

从 Chrome 149 开始,加入 WebMCP 源试用。详细了解如何开始使用源试用。

本地 WebMCP

WebMCP 可作为 Chrome flag 用于本地开发:

  1. 打开 Chrome,然后前往 chrome://flags/#enable-webmcp-testing
  2. 将标志设置为已启用。
  3. 重新启动 Chrome 以应用所做的更改。

使用 WebMCP API

您可以使用以下两种 API 来设置网站工具:

  • 命令式 API:使用标准 JavaScript 定义不同类型的工具,例如表单输入、导航工具、状态管理或其他函数。
  • 声明性 API:向标准 HTML 表单添加注释以创建 WebMCP 工具。

您可以使用 Chrome 开发者工具调试 WebMCP 工具,并验证浏览器解析 JSON 架构的方式。

限制

虽然 WebMCP 旨在让智能体和人类更轻松地完成复杂任务,但仍存在一些限制:

  • 无头浏览:虽然可以在无头环境中运行 WebMCP 工具,但此 API 主要用于本地浏览器工作流,其中有人工干预。
  • 复杂界面的开销:如果您的网站非常复杂,您可能需要重构或添加 JavaScript 来处理应用和界面状态。
  • 工具可发现性:客户端和浏览器必须直接访问网站,才能知道该网站是否具有可调用的工具。

“权限”政策

这两个 API 都受 tools Permissions Policy 控制。此政策的默认值为 self,表示允许在顶级和同源上下文中注册工具,并针对跨源 iframe 停用此功能。

如需允许在跨源 iframe 中使用 WebMCP 工具,请向 iframe 添加 allow="tools" 属性。

演示

以下是一些涵盖命令式和声明式实现的演示示例:

您还可以在 GitHub 上查看和浏览演示源代码。

模仿代理来测试工具

我们构建了两个 Chrome 扩展程序,可帮助您了解 WebMCP 工具在我们的演示和您的应用中的运作方式。

安装示例 Agentic Chrome 扩展程序,以便使用自然语言提示检查、监控和执行 WebMCP 工具。具体而言,此扩展服务始终信任 WebMCP 注释,这些注释可以提醒代理执行敏感操作。这演示了工具在有注释和没有注释的情况下可能会有不同的表现。

默认情况下,此扩展程序使用包含 AI SDK 的小型 Node 服务器。需要 API 密钥,并且密钥会保留在本地服务器上。默认情况下,您的提示会发送给 gemini-3.6-flash 模型,但您可以在扩展程序的 .env 文件中修改模型选择和 API 提供方。其中包含 OpenAI、Google 和 Anthropic 的字段,或者,您也可以自定义扩展程序以使用其他提供商的模型。

或者,您也可以将客户端模型与 Prompt API 搭配使用。此功能不需要 API 密钥,并且数据会保留在您的设备上。为此,请启用 chrome://flags/#prompt-api-tool-use。

安装 Model Context Tool Inspector Extension,以便在实时演示或您自己的应用中试用智能体并了解 WebMCP 工具的运作方式。使用自然语言提示来确定智能体是否按预期与 WebMCP 工具互动。

如需使用 Gemini 调用您的工具,您必须拥有 API 密钥,并在扩展程序的界面中提供该密钥。您的提示默认会发送给 gemini-3.6-flash 模型。您可以选择其他 Gemini 模型进行实验,也可以自定义扩展程序代码以使用其他提供商的模型。

互动和分享反馈

WebMCP 正在积极讨论中,将来可能会发生变化。如果您尝试使用这些 API 并有反馈,我们非常期待收到您的宝贵意见。