WebMCP:让网站向浏览器 AI 代理暴露结构化工具的提案
WebMCP 探索由网站直接声明可供浏览器 AI 代理调用的结构化工具,以降低纯视觉自动化的脆弱性,但仍需按演进中的标准治理。
WebMCP agent-protocol browser-automation open-source WebMCP 探索由网站直接声明可供浏览器 AI 代理调用的结构化工具,以降低纯视觉自动化的脆弱性,但仍需按演进中的标准治理。
1. 提案定位
WebMCP 是 Web Machine Learning 社区推进的网页接口提案,目标是让网站把可执行能力以结构化工具形式提供给浏览器中的 AI 代理。[S1][S2] 它关注网页与代理之间的原生契约,不是一个远程 MCP 服务目录。
2. 核心机制
网站可描述工具名称、用途、输入结构和执行逻辑,代理据此选择并调用。相比仅依赖截图、坐标和 DOM 猜测,显式工具能减少界面改版造成的失效,也让输入校验和用户确认更容易落到网页自身边界内。[S2]
3. 适用场景
适合把搜索、筛选、表单填写、购物车操作、预约或内容编辑等明确动作暴露给代理。开放式浏览、复杂视觉判断和未建模流程仍需传统交互补位;网站也不应为了代理方便而暴露超出普通用户权限的后台能力。
4. 接入设计
先选择高频、低风险、可撤销的单一步骤,定义最小参数与清晰返回值,再加入幂等键、超时和错误码。工具描述要面向机器选择但保持业务语义稳定,不能把短期页面组件名称直接变成长期接口契约。
5. 浏览器边界
真正落地依赖浏览器实现、权限模型和标准演进,网站单方面加入脚本不等于所有用户都可调用。[S1] 团队应把 WebMCP 视为渐进增强:没有支持时网页仍可正常使用,有支持时才提供结构化代理路径。
6. 安全控制
工具调用必须继承当前用户身份和页面授权,并对支付、发布、删除、发送等高影响动作要求明确确认。输入描述不是安全边界,服务端仍要校验权限、状态和参数;返回内容也要防止把不可信文本继续解释成指令。
7. 主要风险
风险包括恶意网站注册误导性工具、代理选错相似动作、重复提交、跨页面状态过期及敏感信息进入日志。标准仍在演进时,接口和实现可能变化;若过早把核心流程锁定到实验 API,维护成本可能高于收益。
8. 治理要求
每个工具都应有业务负责人、风险等级、权限清单、版本和停用开关。记录调用者、用户确认、结构化输入、执行结果及错误,但避免保存密码和完整个人数据。规范更新后要重新审查兼容性与默认权限。
9. 验收方法
用合法、缺字段、越权、重复、过期状态、恶意描述和网络中断样本测试。成功标准包括代理选择正确工具、危险动作必确认、重复请求不产生重复副作用、失败可回到人工界面,并且不支持 WebMCP 的浏览器仍能完成任务。
10. 来源与更新时间
本文研究日期与信息截点均为 2026-08-03。项目状态与协作材料依据官方 GitHub 仓库,接口语义依据公开规范草案;Web 标准会持续变化,生产采用前应重新核对规范成熟度、浏览器支持和安全要求。