给 coding agent 的浏览器 CLI——微软公开押注「CLI + Skills 比 MCP 更省 token」的新路线
更新于 2026-09-14
← 返回汇总浏览器自动化从「工具schema」退回「命令行」
微软官方的 Playwright 命令行界面,2026 年复活重生:60+ 个面向 AI coding agent 的原子命令(open/type/click/snapshot/find/eval……),配合 install --skills 一键装进 Claude Code / GitHub Copilot。核心卖点写在 README 第一屏:不把页面数据强塞进 LLM 上下文——CLI 调用比 MCP 工具 schema + 完整可访问性树省得多。同一团队还维护 playwright-mcp,两条路线官方并列供选。
npx playwright codegen 等),独立 CLI 停止演进——「被自己吸收」| 类别 | 代表命令 |
|---|---|
| 核心交互 | open click fill --submit drag drop --path select upload check hover |
| 感知(省 token 关键) | snapshot [--depth=N] find "text" / --regex eval——窄取代替全树 |
| 导航/键盘/鼠标 | goto go-back press keydown/keyup mousemove mousewheel |
| 标签页 | tab-list/new/close/select |
| 存储 | state-save/load + cookies / localStorage / sessionStorage 全套 CRUD |
| 网络 | route mock 请求 · route-list · unroute |
| 取证(DevTools) | console requests request <i> tracing-start/stop pdf screenshot [--hires] |
| 录制回放 | recording-start/stop(输出 Playwright 代码)· video-start/stop |
| 标注 | highlight [ref] --style= 持久高亮 · generate-locator 生成选择器 |
| 会话管理 | -s=name 多会话 · list close-all kill-all |
| 监控 | show 可视化仪表盘 · show --annotate UI 评审模式 |
| 连接 | attach --extension=chrome · attach --cdp=<url> 接管真实浏览器 · detach |
-s=todo-app 让每个项目/每个 agent 绑定独立浏览器实例;playwright-cli list 总览PLAYWRIGHT_CLI_SESSION=todo-app claude .——agent 全程无感使用专属会话--persistent 落盘跨重启close(页)/close-all(全部优雅)/kill-all(强杀进程)——agent 失控时的保险丝# 两个 agent 各自的浏览器,同时跑 playwright-cli -s=frontend open http://localhost:3000 playwright-cli -s=e2e open https://staging.site # 人类围观 agent 干活 playwright-cli show # 实时仪表盘 # 会话状态跨命令保持 playwright-cli open https://shop.dev playwright-cli fill e12 "user@mail.com" playwright-cli click e15 # 登录态保留
show --annotate 专为设计反馈打造这是「agent 浏览器自动化」独有的新需求:浏览器在后台无头干活,人类需要可观测、可介入、可夺回的窗口。show 把监督做成了产品功能——比传统截图/日志流高一个层级。
video-start 录屏,video-chapter "登录失败" 打章节,video-show-actions 给每个动作加可视标注——agent 测试报告直接是可跳转的录像。
tracing 起停、run-code 跑任意 Playwright 片段、recording 把人工操作转录为代码——CLI 是薄壳,底下是成熟引擎。
highlight 持久高亮元素(自定义 CSS 样式)、console 按级别过滤、requests 逐条网络请求——agent 排障不用截图猜。
# 1. 全局安装 npm install -g @playwright/cli@latest # 2. 给 agent 装 skill(Claude Code / Copilot) playwright-cli install --skills # 3. 对 agent 说 > Test the "add todo" flow on > https://demo.playwright.dev/todomvc > using playwright-cli.
--help 就能上手——「指个方向让它 cook」open --headed 看着浏览器,type/press/check 手动操作同一套命令——agent 与人共享接口open --mobile / --device="iPhone 15" / --browser=chrome| playwright-mcp | playwright-cli | 社区 agent-browser 类 | |
|---|---|---|---|
| 形态 | MCP server(工具 schema) | CLI + SKILL.md | 各异(浏览器内插件/CLI) |
| 上下文成本 | schema + 全树快照 | 按需窄取(find/--depth) | 看实现 |
| 适合 | 长循环自治 · 富内省 | 高吞吐 coding agent · 大代码库并行 | 轻量个人场景 |
| 维护方 | 微软官方 | 微软官方 | 社区 |
| 引擎 | 前两者共享 Playwright 引擎与 ref 交互模型(e21/e35) | ||
真正的看点不是命令清单,而是「agent 工具该长什么样」的路线之争有了官方对照实验——微软双轨并行,让市场用 token 账单投票。
评分重心在「路线价值」而非「当前完成度」:它是 CLI-vs-MCP 之争里目前最高规格的参赛者。若 token 收益被社区实测确认,会成为 coding agent 浏览器操作的事实默认;若被证伪,则是微软一次干净的对冲。两种结局都值得跟踪。