第 1 章 · 认识Browser-Use:装备与编制 本章要回答的三个问题:让一个"靠语言思考"的模型去操作一个"讲究像素级精确"的浏览器,中间到底靠什么衔接?Browser-Use 和 Selenium、Playwright 这些老牌工具的分界线画在哪里?进入命令台之前,有哪几个概念必须在脑子里摆正,否则后面的每一步都会似懂非懂? 为什么会有这一章 很多人第一次接触浏览器智能体,是从一段十行代码的视频演示开始的:输入一句话,屏幕自己动起来,购物车被加满了,表单被提交了。演示很爽,上手之后困惑来得也快:为什么换个网站就不行了?为什么模型会去点一个根本不是按钮的东西?为什么同一个任务今天十步走完、明天二十步绕弯?
本章要回答的三个问题:让一个"靠语言思考"的模型去操作一个"讲究像素级精确"的浏览器,中间到底靠什么衔接?Browser-Use 和 Selenium、Playwright 这些老牌工具的分界线画在哪里?进入命令台之前,有哪几个概念必须在脑子里摆正,否则后面的每一步都会似懂非懂?
很多人第一次接触浏览器智能体,是从一段十行代码的视频演示开始的:输入一句话,屏幕自己动起来,购物车被加满了,表单被提交了。演示很爽,上手之后困惑来得也快:为什么换个网站就不行了?为什么模型会去点一个根本不是按钮的东西?为什么同一个任务今天十步走完、明天二十步绕弯?
这些困惑的根源是同一个:把 Browser-Use 当成一个"更聪明的脚本工具",而没有意识到它是一次操作主体的更换。Selenium 的世界里,脚本就是全部,页面只是被操作的对象;Browser-Use 的世界里,代码只是装备,真正在操作页面的是一个会观察、会判断的模型,而你的角色从"写脚本的人"变成了"下任务单的指挥官"。角色换了,概念体系也得跟着换。
本章就是装备清点。我们先给 Browser-Use 一个准确的定义,看它在 AI 应用技术栈里站哪个位置;再把 Agent、Browser、Controller 这些核心角色的分工捋清楚——类比命令台,就是分清指挥官、战车、通信台和军械库各管什么;最后画一条清晰的分界线,告诉你什么时候该派智能体上场,什么时候老老实实写脚本反而更划算。
命令台第一课:先分清谁在指挥、谁在开车,再谈怎么打胜仗。
对照开头的三个问题,读完本章你应当能够:
| 节号 | 回答哪个问题 | 关键产出 |
|---|---|---|
| 1.1 Browser-Use 是什么 | 操作主体更换意味着什么 | 定义、技术栈位置分层图、第一个最小示例 |
| 1.2 核心概念与分工 | 五个核心对象各管什么 | 概念关系图、对象职责表、两处高频混淆点 |
| 1.3 与传统自动化工具对比 | 什么时候用它、什么时候别用 | 三类工具对比矩阵、同任务双实现对照、选型判断口诀 |
三节是递进的:先立定义,再拆概念,最后拿概念去做选型判断。读完 1.1 你能"叫对名字",读完 1.2 能"对上号",读完 1.3 能"派对兵"。
不需要任何 Selenium 或 Playwright 经验。1.3 的对比会从零讲起,老司机反而要小心:经验里有几处恰恰是理解智能体操作的障碍,文中会明确标出来。
本章结束时,你脑子里应该有一张"指挥链关系图":模型在最高层做决策,Agent 在中间当参谋长,Browser 和 Controller 在底层开车管枪械。第 2 章就沿着这条指挥链做物理安装——把每一层真的装进你的电脑,跑出第一段自动化,让概念落到能点击的屏幕上。如果 1.2 的某个概念你读完还是含糊,别硬闯第 2 章,回去把那张概念关系图亲手画一遍,画得出来就是真懂了。