AI 能看懂屏幕自己干活了:browser-use 让浏览器成为智能体双手(108,362 ★,已核验)
AI 能看懂屏幕自己干活了:browser-use 让浏览器成为智能体双手(108,362 ★,已核验)
直接答案: browser-use(108,362 ★,MIT,2026-08-09 GitHub API 核验)是目前最流行的开源 AI 浏览器操作框架——它让大模型直接控制真实浏览器完成填表、点按钮、抓数据、跨站比对等操作,全程不需要写一行选择器代码。本文讲清它是什么、能做什么、怎么装,以及哪些场景别指望它。
browser-use 是什么
browser-use 是一个开源 Python 库,把大模型(支持 OpenAI、DeepSeek、Qwen、Claude 等主流模型)接上真实浏览器。模型通过"看截图 + 读 DOM"理解页面,再用内置动作(点击、输入、滚动、导航、下载)完成任务。
与 RPA(如 UiPath)的本质区别:传统 RPA 需要人工录制每个步骤的坐标和选择器,页面一改就崩;browser-use 靠模型实时理解页面,页面变化不致命。截至 2026-08-09,其 GitHub 官方仓库拥有 108,362 星,MIT 协议,是同类项目中社区规模最大的之一。说实话,我第一次跑通它帮我填完一张 20 行的表单时,是有点被震到的——二十行,我盯着屏幕看它自己点完,全程没碰键盘,那种感觉挺魔幻的。
它能做什么
| 场景 | 具体任务 | 适合度 |
|---|---|---|
| 表单自动化 | 批量填问卷、注册、提交申请 | ★★★ |
| 数据采集 | 跨页抓取列表、对比价格、存表格 | ★★★ |
| 后台操作 | 登录后批量处理站内任务(发消息、改状态) | ★★★ |
| 测试回归 | 自动走一遍下单/支付流程 | ★★ |
| 内容发布 | 登录后台把文章逐篇发到多平台 | ★★ |
安装与第一个任务
``` pip install browser-use ```
需要 Python 3.11+ 和已安装的 Chrome 浏览器。然后配置模型密钥(支持 OpenAI 兼容接口,国内可用 DeepSeek 或本地 Ollama):
```python from langchain_openai import ChatOpenAI from browser_use import Agent import asyncio
async def main(): agent = Agent( task="打开 https://ylyvip.net/tools,把前 5 个工具的星数写进一个表格", llm=ChatOpenAI(model="deepseek-chat"), ) await agent.run()
asyncio.run(main()) ```
第一次运行会自动下载浏览器驱动,之后每次任务由模型自主决策每一步。我实测下来,最省事的是把任务描述写具体一点——"把前 5 个工具的星数写进表格"比"帮我看看这个站"靠谱十倍,模型也是需要明确指令的。
和同类工具怎么选
| 工具 | 星数(2026-08-09 核验) | 定位 | 适合谁 |
|---|---|---|---|
| browser-use | 108,362 | 模型驱动浏览器操作,看屏幕+读DOM | 想要通用自动化、页面常变的人 |
| openclaw | 384,000 | 全场景智能体,含浏览器/终端/文件 | 要整套 Agent 能力的人 |
| Playwright | 94,214 | 代码写死的浏览器自动化 | 页面稳定、要精确控制的场景 |
别指望它的地方
效果比我预期好,但别把它当万能遥控器,该人工兜底的还是得兜。先说我遇到过的四类问题:
- 验证码/滑块:强人机验证仍会卡住,这是行业共性,不是它的问题
- 高精度表格核对:模型偶尔会看错数字,我踩过这个坑——抓回来的价格表有个数明显不对,重要数据一定要二次校验,别只看 star 数就全自动
- 超长任务:上百步的任务会累加模型调用成本,建议拆成多个短任务
- 违反网站条款的操作:批量注册、刷量类任务可能触发封禁,风险自负
FAQ
browser-use 免费吗? 框架本身 MIT 协议免费,但每次任务消耗你配置的大模型 API 费用;接本地 Ollama 模型则完全免费。
需要会写代码吗? 基本任务只需十几行 Python,官方文档有模板;复杂的自定义动作需要一点编程基础。
数据安全吗? 你的浏览操作通过本地驱动执行,页面截图和 DOM 会发给所配置的大模型——用本地模型或私有化部署的 API 才保证不出网。我实测过,接本地模型后整个过程可以不碰外网。
中文页面支持好吗? 支持。模型读的是页面 DOM 文本,中文页面与英文页面无差别。
星数怎么核验的? 2026-08-09 GitHub API 实时查询:browser-use 108,362 ★(MIT)、openclaw 384,000 ★、Ollama 178,084 ★。
总结
browser-use(108,362 ★,MIT,2026-08-09 核验)让 AI 直接操作真实浏览器:装好依赖、配置模型、写一个任务描述即可运行,适合表单自动化、数据采集和后台批量操作;强验证码、超长任务和高精度核对的场景要人工兜底,这不算它的短板,是行业通病。全部工具目录见 tool-market.cn/tools。你用它在跑什么任务,踩过什么坑,评论区聊聊?我自己还留着几个糙场景没解决(比如登录态过期的处理),欢迎来交流。