别再只让 AI 写代码了,它已经开始操作网页
- 2026-09-24 08:28:01
AI 编程 · 浏览器 Agent · 今日公众号
没有 API 的软件,正在被浏览器 Agent 改写
以前自动化要问:这个系统有没有 API?以后更关键的问题可能变成:这个页面,AI 能不能像人一样稳定操作?
3 分钟读完,你会看懂浏览器 Agent 对 AI 编程意味着什么:它不是让 AI “更会聊天”,而是让 AI 开始进入那些没有 API、但每天都有人在网页里重复操作的软件。
封面文案建议
AI 编程新拐点没有 API 的软件也能被 Agent 接管吗?
爆款标题备选
主推:没有 API 的软件,正在被浏览器 Agent 改写
1. AI 编程下一个分水岭:让 Agent 直接操作网页
2. 以前自动化卡在 API,现在 AI 开始自己点网页了
3. 你以为 AI Agent 是聊天助手,其实它正在变成网页操作员
4. 浏览器 Agent 来了:不会写接口的人,也能做自动化吗?
开头:以前最难的是“没有接口”
很多普通人做 AI 自动化,最容易卡在一个地方:
这个系统没有 API,怎么办?
你想把客户资料自动填进后台。
想把表格里的内容批量发布到平台。
想让 AI 登录一个网页,把数据查出来、整理好、再写进另一个系统。
但很多真实业务系统没有开放接口,或者接口文档很难拿到,或者权限审批很慢。
于是自动化项目经常停在一句话上:
如果人能在浏览器里点,AI 能不能也在浏览器里点?
这就是浏览器 Agent 值得关注的原因。
它不是又一个“会写文案”的 AI,而是让 AI 从回答问题,进一步走向操作软件。
事实边界:Anthropic 2026 年 8 月 19 日 Claude Platform release notes 显示,computer use tool 在 Claude API 上脱离 beta,browser use tool 作为客户端工具集推出;它能驱动由应用托管的浏览器视口,读取页面可访问性树、元素、表单和标签页等信息。本文讨论的是 AI 编程与自动化方向的工程影响,不等于承诺所有网页都能稳定自动化。
01|浏览器正在变成新的“接口层”
过去做自动化,最理想的方式当然是 API。
API 稳定、结构化、可测试、可审计,也更适合长期维护。
但真实世界没有那么理想。
很多公司内部系统、行业后台、老旧管理平台、供应商门户,并不会因为你想接 AI,就突然给你开放一个好用接口。
于是浏览器就变成了现实中的接口。
人能看到的页面,就是业务流程最真实的入口。
浏览器 Agent 的价值,就在于它开始尝试把这个入口交给 AI。
它可以看页面,识别按钮、表单、输入框、标签页和下载结果,再根据任务一步步操作。
对普通人来说,这个变化很重要。
因为你不一定会写复杂接口,也不一定能拿到接口权限,但你每天都在网页里重复做很多事。
02|它最适合解决哪类问题?
我觉得浏览器 Agent 最先有价值的,不是那些特别复杂、特别高风险的操作。
而是那些人每天都在做,但又不值得专门开发系统的小流程。
比如,把多个平台的订单信息整理成一张表。
比如,登录后台查询一批客户状态。
比如,把已经写好的内容发布到不同平台。
比如,从供应商门户下载文件,再按规则改名归档。
比如,帮一个不会写代码的人,把网页上的重复操作变成半自动流程。
这些场景共同特点是:流程清楚、重复度高、页面操作多,但开发一个正式接口成本又很高。
这类任务,正是浏览器 Agent 最容易产生实际价值的地方。
03|别把它想成“全能网页员工”
但这里也要泼一点冷水。
浏览器 Agent 能操作页面,不等于它能稳定接管所有业务。
真实网页有很多麻烦:
页面结构会变。
弹窗会突然出现。
验证码和登录状态会打断流程。
按钮文案可能变化。
同一个动作,成功和失败页面长得很像。
所以,真正靠谱的浏览器 Agent,不应该是“你去自己点完”。
它更像一个有人监督的网页操作员。
低风险、重复动作让 AI 做;高影响、不可逆动作必须停下来让人确认。
04|AI 编程的重点会从“写脚本”变成“搭流程”
以前你想自动化一个网页,可能要学很多东西。
HTML、CSS 选择器、Playwright、Selenium、登录态、异常处理、截图调试。
这些当然还重要。
但浏览器 Agent 出现后,普通人的切入点会发生变化。
你不一定先问:
这个按钮的选择器是什么?
你更应该先问:
这个流程能不能被拆成可观察、可暂停、可验证的步骤?
这就是 AI 编程的变化。
以前编程更像写一段确定逻辑。
现在 AI 编程越来越像设计一个协作流程:AI 什么时候看、什么时候点、什么时候记录证据、什么时候停下来问人、失败时怎么回退。
一张表看懂:API 自动化和浏览器 Agent 的区别
给普通人的 7 个落地问题
☐ 这个网页流程是不是足够重复?
☐ 每一步成功和失败的页面状态能不能看出来?
☐ 哪些动作只是读取,哪些动作会改变系统状态?
☐ 是否存在付款、提交、删除、群发等高影响动作?
☐ 高影响动作前,是否必须让人确认?
☐ 出错以后,能不能保留截图、日志和当前状态?
☐ 如果页面改版,这个流程有没有快速修复办法?
最后说一句
浏览器 Agent 的出现,不代表 API 自动化不重要了。
恰恰相反,真正稳定、长期、核心的业务流程,最好仍然走 API。
但它给普通人和小团队打开了一条新路:
那些以前因为没有接口而做不了的自动化,现在可以先从“网页操作流程”开始验证。
这对 AI 编程很重要。
因为普通人真正需要的,不一定是从零写一个复杂系统。
很多时候,他们需要的是:
把每天重复点网页、复制数据、整理结果的工作,变成一条 AI 可以参与的流程。
所以,别只把 AI 编程理解成“让 AI 写代码”。
接下来更有价值的问题是:
你的真实工作里,有哪些没有 API、但每天都有人在浏览器里重复操作的流程?
这些地方,可能就是普通人用 AI 做出实际价值的入口。
留言区问题
你现在最想让 AI 帮你操作哪个网页流程?是内容发布、后台录入、数据查询、文件下载,还是客户资料整理?欢迎留言