智能体的自动化,为什么还没有想象中那么高效
自动化操作界面这件事,其实做了很多年,比现在这一波智能体热潮早得多。做过爬虫的人都知道,早年靠的是人工写脚本,解析网页结构,模拟鼠标点击,往文本框里塞字符,效率全看脚本写得细不细。这两年多了视觉能力,智能体可以直接看着屏幕做判断,写脚本这一步确实省了不少。但要说这是自动化能力质的突破,我觉得有点急。
往根上想,操作系统和长在它上面的各种应用,本质上还是给人用的。不管智能体进化到什么程度,它要完成一件事,走的还是人走的那条路:看界面、判断、点按钮、等反馈。这条路天生带着误差,它模拟的是一种为视觉和手指设计的交互方式,不是直接和系统对话。识别错一个按钮,漏看一层弹窗,这种事迟早会发生,正确率没法做到百分之百。靠大模型去推这件事,未必比过去写死的脚本更高效,很多时候只是换了一种更贵的方式去犯错。
这两年几个大厂陆续推出了面向工作场景的智能体应用,都特别强调自己的 computer use 能力有多强,能操作系统、能跨应用完成任务。但我觉得这件事本身没解决什么问题,反而带来了新的麻烦。这类应用要跑得动,前提是用户得把系统层面的操作权限大幅度地放给它,桌面、文件、各种已经登录的账号,基本都要打开。这个授权本身就是安全隐患,业内目前也没有很好的办法去监测和管控智能体在系统里到底对哪些应用做了什么操作、做到了哪一步。一旦某个环节出现不可回退的错误,等发现的时候已经晚了,这个后果不管是普通用户还是企业用户,都扛不起。
另一头,平台和服务商也没闲着。鼠标轨迹是不是够自然,点击间隔是不是太规律,翻页速度是不是超出正常人的手速,这些都会被记录下来当作风控依据,重的直接封号封 IP。以前的脚本跑得慢,反而不容易撞线;智能体一旦上手,操作速度和密度都上来了,撞上这些规则的概率只会更高。这也是我觉得现在很多智能体自动化演示挺尴尬的地方:demo 里跑得很顺,真放到线上高频率跑,大概率是要被拦下来的。
说到底,这是一个供需两边都没准备好的问题。做智能体的这一方,还在拼命让它更像人;做平台的这一方,还在拼命防它像人。谁都没有认真想过,如果智能体会长期存在,是不是该有一条专门给它走的通道,而不是逼着它去挤那扇给人开的门。
验证码这件事我倒觉得挺讽刺的。现在的验证码已经复杂到需要一点逻辑推理才能过,人类自己填起来都费劲,本意却主要是拦机器。这笔账其实是平台在拿真人用户的体验,去换一个看起来能防住自动化的门槛,长期看双方都不划算。
换到企业自己的视角,答案反而清楚一些。想让一套在线系统被智能体高效驱动,与其让它去操作界面,不如直接给它开一条专用接口,这在自动化程度和结果的稳定性上,跟走 UI 完全不是一个量级。我对把手机这类终端也做成智能体操作对象兴趣不大,更倾向于让手机和以后各种边缘设备继续做输入输出的端点,真正干活的部分留在云端。这只是我现在的一个猜测,具体会长成什么样还看不清楚,可能还得看软件工程和大模型编程往前推进到什么程度,才有答案。
- 本文作者:BeanHsiang
- 本文链接:https://beanhsiang.github.io/post/2026-09-07-agent-automation-stuck-behind-interfaces-built-for-humans/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议. 进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。