从替你做事到陪你做事:Manus、Claude Code 与 HeyClicky 争夺的不是 Agent,而是工作界面
云端代办、本地共创、屏幕在场。三种 Agent 交互背后,真正变化的是人把注意力、权限和判断交给机器的方式。
从替你做事到陪你做事:Manus、Claude Code 与 HeyClicky 争夺的不是 Agent,而是工作界面
一个人同时开着浏览器、终端和设计软件时,最稀缺的往往不是模型能力,而是注意力。你得解释背景,复制材料,确认权限,再在结果回来时重新进入上下文。Agent 真正想接手的,正是这些缝隙里的劳作。
围绕 Manus、Claude Code 和 HeyClicky 的讨论,常有人用“第一代、第二代、第三代”来区分它们:云端代办、本地执行、贴着屏幕协作。这个说法抓住了交互的迁移,却不宜当成严格的技术年代。Manus 已经提供桌面端本地能力;Claude Code 也有云端会话与远程控制;HeyClicky 同样会在后台启动任务。它们不是彼此淘汰的版本,而是三种不同的工作契约。
差别不在于谁更像人,而在于:任务从哪里开始,机器能看到多大范围,人在什么时刻必须回来做判断。

Manus:把一张需求单交给云端项目组
Manus 最容易让人理解,因为它把 Agent 放进了大家熟悉的“委派”关系里。你提出一个结果导向的要求:研究一个市场、收集一批线索、整理一个方案、完成跨网页流程。任务离开当前窗口,进入一个云端工作区;浏览器、文件、步骤记录和最终交付物都在那里展开。
这种交互最舒服的地方,是它把人从过程里解放出来。你不必守着每一次搜索、每一个网页跳转和每一段表格整理。Manus 的 Cloud Browser 会在云端访问网站、点击、填写、提取信息;用户可以观看过程,也可以在验证码、短信验证或多因素认证出现时接管浏览器。对于研究、资料整合、可异步验收的运营动作,这种设计把“我现在没有时间做”变成“我稍后验收”。
它的代价也很清楚。Agent 越远离你的真实工作环境,上下文就越需要被翻译成任务说明。你知道某份文档为什么重要、某个客户的称呼意味着什么、一个临时改动会牵动哪条内部约定;云端工作区并不天然知道。登录态、数据中心 IP、验证码和敏感账户又会不断把人拉回流程中。Manus 的官方文档也专门区分了 Cloud Browser 与本地的 My Browser:前者适合长时间、公开网页上的工作,后者更适合依赖本机 IP 或既有登录态的场景。
所以,Manus 的强项不是“替人按鼠标”,而是把一团可描述、可验收的工作压缩成一次委派。它最像一个远程项目组:先给清楚边界,再等结果回来。
Claude Code:让 Agent 走进项目,而不是替项目另开一间办公室
Claude Code 的起点几乎相反。它不是先问“你想得到什么成品”,而是先站进已有的仓库、终端和开发工具里,面对正在变化的代码、依赖和日志。它读文件、跑命令、修改代码、执行测试,反馈也跟着本地开发节奏走。
这种方式改变了用户感受。开发者不再把整个项目打包成一段需求交出去,而是把 Agent 放进问题发生的现场:报错就在终端里,规范就在仓库里,验证命令也在手边。一个修复可以从“看一眼这个错误”开始,在几个来回后变成真正跑过的改动。这里的价值不只是本地文件可访问,更是上下文几乎不必搬家。
Claude Code 对权限的设计,也说明它默认人和 Agent 是共同作业,而非彻底交接。用户可以选择手动确认、自动接受编辑、计划模式等不同强度。计划模式允许它读文件和做只读探索,却不允许直接改源码;计划出来后,人可以选择继续人工审批,或切换到更自动的执行方式。这样的停顿并不华丽,却很适合高代价的本地环境:删除、迁移、发布、覆盖配置,都不该因为一句“帮我处理一下”而失去边界。
本地交互当然也有摩擦。环境不同、依赖复杂、权限繁多,意味着 Agent 要处理更多现实细节;一次好的会话,需要用户保留判断力,知道何时给权限、何时让它先计划、何时必须亲自检查。它不像把事情扔出去那样轻松,但更像资深同事坐在同一张工位旁:速度来自共享现场,可靠性来自持续复核。
HeyClicky:不是把任务移走,而是把求助入口放到鼠标旁边
HeyClicky 的新鲜感,不主要来自“它也能跑 Agent”。更关键的是,它试图把入口从对话框、终端和任务面板,挪到用户已经在看的屏幕上。
官方产品介绍把它描述为运行在 Mac 上的 AI buddy:按下热键,它看到用户正在看的内容;用户可以直接说出问题,它会语音回应、在屏幕上指向位置,带着用户完成操作。说出“Heyclicky agent”时,产品又会把工作交给后台 Agent。早期公开代码则展示了这种体验的一个实现方向:菜单栏应用、透明的全屏指针叠层、按住说话后的转写、截图与模型响应,以及模型用坐标标记界面元素。
这是一种更短的交互回路。传统助手要求用户先停下来,再把屏幕上的困惑翻译成文字;HeyClicky 想利用“同一块屏幕”作为共同上下文,让问题可以是“这个按钮为什么灰了”“下一步点哪里”“把这套流程做掉”。对于不会写提示词、也不熟悉复杂软件的人,这不是小改动。教程不再是离开工作现场去看的视频,帮助发生在出错的那一秒、那个按钮旁边。
但“它看见我看见的一切”也是这类产品最需要克制的地方。屏幕上有私人聊天、财务信息、客户资料和不该被长期记住的细节。产品必须把采集时机、可见范围、云端传输、截图保存、执行授权和撤销入口做得极其清楚。HeyClicky 的公开表述强调由热键触发的屏幕理解,但任何屏幕型 Agent 的信任,都不能只靠一句“它很懂你”。用户需要知道它在何时看、看到了什么、准备做什么,并能立刻按下暂停。
因此,HeyClicky 所代表的并非已经胜出的“第三代”,而是一种值得重视的界面赌注:Agent 不再等待被打开,而是以低打扰的方式在场;人不必离开应用去找帮助,也不必总把背景复述一遍。

三种体验,分别优化了三种人类成本
把三者并排,问题会更清楚。
Manus 优化的是等待成本。 一项任务能否离开你,取决于它是否足够独立、边界是否足够清楚、结果能否在最后集中验收。研究、资料汇总、跨站重复操作,往往适合这条路。
Claude Code 优化的是上下文切换成本。 当工作的价值藏在本地文件、版本历史、命令行反馈和团队约定里,最好的 Agent 不是把材料搬到远处,而是进入原来的工作台。开发是最典型的场景,但财务建模、设计资产整理、数据分析也会越来越像这样。
HeyClicky 优化的是求助成本。 人通常不是缺少一个能完成任务的模型,而是缺少一个不打断工作、又能在关键处接住自己的入口。它把语音、视觉提示和后台委派放在同一个轻量界面里,瞄准的是软件学习、个人工作流和跨应用的小任务。
这三种成本不可能被一个界面彻底消灭。越异步,越需要清晰的任务定义;越贴近本机,越需要权限和审计;越贴近屏幕,越需要隐私与打扰控制。把它们全叫成“更自动化”,反而掩盖了真正的取舍。
面向未来的,不会是单一入口,而是一套可伸缩的控制权
最有前途的交互,不是让 Agent 永远替人做,也不是让人永远盯着 Agent 做。它应该能随任务风险和上下文密度变化。
低风险、目标清晰的工作,应该一键委派到云端,像 Manus 那样在你离开后继续推进;高上下文、可验证的专业工作,应该留在本地工作台,像 Claude Code 那样允许计划、执行、测试和回退紧紧相连;当人卡在一个陌生界面、一个短暂障碍或一个跨应用流程里,屏幕旁的 HeyClicky 式入口会更自然,因为它不强迫人离开当下。
真正的下一代,不是“看屏幕”本身。它应当同时做到三件事:在该安静时安静,在需要时拿到足够上下文,在每一次高后果动作前把控制权还给人。
能把这三件事做成同一套连贯体验的产品,才可能从一个会做事的 Agent,变成用户愿意长期共处的工作界面。
资料与产品说明
- Manus Cloud Browser 与 My Computer:https://manus.im/docs/features/cloud-browser;https://manus.im/docs/features/desktop
- Anthropic Claude Code 权限模式:https://code.claude.com/docs/en/permission-modes
- HeyClicky 产品介绍:https://www.heyclicky.com/
- HeyClicky / Clicky 公开代码与架构说明:https://github.com/farzaa/clicky
- Y Combinator 的 HeyClicky 公司介绍:https://www.ycombinator.com/companies/heyclicky
More from WayDigital
Continue through other published articles from the same publisher.
Comments
0 public responses
All visitors can read comments. Sign in to join the discussion.
Log in to comment