AI Agent 工具栈:真正把工作做完,需要哪几层能力?

拆解 AI Agent 从执行、上下文、复用流程到权限与人工审核所需的完整工具栈。

Buda Team
返回博客
AI Agent 工具栈:真正把工作做完,需要哪几层能力?

AI Agent 工具栈:真正把工作做完,需要哪几层能力?

AI Agent 不是工具越多越好。真正有用的 Agent,需要一条受控闭环:先看清现场,再在正确环境里执行;把上下文留下来,把成功方法固化;结果真正影响业务前,停下来交给人审核。

这才是 AI Agent 工具栈 的实际含义。Browser、Terminal、Git、Drive、Skills、连接器、Automations、权限和人工审核,不是九个彼此独立的功能点。它们共同决定 Agent 能不能从一句需求,走到一个看得见、查得到、可以验收的产物。

**先记住四层:**执行层负责浏览和运行;上下文层保存文件与状态;流程层把好方法变成可复用 Skill;控制层限制访问范围,并让人对最终结果负责。

好用的 AI Agent 需要一条受控工具闭环

别再按“工具数量”选平台

很多选型表只数 integrations 和工具名,但真正决定能否落地的是这些问题:

  • Agent 能自己检查来源,还是只能接收复制进来的文字?
  • 遇到精确操作时,它能运行确定性命令,还是只会建议你运行?
  • 下一次 session 能不能拿到上一次留下的文件和判断?
  • 一次成功执行,能不能固化成团队复用的流程?
  • 权限是否只覆盖当前任务?
  • 人最终审核的是一次 tool call、一份 diff,还是可投入业务的产物?

Anthropic 对 workflow 与 agent 的区分很实用:workflow 由代码预先规定路径,agent 则会根据现场动态选择工具。它在 tool 设计文章里也强调,与其塞进一堆含糊工具,不如提供少量、清晰、能解决高价值任务的工具。

所以工具栈应从任务和验收标准开始。“研究五个竞品,保存证据,更新比较,发布前询问”可以配置工具;“把营销做好”不可以。

第一层:Browser 负责观察外部世界

Browser 是 Agent 的观察面。它可以打开当前网页、跟随链接、检查真实界面,并补充 prompt 里没有的新证据。

它适合产品研究、来源核验、表单操作、公开数据采集和上线结果检查,同时也是风险入口。登录状态、表单、下载和外部提交都可能带来敏感动作。

因此 Browser 至少要回答三件事:Agent 能访问哪些网站和登录态;读取与外部写入是否分开;Reviewer 能否看到来源和最终结果。

浏览器也不能替代证据纪律。Agent 应记录 URL、核验日期、关键摘录和事实边界,而不是只说“网上查到了”。

第二层:Terminal 与 Git 负责精确执行

模型擅长理解,Terminal 擅长精确动作。

有了 Terminal,Agent 才能运行 parser、测试、数据转换、构建命令、图像工具和校验脚本。关键变化是:不再只描述应该怎么做,而是留下 exit code、生成文件、测试结果和可重复命令,证明事情确实做过。

Git 为代码和文本项目保留可审核历史。它能记录变化、支持 branch 和 diff,让另一个人检查具体改了什么。不是每个业务任务都需要 Git,但产物属于 repository 时,它比把代码贴进聊天更可靠。

Buda 当前 Agent Workspace 把这些工作面放在同一任务旁边。下面是官方产品截图:Files、Local Browser、Terminal、AI Browser 和 Git 都可见,不需要把执行过程藏在一条聊天回复里。

Buda Agent Workspace 在任务旁显示文件、浏览器、终端与 Git

第三层:Drive 把上下文变成可检查材料

上下文不等于一段很长的聊天。长期工作的 Agent 需要人可以打开、改名、比较和复用的文件。

Drive 可以保存来源文档、运行规则、研究快照、中间数据、已接受产物和下一步说明。这样,另一位同事不用重放原 prompt,也不用盲信旧聊天摘要,就能检查同一批材料。

至少要区分三类文件:Agent 可以作为输入的来源材料;草稿、缓存、提取结果等工作材料;以及经人确认、可以进入下游流程的已接受材料

“Agent 记得”并不能说明这段记忆是否最新、是否有来源、是否被接受。文件和状态需要可见。

Buda Drive 让来源文件和工作产物保持可见

第四层:Skills 与连接器把工作变成可复用流程

Tool 完成一个动作,Skill 说明如何把多个动作组合成一项长期工作。

“打开网页”是 Browser 动作;“审核落地页、抓 canonical、检查移动端、记录坏链并生成审核报告”才是一条可复用流程。Skill 应写清输入、输出、证据要求和停止条件。

连接器与 MCP 可以把外部系统接进来,但不应变成无限访问。每条连接都要有明确账号、scope、credential owner 和撤销路径。Buda 的 Marketplace 可以直接搜索并安装 Skill,不必每次从零拼流程。

流程稳定后再固化 Skill;先让前几次运行保持可见、可审核。Automation 应排在流程验证之后。

第五层:Automations 提供时间,不替代判断

Automation 回答“什么时候运行”。它可以启动日报、周检或一次性跟进,但不会自动证明结果正确。

计划任务仍要绑定命名 Agent、持久 workspace、边界清楚的 prompt/Skill、明确输入源、可见输出位置、失败报告和 Reviewer。否则只是把一个模糊任务更频繁地重复。

第六层:权限决定事故半径

权限应匹配岗位,不应匹配平台能提供的最强工具。

研究 Agent 可能只需要公开 Browser 和只读文件;Coding Agent 需要一套 repository 与测试环境;财务 Agent 可以读取发票,但付款必须有独立审批边界。

实用的权限设计包括:按客户或数据域拆分 Space/Agent;按 Agent 连接 integration;限定 repository/folder;区分 read/write;对敏感外部动作要求确认;能随时移除成员或断开连接。

Buda 文档说明,每个 Agent 运行在自己的 cloud computer 中,包含 Files、Browser、Terminal 和 Git;Space 与 Drive 决定共享材料边界。不同套餐可用工具不同,采购前要核对实际 plan。

第七层:人工审核闭合责任

Review 不是装饰性的最后一步,而是责任回到人的地方。

Tool confirmation 回答“能不能执行”;artifact review 回答“这个结果能不能投入业务”。Campaign brief、报告、代码 diff、表格和客户回复,都应按后果设置验收点。

Buda 当前界面可以在需要人的判断时暂停。负责人不必盯住每个中间 tool call,只需要在真正改变业务状态的选择或产物上做决定。

Buda 在关键决定前暂停工作流并等待人确认

用这张表检查平台

平台必须回答失败信号
BrowserAgent 能观察和操作什么?来源与外部动作不可见
Terminal能否运行确定性工具和校验?只会给命令建议
GitRepository 变化能否 diff 和 review?代码贴在聊天里,没有历史
Drive来源、状态和产物在哪里持久保存?连续性依赖聊天摘要
Skills/连接器一次成功怎样变成可复用流程?每次都重新发明方法
Automations谁触发任务,失败怎样报告?定时任务静默输出
权限/审核谁能访问、执行和验收?宽权限,没有负责人

不要一次买齐所有层。先选一项结果可以检查的工作,只给 Agent 必要工具,手动跑通,记录缺失上下文和风险判断。审核链成立后,再固化 Skill 和计划任务。

一条具体的 Buda 工作流

以每周竞品更新为例:Browser 打开官方 release notes;Drive 保存日期快照和当前比较稿;Terminal 提取变化并检查链接;需要 repository 时由 Git 记录改动;Skill 固化证据、格式与去重规则;Automation 每周启动;遇到争议说法先暂停,最终 brief 由人接受。

价值不来自某一个工具,而来自工具之间没有丢失证据和责任。

常见问题

AI Agent 需要哪些工具?

通常需要 Browser 等观察工具、Terminal 等执行面、持久文件、可复用 Skills、scope 明确的 integrations,以及人工审核路径。Coding 工作常加 Git;周期工作再加 Automations。

团队怎样控制 AI Agent 的工具权限?

每个 Agent 只拿岗位必需的数据和工具。拆分读写权限,限定 repository/folder,隔离客户或公司数据,敏感动作前要求确认,并为最终产物指定一个人类 owner。

哪些 AI Agent 平台把 Browser、Terminal、Git 与共享文件放在一起?

Buda 在持久 Agent Workspace 中组合 Browser、Terminal、Git、Files/Drive、Skills、Automations 与 review。团队仍要核对套餐、integration scope,以及工作流是否真的需要全部工具。其他平台也可能通过独立 runtime 和 integrations 组合这些层。

工具越多越好吗?

不是。每个工具都会增加歧义、权限、失败面和维护成本。只有当它能补上一条真实工作流中的明确缺口时,才应该加入。

固定 Workflow 会不会比 Agent 更好?

路径明确时,确定性 workflow 通常更容易测试。只有系统需要理解变化上下文并动态选择工具时,才需要 Agent。可靠系统往往把两者组合:固定边界包住动态推理。

从一项可审核任务开始

找一项同时需要实时来源、命令、保存文件和一次人工判断的工作,放进 Buda AI Agent Workspace 运行。缺的是执行、上下文、流程、权限还是审核,会很快暴露。

从成熟岗位创建 Agent,或从 Marketplace 安装可复用 Skill

来源