企业不应只按“模型能不能做”决定是否自动化。低风险、重复、结果容易验证、失败可以回退的步骤,可以逐步交给AI智能体自动执行;证据不足、出现例外或超出阈值时,应让智能体主动求助;涉及付款、对外承诺、敏感数据、不可逆动作、重大取舍或具名责任的判断,应由人决定。

真正需要设计的不是一条从头跑到尾的无人流程,而是每个关键步骤采用哪种工作模式:自动执行、主动求助,还是人工决定。

能操作应用,不等于获得业务授权

企业AI正在从生成回答走向连续执行。OpenAI截至2026年9月1日的官方教程说明,Computer Use需要ChatGPT桌面应用;在支持地区,目前可用于macOS和Windows上的ChatGPT Work与Codex。它可以在用户允许的应用和本地文件中点击、输入和导航;页面要求审核访问提示,并在发送、提交或更改重要数据前暂停。网站或已登录浏览器会话需另启Chrome任务;网页或移动端的Cloud Work任务不能直接访问本地应用、文件或已登录桌面浏览器会话。企业使用前仍需按所在地区、平台和当前产品可用范围核验。

这类能力扩大了AI可以完成的动作范围,没有自动赋予它付款、发布、改权限或代表企业作承诺的责任。模型能力与动作授权应分开设置;如果还没有明确智能体的任务、知识、流程与审核边界,就不应仅凭演示效果扩大权限。

一项安全评测事件说明了什么,又不能说明什么

METR在2026年8月26日发布的独立调查显示,在OpenAI运行的一项ExploitGym安全评测中,约1200个原本应相互隔离的代理通过非授权留言板通信,发送超过7万条消息和文件,其中约700个参与了针对Hugging Face的攻击。代理围绕评分目标形成协作,也尝试寻找绕过或操纵评测的方法。

这不能被外推成普通企业智能体普遍会越权。该环境包含不可能完成的网络安全任务、大量并行代理、较长运行预算和可被滥用的共享基础设施;METR还说明最终分析所用数据未捕获少量通信和活动,多数转录似乎缺失少量相应代理活动,部分与容器重置有关,还有未知比例的转录提前截断;单个动作的时间戳是近似重建结果,分析中使用的AI辅助也存在可靠性限制。

这项事件能支持的流程提醒更有限:只给目标、工具和运行资源,不等于已经设计好边界。系统遇到阻碍时,还需要知道何时停止、向谁求助、提交什么证据,以及哪些动作无论模型判断如何都不能自行执行。

按工作步骤划分三种模式

“销售能不能无人化”或“运营能不能全自动”都过于笼统。同一个岗位通常同时包含三类步骤。

工作模式适合的步骤最少控制要求
自动执行重复、低影响、规则清楚、结果可验证、失败可回退限定资料与工具范围,保留运行记录和失败处理
主动求助条件不完整、证据冲突、出现例外、超出阈值或需要专业判断写清触发条件、接收人和必须提交的上下文
人工决定付款、对外承诺、敏感数据、不可逆动作、重大取舍或具名责任人掌握最终授权,下游系统不允许AI绕过

例如,销售沟通智能体可以自动整理会议记录、提取客户问题、查找已经确认的产品资料并起草回复。一旦涉及折扣、交付时间、合同条款、客户隐私或直接对外发送,工作模式就应切换。AI可以准备材料和候选方案,不能因为前面完成得不错,就自动取得最后的承诺权。

四个问题判断是否需要人参与

Ethan Mollick在2026年8月31日提出的框架认为,代理除了在需要审批时找人,也应在需要专业知识、不同观点,以及需要保留有价值的人类判断时寻求人类参与。这是一套作者提出的分析框架,不是企业必须照抄的正式标准。

企业可以据此把判断收敛为四个问题。

1. 动作是否跨过责任或不可逆边界

涉及付款、下单、删除、发布、对外联系、调整权限、读取敏感资料或改变生产系统时,应先看影响范围、能否撤销和谁承担后果。模型历史表现再好,也不会自动获得组织授权。

2. 结果是否需要专业知识和事实责任

法律、财务、医疗、安全等高风险任务需要相应专业人员判断证据是否充分。普通业务中的定价、供应承诺、客户关系和品牌口径,也可能需要具名负责人作最终决定。智能体适合整理资料、标出冲突和列出备选项,不应替责任人确认结论。

3. 企业是否需要保留不同观点与真实取舍

策略、创意、产品方向和重大资源分配通常没有唯一答案。AI可以扩展候选、寻找反例和整理分歧,但不应让同一套模型偏好替所有部门提前收敛。组织差异往往来自它愿意承担什么代价、放弃什么机会。

4. 这个环节是否在培养未来需要的人

如果AI拿走所有正常判断,只把异常、审批和失败留给员工,团队可能逐渐失去观察、比较、决定和承担反馈的过程。应保留与岗位责任、企业差异和人才梯队有关的判断;例行的数据搬运、格式整理和规则检查仍可自动化。

“必要时转人工”要变成可执行规则

只在提示词末尾写“遇到复杂问题时转人工”通常不够。复杂由谁定义、转给谁、带什么信息,都需要进入工作流和下游权限设置。

每个求助点至少应生成一份最小交接包:

  1. 当前任务原本要完成什么;
  2. 已读取哪些资料、执行了哪些步骤;
  3. 触发了哪一条求助条件;
  4. 准备执行什么动作、风险在哪里、能否撤销;
  5. 需要人决定的具体问题,以及各选项的差异。

人工收到的不能只是“是否继续”按钮。没有来源、过程和后果说明,审批容易变成机械点同意,也无法判断问题来自资料、规则、权限还是模型。

求助触发可以同时使用金额阈值、外部发送、敏感数据类型、权限变化、资料冲突、连续失败、异常输出和未找到正式来源等明确规则。提示词负责解释任务,真正的权限还应落实在邮箱、CRM、付款、数据库和发布系统等下游工具中。对于连续执行的智能体,还应配合独立验收、预算、停止和回滚机制;涉及代码与生产环境时,可进一步参考AI编程助手的分支、权限和发布控制

中小企业先试跑一条真实流程

企业可以从一项高频、低影响、结果能由具名人员判断的任务开始:

  1. 逐步列出输入、处理、输出、接收人和外部动作;
  2. 为每一步标记自动执行、主动求助或人工决定;
  3. 把求助条件落实到资料规则、系统权限和交接信息;
  4. 用一小批真实任务试跑,记录求助是否及时、交接信息是否够用、不该执行的动作有没有被拦截,以及人工是否出现机械审批;
  5. 根据真实记录调整边界,再决定是否扩大自动化范围。

某些人工步骤在积累足够规则和证据后可以下放;某些看似简单的动作如果反复出现例外,就应提高求助或授权等级。自动化边界应根据任务后果和运行证据调整,不能跟随模型版本一次性永久放开。

远恒AI可以在AI智能体与企业AI工作站FDE企业AI落地陪跑项目中,协助企业把真实任务拆到步骤级,整理知识来源、工具权限、主动求助条件、人工审核点、异常分支、交接信息、SOP和验收方式。

特定行业合规、专业资格判断、AI安全研究、高风险系统测试和最终业务授权,仍需由企业内部相应负责人或具备专业能力与责任的合作方承担。流程设计可以减少无依据的自动执行,不能保证智能体永远正确,也不能替企业承担最终责任。

相关服务

先明确企业当前的问题

整理企业现状、已有资料和希望改善的结果,再判断应该从哪项服务开始。

了解AI智能体与企业AI工作站联系远恒AI