先看结论
- 先定义可验收的任务契约,再讨论模型和编排方式。
- 查询、建议和执行必须使用不同的权限与人工确认策略。
- 上线是运营起点:失败样本、知识变化和成本都需要持续治理。
演示证明“能做”,生产需要证明“持续做对”
演示环境通常拥有干净问题、固定知识和熟悉流程的人。生产环境恰好相反:输入不完整、数据随时变化、工具可能超时,用户还会把一句模糊指令当成完整任务。模型在演示里给出一次好答案,并不能说明系统能够每天稳定完成同类工作。
生产化的关键判断,是系统面对不确定输入时是否仍能维持边界。它需要知道缺什么信息、何时拒绝、何时询问、何时转人工,以及失败后如何恢复。企业真正购买的不是一次生成结果,而是可预测的任务完成能力。
用任务契约替代“做一个智能助手”
一个可运营场景应写成任务契约:谁在什么条件下触发,必须取得哪些上下文,可以使用哪些知识和工具,输出满足什么标准,以及哪些情况必须升级。任务契约把产品需求、权限设计和测试用例连接在同一对象上。
例如“协助销售准备客户会议”不是完整任务。“在 CRM 商机进入方案阶段后,基于已授权的客户资料和产品知识生成会议简报;缺少关键字段时列出问题;任何对外发送均由客户经理确认”才具备实现与验收条件。
- 触发条件与任务所有者
- 输入、数据来源与新鲜度要求
- 允许的工具、动作和调用预算
- 完成标准、拒绝条件与人工升级路径
智能体生产闭环
把身份、知识和工具放进同一条执行链
检索增强并不会自动带来企业级安全。智能体查询知识时必须继承当前用户的身份、组织和数据范围;引用不仅要能跳回来源,还要记录文档版本与检索时间。否则同一句问题可能在不同权限下泄露不该出现的答案。
工具调用需要通过受控适配层,而不是把内部 API 原样交给模型。适配层负责参数校验、幂等、超时、重试、速率限制和审计。读取客户状态、建议库存调拨、真正创建调拨单,是三个风险完全不同的动作。
按动作风险配置人工闸门
“有人在环”不应等于所有结果都由人重做一遍。低风险查询可以自动完成并保留来源;中风险建议需要岗位人员确认;高风险执行则应展示即将改变的对象、影响范围和回滚方式,并使用明确的二次确认。
人工确认也需要被记录为产品数据。团队应观察哪些建议经常被修改、哪些字段导致犹豫、哪些确认只是机械点击。成熟之后,低风险且高一致性的步骤可以逐步自动化,而不是一开始就追求端到端无人值守。
评测必须覆盖结果、过程和业务影响
离线评测集应来自真实任务和失败样本,覆盖正常、边界与对抗输入。除了答案正确性,还要检查引用是否支持结论、工具是否选对、参数是否完整、拒绝是否合理、过程是否超出预算。单一平均分会掩盖高风险少数场景。
线上指标需要与业务结果连接:任务完成率、人工修改率、升级率、端到端耗时、单任务成本,以及最终是否被采用。只有模型指标和经营指标同时可见,团队才能分辨“回答更像人”与“流程真的更好”。
把上线后的责任机制设计在上线之前
每个生产智能体至少需要四类所有者:业务负责人定义完成标准,知识负责人维护来源,技术负责人管理模型与工具,风险负责人审批边界变化。责任可以由同一人兼任,但不能缺席。
更稳妥的推进方式是分阶段扩大边界:前 30 天只读并积累评测样本;中间 30 天加入受控建议;后 30 天开放少量可回滚动作。每一次能力扩展都必须以回归评测和故障复盘为依据。
参考资料
以下资料用于核对法规、技术标准与平台机制;文中框架与判断由极策科技结合项目方法独立整理。
- NIST生成式人工智能风险管理框架应用档案(AI 600-1)
- OpenAI评测指南
- NIST零信任架构(SP 800-207)
本文用于企业技术与经营决策参考,不构成法律、审计或税务意见。具体实施应结合所在司法辖区和企业内部制度复核。