先看结论
- 评测集应来自真实任务分布,而不是只收集“标准问题”。
- 高风险失败必须单独设门槛,不能被平均分稀释。
- 线上监控和人工反馈应持续回流为回归样本。
从“模型得分”转向“任务成功”
通用基准能帮助比较模型,却无法替代企业任务评测。同一个模型在客服检索、合同审阅和库存调拨中的失败代价不同;评测标准必须从任务完成条件和风险边界反推。
评测对象应覆盖输入到结果的全过程。一个答案即使语言正确,如果检索了过期制度、调用了错误客户、重复创建单据或没有触发必要审批,仍然是业务失败。
建立覆盖真实分布的任务样本库
高质量评测集通常由三部分组成:高频正常任务、容易混淆的边界任务,以及安全和权限相关的对抗任务。每个样本应保存输入、上下文快照、预期行为、不可接受行为和判分依据。
样本库不是一次性测试文档。新政策、工具版本和用户行为会改变任务分布;每次线上失败都应判断是否需要脱敏后进入回归集,并标记影响范围和风险等级。
- 按岗位、渠道和任务类型分层抽样
- 为时间敏感数据保存快照或模拟器
- 单独维护拒答、越权和提示词注入样本
- 记录样本来源、版本和最近复核时间
智能体评测风险矩阵
四层指标比一个总分更有解释力
第一层评估结果:事实、引用、格式和业务规则。第二层评估过程:检索、工具选择、参数、调用顺序和重试。第三层评估控制:权限、拒绝、确认和审计是否触发。第四层才是业务影响:采用率、节省时间、差错和成本。
这些指标不应被压缩为一个“智能度”。高风险场景应设硬门槛,例如越权率必须为零;低风险内容可以使用抽样和趋势监控。分层指标让团队知道问题来自模型、知识、编排还是流程。
组合确定性规则、模型评分与人工复核
结构化字段、金额、权限和工具调用适合确定性校验;语义完整性和语气可由模型评分,但需要先用人工标注集校准;高风险结论和新型失败仍应由领域专家复核。三类判分方式各自处理擅长的问题。
使用模型充当裁判时,应固定评分量表、要求给出证据,并持续观察与人工判断的一致性。不能让同一提示同时生成结果和决定自己是否正确,也不应把模型评分当成不可质疑的真值。
线上监控要捕捉漂移,而不只是报错
很多智能体不会以异常退出的方式失败,而是逐渐变得不合用:引用变旧、人工修改增加、工具重试变多、成本缓慢上升。监控需要同时看质量、行为、性能、成本和用户采纳。
将任务轨迹按模型、知识版本、工具版本和用户角色切片,才能定位变化来源。告警阈值也应按风险等级设计:越权和重复写入需要即时阻断,语气和摘要质量可以采用周期抽样。
让发布门槛与风险等级绑定
任何模型、提示词、知识或工具变更都应触发对应范围的回归评测。低风险查询可以在通过核心集后灰度;高风险执行除了全量关键集,还需要回滚验证、审批和上线后加密抽样。
成熟评测体系的产物不是一张漂亮报表,而是一套能回答“这个版本可以承担哪些任务”的发布规则。它帮助团队扩大能力边界,同时避免每次升级都从零争论。
参考资料
以下资料用于核对法规、技术标准与平台机制;文中框架与判断由极策科技结合项目方法独立整理。
- NIST生成式人工智能风险管理框架应用档案
- OpenAI评测指南
- OWASP面向大语言模型应用的提示词注入风险
本文用于企业技术与经营决策参考,不构成法律、审计或税务意见。具体实施应结合所在司法辖区和企业内部制度复核。