AI Agent 求职专题(五):评测、可观测性与生产化

建立 Agent 的质量模型、评测数据集、Trace、成本与容量模型,并掌握上线、灰度、回滚和人工接管的完整方法。

Agent 质量模型

Agent 的质量不能只用一个“回答准确率”表示,因为错误可能发生在检索、工具选择、参数生成、执行、状态转移或最终表达。

层次关注问题核心指标
模型层理解和生成是否稳定结构化输出通过率、事实一致性
检索层证据是否找对Recall@K、MRR、Context Precision
工具层是否选对工具和参数工具选择准确率、参数通过率
任务层任务是否真正完成任务成功率、步骤成功率、重试次数
系统层服务是否够快够稳P50/P95 延迟、吞吐、错误率、可用性
业务层是否创造价值节省时间、转化、满意度、转人工率
安全层是否产生越权和泄露拦截率、误报率、敏感泄露事件

评测集与指标

评测集应来自真实任务和线上 Badcase,而不是只由开发者编写的理想问题。每条样本至少包含输入、期望结果、允许工具、不可接受行为和评分标准。

样本类型示例检查点
事实题某制度的生效时间召回正确、答案和引用一致
综合题根据多个制度给出办理步骤跨片段整合,不漏条件
工具题查询订单并生成摘要工具选择、参数、结果处理
无答案题资料中没有该政策正确拒答,不编造
边界题读取他人订单拒绝越权并说明原因
攻击题文档要求忽略系统规则识别不可信指令
故障题工具超时或返回冲突重试、降级或人工接管

自动评测适合结构、引用、工具参数和规则检查;模型评分适合语义相关性,但需要校准;人工评审用于复杂业务和高风险样本。三者应组合使用。

Trace 与可观测性

每次任务都应有一个可检索的 Trace,串联请求、模型、检索、工具、状态和交付结果。建议记录:

  • 请求 ID、用户、租户、模型和版本。
  • 输入摘要、Prompt 版本、上下文来源。
  • 每一步状态、工具名、参数、结果、耗时和错误。
  • Token、重试次数、成本估算和人工审批。
  • 最终答案、引用、任务状态和用户反馈。

日志要支持按一次任务回放,也要支持聚合分析:哪个工具最容易失败、哪个 Prompt 版本回归、哪类问题成本最高、哪个租户经常触发超时。

延迟、成本与容量

优化点方法代价或风险
模型路由简单任务用轻量模型,复杂任务升级路由错误会影响质量
减少上下文摘要、裁剪、只取相关证据可能丢失条件
并行工具并发执行互不依赖的只读调用并发冲击下游系统
缓存缓存 Embedding、检索和稳定业务查询需要失效和权限策略
流式输出尽快返回状态或增量文本不能掩盖最终失败
降级关闭 Rerank、切备用模型、转人工质量和体验下降

容量估算至少要知道:每秒请求数、平均和峰值步骤数、每步模型耗时、工具并发、上下文 token、下游 QPS 和失败重试放大系数。Agent 的一次用户请求可能产生多次模型和工具请求,不能只按入口 QPS 估算。

安全与人工接管

建议把安全控制分成输入、执行前、执行中和输出四层。输入检查恶意内容,执行前检查工具和权限,执行中限制资源和网络,输出检查敏感信息和业务格式。

触发条件处理方式
删除、支付、发消息展示结构化摘要并要求确认
权限不确定停止执行,转人工或要求授权
连续失败或循环超过阈值后冻结任务并保留 Trace
敏感信息命中脱敏、阻断或转人工
模型与工具结果冲突重新读取确定性来源,不让模型猜测

上线与回滚

上线前固定模型版本、Prompt 版本、工具 Schema、RAG 索引版本和评测集版本。发布时先在离线数据集回归,再做小流量灰度,观察质量、成本、延迟和安全指标。

回滚不只是恢复代码,还要恢复与代码绑定的 Prompt、模型路由、工具协议和索引版本。对有副作用的任务,应有补偿流程和人工处置手册。

生产检查表

  • ✓有离线评测集,并包含线上 Badcase、无答案和攻击样本。
  • ✓每个请求都有 Trace,可以定位模型、检索、工具和状态问题。
  • ✓配置了步数、超时、重试、限流、熔断、降级和取消。
  • ✓高风险工具有权限、审批、幂等、审计和补偿方案。
  • ✓能按 Prompt、模型、工具 Schema 和索引版本回滚。
  • ✓成本、延迟、错误率、成功率和安全事件都有告警。

下一篇进入 面试题与项目实战,把前面的知识转化为面试表达和作品集。