本文目录导读:

模型监控的指标选择,取决于你监控的对象是机器学习模型还是大语言模型(LLM),以及监控的阶段(训练中 vs 上线后)。
我们可以分三个场景来看:
传统机器学习模型(上线后/生产环境)
这是最经典的数据科学监控场景,核心关注数据漂移和模型衰退。
数据质量与输入监控
- 特征缺失率:输入特征的空值比例是否突然升高。
- 特征分布漂移:使用
PSI(群体稳定性指数)或KS检验,判断特征的分布是否与训练时一致(例如用户年龄分布突然偏移)。 - 业务逻辑校验:输入值是否符合业务规则(如年龄>0,金额>0)。
预测性能监控
- 准确率/精确率/召回率/F1:如果有实时反馈标签,这是最直接的。
- AUC / LogLoss:用于概率预测模型的排名和校准能力。
- 残差分析:预测值与实际值的误差是否变大,是否有系统性偏差。
业务与运行监控
- 预测分布:模型预测的正负样本比例是否剧烈变化(例如贷款通过率突然从30%飙升到80%)。
- 模型延迟与吞吐量:API响应时间(P99)和每秒请求量。
- 模型新鲜度:模型上次训练时间距今多久(数据过期程度)。
大语言模型(LLM)应用
LLM监控不仅看技术指标,还要看安全性和用户体验,通常使用“RAG”或“Agent”架构时需分层监控。
质量与准确性
- 答案相关性(Answer Relevance):回答是否切题。
- 上下文相关性(Context Relevance):检索到的文档是否与问题相关(用于RAG系统)。
- 忠实度/幻觉率(Groundedness):回答是否有依据,是否编造事实。
- 语义相似度:输出与期望输出的余弦相似度。
安全与合规
- PII泄漏检测:模型是否在回答中泄露了身份证、手机号等个人信息。
- 阻断率:涉及暴力、歧视、违法等内容的拦截比例。
- 提示注入攻击率:检测恶意Prompt试图绕过限制的比例。
成本与性能
- Token消耗:单次请求的平均Token数,直接关联费用。
- 首Token延迟(TTFT):用户等待第一个字出现的时间。
- 响应中断率:流式输出中途断开的比例。
业务闭环指标(最难但最重要)
- 用户采纳率:用户是否复制了生成的答案,或是否点击了“点赞/点踩”。
- 任务完成率:在Agent场景下,AI是否成功帮用户完成了多步任务。
模型训练过程中的监控
如果你在调参或训练,关注的是收敛性和过拟合。
- 损失函数(Loss):训练集和验证集的Loss曲线是否同步下降。
- 梯度范数:梯度是否消失(趋近于0)或爆炸(突然巨大)。
- 学习率:当前学习率的实时状态。
- 过拟合差距:训练集的准确率与验证集的准确率差距是否过大。
核心优先级
如果你时间有限,建议优先关注以下三个“生死攸关”的指标:
- 数据漂移(PSI):线上数据变了,模型大概率会失效。
- 业务关键指标(如转化率/AUC):模型是否还在挣钱/解决问题。
- 可用性(SLO/延迟):模型是否还在正常服务(宕机一切免谈)。
补充一个技巧:监控不是只看数字,关键是设置动态阈值和报警机制,一旦指标突破了历史波动范围(如PSI>0.25),就需要触发告警并触发模型重训。