· Xiaojing Yang · Machine Learning · 3 min read

EN

Accuracy 之外的评估指标

Accuracy 容易理解,但在不平衡、排序或代价敏感任务中经常不够。

核心观点

指标本质上是在决定:哪些错误更重要。

1. 为什么 accuracy 不够

Accuracy 统计预测正确的比例。当类别均衡、错误代价相近时,它很好用。但很多真实任务类别不平衡,或者错误代价不同。

混淆矩阵视角
TP
正确预测正类
FP
误报
FN
漏报
TN
正确预测负类

2. 常见指标

指标适用场景
Accuracy类别均衡、错误代价相近
Precisionfalse positive 代价高
Recallfalse negative 代价高
F1需要平衡 precision 和 recall
ROC-AUC看正样本是否排在负样本前
PR-AUC正类很稀有
Macro-F1希望每个类别同等重要

3. sklearn 例子

from sklearn.metrics import classification_report, f1_score, roc_auc_score

print(classification_report(y_test, y_pred))
macro_f1 = f1_score(y_test, y_pred, average="macro")

4. AI/NLP 连接

在 NLP 里,accuracy 可能隐藏少数语言失败、稀有标签失败或安全关键 false negatives。在 RAG 中,retrieval accuracy 不代表最终答案 grounded。在 MT 中,只看 BLEU 可能隐藏术语错误。

指标选择

根据任务风险、类别平衡和错误代价选择。

研究结论

说明指标能支持什么,也不能支持什么。

总结

指标不是中性的。选择指标就是选择模型可以声称哪一种成功。

面试回答模板

如果面试问到这个概念,我会分四层回答:

  1. 先给短定义;
  2. 再讲直觉;
  3. 指出常见失败模式;
  4. 最后连接到真实评估或部署决策。

参考资料

Share:
Back to Blog

Related Posts

View All Posts »