· Xiaojing Yang · Machine Learning · 3 min read
ENAccuracy 之外的评估指标
Accuracy 容易理解,但在不平衡、排序或代价敏感任务中经常不够。
核心观点
指标本质上是在决定:哪些错误更重要。
1. 为什么 accuracy 不够
Accuracy 统计预测正确的比例。当类别均衡、错误代价相近时,它很好用。但很多真实任务类别不平衡,或者错误代价不同。
混淆矩阵视角
TP
正确预测正类
正确预测正类
FP
误报
误报
FN
漏报
漏报
TN
正确预测负类
正确预测负类
2. 常见指标
| 指标 | 适用场景 |
|---|---|
| Accuracy | 类别均衡、错误代价相近 |
| Precision | false positive 代价高 |
| Recall | false negative 代价高 |
| F1 | 需要平衡 precision 和 recall |
| ROC-AUC | 看正样本是否排在负样本前 |
| PR-AUC | 正类很稀有 |
| Macro-F1 | 希望每个类别同等重要 |
3. sklearn 例子
from sklearn.metrics import classification_report, f1_score, roc_auc_score
print(classification_report(y_test, y_pred))
macro_f1 = f1_score(y_test, y_pred, average="macro")4. AI/NLP 连接
在 NLP 里,accuracy 可能隐藏少数语言失败、稀有标签失败或安全关键 false negatives。在 RAG 中,retrieval accuracy 不代表最终答案 grounded。在 MT 中,只看 BLEU 可能隐藏术语错误。
指标选择
根据任务风险、类别平衡和错误代价选择。
研究结论
说明指标能支持什么,也不能支持什么。
总结
指标不是中性的。选择指标就是选择模型可以声称哪一种成功。
面试回答模板
如果面试问到这个概念,我会分四层回答:
- 先给短定义;
- 再讲直觉;
- 指出常见失败模式;
- 最后连接到真实评估或部署决策。