· Xiaojing Yang · Statistics
Multiple Comparisons in AI Experiments
When we try many models, prompts, seeds, and metrics, false discoveries become easier than they look.
When we try many models, prompts, seeds, and metrics, false discoveries become easier than they look.
当我们测试很多模型、prompt、seed 和指标时,假阳性会比想象中更容易出现。