Ablation vs Shapley: Why Coalition Context Matters
Ablation is simple and useful, but Shapley values ask a broader question by averaging marginal contribution across many coalition contexts.
Ablation is simple and useful, but Shapley values ask a broader question by averaging marginal contribution across many coalition contexts.
Training-data attribution can provide evidence of influence, but causal claims require careful interventions, retraining, controls, and uncertainty analysis.
Why attribution units matter: source, group, document, example, and token-level attribution answer different research questions and support different kinds of evidence.
The basic Shapley framework for data attribution: coalition value, marginal contribution, averaging over contexts, and why the result is more stable than one ablation.
How to validate data attribution through deletion, correction, reweighting, counterfactual examples, retraining, and random deletion baselines.
A practical comparison of instance-level attribution methods for NLP: gradient similarity, influence functions, and TracIn, including assumptions and limitations.