Interview Notes: Explaining My Training-Data Attribution Thesis
A compact interview narrative for a training-data attribution thesis: research question, method, contribution, limitations, and PhD extensions.
A compact interview narrative for a training-data attribution thesis: research question, method, contribution, limitations, and PhD extensions.
Why exact Shapley is expensive and how scalable attribution uses sampling, surrogate models, datamodels, and group-to-document-to-example hierarchies.
Attribution scores are estimates. This note separates estimator bias, sampling variance, training randomness, evaluation uncertainty, and bootstrap confidence intervals.
Training-data attribution depends on the utility function. Quality, factuality, style, safety, fairness, and terminology may point to different influential data.
A first research-oriented explanation of training-data attribution for NLP and LLMs: what it explains, how it differs from feature attribution, and why it matters for evaluation and data-centric research.
Ablation 简单且有用,但 Shapley 通过跨多个 coalition context 平均边际贡献,回答更全面的问题。