Interview Notes: Explaining My Training-Data Attribution Thesis
A compact interview narrative for a training-data attribution thesis: research question, method, contribution, limitations, and PhD extensions.
A compact interview narrative for a training-data attribution thesis: research question, method, contribution, limitations, and PhD extensions.
Why exact Shapley is expensive and how scalable attribution uses sampling, surrogate models, datamodels, and group-to-document-to-example hierarchies.
Attribution scores are estimates. This note separates estimator bias, sampling variance, training randomness, evaluation uncertainty, and bootstrap confidence intervals.
A research-oriented guide to training-data attribution: attribution units, utility functions, Shapley values, influence methods, causality, scalability, and uncertainty.
Training-data attribution depends on the utility function. Quality, factuality, style, safety, fairness, and terminology may point to different influential data.
A first research-oriented explanation of training-data attribution for NLP and LLMs: what it explains, how it differs from feature attribution, and why it matters for evaluation and data-centric research.