· Xiaojing Yang · Explainability and Responsible AI
从关联到因果证据:Attribution 到底能声称什么?
Training-data attribution 可以提供数据影响的证据,但因果声称需要谨慎的干预、重新训练、控制条件和不确定性分析。
Training-data attribution 可以提供数据影响的证据,但因果声称需要谨慎的干预、重新训练、控制条件和不确定性分析。
为什么 attribution unit 很关键:数据源、数据组、文档、样本和 token 层面的归因回答的是不同研究问题,也支持不同证据强度。
数据归因中的 Shapley 基础:coalition value、边际贡献、跨上下文平均,以及为什么它比一次 ablation 更全面。
如何通过删除、修正、重加权、counterfactual examples、重新训练和随机删除 baseline 来验证数据归因。
面向 NLP 的样本级归因方法比较:gradient similarity、influence functions 与 TracIn,以及它们的假设和局限。
面试中解释 training-data attribution 论文的叙事模板:研究问题、方法、贡献、局限和博士阶段扩展。