· Xiaojing Yang · NLP and LLMs
LLM Evaluation and Failure Modes
LLM 评估风险图:幻觉、prompt 敏感性、偏见、污染和脆弱 benchmark。
LLM 评估风险图:幻觉、prompt 敏感性、偏见、污染和脆弱 benchmark。
为什么 NLP 评估需要指标、不确定性、人类判断和任务特定错误分析。
为什么当 full fine-tuning 太贵或不稳定时,LoRA 和 adapters 会有价值。
Prompting 既是任务说明,也是接口设计和评估风险。
机器翻译、摘要和许多生成任务背后的 encoder-decoder 思想。
Tokenization 是 NLP 里的第一个建模决定:它决定模型能看见什么单位、稀有术语如何表示,以及多语系统如何处理领域语言。