· Xiaojing Yang · NLP and LLMs
NLP 中的 Transformers
Transformers 如何组合 self-attention、feed-forward layers、residuals 和位置信息。
Transformers 如何组合 self-attention、feed-forward layers、residuals 和位置信息。
离散语言如何变成向量空间,以及句向量为什么对检索和评估重要。
A practical explanation of LoRA for NMT: what it changes, why it is useful for domain adaptation, and how it differs from full fine-tuning.