· Xiaojing Yang · Multilingual AI · 1 min read

Multilingual AI as a System Problem

A research note framing multilingual AI beyond translation: data, tokenization, evaluation, domains, language variation, and deployment constraints.

中文导读

如果只把 multilingual AI 理解为“多语言翻译”,会太窄。真实系统里,语言差异会出现在数据、tokenization、检索、评估、术语、文化语境和部署约束里。

Working outline

  1. Multilingual AI vs machine translation
  2. Language coverage and data imbalance
  3. Tokenization and representation gaps
  4. Domain terminology and low-resource settings
  5. Evaluation across languages
  6. What I learned from English—Norwegian petroleum MT

Reference materials to digest

My angle

This category lets me write about MT when useful, without making the entire blog look like it only covers machine translation.

Share:
Back to Blog

Related Posts

View All Posts »
Research & ApplicationsMultilingual AIEN

Why LoRA Fits Low-Resource Domain Adaptation

A research-facing explanation of why LoRA is a good fit for low-resource domain machine translation: controlled adaptation, lower experimental cost, and reduced overfitting risk.

Research & ApplicationsMultilingual AI中文

LoRA 领域适配中的数据规模实验

如何研究领域数据规模对 LoRA 机器翻译适配的影响:数据多少才够,什么时候收益递减,什么时候是数据质量问题。