7000种语言,大模型只学会了100种

2026.08.07 20:23
全球首个专为意第绪语构建的开源8B语言模型MameLoshnLM诞生,在评测中击败Llama 3.1和Gemma 2等通用多语言模型。论文同时揭示了多语言语料库mC4中意第绪语数据被大量污染的事实,为全球低资源语言NLP提供了一份可复制的技术模板。

全球现存超过7000种语言,但大模型能流畅对话的,大约只有100种。剩下的98%,在AI的版图上几乎是一片空白。意第绪语,这门拥有千年文学传统、曾孕育过肖洛姆-阿莱赫姆和艾萨克·巴什维斯·辛格的语言,正是这片空白中最具讽刺意味的案例。它的历史文本遗产远比它的网络足迹丰富。当研究人员翻遍互联网上标注为“意第绪语”的公开语料时,他们发现了一个令人不安的事实:大部分数据,根本就不是意第绪语。

从“母语”到模型:一个命名背后的追问

2026年8月,一篇题为《MameLoshnLM: Yiddish Language Model and Evaluation Benchmark》的论文被语言建模顶会COLM 2026接收。五位来自以色列、波兰和美国的学者——Uri Katz、Omer Goldman、Tomasz Limisiewicz、Reut Tsarfaty和Noah A. Smith——联手发布了全球首个专为意第绪语构建的开源8B参数语言模型。

“MameLoshn”在意第绪语中意为“母语”,字面义即“母亲的语言”。这个命名本身就是论文最核心的追问:对于一种在数字世界中几乎隐形、却拥有深厚文学传统的语言,什么样的模型才配得上被称为“母语者”?

论文的核心贡献不仅在于模型本身。它同时构建了两块此前缺位的基石。

第一块基石是Oytser,意第绪语意为“宝库”。这是一个高质量的意第绪语预训练语料库,从9个来源聚合了34.63万份文档,总计9.15亿词、52.8亿token。其中占比最大的来源是Yiddish Book Center(意第绪语图书中心)的1.23万册数字化书籍,贡献了7.23亿词,占语料库的79%。除此之外,还有来自Ivelt和Kaveshtiebel等意第绪语论坛的讨论帖、《Forward》等意第绪语新闻媒体的文章、维基百科条目、社区报纸,甚至包含希伯来圣经的意第绪语译本。

第二块基石是Kashes,意第绪语意为“问题”。这是一个多任务评测基准,涵盖翻译、语言学分析、信息抽取和语言理解,填补了意第绪语NLP长期缺乏可靠评测标准的空白。

在Kashes的14项评测中,MameLoshnLM以平均分62.6的成绩,击败了同规模的Gemma-2 9B(57.0分)、Llama 3.1 8B(56.8分)和Qwen3 8B(54.7分)。它的优势集中在意第绪语特有的任务上:词性标注、依存句法分析、音译,以及两个命名实体识别任务。

mC4的“语言垃圾场”

论文的一个关键贡献,是对现有最大规模多语言语料库mC4中的意第绪语部分进行了一次地毯式审计。mC4是Google基于Common Crawl构建的覆盖101种语言的万亿token级语料,66亿页面、6.3万亿token,被广泛用于多语言模型的预训练。但其中意第绪语标签下的14.37万页内容,来自7621个不同域名,全部由CLD3语言识别器标注。

研究者发现,mC4的意第绪语部分存在两个严重问题。希伯来语被大量误标为意第绪语,因为两种语言共用希伯来字母书写系统,仅靠语言识别器很难区分。同时,大量机器翻译内容混入其中:某些网站自动为所有页面生成数十种语言版本,意第绪语版本不过是机器翻译的产物。

研究者对数百个域名和采样页面进行了人工审查,结果令人警醒:噪声数据占据了相当大的比例。这意味着,任何在mC4上训练的多语言模型,在“意第绪语”任务上的表现,很可能建立在大量虚假数据之上。

多语言模型的“虚假繁荣”

这一发现指向了一个更深层的结构性问题。当前主流的多语言模型——Llama 3、Gemma 2、Qwen 3——虽然都宣称支持数十种语言,但它们的“多语言能力”在低资源语言上的表现,往往是泡沫。

论文的分析部分提供了一个精妙的验证。研究者对比了MameLoshnLM与通用多语言模型在loshn-koydesh词汇层上的产出能力。Loshn-koydesh是意第绪语中源自希伯来-阿拉米语的词汇层,是意第绪语区别于德语的核心特征之一,好比中文里的“文言成分”在现代白话语中的地位。

结果令人震惊。通用多语言模型在翻译任务中系统性低估了loshn-koydesh词汇的使用频率。当原文中出现传统意第绪语词汇时,Llama 3.1 8B和Gemma-2 9B倾向于将其替换为德语同源词或更通用的表达,丢失了意第绪语特有的词汇质感。同样的非母语模式也出现在意第绪语特有的形态学特征上,比如前缀变化和动词屈折模式。

研究者指出,这种模式与mC4的数据质量审计结果完全一致。当模型在大量噪声数据(希伯来语误标、机器翻译)上训练时,它学到的“意第绪语”本质上是一种被污染的语言变体,无法准确捕捉真正的意第绪语词汇和形态特征。这不是模型能力的问题,而是数据根基的问题。

从“文学宝库”到“母语者”

MameLoshnLM的解决方案在技术上并不复杂。它在Llama 3.1 8B的基础上,使用Oytser语料库进行了继续预训练。训练数据包含34.63万份文档、52.8亿token,其中79%来自Yiddish Book Center的高质量文学作品,其余来自当代网络来源。

这种“文学+网络”的组合策略是有意为之。Yiddish Book Center的数字化藏书代表了意第绪语文学的黄金时代,从19世纪末到20世纪中叶,意第绪语曾是东欧犹太人的日常语言,产生了丰富的小说、诗歌、戏剧和新闻作品。而Ivelt和Kaveshtiebel等论坛则捕捉了当代意第绪语在使用中的真实面貌,包括英语借词、现代术语和口语化表达。

论文的实验部分还测试了一个有趣的问题:在训练数据中混入德语(意第绪语的近亲语言)数据,是否有助于提升模型性能?结果显示,混合德语数据对意第绪语任务的提升有限,甚至在某些任务上产生负面影响。这一发现进一步验证了论文的核心论点:对于低资源语言,数据质量远比数据量更重要。与其从近亲语言“借”数据,不如专注于筛选和构建该语言本身的高质量语料。

被AI遗忘的98%,谁来拯救?

MameLoshnLM的诞生,意义远超一个8B参数模型本身。

它为意第绪语NLP建立了基础资源设施。在此之前,意第绪语在NLP领域的地位几乎是“被遗忘的角落”,没有专门的评测基准,没有高质量的预训练语料,研究者只能依赖多语言语料库中充斥着噪声的“意第绪语”子集。Oytser和Kashes的发布,意味着未来的意第绪语NLP研究有了可依赖的基线。

更重要的是,MameLoshnLM提供了一份可复制的模板。论文的整套方法,审计算法语料库的噪声、构建高质量领域语料、设计多任务评测基准、在开源基座模型上继续预训练,可以适用于任何面临类似困境的语言。从非洲的约鲁巴语、斯瓦希里语,到亚洲的藏语、缅甸语,再到全球数百种面临数字灭绝威胁的少数民族语言,这套方法论都有直接的参考价值。

论文被COLM 2026接收,也标志着学术界对低资源语言NLP的重视正在从边缘走向主流。意第绪语不是第一门被“拯救”的低资源语言,但它用自己千年文学传统和当代数字困境之间的巨大反差,向整个AI行业提出了一个尖锐的问题:当大模型不断刷新基准测试纪录时,我们是否正在用7000种语言中的6900种,换取100种语言上的极致表现?

意第绪语有一句古老的谚语,来自著名语言学家Max Weinreich在1945年的一次讲座:“A shprakh iz a dyalekt mit an armey un a flot”,一种语言,就是拥有军队和海军的一个方言。MameLoshnLM没有军队,也没有海军,但它给了这门千年语言一样更珍贵的东西:在AI时代被数字世界看见的权利。

作品声明:内容由AI生成