语言链条上的对齐:当大模型学会用英语的智慧说母语的话

栏目:教育 | 来源:科技行者 | 2026-09-09 20:13

你有没有用过一些国产大模型,用中文问它问题,它却突然冒出一句英文?或者更离谱的是,中文回答倒是回答了,但你能感觉出这个回答是先用英语想好、再硬翻译过来的,读起来怪怪的,甚至逻辑都有点绕。

这不是你的错觉。这是当前几乎所有大语言模型都在偷偷面对的一个难题。

先说一个可能颠覆你认知的事实:现在市面上主流的大模型对齐技术,几乎全部建立在英语数据上。所谓"对齐",通俗讲就是教模型什么样的回答是好回答、什么样的是差回答,让它学会讨好人类的偏好。可这套教学法几乎清一色用英语教材写成,等模型要用中文、韩语、印尼语这些语言回答问题时,它其实是在用一套从没被系统训练过的语言体系,硬套着从英语里学来的审美标准在说话。

这篇论文的作者来自韩国高丽大学,他们盯上了这个问题,提出了一个叫CRPO的新方法,试图让模型把它在英语世界里学到的"好品味",原封不动地搬到中文、韩语这些语言里去。

问题到底难在哪

先说说现在大家是怎么解决这个问题的。

最直接的思路是砸钱做人工标注,找母语者给每种语言单独标注一套偏好数据。这个办法当然有效,但贵得离谱,而且没法覆盖世界上几千种语言。

第二种思路是把英语的偏好数据集机器翻译成目标语言,和英语数据混在一起训练。这个办法便宜很多,但有个致命缺陷:它没法让模型把自己在英语里"练出来的直觉"真正用到目标语言上。模型在两种语言里的知识,始终是脱节的,两套系统各自为战。

论文里举了一个特别扎心的例子。用户拿中文问一个对齐过的模型:"你对人工智能的未来有什么看法?"结果出现三种情况。

第一种,模型直接用英文回答了,这叫"语言不匹配"。第二种,模型倒是老老实实用中文回答了,但内容质量很差,比如一本正经地胡说"机器人会取代所有工作,人类只能休息",这是"语言匹配但质量低"。第三种,也就是论文里CRPO方法训练出来的模型,既用中文回答,内容也扎实靠谱,这才是真正理想的状态。

你发现问题了吗?现有方法往往只能解决"说哪种语言"的问题,却解决不了"说得好不好"的问题,或者反过来,提升了质量却顾不上语言一致性。这两件事纠缠在一起,谁都很难两头兼顾。

CRPO的核心思路:排出一个四人名次

CRPO的全称是Cross-lingual Ranking Preference Optimization,跨语言排序偏好优化。

它的起点是一个叫DPO的经典对齐方法。

DPO*:Direct Preference Optimization,直接偏好优化,是目前最流行的大模型对齐技术之一。它的做法很简单,给模型看一对回答,一个"好"一个"差",让模型学会把好的那个的概率往上提,差的那个往下压,不需要单独训练一个奖励模型,也不需要复杂的强化学习流程。

DPO简单高效,但它有个天生的局限,它只能处理二选一的比较。而CRPO想同时解决两个维度的问题,语言对不对,质量好不好,二选一的框架根本装不下这么多信息。

于是研究者们把目光投向了另一个领域,信息检索里的"学习排序"技术。

Learning-to-Rank*:学习排序,原本是搜索引擎领域的技术,核心思想不是简单比较两个结果谁更好,而是给一整个候选列表排出名次,越靠前的结果权重越大,排错位置的惩罚也越重。

具体来说,CRPO为每一条训练数据构造了四个回答:目标语言的好回答、目标语言的差回答、英语的好回答、英语的差回答。然后给这四个回答定了一个严格的名次:

目标语言好回答排第一,英语好回答排第二,目标语言差回答排第三,英语差回答排第四。

这个排序设计初看有点反直觉。为什么英语的好回答要排在目标语言差回答的前面?按常理不应该是先分语言,语言对的都排在前面,语言不对的都排在后面吗?

这恰恰是CRPO最精妙的地方。研究者们发现,如果一味强调语言优先,模型很容易走捷径,只学会了"说对语言"这件事,却没有真正把质量的差异学进去。让英语好回答的名次高于目标语言差回答,相当于告诉模型:光说对语言不够,内容也得跟上,哪怕是另一种语言里的高质量范本,也比本语言里敷衍了事的回答更值得学习。

这就像一个厨师带徒弟。徒弟本来只会做家乡菜,厨师手把手教了他一道法式料理做得极其精致。现在徒弟要转做家乡菜了,厨师完全可以只让徒弟对着家乡菜的样本练,做得难吃就骂,做得好就夸。但如果厨师告诉徒弟,你做的这道难吃的家乡菜,连我教你的那道精致法餐都不如,那是在逼徒弟明白一件事:好菜的标准是相通的,不是换了个菜系审美就能降低。如果不这么做会怎样?徒弟可能很快学会了用家乡菜的食材,但审美标准始终没提上来,做出来的东西能吃但不精致,这正是那些只做"语言适配"却没做"质量对齐"的方法最终掉入的陷阱。

论文里也做了严谨的对比实验来验证这个排序设计。他们试过一个更"直觉"的版本,让英语好回答的名次故意排在目标语言差回答之后,结果发现除了斯瓦希里语这种极低资源语言,在中文、韩语、印尼语、孟加拉语上,这种设计反而表现更差。这说明,过度强调语言匹配,牺牲质量对齐,是要付出代价的。

数学上怎么实现这套排序

这套排序思想具体怎么变成模型能学习的损失函数,论文借鉴了搜索排序领域一个叫LambdaLoss的经典框架。

LambdaLoss*:一种"学习排序"框架,核心机制是给每一对比较打一个权重,这个权重取决于这两个结果在整个排序列表里的位置,如果排序被打乱得越严重,惩罚就越重。

具体来说,每一对回答之间的比较权重,由三个因素共同决定:两者"相关性"差距有多大、两者在当前排序里的位置差多远。这个权重会重点惩罚那种"高价值回答被挤到后面去"的情况,因为在搜索排序里,把最好的结果放在第一页远比放在第十页重要得多。

论文里还探索了三种不同的权重计算方式,分别叫LambdaRank、nDCG2和nDCG2++,它们对"排序位置"这件事的敏感程度略有不同。实验发现这三种方式都比传统的二选一比较效果好,证明了这套排序框架本身的普适性,而不是靠某一个具体公式的巧合。

DCG*:Discounted Cumulative Gain,折损累计增益,是信息检索里衡量排序质量的经典指标,核心逻辑是排名越靠前的好结果贡献越大,越靠后贡献越小。

最终,CRPO的完整损失函数由两部分组成,一部分是常规的语言建模损失,用来保证目标语言回答本身的流畅度,另一部分就是刚才说的排序损失,两者按一个可调节的比例混合。

实验结果:五种语言,全面胜出

光有理论不够,得看实际效果。

研究团队选了五种资源丰富程度不同的语言来测试:中文、印尼语、韩语这些相对资源丰富一些的语言,以及斯瓦希里语、孟加拉语这类资源稀缺的语言。他们用了三个基础模型,Llama-2-7B、Llama-3-8B和Mistral-7B,分别在这五种语言上做对齐训练,然后跟两个对照组比较。

第一个对照组叫SFT+DPO,就是最朴素的做法,拿目标语言的偏好数据直接做传统DPO训练。第二个对照组叫CLO,一种更精巧一点的方法,把英语回答设为"差"、目标语言回答设为"好",做二选一比较,专门用来抑制模型说英语的倾向。

结果在AlpacaEval*:一个专门评估大模型对话能力的评测集,包含805个来自不同来源的问题,通过让模型的回答和参考答案做质量对比,算出一个"胜率"分数。这里用的是它的多语言版本。

一个方法主动生成对话回答,拿去和SFT模型的回答比较胜负,算出胜率上,CRPO几乎在所有语言和模型组合上都拿到了最高分。以Llama-3-8B为例,在斯瓦希里语上,SFT+DPO的胜率只有46.95%,CLO更是掉到44.93%,而CRPO直接冲到62.17%,足足高出了15个百分点以上。在孟加拉语上差距更夸张,SFT+DPO是36.89%,CRPO是55.65%,几乎翻了一倍的提升幅度。

更值得琢磨的是,论文发现在低资源语言上,其他方法反而会出现"崩溃"现象。Llama-3-8B在孟加拉语上用CLO训练之后,性能比不训练还差,这说明当模型对某种语言的语言基础掌握得还不够扎实时,单纯靠二选一的偏好优化很容易把模型带偏,训练变得不稳定。而CRPO凭借那套"参照英语锚点"的排序结构,反而在这些困难场景里表现出更强的韧性。

这个现象让我想起学外语这件事。一个刚学韩语没多久的人,如果直接被丢进纯韩语的高强度辩论训练,很容易因为基础不牢而彻底乱了阵脚,越练越差。但如果给他一个参照物,比如让他先想清楚用母语该怎么表达这个观点,再对照着把逻辑框架搬到韩语里,反而能学得更稳。CRPO里那对平行的英语偏好数据,起的正是这个参照锚点的作用。如果去掉这个锚点,模型在语言基础薄弱的场景里就失去了依靠,这正是SFT+DPO和CLO在低资源语言上崩盘的原因。

除了对话能力,论文还测了模型的知识运用能力,用了两个评测集。

MMMLU*:Multilingual Massive Multitask Language Understanding,多语言大规模多任务语言理解测试,是MMLU基准的多语言版本,涵盖57个学科领域,题目由人工翻译成各语言,用来检验模型能不能在目标语言语境下调用自己的世界知识。

Belebele*:一个专门测多语言阅读理解能力的评测集,给模型一段短文和一个问题,让它从四个选项里挑出正确答案。

在这两项测试里,CRPO同样表现亮眼。以Llama-3-8B为例,印尼语的MMMLU得分,CRPO比最强的对照组高出超过4分,韩语的Belebele得分更是冲到68.66分。这说明CRPO不只是让模型学会了嘴上说目标语言,也真正把内在的知识体系稳稳地锚定在了目标语言的语境里。

拆开模型的大脑:奖励和概率都变好了

胜率数字说明了结果,但研究者们没有止步于此,他们还想弄清楚,CRPO到底是怎么在模型内部起作用的。

他们分析了两个内部指标:一个是"奖励差异",就是模型给"好回答"打的分减去给"差回答"打的分;另一个是"好回答的对数概率",也就是模型生成那个理想回答的可能性有多大。

结果发现一个很有意思的现象。SFT+DPO和CLO这两种方法,虽然也能拉开好回答和差回答之间的奖励差距,但仔细看对数概率分布,会发现好回答被生成的概率其实没怎么提升,跟没训练之前几乎一样。这说明这些方法主要是靠"打压差回答"来拉开差距的,而不是真正让模型更愿意生成好回答。

这里有一个偏好优化领域公认的风险:如果模型只学会了压低差回答的概率,却没有真正把好回答的生成概率提上去,模型的语言流畅度和稳定性反而可能被破坏,长远来看容易导致输出退化。

CRPO在这方面表现明显不同,它同时把好回答的对数概率和整体奖励差异都往上推了。这就好比训练一个跳高运动员,有的教练只会不停批评他跳得差的那几次,却没告诉他怎样才能真正跳得更高。运动员确实会因为怕挨骂而减少失误,但他的真实实力并没有提升。如果比赛现场情况有变,这种只靠"避免失误"练出来的选手很容易露怯。CRPO更像是那种既纠正失误、也扎实提升技术动作的教练,运动员的真实水平是实打实涨上去的。

为了让这个结论更有说服力,研究团队还找了一个独立的外部裁判,叫Skywork-Reward-V2-Qwen3-8B,一个专门支持多语言场景打分的奖励模型,拿它给各个方法生成的回答单独打分。结果在Mistral-7B的印尼语场景里,SFT+DPO的平均得分是负的0.037,几乎在及格线徘徊,CRPO直接冲到0.805,差距相当悬殊。这从一个完全独立于训练过程的视角,再次印证了CRPO确实让生成质量有了实打实的提升,而不是自说自话的数字游戏。

写在后面

读这篇论文的时候,我一直在想一个问题:为什么"用英语的好品味去带目标语言"这件事,以前很少有人这么明确地做出来?

其实答案可能藏在一个容易被忽略的细节里。论文的消融实验显示,如果把权重打乱,故意让英语好回答的名次低于目标语言差回答,模型在大多数语言上反而表现更差,唯独在斯瓦希里语这个几乎所有大模型都学得最吃力的低资源语言上,这种"强行纠正语言"的粗暴做法短暂占了上风。这个反常的例外挺耐人寻味的,它暗示着当一门语言的基础实在太薄弱时,连"参照英语锚点"这种精细手段可能都不够用,模型可能连锚点本身都够不着。这大概也是论文里提到的,未来想尝试根据语言相似度动态调整权重的原因。

还有一点让我意外,论文专门测了训练之后模型的英语能力有没有因此下降,这个现象在业内叫对齐税,意思是你想提升一个方面的能力,结果连累了原本擅长的方面。结果CRPO不仅没让英语变差,反而在大多数情况下英语的胜率也比其他方法更高。这其实说明了一件更深层的事:让模型同时兼顾英语和目标语言的排序结构,并不是在两者之间做减法式的取舍,而更像是一种互相拉扯着往上走的关系。这跟很多人对"多语言能力此消彼长"的直觉预期是相反的。

这篇论文没有解决的问题也很明显,它测试的五种语言里,像斯瓦希里语这样真正的低资源语言表现依然是最不稳定的那个。当一门语言在互联网语料里本来就稀缺,模型对它的语言基础理解本身就单薄,再精妙的排序结构恐怕也很难无中生有地补齐这块短板。这大概才是接下来真正难啃的骨头。

Q&A

Q1:CRPO是什么方法?

A:CRPO全称Cross-lingual Ranking Preference Optimization,是一种跨语言排序偏好优化框架,通过给目标语言和英语的好坏回答排出一个四层名次,让模型把英语里学到的偏好知识迁移到目标语言的对齐训练中。

Q2:CRPO和传统的DPO对齐方法有什么区别?

A:DPO只能做两个回答之间的二选一比较,CRPO则借鉴信息检索里的排序技术,同时对目标语言好回答、英语好回答、目标语言差回答、英语差回答四者进行排序优化,能同时兼顾语言一致性和内容质量。

Q3:CRPO在低资源语言上表现怎么样?

A:CRPO在斯瓦希里语、孟加拉语这类低资源语言上表现出明显的稳定性优势,其他方法容易出现性能崩溃的情况,而CRPO凭借参照英语偏好结构的设计,能有效抵抗这种训练不稳定问题。

了解更多

猜你想看

← 返回首页