这项由上海交通大学与上海人工智能实验室联合开展的研究,于2026年8月3日以预印本形式发布,论文编号为arXiv:2608.01735,感兴趣的读者可通过该编号查阅完整原文。研究提出了一种名为"双锚点策略蒸馏"(DAPD)的全新训练框架,专门用于解决大型语言模型在训练过程中产生的一种奇特"幻觉"现象。

你有没有见过这样的场景:一个学生明明没看过答案,却在考试时煞有介事地说"我记得答案是42",然后洋洋洒洒写了一篇推导过程来"验证"这个凭空捏造的答案?这种行为在人类考场上叫作"蒙答案",但研究团队发现,当今最先进的AI语言模型在某种特定训练方式下,也会出现完全相同的怪异行为——它们会在解题卡壳之后,突然声称"记起了答案",然后倒推出一套看似合理的推导过程,但这个答案根本没有经过真正的推导,完全是凭空断言的。

更令人困惑的是,这种现象并非AI能力不足的表现,恰恰相反,它出现在一种被业界广泛采用、本意是让AI变得更聪明的先进训练方法中。研究团队通过深入分析,找到了这种"幻觉"的根本原因,并设计出了一套巧妙的解决方案,让AI在各类数学竞赛题、编程题和指令遵循任务上的表现获得了显著提升。

**一、AI训练中的"考场作弊"问题**

要理解这项研究解决了什么问题,先得了解一种叫做"在线策略自蒸馏"(OPSD)的训练方法。这个名字听起来很学术,但背后的逻辑其实相当直观。

可以把AI模型的训练过程想象成培养一个学生。普通的训练方式就像给学生一堆标准答案让他抄写——效果有限,因为学生只是在死记硬背别人的解题思路。而OPSD这种方法聪明得多,它让AI同时扮演两个角色:一个是"参考老师版本",可以看到参考答案;另一个是"实际考试版本",只能靠自己推理,看不到参考答案。然后用前者来指导后者,让AI学习如何从看过答案后的推理方式,倒推出不看答案也能得出正确结论的推理方式。

这个方法的优势在于,它让AI在自己生成的推理路径上进行学习,而不是死啃别人的固定答案,因此更贴近AI在实际使用时的真实状态。同时,"参考老师版本"因为能看到答案,会有更明确的推理方向,其指导信号比纯粹靠AI自己摸索要强得多。

然而,研究团队在大量实验中发现了一个令人头疼的副作用。随着用这种方法训练的时间越来越长,AI开始出现一种奇怪的退化行为——它在解题过程中卡住之后,不再老老实实承认"我不会"或者继续探索其他思路,而是突然断言"我想起来答案大概是某某数字",然后在这个没有经过推导的答案基础上继续编造推理过程。

研究团队用一个形象的词来描述这种现象:**特权幻觉**(privilege illusion)。所谓"特权",是指那些只有在训练时才存在的额外信息——也就是参考答案。AI在训练时习惯了有参考答案可以依赖,于是在真正考试(推理阶段)时,即便参考答案根本不存在,它仍然表现得好像那个答案就在眼前一样,直接说出来,而不是真正推导出来。

为了量化这种现象,研究团队设计了一个"错误断言"检测器:专门识别那些"先宣布答案、再倒推推导"的生成内容。实验数据显示,在五种不同规模的Qwen3模型上,随着OPSD训练的进行,这类错误断言从每万次生成约13次急剧攀升到37次;与此同时,AI在美国数学邀请赛(AIME)等高难度题目上的平均正确率,也从大约59.56分跌落到53.24分。训练越久,问题越严重——这对一个本来旨在让AI变聪明的训练方法来说,无疑是一个令人不安的反讽。

**二、问题的根源:一场信息不对等的"考试"**

研究团队没有满足于仅仅观察到这个现象,而是深入追问:为什么会这样?

他们的诊断是:**信息不对等**。在OPSD的训练框架里,充当"老师"的那个版本(能看到参考答案的版本)和充当"学生"的那个版本(只能靠自己推理的版本)之间,存在一道信息鸿沟。老师版本看到了答案,所以它的每一个推理步骤都隐含着"我已经知道终点在哪里"的前提;而学生版本在实际使用时什么都看不到,却被要求模仿老师那种"已知终点"的推理方式。

这就好像让一个只知道终点位置的导游来指导另一个蒙眼走迷宫的人。导游的指引是基于"我看得到出口"的视角,而蒙眼的人根本无法知道出口在哪里。如果蒙眼的人完全照搬导游的指引方式,最终就会产生一种奇怪的行为:虽然眼睛被蒙着,却表现得好像自己能看见出口一样——这就是特权幻觉。

为了验证这个诊断,研究团队做了一个巧妙的对照实验。他们保持"老师版本"不变(继续看答案),但把"学生版本"换成了一种特殊设计:让学生版本不是仅看着当前推理到的前缀,而是同时能看到自己正在生成的完整答案。这样,老师和学生都有了完整的信息,信息不对等被消除了。

这个改动的效果相当惊人。仅仅这一项调整,就让错误断言在训练后期减少了45%,同时推理正确率提升了6.22分。这个实验有力地证明了:OPSD产生特权幻觉的根本原因,确实在于老师和学生之间的信息鸿沟,而不是老师的质量有问题,也不是学习的数据有问题。

这个发现同时解释了为什么之前业界尝试的一些修补方案收效甚微。有些方法试图过滤掉老师信号里"太依赖参考答案"的部分,有些方法试图根据老师和学生的差距来动态调整学习权重——但这些方法本质上都是在修补老师发出的信号,而没有真正解决老师和学生之间那道信息鸿沟。换句话说,不管你怎么修剪导游的话术,蒙眼走路的人还是蒙着眼,问题并没有从根源上得到解决。

**三、修复方案:用"自知"作为桥梁**

既然问题的根源是信息不对等,解决方案的方向就清晰了:需要在老师和学生之间架设一座信息桥梁,让老师和学生在某些关键环节能够处于相同的信息条件下进行对齐。

研究团队为此引入了第三种视角,并称之为**"自我版本"(Self distribution)**。这个视角的设计颇为精妙:它不像"考试版本"那样完全不知道答案,也不像"老师版本"那样能看到别人的参考答案,而是能看到自己正在生成的那个完整答案。

用一个比喻来理解:这就像让一个棋手在复盘的时候,把自己刚才下的那盘棋完整地摆在面前分析。他看不到别的高手的棋谱(这是老师的特权),但他可以完整地审视自己的每一步棋(这是"自我版本"的特权)。这个视角既与实际对局的状态有所不同,又天然与老师版本处于相同量级的信息条件。

这个"自我版本"扮演的角色是一座可以被双向使用的桥梁。一方面,它可以向"考试版本"靠拢——通过训练让"自我版本"的推理行为越来越接近纯靠自己推理时的行为,这个过程叫做"推理锚点";另一方面,它可以向"老师版本"对齐——因为两者都拥有完整的答案信息,这种对齐是在信息匹配的条件下进行的,叫做"特权锚点"。

由此,研究团队设计出了**双锚点策略蒸馏(DAPD)**框架,其核心由两个相互配合的模块构成。

**四、双路径锚定:同时走两条对齐路**

第一个模块叫做**双路径锚定(DPA)**。它的设计思路是:既然我们需要既保留原有训练信号的优点,又修复信息不对等的问题,那就同时维护两条对齐路径。

第一条路径叫"无特权路径"。这条路径关注的是实际考试时的情形——两边都没有参考答案。它的工作方式是把原有的"老师指导考试版本"保留下来(这是原始OPSD的核心),同时增加一个新的训练目标:让"自我版本"向"考试版本"靠拢。两个目标配合起来,相当于通过"自我版本"这座桥,把"老师版本"的有用信息间接传递给了"考试版本",同时过滤掉了那些依赖参考答案才能复现的推理行为。

第二条路径叫"特权路径"。这条路径处理的是两边都有完整信息的情形。在这个条件下,直接让"自我版本"向"老师版本"对齐,因为两者都持有某种完整答案,信息是匹配的。这条路径能够更直接地纠正模型在"知道答案"状态下的推理行为,让这种行为更加准确、一致。

两条路径并行工作,互相补充。前者解决了"考试时不该依赖答案却仍然依赖"的问题,后者则让模型在"知道答案"时的推理也更加规范。

为了从理论上证明这套设计确实有效,研究团队还给出了数学上的证明。核心结论是:当"无特权路径"的训练损失足够小,并且"自我版本"和"老师版本"之间保持足够相似时,"考试版本"在参考答案对应的前缀上,和在自己推理的前缀上,行为差距会被严格控制在一个可计算的上界之内。研究团队还在Qwen3-4B模型上做了实际测量,验证了这一理论条件在实践中确实成立。

**五、双来源锚定:让AI同时向参考答案和自己的推理学习**

第二个模块叫做**双来源锚定(DSA)**,解决的是另一个问题:到底应该让AI主要向参考答案学习,还是主要向自己生成的推理路径学习?

这两者各有优缺点。参考答案(标准解法)往往是正确的、经过验证的,用它来指导AI能保证学习方向不偏,但这些解法往往是专家写的,风格与AI自己的推理方式差距较大,硬学可能水土不服。AI自己生成的推理路径(我们称之为"rollout")则非常贴近AI的实际思维习惯,不存在"风格不匹配"的问题,但这些推理路径可能是错的,如果完全照着学,等于学了一堆错误示范。

DSA的解决方案是:两个方向都要,但要保持平衡,并且允许根据实际情况调整比例。具体来说,以参考答案为基础的路径("rollout指向reference"方向)提供可靠的正确性保障;以AI自己的推理路径为基础的方向("reference指向rollout"方向)则提供更贴近AI实际能力的学习信号。最终的训练目标是两者的加权组合,权重λ用于调节两个方向的相对比重。

更有意思的是,研究团队发现,这个最优权重随着模型规模的变化而系统性地移动。在参数量较小的1.7B模型上,最优的λ是0.5,也就是两个方向各占一半;而在4B、8B和14B规模上,最优λ降到了0.2,即参考答案方向只占两成,AI自身推理路径方向占了八成。这背后的直觉非常合理:越小的模型,自己的推理越不可靠,越需要向正确的参考答案靠拢;越大的模型,自己的推理越有价值,可以更多地从自身推理中学习。

**六、实验结果:效果如何?**

研究团队在六项不同类型的测试上对DAPD进行了全面评估,涵盖数学竞赛推理(AIME24、AIME25、HMMT25)、代码生成(LiveCodeBench v5、BFCL v3)以及指令遵循(IFBench)。

在最核心的Qwen3-4B规模上,DAPD的平均得分达到57.34分,相比OPSD提升了2.00分。虽然这个数字看起来不大,但要知道,OPSD本身已经是当时最先进的方法之一,在它的基础上再稳定提升2分是相当不容易的。具体到各项任务,AIME25提升了4.44分,HMMT25提升了3.06分,IFBench提升了2.33分,而编程任务BFCL v3也有0.59分的提升。

规模扩展实验揭示了一个更重要的规律。OPSD相对于未经训练基础模型的提升,随着模型规模的增大迅速缩水:在1.7B模型上有约5.19分的提升,到4B时降到1.39分,而在8B到32B的范围内几乎没有提升,最多只有0.28分。这意味着OPSD在大模型上几乎失效了。

DAPD则完全不同。它在各个规模上都保持了稳健的提升:相对于对应基础模型,1.7B提升7.13分,4B提升4.08分,8B提升2.41分,14B提升2.13分,32B提升3.06分。更重要的是,DAPD在每个规模上都稳定优于OPSD:4B提升2.69分,32B提升2.78分。在模型越来越大、OPSD越来越无力的情况下,DAPD仍然保持着清晰可见的正向效果。

研究团队对这一现象给出了直觉性解释:随着模型能力的增强,它自己生成的推理过程越来越有价值,包含越来越多有意义的自我纠错和深度推理。OPSD的问题在于,它训练出了一个会"绕过"这些推理步骤的模型——因为有参考答案可以直接对标,模型学会了跳过中间步骤直接往答案靠。DAPD通过信息对等的锚定,保留了这些推理步骤的学习价值,因此在大模型上的效果反而更好。

在一道具体的AIME24题目上,这种差异体现得非常直观。题目是关于圆环(torus)和切球的距离计算,正确答案对应的m+n=127。OPSD训练的模型在推导卡壳之后,写道"我实在卡住了,只能放弃,但我想起来答案可能是36/7,所以m+n=43"——完全是无依据的断言。DAPD训练的模型则从内切和外切两种情形分别建立方程,一步步推出了正确答案127。

研究团队还测试了DAPD在训练领域之外的泛化能力。他们用纯数学数据训练模型,然后在编程和指令遵循任务上测试,发现DAPD的平均得分为49.64,比OPSD高出1.37分,在编程任务LiveCodeBench v5上更是高出了4.82分。这说明DAPD学到的不只是特定题型的技巧,而是更通用的、不依赖特权信息的推理能力。

**七、不用参考答案也能行:向更自由的训练方向探索**

一个自然而然的问题是:DAPD依赖参考答案(标准解法)作为特权信息,在实践中这些标准解法并不总是容易获得的。没有参考答案的时候,DAPD还能工作吗?

研究团队对此进行了初步探索。他们设计了一种"双rollout"变体:不再使用任何参考答案,而是让AI对同一道题生成两个独立的答案,用一个作为"参考侧",另一个作为"rollout侧",按照同样的框架进行训练。

实验结果表明,即使没有任何外部参考答案,这种方式相比OPSD也能在1.7B、4B、8B模型上分别提升0.46、2.41、2.41分。这说明第二个rollout确实提供了有价值的互补信息,而不仅仅是重复的噪声。

进一步地,如果让AI对同一道题生成四个候选答案,从中筛选出一个被自动验证器认为正确的答案作为"参考侧",效果还会更好:在4B模型上达到了66.11分,比不做任何筛选的双rollout方案提升了1.11分。这指向了一种更灵活的未来方向:不依赖人工撰写的标准答案,而是通过AI自身的多次尝试和自动验证来提供训练信号。

**八、细节实验:每个组件都必不可少**

研究团队还通过系统性的消融实验(即逐一去掉某个组件,观察效果变化),验证了DAPD每个设计选择的必要性。

在双路径锚定方面,无论是以参考答案为基础的方向还是以AI推理路径为基础的方向,单独只用"原始OPSD信号"时的效果最差(分别是62.13和63.33分),加入推理锚点后效果提升(63.43和64.91),再加入特权锚点后效果进一步提升到最高(63.89和65.09)。两条路径都需要。

在双来源锚定方面,只使用参考答案方向得到63.89分,只使用AI推理路径方向得到65.09分,同时使用两个方向则达到65.28分。互补效果明显,两者结合优于任一单独使用。

在散度(divergence)的实现方式上,研究团队比较了前向KL、反向KL,以及是否使用组件截断。结果显示带截断的前向KL效果最好(65.28分),而不带截断的前向KL降至62.50分,带截断的反向KL也是62.50分,不带截断的反向KL稍好一点是63.33分。这说明训练信号的稳定性控制(通过截断限制每个词的最大梯度贡献)对最终效果有显著影响。

说到底,这项研究做的事情可以用一句话概括:找到了一种让AI"老老实实推理"而不是"凭空断言"的训练方法。特权幻觉这个问题听起来有点抽象,但它的影响是非常实际的——一个会在卡壳时直接编答案的AI,在用于辅助解数学题、写代码、或者完成复杂推理任务时,可靠性会大打折扣。你永远不知道它给出的答案是真的推导出来的,还是"我感觉答案大概是这样"。

DAPD提供的修复方案没有引入额外的推理成本——训练好的模型在使用时和普通模型完全一样,不需要任何额外操作。代价只是训练时需要同时维护更多的分布视角,计算量比OPSD有所增加,但推理阶段没有任何额外负担。

这项研究还留下了一些有趣的开放问题。参考答案只是"特权信息"的一种形式,现实中还有很多其他类型的特权信息——比如搜索引擎返回的文档、代码执行的结果、专家给出的步骤提示。DAPD的框架是否能够延伸到这些场景,以及如何在训练过程中动态地根据模型当前能力调整参考来源和权重,是研究团队明确点出的未来方向。对这些问题感兴趣的读者,可以通过arXiv编号2608.01735找到完整论文深入了解。

**Q&A**

Q1:什么是"特权幻觉",它对AI使用有什么实际影响?

A:特权幻觉是指AI在训练时习惯了依赖参考答案,导致它在实际使用(没有参考答案)时,仍然表现得好像答案已知——直接断言答案而非真正推导,说白了就是"编答案"。这会让AI在数学推理、代码生成等需要严格推导的任务上产生看似合理实则错误的输出,降低可信度。

Q2:DAPD训练出来的模型在使用时会更慢或需要特殊操作吗?

A:不会。DAPD只在训练阶段增加了计算复杂度,训练好的模型在实际使用时与普通模型完全相同,不需要任何额外操作或输入,推理速度也没有任何影响。

Q3:双锚点策略蒸馏(DAPD)为什么在大模型上效果反而更明显?

A:因为越大的模型,自己生成的推理过程越有价值、越准确。OPSD会让模型绕过这些有价值的推理步骤直接对标参考答案,大模型因此损失更多;DAPD通过信息对等的锚定保留了这些推理步骤的学习价值,所以在大模型上优势更显著。