【大模型的】aha moment:不是装腔作势 内部信息量暴增;数倍

2025-07-22 00:18:55      来源:上海热线

刘勇,中国人民大学,长聘副教授,博士生导师,国家级高层次青年人才。长期从事机器学习基础理论研究,共发表论文100余篇,其中以第一作者/通讯作者发表顶级期刊和会议论文近50篇,涵盖机器学习领域顶级期刊JMLR、IEEETPAMI、ArtificialIntelligence和顶级会议ICML、NeurIPS等。

你肯定见过大模型在解题时「装模作样」地输出:「Hmm…」、「Wait,letmethink」、「Therefore…」这些看似「人类化」的思考词。

但一个灵魂拷问始终存在:这些词真的代表模型在「思考」,还是仅仅为了「表演」更像人类而添加的语言装饰?是模型的「顿悟时刻」,还是纯粹的「烟雾弹」?

现在,实锤来了!来自中国人民大学高瓴人工智能学院、上海人工智能实验室、伦敦大学学院(UCL)和大连理工大学的联合研究团队,在最新论文中首次利用信息论这把「手术刀」,精准解剖了大模型内部的推理动态,给出了令人信服的答案:

当这些「思考词」出现的瞬间,模型大脑(隐空间)中关于正确答案的信息量,会突然飙升数倍!

这绝非偶然装饰,而是真正的「信息高峰」与「决策拐点」!更酷的是,基于这一发现,研究者提出了无需额外训练就能显著提升模型推理性能的简单方法,代码已开源!

论文题目:DemystifyingReasoningDynamicswithMutualInformation:ThinkingTokensareInformationPeaksinLLMReasoning

论文链接:https://arxiv.org/abs/2506.02867

代码链接:https://github.com/ChnQ/MI-Peaks

核心发现一:揭秘大模型推理轨迹中的「信息高峰」现象

研究者们追踪了像DeepSeek-R1系列蒸馏模型、QwQ这类擅长推理的大模型在解题时的「脑电波」(隐空间表征)。他们测量每一步的「脑电波」与最终正确答案的互信息(MutualInformation,MI),并观察这些互信息如何演绎变化。

惊人现象出现了:模型推理并非匀速「爬坡」,而是存在剧烈的「信息脉冲」!在特定步骤,互信息值会突然、显著地飙升,形成显著的「互信息峰值」(MIPeaks)现象。这些峰值点稀疏但关键,如同黑暗推理路径上突然点亮的强光路标!

这意味着什么?直觉上,这些互信息峰值点处的表征,模型大脑中那一刻的状态,蕴含了更多指向正确答案的最关键信息!

进一步地,研究者通过理论分析证明(定理1&2),推理过程中积累的互信息越高,模型最终回答错误概率的上界和下界就越紧,换言之,回答正确的概率就越高!

既然互信息峰值的现象较为普遍地出现在推理模型(LRMs)中,那么非推理模型(non-reasoningLLMs)上也会表现出类似的现象吗?

为了探索这一问题,研究者选取了DeepSeek-R1-Distill系列模型和其对应的非推理模型进行实验。如上图橙色线所示,在非推理模型的推理过程中,互信息往往表现出更小的波动,体现出明显更弱的互信息峰值现象,且互信息的数值整体上更小。

这表明在经过推理能力强化训练后,推理模型一方面似乎整体在表征中编码了更多关于正确答案的信息,另一方面催生了互信息峰值现象的出现!

核心发现二:「思考词汇」=「信息高峰」的语言化身

那么,这些互信息峰值点处的表征,到底蕴含着怎样的语义信息?

神奇的是,当研究者把这些「信息高峰」时刻的「脑电波」翻译回人能看懂的语言(解码到词汇空间)时,发现它们最常对应的,恰恰是那些标志性的「思考词」:

反思/停顿型:「Hmm」、「Wait」…

逻辑/过渡型:「Therefore」、「So」…

行动型:「Let」、「First」…

例如,研究者随机摘取了一些模型输出:「Wait,letmethinkdifferently.Let’sdenote...,」「Hmm,soImusthavemadeamistakesomewhere.Letmedouble-checkmycalculations.First,...」

研究团队将这些在互信息峰值点频繁出现、承载关键信息并在语言上推动模型思考的词汇命名为「思考词汇」(thinkingtokens)。它们不是可有可无的装饰,而是信息高峰在语言层面的「显灵」,可能在模型推理路径上扮演着关键路标或决策点的角色!

为了证明这些tokens的关键性,研究者进行了干预实验,即在模型推理时抑制这些思考词汇的生成。

实锤验证:实验结果显示,抑制思考词汇的生成会显著影响模型在数学推理数据集(如GSM8K、MATH、AIME24)上的性能;相比之下,随机屏蔽相同数量的其他普通词汇,对性能影响甚微。这表明这些存在于互信息峰值点处的思考词汇,确实对模型有效推理具有至关重要的作用!

启发应用:无需训练,巧用「信息高峰」提升推理性能

理解了「信息高峰」和「思考词汇」的奥秘,研究者提出了两种无需额外训练即可提升现有LRMs推理性能的实用方法。

应用一:表征循环(RepresentationRecycling-RR)

启发:既然MI峰值点的表征蕴含丰富信息,何不让模型「多咀嚼消化」一下?

方法:在模型推理过程中,当检测到生成了思考词汇时,不急于让其立刻输出,而是将其对应的表征重新输入到模型中进行额外一轮计算,让模型充分挖掘利用表征中的丰富信息。

效果:在多个数学推理基准(GSM8K、MATH500、AIME24)上,RR方法一致地提升了LRMs的推理性能。例如,在极具挑战性的AIME24上,DeepSeek-R1-Distill-LLaMA-8B的准确率相对提升了20%!这表明让模型更充分地利用这些高信息量的「顿悟」表征,能有效解锁其推理潜力。

应用二:基于思考词汇的测试时扩展(ThinkingTokenbasedTest-timeScaling-TTTS)

启发:在推理时如果允许模型生成更多token(增加计算预算),如何引导模型进行更有效的「深度思考」,而不是漫无目的地延伸?

方法:受启发于前人工作,作者在模型完成初始推理输出后,如果还有token预算,则强制模型以「思考词汇」开头(如「Therefore」、「So」、「Wait」、「Hmm」等)继续生成后续内容,引导模型在额外计算资源下进行更深入的推理。

效果:当token预算增加时,TTTS能持续稳定地提升模型的推理性能。如图所示,在GSM8K和MATH500数据集上,在相同的Token预算下,TTTS持续优于原始模型。在AIME24数据集上,尽管原始模型的性能在早期提升得较快,但当token预算达到4096后,模型性能就到达了瓶颈期;而TTTS引导下的模型,其性能随着Token预算的增加而持续提升,并在预算达到6144后超越了原始模型。

小结

这项研究首次揭示了LRMs推理过程中的动态机制:通过互信息动态追踪,首次清晰观测到LRMs推理过程中的互信息峰值(MIPeaks)现象,为理解模型「黑箱」推理提供了创新视角和实证基础。

进一步地,研究者发现这些互信息峰值处的token对应的是表达思考、反思等的「思考词汇」(ThinkingTokens),并通过干预实验验证了这些token对模型推理性能具有至关重要的影响。

最后,受启发于对上述现象的理解和分析,研究者提出了两种简单有效且无需训练的方法来提升LRMs的推理性能,即表征循环(RepresentationRecycling-RR)和基于思考词汇的测试时扩展(ThinkingTokenbasedTest-timeScaling-TTTS)。

研究者希望这篇工作可以为深入理解LRMs的推理机制提供新的视角,并进一步提出可行的方案来进一步推升模型的推理能力。

  据介绍,根据气象监测情况,今年4月下旬以来,全省平均降水量26.6毫米,较常年同期偏少75%,截至6月13日,大部分地区连续无有效降水日数超60天,郑州等10个地市在70天以上;平均气温23.2度,较常年同期偏高1.8度。

责编:汤嘉怡编辑

再来两张成毅

  另外,近些年受经济下行、大规模减税降费、楼市土地市场低迷等影响,地方财政收入受到一定冲击,而刚性支出有增无减。在财政收支矛盾不断加大的背景下,地方政府也有更大的动力加强征管,查漏补缺,依法依规征收该征收的税费。当然,税务部门也要同时落实落细减税降费政策,坚守不收“过头税费”红线。

成毅去钓鱼了

  “当年李娜一度手握13个国内外知名品牌代言,而郑钦文在奥运夺冠之前已有10个代言品牌。”纪宁认为,网球目前在中国的热度已今非昔比,李娜时代已奠定的中国网球经济的热度,在郑钦文夺冠后会被逐渐引爆。纪宁还表示,网球作为全球顶级的职业体育和商业体育项目,正逐步释放巨大的产业经济空间。

歌手顺序

  美团数据也显示,7月以来,“网球”搜索量同比去年增长超60%。网球体验课、网球培训季度课包在平台热销,美团上网球运动相关团购订单量同比激增172%。

美国型钻地弹仅次于核武器

  据介绍,全省夏收工作6月7日基本结束,夏粮丰收已成定局。夏播工作从5月28日大面积展开,截至6月13日,已播种面积7915.2万亩,夏播工作大头落地。初步统计,目前全省因旱不能播种面积323万亩,若未来持续无有效降水,夏播进度将会进一步放慢。

周深的近视眼用到点上了

  在四川之前,河南、内蒙古、浙江、江西的省级党委科技委员会已经亮相。河南、吉林和四川的省委科技委员会,都是由省委书记和省长担任主任。

歌手排名

  数据显示,免签对入境游的促进效果显著。春秋旅游副总经理周卫红此前表示,自中国对多国单方面免签以来,对入境游市场起到积极的推动作用,让来自更多客源地的境外游客能够以更便捷的方式来到中国。/p>

工人跪地哀求主管别开除

  6月13日、14日,河南多地发布人工增雨公告。提醒:任何组织和个人若发现未爆炸或爆炸不完全弹头、弹药碎片或火箭弹残骸,切勿擅自移动、藏匿、拆解和损毁等,请立即报告当地政府或人工影响天气有关部门,或者立即拨打110向当地公安部门报警。/p>

伊朗玩抽象

  中国驻英国使馆发言人13日表示,英方有关制裁是没有国际法依据的单边主义行径,中方坚决反对,已向英方提出严正交涉。英国政府罔顾国内国际民意,不断火上浇油,助长战事延绵不绝、生灵涂炭,致使和平更加遥遥无期。