一个数字。
74.7个百分点。
不是通胀率,不是失业率,是IBM上周发的一篇论文里的核心发现:在同一道数学题、同一个正确答案的前提下,仅仅因为题目的措辞不同,大语言模型的准确率波动幅度,平均是74.7个百分点。
这意味着什么?
意味着你看到的每一份模型排行榜,每一次"A模型以93%击败B模型的91%"的结论,都建立在一个荒谬的假设上——出题方式只有一种,这一种能代表所有。
它不能。

IBM Research的团队做了一件简单到几乎令人恼火的事:他们把现有benchmark的题目换了个说法。
不是改题目。不是改答案。只是换一种问法。
他们管这个框架叫BenchDrift。具体操作是沿着四个轴——语言风格、指涉对象、语用场景、结构排列——对同一道题生成一系列"含义不变、答案不变、措辞变了"的版本。然后让模型做。
拿微软的Phi-4在GSM8K小学数学测试上的表现来说。
它的官方报告分数:93.4%。好成绩。接近满分。如果你是个企业采购负责人,这个数字可能会让你觉得:嗯,这模型的数学能力很强,可以放心用。
但BenchDrift发现的是——
如果每道题只要有一种措辞答对就算对,准确率是99.2%。
如果每道题必须所有措辞都答对才算对,准确率掉到38.2%。
61个百分点的窗口。而93.4%这个"官方分数",恰好坐在窗口的顶端附近。
让我再说一遍:同一个模型,同一套题,同一组正确答案,只是问法不同,成绩可以是接近满分,也可以是不及格。
你觉得93.4%代表的是哪一个现实?

传统benchmark的工作原理极其朴素:一道题配一种措辞。整个评测集可能有几千道题,但每道题的表述只有一个版本。模型在这一个版本上答对了,就算会了。
这就好比你测试一个人的英语水平,只用一句话考:
"What is the capital of France?"
他答对了。你说他英语流利。
但如果你换个问法:"Could you kindly inform me which city serves as the seat of government for the French Republic?"
他懵了。
你还会说他英语流利吗?
BenchDrift证明的就是这件事——只不过发生在数学、常识推理和多学科知识三个领域,跨越八个主流大语言模型。而且情况比上面的类比更诡异。
这是论文里最反直觉的发现。
你可能以为:模型越强,对措辞变化的抵抗力越好。毕竟能力强意味着真正理解了问题,不会被表面文字干扰。
事实恰好相反。
BenchDrift发现了一条清晰的规律(Pearson相关系数0.98,几乎完美线性):模型的基线准确率越高,它因措辞变化而丢分的幅度就越大于因措辞变化而得分的幅度。
翻译成人话就是——
弱模型本来就答不对很多题,换个说法反而可能"碰巧"触发了正确思路。所以对弱模型而言,换措辞是个正面彩票:答错的题可能变对,答对的题丢得不多。
强模型则正好反过来。它本来就答对了绝大部分题。换个说法?对不起,它没什么新题可以"碰巧"答对了,但它确实有大量"本来答对的题"会因为措辞变化而突然崩溃。
Mistral-7B在MATH-Hard上就是典型的弱模型案例:正向漂移(答错变答对)37.6%,负向漂移(答对变答错)只有9.0%。它在基准措辞下被低估了。
而GPT-OSS-20B和Phi-4——GSM8K上最强的两个模型——在最差措辞下双双跌破40%。它们在基准措辞下被高估了。
这引出一个令人不安的推论:
排行榜上排名第一的模型,从定义上讲,就是那个分数最依赖于"碰巧出题措辞对它有利"的模型。
你以为你在看实力排名。你实际上在看运气排名。

也许你会想:模型自己不是有个"置信度"指标吗?如果一个答案模型自己都不确定,丢了也就丢了。但如果模型90%以上确定这个答案是对的,那它应该稳得住吧?
BenchDrift测了这个。
结果:在最高置信度区间里,仍然有18.5%的正确答案被一次含义不变的措辞重写击垮。
18.5%。
不是边缘答案。是模型最有把握的那些答案。将近五分之一。
各模型的数据分布在13%到26%之间,但没有一个例外。无论你用的是什么模型,它"最确定"的答案里,都有相当比例会因为你换一种方式问同样的问题而翻车。
论文的原话冷冰冰的:"模型的置信度无法用来判断哪些正确答案能在重述后存活。"
这里有一个很容易被忽略的发现。
你可能以为:某些模型特别脆弱,某些模型特别稳健。选"稳健"的模型不就行了?
BenchDrift告诉你:不行。
因为脆弱性不属于模型,它属于重述方式本身。
八个模型在"哪些重述方式最具杀伤力"这件事上高度一致。虽然不同模型的绝对漂移幅度有差异,但它们被同样的措辞变换打倒。就像八个不同身高的人站在同一片流沙上——有人陷得深一些有人浅一些,但流沙是同一片。
这意味着问题出在benchmark的"单一措辞"设计本身,而不是某个特定模型的缺陷。你换一个模型,不能解决这个问题。你需要换一把尺子。
也许你会觉得:好吧,学术论文嘛,总要找点问题来研究。现实中谁在乎?
我在乎。你也应该在乎。原因有三。
这直接影响你的购买决策。
企业花几十万甚至几百万部署一个大模型,选哪个模型很大程度上看benchmark分数。"这个模型在MMLU上比那个高3个百分点"——这种差距在IBM的实验里完全可以被措辞变化淹没。你花了大价钱买的可能只是"碰巧在这套措辞下表现更好的模型",而非真正更强的那一个。
这动摇了整个"模型越来越好"的叙事。
我们被告知模型在一代代进步。GPT-4比GPT-3.5强,Claude 3比Claude 2强,Gemini 3比Gemini 2强。证据?benchmark分数在涨。但如果分数本身就不稳定,如果同一模型在不同措辞下的波动幅度远远大于代际之间的进步幅度——那我们怎么确定"进步"是真实的,而不是措辞选择造成的幻觉?
Stanford AI Index 2026年报告提到:GSM8K的无效题目率高达42%,Arena排行榜的排名"可能部分反映对平台的适应而非通用能力"。BenchDrift的发现恰好补了另一块拼图:即便题目有效、答案正确,分数仍然不稳定。
这暗示了一个更深层的问题:模型到底"懂"了什么。
模型可能并没有在"理解"数学题。它在匹配措辞模式。
如果理解了,那换一种问法不应该影响答案。1+1=2,不管你用什么语言、什么句式、什么语气问,答案都是2。一个真正理解了加法的智能体不会因为你用了"请问"开头就算错。
但大语言模型会。
这不是在贬低大语言模型。它们很有用。在很多实际场景下效果惊艳。但BenchDrift告诉我们的是:我们对它们的"理解"能力到底有多深这件事的判断,可能严重偏离了真实情况。benchmark给了我们一个关于"AI已经学会了什么"的故事,但这个故事的可信度比我们以为的低得多。

IBM并非唯一一个发出警报的。
今年2月,Meta的研究团队发布了一个叫Brittlebench的框架,做的是类似的事——给benchmark题目施加语义保留的扰动,看模型表现怎么变。
他们的发现:
- 语义保留扰动导致性能平均下降12%
- 一个单一扰动在63%的情况下就能改变模型之间的相对排名
63%。
你看到的"A模型比B模型强"的结论,有超过一半的概率可以被一次措辞调整推翻。
而且Brittlebench还发现了一个有趣的事:推理(chain-of-thought)在某些条件下反而会放大脆弱性,而非缓解。你让模型"想一想再答",它有时候想多了反而更容易被措辞带偏。
我不认为排行榜是坏东西。比较模型需要某种标准化方法。问题在于我们怎么读它。
BenchDrift论文最后的建议很实在:不要只报告单一措辞分数。报告一个区间——最差到最佳。或者至少报告一个漂移率(负向漂移多少,正向漂移多少),让读者知道这个分数有多"脆"。
这就像天气预报不只告诉你明天气温28度,还告诉你可能在24到32度之间波动。一个带置信区间的分数比一个精确到小数点后一位的"假精确"数字有用得多。
但更现实的建议是给你——读排行榜的人:
不要在乎3-5个百分点以内的差距。 BenchDrift证明这种差距完全可以被措辞选择解释掉。它不代表模型实力差距。
用你自己的措辞测模型。 你的用户不会用benchmark的原文来提问。用你自己的数据、你自己的表述去测。这是唯一能告诉你"这个模型在我的场景下表现如何"的方法。
测多种表述。 同一个问题换三种不同说法去问。如果三种说法都答对,这才是稳健的能力。如果只有某一种说法答对,那是运气,不是能力。
我们一直以为benchmark在测模型的"智力"。BenchDrift告诉我们,它可能只在测模型对"考试原文"的记忆力。
93.4%的分数背后,可能是一个38.2%的现实。
而排行榜第一名,可能只是那个"碰巧没被这套措辞难住"的幸运儿。
下次看到有人拿benchmark分数说事,你可以把这篇文章转给他。然后问一句:
"这个93%,是哪种93%?"

评论区
欢迎留下你的看法,支持匿名评论。
你的评论会公开展示,建议填写便于交流的昵称,并尽量提供有信息量的反馈。