IBM BenchDrift论文发现:在同一道数学题、同一个正确答案的前提下,仅仅因为题目的措辞不同,大语言模型的准确率波动幅度平均是74.7个百分点。排行榜第一名可能只是碰巧没被这套措辞难住的幸运儿。
模型发布会的成绩单该怎么看?从代码、工具、专业领域到通用智能,梳理19项主流AI benchmark到底在测什么。