大模型的参数与能力维度

一份讲”参数到底意味着什么、智能由哪些维度构成、为什么同一批模型的跑分会互相打架”的解读。

所有数字都锚定到 2026-08-31 实时抓取的一手来源(论文原文、官方技术报告、榜单官网、知名技术作者文章)。必须保留英文原话的地方,我会在前面写明谁在什么场合说的、在后面给一段人话翻译,不会只丢一段原文给你。

不写代码,不堆公式。你只需要先记住一句话:“这个模型有多少参数”和”这个模型有多能干”,中间隔着差不多五层。


0. 先厘清:厂商宣传里的五个数字,各管各的

看模型介绍时你会同时看到好几个数字,它们经常被混着用,但它们回答的是完全不同的问题:

数字它回答的问题它不能回答什么
总参数量(total parameters)这个模型有多大?要多少显存?每生成一个字要多少算力
激活参数(activated parameters)每生成一个字,真正参与计算的有多少?模型有多聪明
训练 token 数喂了多少数据?数据质量如何
上下文窗口(context window)一次能塞进去多少字?塞进去之后还能正常思考多少
榜单分数在某张卷子上考了多少?在其他卷子上考多少

一个生活化的类比:总参数量像”公司有多少员工”,激活参数像”每个项目实际投入几个人”,训练 token 数像”员工累计培训时长”,上下文窗口像”一个人一次能同时看多少页材料”,榜单分数像”某次考试的成绩”。这五件事互相有关,但你没法从”员工多”直接推出”项目做得好”。

先把这五个数字分开,剩下的就好懂了。


1. 参数(Model Parameters)到底是什么

1.1 一个不用公式的说法

模型处理文字时,会先把文字切成一串 token(词元),每个 token 变成一组数字。接下来的每一步计算,都是把这些数字乘上一批权重、加总、过一次变换,最后输出”下一个字最可能是谁”。

这些权重就是参数。训练的全部内容,就是不断微调这些数字——让模型对”下一个字是什么”的预测越来越准。训练结束后,模型”知道”的一切,全部编码在这些数字里,没有别的地方,没有外挂的知识库。

所以参数量衡量的不是”有多聪明”,而是**“有多少个可以调节的旋钮”**。旋钮越多,能拟合的模式就越复杂。这是理解后面所有内容的基础。

1.2 参数里装的是什么

三件事要分清:

第一,参数里存的不是文件,不是数据库条目。 它存的是高度压缩、分布式的模式——你没法从里面”检索”出一条事实,只能让模型把它”生成”出来。这个区别在第 4 节会变得非常关键。

第二,存储量有硬上限。 朱泽园 Allen-Zhu 与李远志 Li 的论文《Physics of Language Models 3.3》(知识容量缩放定律论文)用受控合成数据测出:语言模型能且只能每参数存储 2 bits 知识,即使量化到 int8 也成立。论文摘要原文:

“language models can and only can store 2 bits of knowledge per parameter, even when quantized to int8 … Consequently, a 7B model can store 14B bits of knowledge, surpassing the English Wikipedia and textbooks combined based on our estimation.”

这句话有两部分。前半句是上限——“能且只能”(can and only can)是关键词,2 bits 是天花板不是平均值,训练不足时根本达不到。后半句是换算——1 bit 约等于一个”是/否”的最小信息单位,14B bits 大致相当于能存下 17.5 亿字节的纯事实信息。作者的估算认为这超过英文维基百科加教科书的总和。

但先别兴奋。 一个 7B 模型理论上”装得下”全世界的知识,不代表它”用得上”——第 4 节会用一个让人很不舒服的实验说明这一点。

第三,数据质量本身就是杠杆。 同一篇论文发现:在训练数据开头加个域名前缀(比如 wikipedia.org),模型的知识容量就会明显提升。作者的解释是模型能自己识别并优先从知识密集的来源学习。换句话说,同样一批数据,“怎么喂”会影响”能喂进去多少”。

1.3 参数量怎么换算成显存

一个够用的估算式:显存 ≈ 总参数量 × 每个参数占几个字节。

精度每参数字节数7B 模型大约需要
FP16 / BF16214 GB
FP8 / INT817 GB
INT40.53.5 GB

⚠️ 编号勘误提醒:网络上常把”2 bits/参数”这条结论误标成 arXiv 2309.02427。实际上 2309.02427 是《Cognitive Architectures for Language Agents (CoALA)》,讲智能体架构的,跟知识容量毫无关系。正确编号是 2404.05405。 这类错误在中文技术文章里非常多,引用前务必核对标题和编号是否对得上。


2. 为什么会有”激活参数”(Activated Parameters)这个数字

2.1 稠密模型的死约束

在 2020 年之前的主流模型(稠密模型,dense model)里,有一条几乎无法打破的等式:

参数量 = 每生成一个字所需的算力

模型里所有的权重,每生成一个字都要全部用一遍。想把模型变大 10 倍,推理成本就跟着涨 10 倍。这让”堆参数”这件事在商业上很快碰到天花板。

2.2 混合专家(Mixture of Experts, MoE)怎么打破它

混合专家 的思路其实很朴素。一个 Transformer 模型里,参数最集中的地方是前馈网络(FeedForward, FFN)那一层。MoE 的做法是:把这个 FFN 复制成很多份(每份叫一个”专家”),然后每个 token 只挑其中几个来用。

技术作者 Sebastian Raschka 的说法最好懂:

“The core idea in MoE is to replace each FeedForward module in a transformer block with multiple expert layers … The router then selects only a small subset of experts for each token. This is how an MoE model can have a high total parameter count without using all of these parameters for every inference step.”

把模型里最占参数的那一层复制成 N 份,再配一个”路由器”(router)来决定每个 token 走哪几份。这样一来,模型的总参数可以做得很夸张,但每处理一个字只需要动用其中一小部分。原文最后那句 “without using all of these parameters for every inference step” 就是整个设计的目的。

三条必须记住的细节:

  1. 路由是逐 token 的。 Raschka 原话:“Two neighboring tokens can therefore use different experts.”(相邻的两个 token 因此会走不同的专家。)也就是说,同一个句子里前后两个字,处理它们的可能是完全不同的两组参数。
  2. 有”共享专家”(shared expert)恒激活。 总有几个专家对每个 token 都跑,专门承载所有人都要用的通用知识。剩下那些才是”专才”。
  3. 当前没被激活的专家不是废物。 它们只是这一轮用不上——下一个 token 很可能就会路由到它们。

“专家”这个词会骗人。 别以为存在一个”数学专家”、一个”语文专家”。Raschka 特别提醒:“Experts do not necessarily separate into clean human categories… Specialization can overlap and may vary across layers or training stages.”(专家不一定会按人类理解的学科分开,分工可能重叠,也可能随层数和训练阶段变化。)

2.3 一个具体的样本:DeepSeek-V3

DeepSeek-V3 是讲这件事最好的例子,因为它的技术报告把每个数字都写清楚了:

项值
Transformer 层数61(前 3 层是稠密的,后 58 层才是 MoE)
每层专家1 个共享专家 + 256 个路由专家
每个 token 激活8 个路由专家 + 1 个共享专家 = 9 个
最终结果671B 总参数,每 token 只用 37B
上下文128K
训练成本278.8 万 H800 GPU 小时(约 557.6 万美元)

怎么读这张表:这个模型有 6710 亿个参数,但每处理一个字,只动用其中约 370 亿个。剩下那 6000 多亿不是”没用”,而是”这一轮用不上,但别的字会用到”。这就是”总参数”和”激活参数”两个数字并存的由来。

2.4 记账规则(这一节最值得记住)

Raschka 给了一条被全行业反复引用的记账规则:

“Use total parameters to estimate checkpoint storage and device capacity. Use active parameters as a first approximation of per-token compute. Use an actual benchmark to determine speed.”

三句话,三个用途,别混用。

  • 总参数 → 用来估算”要多少显存、模型文件多大、能不能塞进这张卡”
  • 激活参数 → 用来粗略估算”每生成一个字要多少算力”(注意是粗略)
  • 真实速度 → 只能靠实测跑分,前两个都推不出来

他还有一句更精炼的总结:“‘active parameters’ is a compute claim, not a memory claim.”(激活参数是一个算力声明,不是一个显存声明。)

一个能让人立刻清醒的对比:Mixtral 8x7B 的激活参数只有 13B,如果按激活参数算,BF16 精度下只需要约 26 GB 显存——但它的实际权重需要 93 GB。差了 3.6 倍。你要部署它,得按 93 GB 准备机器,不是 26 GB。

2.5 一个常见错误:比值不等于”专家数 ÷ top-k”

很多人会这么算:“256 个专家选 8 个,那激活比例就是 8/256 = 1/32,所以 671B 里只用了 21B。” 这是错的。

原因:模型里只有 FFN 那一层被稀疏化了。注意力层(attention)、嵌入层(embedding)、归一化层、输出头——这些对每个 token 都老老实实跑一遍,一点没省。

Raschka 给了正确的算术。假设共享部分是 S,每层有 8 个专家、每个专家 P 个参数、每次选 2 个:

  • 总参数 ≈ S + 8P(8 个专家全都要存)
  • 激活参数 ≈ S + 2P(只跑 2 个)

比值是 (S+8P)/(S+2P),不是 8÷2 = 4。 共享部分 S 越大,这个比值就越小,稀疏化的收益就越有限。

2.6 “37B 激活 = 37B 稠密模型”?这句话不成立

这是本文要纠正的核心误解。MoE 的能力夹在两个稠密模型之间,而且这个区间是有实证的,不是推测:

边界证据来源
下界:强于同激活量的稠密模型DeepSeekMoE 145B 达到 DeepSeek 67B 稠密模型的性能,但只用 28.5% 的算力DeepSeekMoE论文
上界:弱于同总参数的稠密模型DeepSeekMoE 2B “nearly approaches the performance of its dense counterpart with the same number of total parameters, which set the upper bound of MoE models”(几乎追平同总参数的稠密模型,而这个稠密模型设定了 MoE 的能力上界)DeepSeekMoE论文

一个”激活 37B 的 MoE”,比一个真正的 37B 稠密模型要强(因为它背后有 671B 的参数池可选),但比不上一个 671B 稠密模型(如果真训得出来的话)。它落在这两者中间。

Raschka 的直接反驳更加彻底:

“a model with 22 billion active parameters does not necessarily behave like a dense 22-billion-parameter model. The two models can have different attention dimensions, numbers of layers, expert shapes, memory access patterns, and kernels.”

一个”激活 220 亿参数”的模型,不一定表现得像一个”220 亿参数的稠密模型”。因为两者的注意力维度、层数、专家形状、内存访问模式、计算内核都可能完全不同——激活参数只是一个加总数字,它抹掉了所有这些细节。

所以正确的说法是:激活参数决定的是算力,不是能力。

2.7 那”激活参数小”是不是就等于便宜?也不完全

三个容易踩的坑:

  • 大批量推理时优势会消失。 Raschka 原话:“One batch may collectively touch many experts even though each individual token uses only a few.”(一个批次放在一起可能会碰到几乎所有专家,尽管每个单独的 token 只用了几个。)意思是:你一次性处理 1000 个 token,这 1000 个 token 合起来很可能把 256 个专家全跑了一遍——省下来的算力又花回去了。
  • 小批量时也不划算。 批量大小为 1 时,可能为了处理一两个字,而要把整个专家的权重从显存里读出来。读取权重的开销比计算本身还大。
  • 通信变成了新的瓶颈。 一句流传很广的总结:“MoEs trade dense compute for sparse compute—but replace it with dense communication.”(MoE 用稀疏计算换掉了稠密计算,代价是换来了稠密通信。)因为 token 被路由到不同专家,这些专家往往分布在不同 GPU 上,把结果来回搬运就成了新的开销。

结论:MoE 存在一个”中间最优 batch 区间”。 批量太小,权重读取摊不平;批量太大,稀疏优势消失。这也是为什么 MoE 在云端大规模服务上划算,在个人单卡上未必。

2.8 2026 年的趋势:激活占比越来越低

模型总参数激活参数占比
Mixtral 8x7B(2024-01)47B13B27.7%
DeepSeek-V3(2024-12)671B37B5.5%
Qwen3.5-397B-A17B(2026-02)397B17B4.3%
DeepSeek-V4-Pro(2026-04)1.6T49B3.1%

趋势很清楚:模型越做越大,但每个 token 真正动用的比例越来越小。研发方向已经从”堆总参数”转向”让每个 token 用得更少、选得更准”。

⚠️ 数据可信度提醒:上表的总/激活参数来自官方公告或官方模型卡;但专家配置多为社区整理,官方未公布(Qwen3.5、DeepSeek-V4 均如此)。另外,搜索这类信息时你会遇到大量”2026 开源大模型 TOP10 榜单”,其中把 DeepSeek-V4 写成 671B/28B、Kimi K2.5 写成 200B/20B——这些与官方数字严重冲突,是 AI 生成的垃圾内容,不要采信。


3. 参数量怎么变成智能:缩放定律(Scaling Law)与它的三次修正

“参数越多越聪明”这句话不是拍脑袋来的,它有一条定量规律支撑,叫缩放定律(Scaling Law)。但这六年里它被修正了三次,每一次修正都改变了对”参数重要性”的判断。

3.1 第一版:参数最重要(2020)

Kaplan缩放定律论文 的第一个发现是:模型的损失(loss,可以理解为”预测错了多少”)随参数量、数据量、算力呈**幂律(power-law)**下降,而且跨越七个数量级都成立。

幂律是什么意思? 不是”投入增加一倍,产出增加一份”,而是”投入翻一个固定倍数,产出改善一个固定台阶”。所以从 1B 到 10B 的收益,和从 10B 到 100B 的收益是同一个量级——这就是为什么这条路能一直走下去,而不是很快就饱和。

论文的第二条结论更著名,原文两句:

“Larger models are significantly more sample-efficient, such that optimally compute-efficient training involves training very large models on a relatively modest amount of data and stopping significantly before convergence.”

“Big models may be more important than big data.”

大模型”学得更省”——同样的数据,大模型能榨出更多东西。所以在算力固定的情况下,最优策略是把模型做得很大,数据只喂相对少量,而且在远没收敛时就停手。第二句”大模型可能比大数据更重要”,就是这条研究路线最重要的一句理论背书。

按这个结论,算力涨了应该主要用来加参数(论文给出的配比是参数 ∝ 算力^0.73,数据 ∝ 算力

3.2 第二版:参数和数据要五五开(2022)

两年后,DeepMind 的 Chinchilla计算最优论文 用 400 多个模型重做实验,发现 Kaplan 的实验设计有个漏洞:所有模型都训了同样多的 token,等于人为限制了数据的贡献,结论自然偏向”参数更重要”。

修正后的结论,原文:

“We find that current large language models are significantly undertrained … the model size and the number of training tokens should be scaled equally: for every doubling of model size the number of training tokens should also be doubled.”

当时所有大模型都严重训练不足(significantly undertrained)。正确的做法是参数和数据等比例放大——模型每翻一倍,训练数据也要翻一倍。

实证:用和 Gopher(280B 参数)相同的算力,改训一个 70B 参数 / 1.4T tokens 的 Chinchilla,MMLU 从 60.0% 涨到 67.6%。参数少了 4 倍,成绩反而更好。

这就是行业内那句”约 20 tokens/parameter”的来历(来自 Chinchilla 自己的 70B ÷ 1.4T 配置)。

3.3 第三版:产业界反其道而行之——过训练(over-training)

Chinchilla 优化的是”训练算力固定的情况下,损失最低”。但厂商真正关心的是另一件事:推理成本。

  • 训练是一次性支出
  • 推理是持续的,随用户量线性增长

于是为了压低长期成本,过训练(over-training) 成了行业标配。Epoch AI 的定义:

“Overtrained models are those that are trained on more data than what is prescribed by compute-optimal scaling laws. Holding training compute constant, overtrained models are more efficient during inference (because they have fewer parameters), at the cost of more data usage and somewhat lower performance.”

过训练的模型 = 喂了超过”计算最优”所需的数据量。在训练算力相同的前提下,这类模型因为参数更少,推理时更便宜;代价是消耗了更多数据,而且性能会稍微差一点。这是拿”训练时多花”换”服务每个用户时少花”。

Llama 3 团队自己说得非常直白:

“While our scaling laws suggest our flagship model is an approximately compute-optimal size for our training budget, we also train our smaller models for much longer than is compute-optimal. The resulting models perform better than compute-optimal models at the same inference budget.”

旗舰模型我们按计算最优来做;但小模型我们故意喂得远超最优值。结果就是——同样的推理预算下,这些过训练的小模型比计算最优的模型表现更好。

Epoch AI 还给了一个参照系:“Llama 3-70B 被过训练了 10 倍”(overtrained by 10x)。

模型参数训练 tokenstokens/param
Chinchilla(理论基准)70B1.4T20
Llama 3 405B(旗舰)405B15.6T约 38.5(接近计算最优)
Qwen3 系列(235B 档)235B36T(全系列共用)约 153
Qwen2.5 系列(72B 档)72B18T(全系列共用)约 250
phi-11.3B6B + 1B 合成约 5.4(低于最优线,靠数据质量取胜)

还有一条完全不同的路线:不是所有小模型都靠”喂更多”取胜。微软的 phi-1 只有 1.3B 参数,配比远低于 Chinchilla 的 20,靠的是”教科书质量”的筛选数据——它的论文标题就叫《Textbooks Are All You Need》。数据质量可以替代数据数量。

⚠️ 除 Llama 3-70B 的 10×(Epoch AI 原句)外,表中其他”倍数”是我按 (tokens/param) ÷ 20 推算的,不是来源原文的结论,引用时不要当成论文结论。

3.4 数据墙(Data Wall):这条路的尽头在哪

数据墙与数据耗尽研究 算了一笔账:人类公开文本的有效存量约 300 万亿 tokens(90% 置信区间:100T–1000T),按现有趋势将在 2026–2032 年被用尽(80% 置信区间)。

而过训练会加速撞墙:过训练 5 倍 → 2027 年耗尽;过训练 100 倍 → 2025 年耗尽。

但反方也有硬数据(Epoch AI 2026-08 实时面板):

  • 前沿模型的训练算力仍在以每年约 5 倍(每 5.2 个月翻一倍)的速度增长,到目前为止没有放缓迹象
  • 如果把多模态数据和合成数据算进来,2030 年可用数据当量可达 400 万亿–2 亿亿 tokens
  • 而且最先到顶的瓶颈可能根本不是数据,而是电力。原文:“The constraint likely to bind first is power, followed by the capacity to manufacture enough chips.”(最先卡住我们的可能是电力,其次是芯片产能。)

“数据枯竭”和”算力继续涨”这两件事同时为真。数据不够,就靠多模态、靠合成数据、靠更高效地利用数据;而真正的硬约束正在从数据转移到电厂和晶圆厂。

3.5 第三条曲线:不训更大,改成”想更久”

既然”把模型训大”这条路在减速,算力就转移到了另一个方向——推理期缩放(test-time scaling):不改任何权重,只在回答问题时多花点算力,让它想得更久。

Raschka 把这件事概括为两个旋钮:

“We can spend more resources during training (more data, bigger models, more or longer training stages) or inference. … in practice, it’s even better to do both at the same time.”

算力可以花在训练阶段(更多数据、更大模型、更长的训练),也可以花在推理阶段(让模型多想一会儿)。实践中两者一起做效果最好。

量化证据:

现象数字来源
OpenAI o1 在 AIME 2024 上单次采样 74.4% → 64 个样本投票 83.3% → 1000 个样本重排 93%o1 官方博客
计算最优的测试时分配 vs 朴素的”多采样几个挑一个”效率提升 >4 倍Snell et al., arXiv:2408.03314
在算力相同的前提下,小模型靠”想更久”可以超过比它大 14 倍的模型同上
s1-32B 用”预算强制”延长思考AIME24 从 50% → 57%arXiv:2501.19393

⚠️ “14 倍”这条有严格限定:只在”小模型本来就有一定成功率的题目”上成立。如果题目超出了模型的能力边界,想再久也没用——多试几次只能放大已有的成功率,不能凭空创造能力。

最关键的一个案例:s1 论文只用 1,000 条精选问答对 Qwen2.5-32B-Instruct 做微调,再加一个叫”预算强制”的小技巧(模型想停下来时,强行在后面追加一个 “Wait”,逼它继续想),就在竞赛数学题上最高超出 o1-preview 27%。

同一份模型权重,光改推理时的策略,就能拉开 27 个百分点。 这一条比本文任何论证都更能说明:参数量 ≠ 能力。

3.6 压缩之后还剩多少:量化与蒸馏

量化(quantization)降的是数值精度——把每个参数从 16 位压到 8 位甚至 4 位。ACL 2025 有一项在整个 Llama-3.1 家族上做了 50 万次以上评测的研究:

格式精度损失
FP8(W8A8-FP)effectively lossless(跨所有模型规模基本无损)
INT8(W8A8-INT)1–3%(调校得当时)
INT4(W4A16-INT,仅压缩权重)比预期更有竞争力,原文称 “rivaling 8-bit quantization”(可与 8 位量化抗衡)

“4-bit 量化版”不等于”变笨的版本”。FP8 基本无损,INT8 只掉 1–3%,连 INT4 在 2025 年后的调校方法下都追平了 8 位。而且 知识容量缩放定律论文 确认:int8 量化不损害知识容量(2 bits/参数依然成立)。

蒸馏(distillation)降的是参数量——让一个小模型(学生)去模仿大模型(教师)的输出。DeepSeek-R1 论文给了一组很说明问题的对照,两者都在同一个 Qwen-32B 基座上:

方法AIME 2024 pass@1
做超过 1 万步的大规模强化学习(RL)47.0
直接蒸馏 R1 的输出72.6

论文的两条结论,原文:

“First, distilling more powerful models into smaller ones yields excellent results, whereas smaller models relying on the large-scale RL … may not even achieve the performance of distillation. Second, while distillation strategies are both economical and effective, advancing beyond the boundaries of intelligence may still require more powerful base models and larger-scale reinforcement learning.”

第一,把强模型的能力蒸馏到小模型里效果极好,而让小模型自己去做大规模强化学习,甚至可能达不到蒸馏的效果(还更贵)。第二,但蒸馏再好用,它只能传递教师已有的能力——想要突破智能的边界,最终还是得靠更强大的基座模型和大规模强化学习。

一句话总结:能力可以从大参数压缩进小参数,但压缩不能创造新能力。


4. 知识与推理是两条独立的轴

这是理解”能力维度”的钥匙,也是最反直觉的一节。

4.1 一个让人很不舒服的实验

知识操纵与思维链论文 做了一件很绝的事:构造一个受控的传记数据集,让模型把所有人的出生月份背到 100% 正确,训练了 25,000 条样本——这个数据量用来学”12 个月分奇偶”绰绰有余。

然后问模型一个问题:“Anya 出生在偶数月吗?”

模型答不上来。除非让它先把 “October” 这个词写出来,再对着这个词判断奇偶。论文的原文结论:

“language models cannot efficiently be trained+finetuned to perform even a single step of knowledge manipulation during inference time without CoT”

不做思维链(CoT)的话,语言模型连一步知识操纵都做不了。注意 “even a single step”(连一步都)这个措辞——不是”多步推理会失败”,而是一步都不行。

为什么会这样? 关键机制在这里:语言模型只能对”已经生成出来的 token”做运算,不能对参数里的知识做运算。

这个区别很重要。参数里的知识是”死”的,它只能影响下一个字该生成什么;一旦生成出来变成上下文里的文字,模型就能对它做判断、比较、推导了。

所以 思维链(Chain-of-Thought, CoT)的作用不是”让模型更认真”,而是把参数里的知识搬运到可以操作的上下文里。这是机制上的必需,不是心理上的鼓励。

4.2 另外四条边界,一条比一条硬

  • 训练时加 CoT 数据,改善不了推理时的非 CoT 表现。 原文:“Including sufficient CoT samples in training does not enhance non-CoT inference”(训练里加了足够的思维链样本,也不会增强不做思维链时的推理能力)。人话:学生看了例题,不代表他能心算。
  • 改善知识抽取,改善不了知识操纵。 原文:“Improving model’s knowledge extraction don’t improve its manipulation ability”。人话:这是两条独立的通道,把”查得到”练到满分,“推得动”还是零分。
  • 反向检索彻底失败。 问”谁的某个属性等于 T?“(比如”谁的生日在十月?”),无论怎么训练都接近 0%,除非数据里本来就有倒过来写的内容。论文原话:“language models cannot be used as databases”(语言模型不能被当作数据库用)。
  • 规模也救不了。 原文:“modern large models like GPT-4 or Llama-3 … struggle with these tasks … these limitations may be inherent to generative language models and not easily overcome by scaling up”。人话:作者认为这是生成式语言模型固有的局限,光靠加大规模不容易克服。

4.3 一个交叉印证:MMLU vs MMLU-Pro

MMLU 的升级版论文发现了一个反转:

“models utilizing Chain of Thought (CoT) reasoning achieved better performance on MMLU-Pro compared to direct answering, which is in stark contrast to the findings on the original MMLU, indicating that MMLU-Pro includes more complex reasoning questions.”

在升级版 MMLU-Pro 上,让模型写思维链能提分;但在原始 MMLU 上,结论完全相反(写不写都一样)。原因是 MMLU-Pro 里推理题更多。

同样的一个技巧,在纯知识榜上没用,在推理榜上有用——因为这两个榜根本在测不同的东西。

4.4 这一节告诉你什么

正确的心智模型:知识容量是”仓库面积”,推理操纵是”分拣能力”。两者相互独立,前者不会自动带来后者。

所以”参数大 → 懂得多 → 更聪明”这个三段论,在第一步就断了。


5. 能力维度全景图

5.1 为什么必须拆成多维

HELM整体评估框架 给出的数据最有说服力:

“Prior to HELM, models on average were evaluated on just 17.9% of the core HELM scenarios, with some prominent models not sharing a single scenario in common.”

在 HELM 出现之前,一个模型平均只被评估了核心场景的 17.9%;更夸张的是,有些知名模型之间连一个共同的评测场景都没有。

这意味着什么? 意味着你看到两个模型在各自榜单上的分数时,它们可能根本没在同一张卷子上考过。这就是”跑分不能横向比较”的方法论根源。

HELM 的对策是”场景 × 指标”矩阵,其中指标有 7 个,而不只是准确率:accuracy(准确率)、calibration(校准度,即模型说”我有八成把握”时是不是真有八成)、robustness(鲁棒性)、fairness(公平性)、bias(偏见)、toxicity(毒性)、efficiency(效率)。

5.2 2026 年的能力是怎么切的

第三方评测机构 Artificial Analysis 用两套标签给每个榜单打标:

  • skill(能力,10 类):Reasoning(推理)、Agentic(智能体)、Tool Use(工具调用)、Coding(代码)、Instruction Following(指令遵循)、Long Context(长上下文)、Writing(写作)、User Interaction(用户交互)、Faithfulness(忠实性)、Multilingual(多语言)
  • knowledge(知识域,7 类):Humanities(人文)、Science(科学)、Math(数学)、Business(商业)、Legal(法律)、Medical(医学)、Finance(金融)

注意一个隐含的价值判断:它的综合指数权重是 Agents 34% / Coding 24% / Scientific Reasoning 24% / General 18%。“什么算智能”本身就是一个可以被质疑的选择——给编程 24% 权重的人,和给写作 24% 权重的人,会选出完全不同的”最强模型”。

5.3 各维度与参数量的关系(本文的核心表)

维度主要取决于什么与参数量的关系
知识广度预训练数据的覆盖与质量、知识容量正相关,但有 2 bits/param 上限
推理后训练 / 强化学习、思维链、推理期缩放弱相关——见第 4 节
代码代码数据、带可执行反馈的强化学习中等相关,且部分榜单已接近饱和
工具调用专门的工具调用后训练数据不单调——见第 7 节
长上下文位置编码、长文本训练、注意力稀疏化标称 ≠ 有效——见第 8 节
指令遵循指令微调数据 + 指令是否可验证小模型未必输大模型
稳定性/一致性模型自身的方差与单次成功率不成正比
拒答(abstention)训练中的”不知道”信号独立维度

这张表是本文件最实用的一张表。 它的意思是:看到”XX 维度强”,不要自动外推出”所以它在别的维度也强”。

5.4 一个常被忽略的维度:拒答

Chroma 的 ContextRot技术报告 发现模型家族之间存在系统性分化:

“Claude models consistently exhibit the lowest hallucination rates. … they tend to abstain when uncertain, explicitly stating that no answer can be found. In contrast, GPT models show the highest rates of hallucination, often generating confident but incorrect responses when distractors are present.”

Claude 系列模型的幻觉率一直最低,因为在不确定时它们倾向于明确说”找不到答案”;相反,GPT 系列幻觉率最高,在有干扰信息时经常会生成自信但错误的回答。

幻觉率低不等于懂得多,而是”更愿意说不知道”。 这是一个与知识量完全正交的独立特质——两个知识水平相同的模型,一个选择编,一个选择说不知道,它们的”幻觉率”会差很多。

5.5 2026 年的实证:各榜榜首不是同一个模型

抓取于 2026-08-31(Artificial Analysis 口径;各榜快照时间不同步,见第 6.5 节):

榜单测的是什么榜首
综合指数9 个榜加权Claude Opus 5(63)
GPQA Diamond研究生级科学推理Grok 4.6(94.9%)
MMLU-Pro知识 + 推理Gemini 3 Pro Preview(89.8%)
LiveCodeBench竞赛编程Gemini 3 Pro Preview(91.7%)
Terminal-Bench v2.1终端智能体GPT-5.6 Sol(89.5%)
Humanity’s Last Exam前沿学术知识Claude Fable 5(55.5%)
LMArena Text人类偏好Claude Fable 5(1507)

没有一个模型同时拿下两个以上的榜首。 这就是”能力是多维的”最直观的证据——如果智能真的是一根轴,那么最强的模型应该横扫所有榜单。它没有。


6. 为什么榜单会互相打架

如果你只记住本文一节,记这一节。榜单打架有六个原因,其中第五个最容易被忽略。

6.1 原因一:它们测的根本不是同一件事

第 5 节已经说明:知识榜、推理榜、代码榜、偏好榜,测的是不同的轴。

6.2 原因二:评测污染(benchmark contamination)

什么是污染? 就是考试题目出现在了训练数据里,模型”背过答案”。

主流平台用 n-gram 重叠来检测和去除污染。评测污染改写法论文 证明这个方法可以被简单绕过——只需要对测试题做改写或翻译:

检测方法在改写样本上的 F1
n-gram 重叠0(完全失效)
LLM 去污器0.94–1.00

n-gram 去污的 F1 是 0,意思是”一个污染样本都没检测出来”,等于摆设。而用另一个 LLM 来当去污器,则能几乎全部识别出来。

后果有多严重?论文原话:

“a 13B model can easily overfit a test benchmark and achieve drastically high performance, on par with GPT-4.”

一个 130 亿参数的小模型,只要拿改写的测试题微调一下,就能轻易刷到和 GPT-4 一个水平。

具体数字:

榜单微调前用改写样本微调后
MMLU约 45–54%88.5–89.9%
GSM-8K约 15–29%86.7–95.3%
HumanEval约 33–36%67.7–81.1%

污染也不全是刻意的。 论文在真实预训练语料里也发现了重叠:

“in pre-training sets such as RedPajama-Data-1T and StarCoder-Data, we identified that 8-18% of the HumanEval benchmark overlaps. … we also find such contamination in synthetic dataset generated by GPT-3.5/4, suggesting a potential risk of unintentional contamination.”

在 RedPajama-Data-1T 和 StarCoder-Data 这类公开预训练集里,HumanEval 榜单有 8–18% 的内容是重叠的。而且在 GPT-3.5/4 生成的合成数据里也有——这说明用 AI 生成训练数据,会不知不觉把测试题污染进去。

但也别走向另一个极端。 GSM1k 用 1,250 道全新由人类出的镜像题来测真实污染程度,结果:

“we observe accuracy drops of up to 13%, with several families of models (e.g. Phi and Mistral) showing evidence of systematic overfitting … At the same time, many models, especially those on the frontier, (e.g., Gemini/GPT/Claude) show minimal signs of overfitting.”

准确率最多掉 13%,其中 Phi 和 Mistral 系列有明显过拟合痕迹;但前沿模型(Gemini/GPT/Claude)几乎没有过拟合迹象。

结论:污染是程度问题,不是有无问题。越流行的榜越容易被污染,越新的模型受影响反而越小(因为它们用了更严格的去污流程)。

6.3 原因三:提示词与格式敏感性

同一道题,换个问法,分数就不一样。MMLU-Pro 论文给出的对比:

“the sensitivity of model scores to prompt variations decreased from 4-5% in MMLU to just 2% in MMLU-Pro”

模型分数对提示词变化的敏感度,从 MMLU 的 4–5% 降到了 MMLU-Pro 的 2%。换算成正面的说法就是:在 MMLU 上,同一个模型换个提示词模板,分数能差 4–5 个百分点——这个幅度比很多模型之间的真实差距还大。

另外,选择题这个形式本身就脆弱:模型对选项的位置存在系统性偏好(比如总是偏爱 A 或总是偏爱最长的那个),相关研究见 arXiv:2309.03882。

⚠️ 编号勘误:这篇常被误引为 2305.14622,正确编号是 2309.03882。

6.4 原因四:对战榜在测”人类更喜欢谁”,不是”谁更能干”

偏好对战榜(LMArena)的设计很聪明:让两个匿名模型回答同一个问题,由人类投票选更好的那个。这天然绕开了静态榜单的污染问题。但它引入了全新的偏见。

LMSYS 官方自己做了实验并公开了结果,开篇就直指社区的两个疑问:

“Why is GPT-4o-mini so good? Why does Claude rank so low, when anecdotal experience suggests otherwise? … We controlled for the effect of length and markdown, and indeed, the ranking changed.”

为什么 GPT-4o-mini 排名这么高?为什么 Claude 排名这么低,和大家的实际体验对不上?我们把”回答长度”和”markdown 排版”这两个因素控制住之后——排名真的变了。

具体测出每个风格因素的权重(数值越大,对胜率的影响越大):

style 特征系数
Length(回答长度)0.249
Markdown List(列表)0.031
Markdown Header(标题)0.024
Markdown Bold(加粗)0.019

长度的影响系数是 0.249,而加粗只有 0.019。“写长一点”比”排版好看”值钱 13 倍。 官方的结论原文:

“length was the dominant style factor. All other markdown effects are second order.”

(长度是压倒性的风格因素,所有其他 markdown 效果都是二阶的、次要的。)

控制风格后的排名变动:grok-2-mini 从第 6 名掉到第 18,Claude 3 Opus 从第 16 名升到第 10。

但官方也声明这只是一个观察性研究:

“There are possible unobserved confounders such as positive correlation between length and substantive quality … a chain-of-thought explanation for a reasoning question”

可能存在没被控制的混淆因素,比如”回答长度”和”回答质量”本身正相关——一个最典型的例子就是,一道推理题的思维链解释会同时让回答变长、也让质量变高。所以把长度完全消掉,会误伤那些真的在认真推理的模型。

还有数据特权问题(排行榜幻象论文):

“We establish that the ability of these providers to choose the best score leads to biased Arena scores due to selective disclosure of performance results. At an extreme, we identify 27 private LLM variants tested by Meta in the lead-up to the Llama-4 release.”

“Providers like Google and OpenAI have received an estimated 19.2% and 20.4% of all data on the arena, respectively. In contrast, a combined 83 open-weight models have only received an estimated 29.7%.”

厂商可以私测很多个版本、只公开分数最好的那个——极端例子是 Meta 在 Llama-4 发布前私测了 27 个变体。另外,Google 和 OpenAI 分别拿走了平台上约 19.2% 和 20.4% 的数据,而 83 个开源模型加起来只占 29.7%。

而用对战榜数据来训练模型,能让 ArenaHard 胜率从 23.5% 翻倍到 49.9%——但论文紧接着指出:

“This improvement does not translate to out-of-distribution performance on benchmarks such as MMLU.”

这种提升没有转化到 MMLU 等其他榜单上。也就是说,模型学会的是”讨好评委”,不是”变强了”。

6.5 原因五:快照时间不同步(这个最容易被忽略)

2026-08-31 抓取时:LiveCodeBench 和 MMLU-Pro 的榜首还是 Gemini 3 Pro Preview 那一代,而 GPQA 和 Terminal-Bench 的榜首已经是 Grok 4.6 / GPT-5.6 那一代。

不能把不同榜单的”第一名”当成同一时间截面的横向对比。 每家榜单的更新频率不同,你看到的”榜首”可能相差半年。

同样,SWE-bench 官网的最新条目日期是 2026-02-26,落后于第三方聚合站约半年。

6.6 原因六:误差棒已经压过名次差

2026-08 的 LMArena 快照原文:

“Claude Fable 5 — 1506±5; Claude Opus 4.6, High effort — 1505±4; Claude Opus 4.7, High effort — 1502±4”

我们证明,厂商能够挑最好的那个分数来公布,这种做法会让 Arena 分数因「选择性披露」而失真。极端例子是:我们发现 Meta 在 Llama-4 发布前私测了 27 个未公开的变体。

而第三方分析给的解读是:

“the top three scores overlap once you account for ±4-5 points, meaning the leaderboard cannot cleanly distinguish ‘best’ from ‘second best’ among them on any given day”

把 ±4–5 分的误差棒算进去,前三名的分数区间是互相重叠的。意思是在任何一天,这个榜单都无法干净地区分”第一”和”第二”。

更根本的批评(arXiv:2605.06656)甚至认为全局榜单可能本身就没有意义:

“the best-fit global Bradley-Terry (BT) ranking is misleading. Nearly 2/3 of the decisive votes cancel out, and even the top 50 models according to the global BT ranking are statistically indistinguishable (pairwise win probabilities are at most 0.53 within the top 50 models)… What appears as global noise is in fact a mixture of coherent but conflicting subpopulations.”

拟合出来的全局排名是误导性的。近三分之二的有效投票互相抵消;前 50 名模型在统计上根本无法区分(前 50 名里两两对决的胜率最多只有 0.53,几乎等于抛硬币)。看起来像噪声的东西,其实是一堆各自内部一致、但彼此冲突的用户群体混在一起的结果。

⚠️ 该论文为 2605.* 编号,本次未直接核对 arXiv 原文,引文来自审稿综述转录。

6.7 所以该怎么读跑分

  1. 先问”这张榜测的是哪个维度”——它是知识榜、推理榜、代码榜,还是偏好榜?
  2. 再问”我要的那个维度,它测了吗”——用竞技榜的分数去选客服模型,等于用短跑成绩选马拉松选手。
  3. 看趋势,不看名次——误差棒以内的名次差是噪声。
  4. 看新不看旧——静态榜会随时间失效,越老的榜污染越严重。
  5. 最重要的是:在你自己的任务上跑一次。

7. 工具调用:一个特殊的维度,一半能力在模型外

7.1 它是训练出来的,不是参数涌出来的

ToolLLM论文 在 2023 年就点明了原因:

“The reason is that current instruction tuning largely focuses on basic language tasks but ignores the tool-use domain.”

开源模型工具调用能力差的原因,是当时的指令微调主要聚焦在基础语言任务上,把工具使用这个领域整个忽略了。

这句话的含义很重要:工具调用是后训练阶段专门喂出来的能力,不会随着预训练参数量自动出现。

2026 年的数据仍然支持这个判断。 看 BFCL V4 榜单(榜单更新日期 2026-04-12):

模型参数量Overall Acc
Nanbeige4-3B-Thinking (FC)3B51.4
xLAM-2-32b-fc-r32B54.66
Phi-414B28.79
Gemma-3-27b-it27B29.47
Llama-3.3-70B70B31.9

一个 30 亿参数的模型,把一个 700 亿参数的模型甩在了后面。 这说明工具调用能力与参数量不单调——不是越大越强。

7.2 现在的评测重心已经不是”调得对不对”

BFCL V4 的总分构成是这样的:

Overall = Agentic(40%) + Multi-Turn(30%) + Live(10%) + Non-Live(10%) + Hallucination(10%)

单轮函数调用(Live + Non-Live)只占 20%,而”跨轮次保持状态 + 搜索 + 记忆 + 该不该拒绝调用”占了 70%。

有评论把这件事说得很直白:

“That weighting is an admission by the benchmark’s own authors: single-turn accuracy is saturated and no longer separates frontier models”

这个权重分配等于榜单作者自己承认——单轮调用的准确率已经饱和,再考也区分不出前沿模型的高下了。所以他们把重心挪到了模型还做不好的地方。

还有一条特别值得记住:

“The single hardest capability is abstention … tool-tuned models are systematically biased toward calling something.”

最难的能力是拒答(abstention)——知道什么时候不该调用工具。而专门调过工具调用的模型,会系统性地偏向于”总得调点什么”。这是一个训练出来的副作用:你训练它多用工具,它就变成一个手里拿着锤子、看什么都像钉子的模型。

7.3 稳定性:单次跑分会严重高估

τ-bench论文 提出了一个叫 pass^k 的指标(k 次运行全部成功),揭穿了一个结构性问题:

gpt-4o 在 τ-retail 上单次成功率(pass^1)= 61.2%,但连续 8 次全对的概率(pass^8)低于 25%。

61% 的单次成功率听起来像”三分之二的时候能用”。但如果你要把它接进客服系统,每 8 个用户里只有大约 2 个能得到全程正确的服务。

这就是”稳定性”作为一个独立维度的意义:单次成功率高,和每次都成功,是两件完全不同的事。 详见 一致性指标pass的k次方。

Anthropic 官方给的选择指南一句话总结:

“pass@k for tools where one success matters, pass^k for agents where consistency is essential.”

7.4 一半的能力在模型外(这是本节的重点)

Anthropic 官方的定性:

“When we evaluate ‘an agent,’ we’re evaluating the harness and the model working together.”

当你评估一个”智能体”时,你评估的其实是工程框架(harness)和模型协同工作的结果,不是模型单独的能力。

这个说法有多严重?看 Terminal-Bench 2.0 官方榜单给出的数字:

模型harness(工程框架)准确率
Claude Opus 4.6Meta-Harness76.4% ± 2.4
Claude Opus 4.6Claude Code(厂商自家)58.0% ± 2.9
GPT-5.3-CodexLemonHarness84.5% ± 2.6
GPT-5.3-CodexTerminus 264.7% ± 2.7

同一份模型权重,最高和最低差了 18–20 个百分点。 而且有意思的是,厂商自己做的框架并不是最好的那个。

LangChain 的对照实验更干净——模型完全固定,只改框架:

“We used a simple recipe to iteratively improve deepagents-cli … 13.7 points from 52.8 to 66.5 on Terminal Bench 2.0. We only tweaked the harness and kept the model fixed.”

我们只改了框架、模型一个字没动,分数就从 52.8 涨到 66.5,涨了 13.7 个点。他们的总结也很好:“The goal of a harness is to mold the inherently spiky intelligence of a model for tasks we care about.”(框架的目标是把模型那种天生尖峰不均的智能,捏成我们在乎的任务需要的形状。)

为什么? Lilian Weng 引 Lin 等人 2026 年的研究,把这件事拆成了两个独立的轴:

“harness-updating refers to the capability of producing useful harness edits and harness-benefit denotes the capability of utilizing the updated harness… a range of model of different sizes and core intelligence, from Qwen3.5-9B to Claude Opus 4.6, were observed to show similar harness updating capability; the 9B harness proposer is able to write a skill procedurally isomorphic to Opus.”

“harness updating capability is measured flat … harness benefit capability is non-monotonic where middle tier models benefit the most.”

这两句话要拆开读。第一句定义了两个概念:写框架改动的能力(harness-updating),以及把改好的框架用起来的能力(harness-benefit)。第二句是实测结论——前者持平,后者非单调。

  • “写出有用的框架改动”这项能力,跨模型尺寸基本持平——从 90 亿参数的 Qwen3.5-9B 到顶级的 Claude Opus 4.6,写出来的技能在程序结构上几乎是同构的。
  • “把改好的框架用起来”这项能力则是非单调的,中间档模型受益最大。

这正好解释了”参数大 ≠ 工具调用强”:写框架靠的是结构化思考能力(小模型也有),用好框架靠的是”及时且正确地调用工具 + 长程指令遵循”——后面这项能力与参数量的关系不是单调递增的。

7.5 但别走到另一个极端

Addy Osmani 那句被到处引用的话必须加两个限定:

“A decent model with a great harness beats a great model with a bad harness.”

(一个中等模型配好框架,打得过顶级模型配坏框架。)

限定一:框架不是越强越好,要跟模型匹配。 CORE-Bench 的对照:

“Claude Opus 4.5 using Claude Code, it scored 78%, nearly double the 42% we reported using our standard CORE-Agent scaffold.”

“For Opus 4.1, CORE-Agent outperforms Claude Code by almost 10 percentage points.”

换上 Claude Code 之后,Opus 4.5 从 42% 涨到 78%,几乎翻倍。但同一个框架换到 Opus 4.1 身上,反而是原来那个 CORE-Agent 高出近 10 个点。作者的解释是:新模型是在新框架的输出轨迹上训练出来的,两者是配套的;而给不那么强的模型写得太细的指令,反而会妨碍强模型发挥。

限定二:模型必须”够格”,框架才能起正面作用。

“STOP improved mean downstream performance across iterations with GPT-4 but degraded with weaker models like GPT-3.5 and Mixtral. … The base model must be capable enough to improve the mechanism. This implies that harness improvement enables better deployment of the model but intelligence is still the core.”(Lilian Weng)

同一种自我改进方法,配 GPT-4 会越迭代越好,配 GPT-3.5 和 Mixtral 反而越迭代越差。所以基座模型必须”足够有能”,这套机制才能起作用。含义是:改进框架能把模型部署得更好,但智能本身仍然是核心。


8. 长上下文:标称、有效与腐坏

8.1 两个数字,别搞混

  • 标称上下文窗口:一次能塞进去多少 token(2026 年的旗舰模型普遍标称 1M)
  • 有效上下文长度:塞进去之后,还能正常思考多少

它们差得很远。 NoLiMa长上下文论文 的测试数据:

“We evaluate 13 popular LLMs that claim to support contexts of at least 128K tokens. … At 32K, for instance, 11 models drop below 50% of their strong short-length baselines. Even GPT-4o … experiences a reduction from an almost-perfect baseline of 99.3% to 69.7%.”

作者测了 13 个自称支持 128K 上下文的模型。结果在 32K(只有标称长度的四分之一)时,11 个模型已经掉到自己短上下文成绩的 50% 以下。连表现最好的 GPT-4o 也从几乎满分的 99.3% 掉到了 69.7%。

NVIDIA 的 RULER 测试给出同期结论:

“Despite achieving nearly perfect accuracy in the vanilla NIAH test, almost all models exhibit large performance drops as the context length increases. While these models all claim context sizes of 32K tokens or greater, only half of them can maintain satisfactory performance at the length of 32K.”

尽管在经典的”大海捞针”测试里几乎满分,几乎所有模型在上下文变长时都会大幅掉分。这些模型都自称支持 32K 以上,但只有一半能在 32K 这个长度上保持令人满意的表现。

8.2 “大海捞针”测试为什么骗了你

大海捞针(Needle In A Haystack, NIAH)的做法是:在一大段无关文本里藏一句特定的话,让模型把它找出来。这个测试的问题在于:

“NIAH is fundamentally a simple retrieval task … this benchmark typically assesses direct lexical matching, which may not be representative of flexible, semantically oriented tasks.”

大海捞针本质上是个简单的检索任务,考的是字面匹配,不能代表需要语义理解的真实任务。

具体来说:针和草堆之间往往存在字面重叠,模型可以靠”找关键词”来作弊,根本不需要理解内容。NoLiMa 的改进就是让问题和针之间几乎没有字面重叠,逼模型去推断潜在关联——这一改,成绩就崩了。

8.3 上下文腐坏(context rot)

ContextRot技术报告(Chroma)用 18 个模型 × 8 种长度 × 11 个插入位置做了系统测试,核心发现:

“models do not use their context uniformly; instead, their performance grows increasingly unreliable as input length grows.”

模型不是均匀地使用它的上下文窗口;随着输入变长,它的表现会越来越不可靠。

几条具体规律:

  • 干扰项雪上加霜:原文 “Even a single distractor reduces performance … adding four distractors compounds this degradation further”——哪怕只加一条干扰信息,表现就会下降;加到四条,退化会进一步叠加。
  • 语义相似度越低,衰减越快:需要推理才能关联起来的信息,比字面相似的信息掉得更快。
  • 一个反直觉的发现:原文 “models perform worse when the haystack preserves a logical flow of ideas. Shuffling the haystack … consistently improves performance”——当草堆文本保持连贯逻辑时,模型表现反而更差;把文本打乱之后,表现稳定提升。可能的解释是连贯文本更容易让模型被上下文带偏。
  • 家族差异:Claude 系列幻觉率最低、倾向于拒答;GPT 系列幻觉率最高、倾向于自信地编。

8.4 一个直接能用的结论

Chroma 的 LongMemEval 实验给出了最好用的一条建议:同一批信息,用聚焦提示(约 300 tokens) 时的表现,明显高于用完整提示(平均约 113K tokens)。原话:

“adding irrelevant context, and thereby adding an additional step of retrieval, significantly impacts a model’s ability to maintain reliable performance”

加入无关上下文(从而给模型额外增加了一道”检索”工序),会显著损害模型保持稳定表现的能力。

所以:先检索再喂,优于整包丢进去。 这正是 上下文工程 的价值。Chroma 那句总结最到位:“Whether relevant information is present in a model’s context is not all that matters; what matters more is how that information is presented.”(相关信息在不在上下文里还不是全部,更重要的是这些信息”怎么呈现”。)

另外一个必须知道的成本:长上下文的第二座大山不是注意力计算,而是 KV cache(键值缓存)——为了不重复计算,模型要把已处理 token 的中间结果存着。粗略算一下 Llama 3.1 70B(FP16):128K 上下文约需 42 GB KV cache,1M 上下文约需 328 GB,而这还不含模型权重本身的 140 GB。

这也是为什么 2026 年各大厂都在做注意力稀疏化(DeepSeek 的 DSA、GLM-5.2 的 IndexShare 等)。2026 年的新战场已经不是激活参数,而是长上下文。


9. 一张决策地图

9.1 怎么读一个模型的参数表

你看到该问的问题
”671B 参数”激活参数是多少?专家配置是什么?这个数字是架构口径还是张量统计?
“37B 激活”这只是一个算力声明。它不等于 37B 稠密模型的能力。
“1M 上下文”有效长度是多少?有没有 RULER / NoLiMa 的实测数字?
“XX 榜第一名”这张榜测的是哪个维度?快照是什么时候?用的什么框架?
“训练了 XX T tokens”配比是多少?是过训练还是计算最优?数据质量如何?

9.2 怎么选模型

你的场景优先看哪个维度该看什么
问答 / 知识检索知识广度 + 拒答能力MMLU-Pro、HLE;同时注意幻觉率
数学 / 逻辑推理 + 推理期缩放GPQA、AIME、MATH-500;看它是否支持”想更久”
写代码代码 + 工具调用LiveCodeBench(它用时间切分来防污染)
搭智能体工具调用 + 长程指令遵循 + 稳定性BFCL、τ-bench(看 pass^k 而不是 pass^1)、Terminal-Bench
长文档处理有效上下文长度别看标称窗口,自己做一次”检索后喂”vs”整包喂”的对照测试
面向用户的对话人类偏好LMArena,但记住它测的是”更喜欢读谁”,不是”更能干”
本地部署显存 + 速度总参数决定显存,激活参数只粗略决定算力,去实测才知道速度

9.3 怎么提升效果(在换模型之前,先试这四条)

  1. 加思维链——需要多步推理的任务,让模型把步骤写出来。这不是”让它更认真”,而是机制上必需(见第 4 节)。
  2. 先检索再喂——别把整个代码库或文档库丢进去,长输入会腐坏,而且无损信息也会拖后腿。
  3. 把指令写成可验证的——“超过 400 词""必须输出 JSON”。能被程序判定的指令,远比”写得好一点”这种主观要求可靠。
  4. 检查你的框架——同一个模型换个 harness 能差 18 个点,这比换模型便宜得多。

9.4 关于”缩放还行不行”

立场一手证据
仍在缩放Epoch AI 2026-08:训练算力仍以 5 倍/年 增长;2030 年可支撑 10^29 FLOP
数据将耗尽有效存量约 300T tokens,80% 置信区间在 2026–2032 用尽
瓶颈是电力不是数据”The constraint likely to bind first is power, followed by the capacity to manufacture enough chips”(最先卡住的是电力,其次是芯片产能)
新曲线已开启推理期缩放:o1 单次 74.4% → 重排后 93%;s1 用 1,000 条数据 + 预算强制超出 o1-preview 27%
压缩不能创造新能力蒸馏 72.6 分 vs 同基座大规模 RL 47.0 分;“advancing beyond the boundaries of intelligence may still require more powerful base models”

10. 争议与未定

  1. “37B 激活 ≈ 37B 稠密”至今没有直接对照实验。 现有的证据都是间接的:DeepSeekMoE 145B 对 67B 稠密(但两者架构不同)、GLaM 96.6B 激活对 GPT-3 175B(但隔了整整一个时代)。同架构、同数据、同算力下的严格对照,目前没有公开结果。

  2. 涌现能力(emergent abilities)之争未决。 正方(涌现能力论文)认为某些能力”小模型没有、大模型才有”,因此无法从小规模外推预测;反方(涌现能力是幻觉吗论文,NeurIPS 2023 杰出论文)证明这是非线性指标造成的假象——把”精确匹配准确率”这类指标换成连续指标,涌现就消失了,而且他们能在视觉任务上凭空制造出涌现曲线。

    目前的中立立场:“涌现”作为数学性质可疑,作为工程观察有用。

  3. 缩放定律是否撞墙。 见 9.4 表。两边都有一手数据,分歧主要在时间尺度和要不要把多模态/合成数据算进来。

  4. MoE 的显存效率存在反方证据。 常识是”MoE 显存低效”,但 Ludziejewski 等人(arXiv:2502.05172)发现 “MoE models can be more memory-efficient than dense models, contradicting conventional wisdom”(MoE 模型可能比稠密模型更省显存,这与传统认知相悖)。

  5. 榜单本身的有效性正在被质疑。 从”全局 Bradley-Terry 排名可能无意义”(arXiv:2605.06656)到”不推荐用 Elo 来给 LLM 排名”(arXiv:2411.14483,ACL 2025),评测方法本身正在被重新审视。

  6. 2026 年的一手数据缺口(如实记录):

    • LMArena 官网在本次抓取时(2026-08-31)抓取失败,所有对战榜分数来自第三方,且四家来源给出的榜首不一致
    • Qwen3.5、DeepSeek-V4 的专家配置官方未公布,只有社区整理版本
    • 豆包/Seed 全系参数官方从未公布,网传数字互相矛盾且多为 AI 生成内容
    • IFEval、LongBench、RULER 在 2026 年只有”测什么”的定义层,没有具体分数(部分机构已把它们归为 Legacy 或改用自研榜)

11. 待探索问题

  1. “同架构下,MoE 与同等激活量稠密模型的严格对照”——这个空白一旦被填补,“激活参数能不能等价稠密参数”就有定论了。
  2. 能力维度之间是否存在负相关? HELM 提出”应该把取舍清楚地暴露出来”,但 2026 年仍没有系统的量化研究回答”提升推理会不会损害知识”。
  3. 过训练的极限在哪? 从 20 tokens/param 一路推到 250 tokens/param,收益递减的拐点究竟在哪里?
  4. 框架能力会不会被内化进模型? Lilian Weng 的预测是”many harness improvements will be internalized into core model behavior, but the interface with external context and tools should remain”(许多框架改进最终会被内化进模型的核心行为里,但与外部上下文和工具的接口会保留下来)——这个预测值得追踪。
  5. 当静态榜全部失效,评测该走向何方? 目前有三条路线:一次性新题(GSM1k、HLE)、按时间切分(LiveCodeBench)、程序化验证(BFCL、Terminal-Bench)。哪一条能规模化?

参考来源

本文锚定在 2026-08-31 实时抓取的权威来源。原始底稿见 vault 根目录 processed/ 下的四份数据底稿。

数据底稿(processed/)

底稿内容
缩放定律与参数智能关系数据底稿.mdKaplan 2020、Chinchilla、过训练与数据墙、推理期缩放、知识容量、量化与蒸馏
稀疏激活与激活参数数据底稿.mdMoE 原理、5 篇里程碑论文、2025-2026 模型参数对照大表、部署成本换算
大模型能力维度与榜单差异数据底稿.mdHELM / BIG-bench、涌现之争、污染与刷榜、跨榜单名次对照表
工具调用与长上下文能力数据底稿.mdToolformer/ToolLLM、BFCL/τ-bench、NoLiMa/Context Rot、模型与 harness 分责

论文与官方报告(按文中出现顺序)

来源说明
Kaplan et al., arXiv:2001.08361缩放定律开山之作
Hoffmann et al., arXiv:2203.15556Chinchilla,计算最优
Villalobos et al., arXiv:2211.04325 / Epoch AI数据墙与过训练
Allen-Zhu & Li, arXiv:2404.05405知识容量,2 bits/parameter
Allen-Zhu & Li, arXiv:2309.14402知识操纵,知识≠推理
DeepSeek-AI, arXiv:2401.06066DeepSeekMoE,细粒度专家与共享专家
DeepSeek-AI, arXiv:2412.19437DeepSeek-V3 技术报告,671B/37B
Wei et al., arXiv:2206.07682涌现能力(正方)
Schaeffer et al., arXiv:2304.15004涌现是幻觉吗(反方)
Yang et al., arXiv:2311.04850评测污染改写法
arXiv:2405.00332GSM1k,污染量化
arXiv:2504.20879The Leaderboard Illusion
LMSYS 官方博客 2024-08-28Arena 风格控制实验
Sierra / Princeton, arXiv:2406.12045τ-bench,pass^k
arXiv:2502.05167NoLiMa,长上下文失效
Chroma 技术报告 2025-07-14Context Rot
清华, arXiv:2307.16789ToolLLM,工具调用是训练出来的
arXiv:2411.02355(ACL 2025)量化的大规模实测
arXiv:2501.12948DeepSeek-R1,蒸馏 vs RL

知名技术作者文章

作者文章
Sebastian RaschkaWhy MoE models have fewer active parameters;Categories of Inference-Time Scaling(2026-01-24);Using Local Coding Agents(2026-06-29)
Addy OsmaniAgent Harness Engineering(O’Reilly Radar,2026-05-15)
Lilian WengHarness Engineering for Self-Improvement(2026-07-04)
Vivek Trivedy(LangChain)The Anatomy of an Agent Harness(2026-03-10)
LangChain 官方博客Improving Deep Agents with harness engineering
Anthropic 工程博客Demystifying evals for AI agents(2026-01-09)

已摄入本知识库的相关页面

Agent 知识、Harness工程、上下文工程、MCP 模型上下文协议、Agent、Subagent