激活参数:一个位置的计算,实际用到了多少权重?
前面 Q、K、V 的投影矩阵中,训练得到的每个数都是一个参数 。模型还保存专家网络、嵌入表等权重;推理时,当前计算路径会调用其中相应的部分。
看模型保存的全部权重 总参数量 统计模型拥有多少训练得到的数值。各个专家的权重都属于这个集合。
看一个 token 的当前计算路径 激活参数量 统计本次前向计算调用的参数规模。多个位置可以反复使用同一组权重。
同一个模型,读入与生成的激活规模不同
读入 · Prefill 准备长输入的历史状态
8B约 80 亿
生成 · Decode 新位置继续经过全部 40 层
16B约 160 亿
0 8B 16B
前文的 CED 让长输入的大多数位置只完成前 20 层;生成的新位置经过全部 40 层。报告据此给出 8B / 16B 的阶段激活口径,读入末尾仍有窗口重放工作。接下来用 MoE 看清:即使执行某一层,也只会调用这层的一部分权重。
参数量、计算量和缓存量分别统计。 一次前向会执行矩阵乘法等运算;对话产生的 K/V 则是中间状态。激活参数更少有助于减少计算,实际耗时还取决于注意力、访存和设备调度。
B 表示十亿;8B 为 80 亿,16B 为 160 亿。阶段激活量依据报告 §2.1 与 §4.2.1 ;后文继续核对总参数组成。模型的全部权重仍需由部署系统保存和管理。
历代模型比较 总参数、激活参数与计算量分别回答什么? B 表示十亿,T 表示万亿;FLOPs 是 floating-point operations(浮点运算次数),FP8 是 8 位浮点格式。
总参数 描述模型拥有多少训练得到的权重;激活参数 描述一次处理某个 token 时实际经过其中多少权重;计算量 还取决于序列阶段、上下文长度、算子和数值精度。
本图选取 DeepSeek-V2 到 V4.1 的主要架构代际,用来比较参数规模、每个 token 的激活量和同条件下的计算量;它不枚举所有发布型号。额外模块与适用条件随图注明。
V4.1-Flash 的参数量怎样计算?
总参数量描述模型保存了多少训练得到的数值;激活参数量描述一个 token 经过计算时,调用了其中多少。B 表示十亿,1B = 10 亿。
报告所列的两部分参数 约 748B 7,480 亿
主干参数 552B 注意力、专家等模型权重
+
Engram 参数 196B 训练得到的条件记忆
组成条的长度按参数量比例绘制。约 748B 是 552B 与 196B 相加的结果,采用报告的近似口径。
依据:所附 V4.1 报告 §2.1 (第 7 页)、§2.4.2 (第 13 页)和 §4.2.1 (第 21–22 页)。总量与激活量分别统计,推理过程中产生的 KV 缓存另计。约 748B 是报告列出的主干与 Engram 两项近似规模之和,统计范围为这两部分。
展开计算:这些大数字怎样由层、专家和记忆表累积起来?
先算专家主体权重:约 545B
每层有 384 个路由专家和 1 个共享专家。一个专家的前馈计算包含三张大矩阵:两张将 5,120 维转换到 2,304 维,另一张转换回来。这是报告采用的 SwiGLU 前馈结构。
每层专家数 384 + 1 = 385
每个专家的矩阵参数 3 × 5,120 × 2,304
含 MoE 的层数 40
40 × 385 × 3 × 5120 × 2304 = 544,997,376,000 ≈ 545B
这是根据配置估算的专家主体权重规模。报告的 552B 主干还包括注意力等模块,其他部分采用报告总量口径。
再算 Engram 记忆表:约 196B
两个 Engram 模块各自保存三类短片段(2、3、4 个 token)的记忆。每类使用 8 张查找表;原文称为 8 个哈希头,即通过 8 种映射查表。每张表约有 1,600 万条,每条保存 256 个数。
表的数量 2 个模块 × 3 类 × 8 张
每张表的条目数 约 16,000,000
每条的维度 2,048 ÷ 8 = 256
2 × 3 × 8 × 16000000 × 256 ≈ 196.6B
16,000,000 是近似表长;实际采用不同的质数。因此这个算式用于核对数量级,报告将 Engram 参数规模记为 196B,两个模块均分。
用不同训练信号,逐步形成任务能力 报告沿用预训练、监督微调和强化学习等范式,强调数据、环境、可验证任务与教师指导的规模。
01 预训练 在 45T token 多模态语料中学习表示、知识与预测。
02 SFT · 监督微调 学习高质量任务示范中的回应与行动方式。
03 RL · 强化学习 在可运行、可验证的任务中,根据反馈更新策略。
04 OPD · 在策略蒸馏 学生模型先自己回答或执行任务,再利用教师模型对这些过程的指导更新参数;最后阶段超过 40 个教师。
任务准备好后,模型怎样从反馈中学习?
预训练先形成基础模型;后训练 继续调整权重,让模型更好地回应指令和完成任务。V4.1 沿用 SFT → RL → OPD 的流程。下面用一道加法编程题,区分三种学习信号。
同一教学任务 编写 add(a, b),正确处理正数和负数。 两项教学检查:2 + 3 = 5;−2 + 3 = 1。 示例程序与概率用于解释学习方式;实际训练覆盖大量复杂任务。
给模型什么 题目和参考程序,例如 return a + b。
用什么反馈 提供参考答案此前的 token,让模型预测下一项,再与参考下一 token 比较。
怎样更新权重 训练程序汇总预测误差,更新模型,使参考示范中的输出更容易被生成。
参考答案提供逐位置的学习目标。
给模型什么 题目与可运行环境;模型自行生成程序,也可以运行测试、修改代码。
用什么反馈 验证器检查实际结果。例如直接相加通过两项;先把负数改为正数的实现只通过一项。
怎样更新权重 收集一批尝试记录,根据任务反馈等构成奖励;训练程序据此更新权重,调整今后生成这些行为的概率。
完成任务的效果,指导模型怎样行动。
给模型什么 题目;由学生(正在训练的模型) 先生成程序或行动过程。这条实际生成的记录叫作轨迹 。
用什么反馈 教师(提供指导的模型) 读取学生已经生成的前缀,给出下一 token 的概率分布,作为学生权重更新的指导信号。
怎样更新权重 训练程序依据师生预测分布的差异更新学生权重。报告最终阶段采用全词表蒸馏。
学生走过的上下文,决定在哪里接受指导。
一次学习里,输入什么、比较什么、最后改什么?
SFT · 参考答案 RL · 尝试结果 OPD · 教师分布
题目 + 参考前缀 实现加法;参考程序已给到 return a 这段前缀来自参考答案。
等待比较 参考答案的下一项是 + 先预测这个位置,再与参考答案比较。
模型权重:尚未执行这次更新 这一步只是准备题目、前缀和学习目标。
手动步骤用于展开学习信号。真实训练对一批样本、多个位置汇总计算;下面描述权重更新的方向,示例不运行模型训练。
在 RL 中,当前模型先生成并执行一批尝试;任务反馈与长度等因素构成奖励,训练程序据此更新权重,再让更新后的模型继续尝试。改进来自这一循环的累积。
展开一个 OPD 位置:教师具体提供什么?
学生已生成程序片段 return a。在这个相同的学生前缀 上,比较学生与教师对下一项的预测:
一个参与蒸馏的预测位置 · 所有概率为教学设定 候选 token 学生预测 教师指导
+40% 80%
-30% 10%
*20% 5%
其余词表 10% 5%
每列合计 100%,横条满长代表 100%。候选划分为示意;“其余词表”合并了未逐项展示的候选。
比较的是两份分布 教师既给出偏好的下一项,也给出其他候选的概率。训练利用这样的分布信号调整学生预测;“全词表”说明指导覆盖的候选范围。
最终 OPD 阶段覆盖各领域并使用超过 40 个教师模型 ,不同领域可以使用各自适合的教师。学生与教师也可以采用不同架构。
训练时 · 学习发生 记录与反馈进入优化过程 训练程序更新模型权重,并保存成新的模型版本。任务验收负责提高这些学习材料与反馈的可靠性。
使用时 · 应用已学能力 同一份权重处理新请求 模型根据输入生成答案,更新本次会话的中间状态与 KV 缓存。日常推理过程中使用的权重保持固定。
报告依据:§5.1 的 SFT、RL、OPD 流程,§5.1.1 的可验证任务,§5.1.4 的长度奖励,以及 §5.2.4 的全词表 OPD 与教师配置。上面用三种标准训练方式说明学习信号;具体代码、token 划分与概率均为教学示意。
训练题的评分,能分清答对与答错吗?
一个任务包 包括题目、运行环境和验证器。验证器是自动检查结果的程序;它的反馈将用于后续训练,因此也需要验收。报告的代码任务构建流程采用多个 agent 试做,再由独立的质检 agent 验收。
查看合格任务
查看需要修复的任务
微型编程题 · 用于说明验收
被验收的对象:任务包 下面三项一起交给后续训练使用。
问题 编写 add(a, b),返回两个整数的和,也要支持负数 。
验证器 2 项检查 正数检查:add(2, 3) 应为 5 。
负数检查:add(-2, 3) 应为 1。
任务包 v1
1 / 3 · 多个 agent 试做 试做
上一步 下一步:独立验收
实现甲 · 直接相加 2 / 2 通过
输入 2、3 → 5 ;输入 −2、3 → 1 。
实现乙 · 先把负数改为正数 1 / 2 通过
输入 2、3 → 5 ;输入 −2、3 → 5 。
输出用于对照程序行为;得分只统计验证器列出的检查。
用两份试做记录检验评分依据。 甲能处理负数,乙在负数输入上答错。现有验证器给出甲 2 / 2、乙 1 / 2。
接下来独立验收:题目要求与检查是否一致。
入库之后才进入训练使用 训练任务库 保存题目、环境和判分依据;甲、乙作为试做记录保留。以后模型重新做这道题,验证器提供结果反馈,训练程序再据此更新模型权重。
本图的验收步骤整理任务包,模型权重的更新发生在后续训练中。任务入库也与软件部署上线属于不同流程。
这个例子只放大“漏测会使错误实现获得同样好评”。报告中的真实任务更复杂,质检还检查环境、难度、事实与评分漏洞;使用中的任务持续复审。
任务结构与验收流程:官方报告 §5.1.1 (第 25–26 页)。任务卡与验收闭环的组织方式参考 SuperAlign 后训练图解 ;例子与交互为本页教学设计。
推理强度 1–100:模型怎样学会调节思考长短?
强化学习还训练了一种可调节的生成策略 。模型接收一个 1–100 的整数 b ,数值越高,越鼓励更充分的推理。训练时,把这个强度值写入系统提示,和任务一起交给模型;模型通过后续奖励学习怎样响应它。
训练把“强度值”与“推理策略”联系起来。
训练时 · 下面三个步骤反复进行
1 · 生成尝试 任务 + 强度 b 同一道题搭配若干训练档位;模型在每个档位生成多份回答。
→
2 · 计算反馈 任务质量 + 长度项 较低 b:同样长度扣分较多。 较高 b:同样长度扣分较少。
→
3 · 更新权重 比较同题、同档位的回答 根据奖励调整策略,再用更新后的模型生成下一批尝试。
这一训练循环,得到同一套模型权重 模型学会按强度信号,调整推理长度与完成任务的取舍。
使用时 · 训练后的权重保持固定
本次请求 任务 + Reasoning Effort: 75
→
同一个模型 按学到的策略生成推理与回答
箭头表示前一步结果交给后一步。训练覆盖有限档位,部署可输入中间值,利用学到的插值能力;每道题的实际输出长度仍由生成过程决定。
调节的是一次回答愿意花多少推理 强度更高时,平均推理通常更长、计算成本更高,困难任务可能受益更多。前面 MoE 的每层专家配置保持相同;较长的推理让模型多生成一些位置。
具体长度仍由任务与生成过程决定 b 是模型学过的偏好信号。它与 max_tokens 这类输出硬上限各有作用:前者影响生成策略,后者限制最多输出多少。实际长度还随题目、采样和多轮工具调用变化。
模型的细分能力,与 API 提供的档位 报告记录的 2026 年 9 月公开 API 使用三个预设值:
API 档位 b 值所请求的推理强度 low 50 较低 high 75 较高 max 100 最高
展开训练公式:长度扣分怎样随强度变化?
设一份回答使用了 ℓ 个推理 token。训练奖励中的长度项为:
r len = −min(C max , k (b ) × ℓ / L norm )
k (b ) = k 0 exp[−(b − b min ) / τ]
L norm 是参考长度,C max 限制最多扣多少分;b min 是最低训练档位,k 0 是该档位的扣分系数,τ 控制系数下降的速度。随着 b 增大,同样长度的扣分系数按指数下降,模型因而学到不同的成本与质量取舍。
这套公式描述训练中的取舍。具体训练档位与惩罚超参数共同影响学到的策略;附录 C 用局部近似分析长度趋势,实际输出长度随任务与生成过程变化。
依据:报告 §5.1.4 、表 2 (第 29–30 页)、§5.3.3 与附录 C(第 49–51 页)。这项功能属于后训练学到的控制能力。