DeepSeek-V4-Flash preview
比较条件:匹配实际系统总吞吐量。此处是生成阶段每用户 token/s 的提升,不是所有请求总耗时都减少 60–85%。
DSpark 是一种投机解码加速框架:先快速准备一小段草稿,再由原来的大模型把关。它让草稿接得更连贯,也让每一份验证预算用得更划算。 [1]
这里讨论自回归文本生成。模型根据已经确定的文本预测下一个 token,再把它接回上下文。后一个位置需要知道前面究竟选了什么。 [3]
先看一轮“草稿 → 调度 → 验证 → 输出”。下面采用固定的贪心参考结果演示;不相符的第一个候选会截断整段后缀。随机采样的严格规则放在第 05 节。 [4]
候选已经是已知输入,不需要等模型逐个生成。对“喝|一|杯|热”,各位置能同时计算自己的下一 token 分布;因果注意力只让它们读取左边。
例如,“杯”对应的分布在假设前缀“喝一”成立时计算。如果“一”被拒绝,“杯”及后面的计算就不能沿用。计算可以并行,接受必须形成连续前缀。 [4]
| 输入位置 | 喝 | 一 | 杯 | 热 |
|---|---|---|---|---|
| 喝 → 预测一 | 可读 | × | × | × |
| 一 → 预测杯 | 可读 | 可读 | × | × |
| 杯 → 预测热 | 可读 | 可读 | 可读 | × |
| 热 → 预测牛奶 | 可读 | 可读 | 可读 | 可读 |
纯并行草稿虽然快,但后一个位置不知道前一个位置实际采样了什么,可能把两种合理说法拼坏。DSpark 加入很轻的顺序模块,补上块内依赖。 [1 §3.1]
重的 Transformer 不必逐位置重跑;只让很轻的头从左到右工作。
并行骨干仍负责上下文信息;新增的顺序偏置依赖前一个 token,以低秩矩阵实现。不要误解成整个模型只记得一个词。 [1 §3.1]
论文也讨论用递归状态保留块内前缀历史的版本;论文中的 DeepSeek-V4 生产配置采用 Markov 头。 [1 §3.1、§5.1]
Uₖ 是并行骨干对第 k 个位置算出的基础 logits(未归一化分数);Bₖ 是轻量头补上的偏置;softmax 把两者相加后的分数变成概率。低秩分解避免直接保存巨大的“词表 × 词表”转移矩阵。 [1 式4–5]
上面的两词玩具例子从相同分数出发,给兼容搭配加 ln(9) 的偏置,于是概率由 1:1 变成 9:1。这是为了展示机制,真实偏置需要学习,并不保证每次都选中兼容词。
把大模型看作一位同时服务多人的审稿人。空闲时多看几页划算;忙碌时,低把握的后缀会挤占别人的机会。DSpark 同时看前缀存活概率与硬件成本。 [1 §3.2]
拖动负载,观察每条请求保留的长度。点击任意概率方块,查看“单步置信度”怎样变成“整段存活概率”。
cⱼ 估计的是“前面的候选已接受时,当前候选也会被接受”的条件概率;它不是事实正确率。前 j 个全部存活的估计为:
例如 c₁ = c₂ = c₃ = 0.8,则第 3 个候选能被保留的概率是 0.512,而不是 0.8。前面的“1”来自目标模型补出的 token。置信度还需要校准,不能直接把“自信”当作准确概率。 [1 §3.2]
把各请求的前缀扩展按 aⱼ 从高到低排列;在平滑成本假设下,沿此顺序增加验证位置,当预期吞吐量不再提高时停止。不是给每条请求设一个相同的固定置信度阈值。
SPS(B) 表示对应 batch 大小时每秒能执行的步数,应来自实际引擎测量。本实验用合并固定开销后的玩具曲线 T(B) = 20 + (0.05 + 1.15ρ)B + (0.002 + 0.10ρ)B² 毫秒,ρ 为负载比例;SPS = 1000/T。
严格实现还有因果限制:不能偷看当前 token 的结果,再决定是否让它参评。论文的同步算法使用早停;生产方案用前两步的历史预测确定容量,并对当前候选排序,以适应异步流水线与不平滑硬件曲线。此处只演示平滑成本下的同步选择逻辑,不复刻生产服务。 [1 算法1、§5.2、附录A]
严格投机采样保留的是目标模型的输出概率分布,不是保证两次运行得到完全相同的句子。置信度只帮助分配预算,真正把关的是接受与拒绝采样规则。 [4]
假设下一词只有 茶、咖啡、水。目标模型概率固定为 50%、30%、20%;让草稿模型偏爱“茶”,再观察校正。
设 p 是目标分布,q 是实际使用的草稿分布(包括顺序头带来的调整)。先从 q 抽出 x,以如下概率接受:
如果拒绝,不能简单再从 p 随便抽一次,而应从“目标相对草稿缺少的概率质量”中重采样:
玩具例子中,草稿 q = (0.70, 0.18, 0.12),目标 p = (0.50, 0.30, 0.20)。接受部分的总概率质量为 (0.50, 0.18, 0.12),剩余 0.20 按 (0, 0.60, 0.40) 补回,最后正好恢复 p。若 q = p,全部接受,根本不会走拒绝分支。 [4]
调度也必须满足“不偷看未来采样结果”的因果条件;否则先挑“有利的候选”再验证,会引入选择偏差。无损来自完整算法的正确实现,不是来自一句“让大模型检查一下”。 [1 §3.2.2、附录A]
这一节才是论文报告的真实生产数据:DeepSeek-V4 预览版服务中,DSpark-5 与先前 MTP-1 基线比较。单用户出字速度和全系统吞吐量是两种不同指标。 [1 §5.4]
比较条件:匹配实际系统总吞吐量。此处是生成阶段每用户 token/s 的提升,不是所有请求总耗时都减少 60–85%。
比较条件:匹配系统容量。收益受模型、硬件、并发、草稿与目标的一致程度影响;不是本地部署的普遍承诺。
草稿本身要花时间,也占资源。若接受率很低,即使剪掉后缀,已经付出的并行起草成本也无法收回。不同推理引擎对动态长度的支持也会影响收益;仅有草稿权重并不自动等于复现整套生产调度。 [1 §5.2–5.4]
DSpark = 半自回归草稿 + 置信度 / 硬件感知调度 + 严格目标验证。
让便宜的计算多做一点,让昂贵的计算少浪费一点,而不是降低最后的把关标准。 [1]
Cheng 等,DeepSeek-AI / 北京大学。arXiv:2607.05147v1,2026-07-06。§3:架构、概率与调度;§5:部署、收益与限制;附录A:调度选择偏差。本站的原理图为重新绘制的教学示意。
说明该发布是在原 checkpoint 上附加投机解码模块,并非一个全新的主模型。网站不提供模型部署或实际推理服务。
Google Research,2024-12-06。用于补充 token、自回归生成、内存瓶颈,以及并行验证的直觉。
Leviathan、Kalman、Matias,ICML 2023。标准投机解码、拒绝采样算法与目标分布保持证明。
包含草稿模型的数据准备、训练和评估流程。DSpark 是算法 / 模块;DeepSpec 是研究代码库,二者不是同一个概念。
实验 01–04 使用人为分词、概率与成本,不能用于预测 GPU 性能;实验 05 是有限词表上的真实公式模拟;仅第 06 节的数值来自论文。演示不调用 API、不加载模型、不收集输入;打开外部来源才需要联网。