V1 深调:DeepSeek-V4.1-Flash 开源——CED 架构、KV Cache 压缩与 V4 Pro 去留线
调研目标:把 2026-09-16 幸知日报条目「DeepSeek-V4.1-Flash 开源」核到官方模型卡与技术报告原文,并厘清它与 9-11「V4 Pro 下线风波 → 官方称续服」线的连续/矛盾关系。 核验时间:2026-09-17 凌晨(北京时间)。 核验方式:全部走命令行抓取(curl),浏览器 MCP 本
幸知 调研报告 调研
#开源#DeepSeek#Flash#CED#Cache#Pro#MCP
# V1 深调:DeepSeek-V4.1-Flash 开源——CED 架构、KV Cache 压缩与 V4 Pro 去留线
调研目标:把 2026-09-16 幸知日报条目「DeepSeek-V4.1-Flash 开源」核到官方模型卡与技术报告原文,并厘清它与 9-11「V4 Pro 下线风波 → 官方称续服」线的连续/矛盾关系。 核验时间:2026-09-17 凌晨(北京时间)。 核验方式:全部走命令行抓取(curl),浏览器 MCP 本轮未使用;关键数字逐项与一手原文比对。
## 一、结论速览
-
[事实]条目本体核实无误,但口径需修正。 模型确实存在且为官方发布:Hugging Face 仓库deepseek-ai/DeepSeek-V4.1-Flash于 2026-09-10 02:17:58 UTC 创建、08:18:10 UTC 最后更新(HF API 元数据),官方新闻页与更新日志均为 2026-09-10。日报写「页面最近更新 9-10」正确,但它是一条 9-10 的旧闻,不是 9-16 的新事件——9-11 深调已对同一发布做过完整底稿,9-16 条目实为机器之心 Week 37 通讯的回捞。 -
[事实]「552B 参数」是官方公开口径的”骨干参数”,不是总参数。 官方新闻页与模型卡均写「552B backbone parameters」,而技术报告第 2.1 节另行披露还有 196B Engram 参数(has 552B backbone parameters and 196B Engram parameters)。即:公开话术的 552B 与完整技术口径的 552B+196B 是两套数,混用会低估模型规模。日报只写「552B 参数」,沿用了官方公开口径,未区分骨干/总参,也未提 Engram。 -
[事实]日报漏掉了本次发布最核心的卖点——激活参数非对称。 官方与技术报告一致写明:prefill 阶段每 token 激活 8B,decode 阶段激活 16B(activating 8B parameters per token during prefill and 16B during decode)。日报只写「552B 参数 MoE」,未提激活参数,恰好丢了「小成本大智能」的关键(官方中文标题即「非对称模型结构,小成本大智能」)。 -
[事实]CED 与 KV Cache 压缩的表述与官方一致。 40 层 Transformer = 20 层因果编码器 + 20 层解码器;解码器全局 KV cache 由编码器终态隐状态投影而来;全局 KV cache 降至 890 bytes/token(≈ V4-Flash 的 1/4),持久化 KV cache ≈ 1/8,相对初代 V1 缩小 437 倍。日报描述准确,仅「20 层因果编码器 + 20 层解码器」的总层数(40)未点明。 -
[事实]与 9-11 线的矛盾未消,且截至核验时仍挂在官网。 官方新闻页至今仍写「我们计划有序下线 V4 Pro」「9 月 14 日 12:00 之后请求路由到 V4.1 Flash」;而定价页脚注与更新日志写「为响应广大用户需求,决定 9-14 之后继续提供 V4 Pro API 服务,计费方式不变」。两处一手源并存,用户读新闻页会得到已作废的信息。这不是新矛盾,是 9-11 已记录的矛盾延续至今(9-17 仍未修复)。 -
[推断]定价口径必须沿用 9-11 的纠正结论,不可回退到「全线降 60%」。 本次实核定价页:deepseek-flash(V4.1-Flash)与deepseek-v4-pro并列;「降 60%」仅指相对旧 V4 Flash 的缓存命中输入档(¥0.05→¥0.02);缓存未命中降约 33.3%,输出降约 11.1%;混合负载实降 34.7%。另有「相对 V4 Pro 降 77–80%」是另一套基准,与 60% 不可互换。
## 二、模型概况(官方模型卡逐项核对)
以下逐项来自 HF 模型卡原文(README.md,本次 live 重取 13110 字节,与 9-16 存档逐字一致)、HF API JSON、config.json 与官方技术报告 PDF(本次重下,sha256 与 9-16 存档完全一致,51 页)。
| 项目 | 官方值 | 口径说明 | 置信度 |
|---|---|---|---|
| 仓库 | deepseek-ai/DeepSeek-V4.1-Flash | HF 官方库 | [事实] |
| 创建时间 | 2026-09-10 02:17:58 UTC | HF API createdAt | [事实] |
| 最后更新 | 2026-09-10 08:18:10 UTC | HF API lastModified | [事实] |
| 许可 | MIT | 模型卡 frontmatter license: mit + HF API tags 含 license:mit | [事实] |
| 架构类型 | 多模态 MoE(图文输入、文本自回归输出) | pipeline_tag: image-text-to-text | [事实] |
| 骨干参数 | 552B | 官方公开口径(backbone) | [事实] |
| Engram 参数 | 196B(技术报告另行披露) | 稀疏访问的条件记忆,非骨干 | [事实] |
| 激活参数 | prefill 8B / decode 16B(非对称) | 本次发布核心卖点 | [事实] |
| 层数 | 40 层(20 编码器 + 20 解码器) | config.json num_hidden_layers=40;技术报告 2.1 | [事实] |
| 上下文长度 | 1,048,576(1M)token | config.json max_position_embeddings=1048576;定价页 CONTEXT LENGTH 1M | [事实] |
| 最大输出 | 384K token | 定价页 MAX OUTPUT | [事实] |
| RoPE 扩展 | YaRN,factor 16,原始 65536 | config.json rope_scaling | [事实] |
| MoE 配置 | 1 共享专家 + 384 路由专家,每 token 激活 6 个 | 模型卡 + config.json + 技术报告 4.2.1 | [事实] |
| 注意力 | 64 查询头,1 个 KV 头,head_dim 512,SWA 窗口 128 | config.json;GQA 式极端压缩 KV 头 | [事实] |
| 视觉塔 | DeepSeek-ViT,32 层,hidden 1024,patch 14,3×3 pixel-unshuffle | config.json vision_config;技术报告 2.1.1 | [事实] |
| 预训练语料 | 45T token 多模态;稀疏注意力从零以 64K 序列训练,34T token 处扩展到 1M | 模型卡 + 技术报告 4.2.2 | [事实] |
| 推理档位 | 连续可调 reasoning effort 1–100(整数) | 模型卡 + 技术报告 5.1.4 | [事实] |
| 技术报告 | HF 仓库内 DeepSeek_V41_Tech_Report.pdf,51 页 | 非 arXiv(arXiv API 全库检索 0 命中) | [事实] |
| 提示词编码 | 不提供 Jinja 模板,改发 encoding/encoding.py 参考实现 + deepseek-recipe Rust 工具 | 模型卡 Prompt Encoding 节 | [事实] |
| 生态数据 | downloads 366,459,likes 2,816(核验时) | HF API | [事实] |
[事实]模型卡标题即《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》,官方定位非常明确——这不是一次”参数更大”的发布,而是一次”同样能力、更小成本”的发布。
[推断]「552B 骨干 + 196B Engram」意味着完整权重规模约 748B。官方对外只讲 552B,属选择性披露;技术报告与第三方权重文件均能佐证 Engram 真实存在(见第四节 antirez GGUF)。
## 三、技术分析
### 3.1 Causal Encoder-Decoder(CED):把 prefill 砍掉近一半
[事实] 技术报告 2.2 节:CED 受 YoCo(Sun et al., 2024)启发,但做了结构性改进。核心机制是——解码器的全局 KV cache 直接由编码器终态(第 L/2 层,即因果编码器最后一层)隐状态投影而来,而不是每一解码层各自从自己的隐状态生成。这样大多数 prompt token 可以绕过完整的解码器计算,只保留层内滑动窗口注意力。
[事实] 收益:prefill 计算量近乎减半(“nearly halves prefill computation”),对 agentic 场景中”工具调用频繁、缓存频繁未命中”的输入密集型负载收益最大。这也是「输入激活 8B、输出激活 16B」非对称的由来——输入侧走便宜的编码器路径,输出侧才需要完整解码器。
[推断] 用官方自己的比喻:这是把”读长文档”和”写答案”的成本结构拆开了。过去两类工作共用一套昂贵的解码器前向,现在读的部分交给更便宜的编码器。对 agent 工作流(长上下文反复 prefill)是结构性降本,而非调参式优化。
### 3.2 KV Cache 压缩:两套数字,别搞混
[事实] 技术报告把 KV cache 明确分成两类,压缩比完全不同:
| KV 类别 | 存放位置 | V4.1-Flash 值 | 相对 V4-Flash | 实现手段 | 置信度 |
|---|---|---|---|---|---|
| 全局 KV cache | HBM(常驻) | 890 bytes/token | ≈1/4 | CSA2 跨层复用 + FP4 主 KV 量化 | [事实] |
| 持久化 KV cache | SSD / 主机内存 | — | ≈1/8 | SWA Bounded Replay(不再持久化 SWA KV) | [事实] |
[事实] 相对初代模型(DeepSeek-V1):全局 KV cache 缩小约 437 倍(技术报告摘要与官方新闻页一致)。
[事实] 持久化 KV cache 的 1/8 由两个乘法因子构成:① 持久化层不再存 SWA KV,几乎减半;② 其保留的全局 KV 再压到 V4 的 1/4(技术报告 3.2.1)。
### 3.3 CSA2:三种静态模式共享 KV
[事实] Compressed Sparse Attention 2(CSA2)给每个注意力层静态指定三种模式之一:
- Full 模式:本层自算 main KV 与 indexer K,跑完整索引选出 Top-K。
- Reindex 模式:复用前面层的 main KV 与 indexer K,但重新打分产生新的 Top-K。
- Reuse 模式:直接复用前面层算好的 Top-K 索引,不跑索引器。
[事实] 编码器 18 层用 CSA2(压缩率 m=2),分 3 组各 6 层:每组首层 Full、其余 5 层 Reuse。解码器 20 层用 CSA2(m=1),分 5 组各 4 层:首组首层 Full + 3 层 Reuse;其余 4 组首层 Reindex + 3 层 Reuse(技术报告 4.2.1)。
[事实] 解码器另加 Hierarchical Sparse Indexer:首个 Full 层按块打分选出候选池(最多 2048 块 × 8 位置 = 16384 候选位置),后续索引层只在这个池内检索,把深层索引器成本从”随上下文线性”变为常数。
[事实] FP4 主 KV 缓存:采用 OCP 标准 MXFP4 格式,选 E2M1 + 每 16 通道一个 E4M3 scale(仿 NVFP4 但省略二级全局 scale)。SWA KV 仍保留 FP8(对量化敏感)。相比 DeepSeek-V4 的 FP8 主 KV,存储再近乎减半。
### 3.4 SWA Bounded Replay:把”灾难性未命中”变成”优雅降级”
[事实] 精确重建 L 层 SWA KV 需回放 L×n_win 个 token,代价过高。SWA Bounded Replay 只回放最近 n_win(=128)个 token,接受近似状态。它有两个分支:Encoder SWA Bounded Replay(让前缀缓存只依赖全局 KV,从而把 SWA KV 移出持久化缓存)与 Decoder SWA Bounded Replay(把解码器前向限制在 n_win token,近乎再省一半 prefill)。
[事实] 官方承认这是近似重建(“not mathematically equivalent”),但在后训练阶段模拟了同样的回放做 train-aware 适配,实验显示对回答质量影响可忽略。
### 3.5 多模态:原生、从预训练一开始就融合
[事实] 视觉编码器 DeepSeek-ViT 从零训练,用 2D-RoPE 替代绝对位置编码、线性投影替代 patch 卷积(兼容 Muon 优化器)、3×3 pixel-unshuffle 把视觉 token 数降 9 倍(支持到约 1344×1344)。经 2 层 MLP projector 映射到语言骨干,从语言模型预训练一开始就与文本嵌入联合处理(模型卡 + 技术报告 2.1.1)。
[事实] 视觉塔训练分两阶段:SigLIP 式 sigmoid 对比学习(约 47B 图文对,限 224×224)→ 接 4B MoE LLM 做自回归微调(236B token,分辨率 544–1344),之后丢弃该 LLM 只保留视觉编码器。
[推断] 原生多模态的意义在于:V4 Pro 不支持视觉,V4.1-Flash 支持——官方把视觉能力下放到了更便宜的 Flash 档,而贵档反而没有。这与「Flash 全面超越 Pro」的叙事互相矛盾(见第六节)。
## 四、竞品与自家产品线对比
### 4.1 自家三代横评(官方基准表,Base 模型)
[事实] 数据来自模型卡 Evaluation Results 与官方技术报告 Table 1(两处一致):
| 维度 | DeepSeek-V4-Flash-Base | DeepSeek-V4-Pro-Base | DeepSeek-V4.1-Flash-Base |
|---|---|---|---|
| 骨干参数 | 284B | 1.6T | 552B |
| 激活参数 | 13B | 49B | 8B(prefill)/ 16B(decode) |
| MMLU-Pro | 68.3 | 73.5 | 74.1 |
| SimpleQA-Verified | 30.1 | 55.2 | 42.3 |
| LongBench-V2 | 44.7 | 51.5 | 45.2 |
| HumanEval | 69.5 | 76.8 | 79.4 |
| GSM8K | 90.8 | 92.6 | 93.0 |
| MMMU-Pro | — | — | 56.5(原生多模态) |
[事实] 官方自述:V4.1-Flash-Base 用约 1/3 的总参数、约 1/4 的激活参数,达到与 V4-Pro-Base 相当的世界知识/推理/编码能力(技术报告 1)。
### 4.2 Instruct 前沿对比(官方基准表摘)
| 基准 | Opus-5.0 | GPT-5.6 Sol | K3 | GLM-5.3 | DS-V4-Pro | DS-V4-Flash | DS-V4.1-Flash |
|---|---|---|---|---|---|---|---|
| GPQA Diamond | 93.4 | 94.1 | 92.9 | 88.1 | 92.4 | 89.9 | 90.9 |
| HLE | 56.3 | 44.5 | 43.5 | 42.0† | 42.7† | 37.8† | 36.8(39.1†) |
| Terminal-Bench 2.1 | 89.1 | 88.8 | 88.3 | 88.2 | 87.9 | 82.7 | 90.6 |
| DeepSWE v1.1 | 74.0 | 73.0 | 67.5 | 66.9 | 62.7 | 54.4 | 74.2 |
| CyberGym | — | 84.5 | 80.0 | 84.5 | 83.3 | 76.7 | 88.1 |
| HLE w/ tools | 63.6 | — | 59.8 | 62.5 | 60.0 | 51.5 | 63.9 |
| AutomationBench | 50.3 | 45.8 | 46.7 | 48.8 | 43.2 | 37.7 | 54.8 |
[事实] 规律清晰:V4.1-Flash 在 agentic/工具类基准上领先(含自家 V4 Pro),但在纯知识/推理类基准上落后 V4 Pro(GPQA 90.9 < 92.4,HLE 36.8 < 42.7,LongBench-V2 45.2 < 51.5)。
### 4.3 与同量级开源模型对比
[事实] 技术报告结论节自述:尽管参数规模显著小于 GLM-5.3 与 Kimi-K3,V4.1 在关键基准上达到可比、部分任务更优的水平。
[事实] 官方对第三方权重生态的佐证(第三方独立发布,非官方):antirez/deepseek-v4.1-flash-gguf(336,741 downloads)在 README 中写明——每个语言 GGUF 含 188.83 GiB 的原生 FP8 Engram 表,主权重 Q2 151.77 GiB / Q4 294.15 GiB,视觉编码器独立 0.90 GiB,且明确声明与 DeepSeek V4 Flash 权重及 DSpark 草稿器不通用。这是 Engram 参数真实存在、且与骨干分离的强第三方证据。
[推断] 188.83 GiB 的 FP8 Engram 表体量与 196B 参数(FP8 约 196 GB)在数量级上吻合,第三方实测反向印证了技术报告的 196B 口径。
### 4.4 API 定价与产品线(官方定价页,本次 live 实核)
[事实] 现价(单位:每 1M token,空闲档 = 高峰档一半;高峰为 UTC 周一至周五 01:00–04:00 与 06:00–10:00,等价北京时间 9:00–12:00、14:00–18:00):
| 档位 | deepseek-flash(V4.1-Flash)USD | deepseek-v4-pro USD |
|---|---|---|
| 输入·缓存命中·空闲 / 高峰 | $0.003 / $0.006 | $0.022 / $0.044 |
| 输入·缓存未命中·空闲 / 高峰 | $0.15 / $0.30 | $0.66 / $1.32 |
| 输出·空闲 / 高峰 | $0.60 / $1.20 | $1.98 / $3.96 |
| 并发限制 | 2500 | 500 |
[事实] 模型版本:deepseek-flash = DeepSeek-V4.1-Flash;deepseek-v4-pro = DeepSeek-V4-Pro-0813。deepseek-flash 支持视觉,deepseek-v4-pro 不支持。
[事实] 旧名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 仍接受,但对应模型已退役,请求路由到 V4.1-Flash 并按 Flash 价计费。
[事实] 降价口径(沿用 9-11 纠正结论,本次复核一致):
- 相对旧 V4 Flash:缓存命中 −60%(¥0.05→¥0.02,仅此一档);缓存未命中 −33.3%;输出 −11.1%。
- 相对 V4 Pro(同档位):缓存命中 −86.4%;缓存未命中 −77.3%(即「77–80%」口径的来源);输出 −69.7%。
- 混合负载(100 万缓存命中 + 10 万缓存未命中 + 1 万输出,空闲档):¥0.245→¥0.16,−34.7%。
[事实]官方原话只说「API prices have been reduced accordingly / 我们相应下调了 V4.1 Flash 的定价」,未给任何百分比。
## 五、行业研判
以下为研判,均标
[推断]。
-
[推断]这条发布的主线不是”更大”,而是”更便宜地做长上下文 agent”。 CED 砍 prefill、CSA2+FP4 砍 KV、SWA Bounded Replay 砍持久化存储——三个优化都精确瞄准 agent 工作流的成本结构(长 prompt、频繁缓存未命中)。技术报告摘要第一句就点明「long-horizon agents 使负载日益 input-heavy」。这是为 agent 时代重写推理经济学,而非一次常规迭代。 -
[推断]开源前沿模型的竞争焦点正从”参数规模”转向”每 token 成本 × 上下文长度”。 V4.1-Flash 用 552B 骨干 + 8B/16B 激活,在 agentic 基准上压过 1.6T/49B 的自家 V4 Pro。这给同量级开源模型(GLM-5.3、Kimi-K3)的压力不在”分数”,而在”同等分数下的部署成本”。第三方 GGUF/量化版本(antirez、NVFP4、EXL3、MLX 等十余个)在两周内涌现,说明社区对”可本地/低成本部署”的需求被真实激活。 -
[推断]API 价格战的下一战场是”缓存命中价”。 60% 的最大降幅落在缓存命中档,而不是输出档——这是 agent 场景中占比最高的成本项(官方新闻页原话:「在 Agent 使用场景中,缓存命中的费用往往占比较高」)。对高频工具调用的 agent,成本下降的体感会远大于「混合负载 −34.7%」这个平均数字。 -
[推断]官方把「V4.1-Pro」写进了路线图。 新闻页原话「至未来 V4.1 Pro 上线之前」暗示下一代 Pro 已在计划中;V4.1-Flash 是「全新模型结构系列中最小尺寸的模型」(官方原话)。即:CED/CSA2 架构大概率会向上扩展到更大模型,V4 Pro 的续服是过渡安排。 -
[推断]对本地部署者的实际门槛仍高。 官方明说大规模部署需「2k 卡 GPU + 存储集群」。第三方 Q4 GGUF 主权重 294 GiB,单机难承载;antirez 的方案要 512GB Mac 或双 128GB Mac + RDMA。“开源” ≠ “人人可跑”,实际仍是机构级部署。
## 六、争议与反例
-
[事实]「全面超越 V4 Pro」在基准层面不成立。 官方新闻页与更新日志写「在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro」,但官方自己的表格里:GPQA Diamond 90.9 < 92.4、HLE 36.8 < 42.7、SimpleQA-Verified 42.3 < 55.2、LongBench-V2 45.2 < 51.5。[推断]准确表述应是「在 agentic 与成本维度超越,在知识/长上下文维度不及」——这是能力置换(更会调用工具,知识记忆更少),不是全面升级。9-11 深调已指出此点,本次复核不变。 -
[事实]官方两处一手源至今互相矛盾(截至 9-17)。 官方新闻页仍写「我们计划有序下线 V4 Pro 模型」「9 月 14 日 12:00 之后请求全部路由到 V4.1 Flash」;而定价页脚注与更新日志写「为响应广大用户需求,决定 9-14 之后继续提供 V4 Pro API 服务,计费方式保持不变」。[推断]普通用户若只读新闻页,会误以为 V4 Pro 已下线并据此做迁移决策——这是会误导用户的实际风险,而非文字洁癖。9-11 报告已记录,两天后仍未修复。 -
[事实]全部基准均为官方自测,无独立复现。 所有分数出自「DeepSeek internal framework」,且 code agent 类基准使用 DeepSeek Harness minimal mode 作为脚手架(模型卡与更新日志均明示)。[推断]自测脚手架对自家模型有利是结构性风险;更新日志 2026-08-21 条目也确认「DeepSeek family models were tested using the DeepSeek Harness minimal mode」。9-11 找到的唯一独立实测(SMF Clearinghouse)给出 80.9%,反低于其自测的 V4 Pro 81.5%,且该站自述未纳入评分公式——不足以推翻官方数字,但足以把”全面超越”降级为”分维度成立、需按用途选型”。 -
[事实]官方基准表自身存在小口径不一致。 NL2Repo-Bench:更新日志写 65.4,模型卡 Instruct 表写 64.0。[推断]可能是评测脚手架或版本差异,但官方两处公开数字不一致本身值得注意(不影响主结论)。 -
[事实]「552B 参数」的对外口径隐去了 196B Engram。 官方新闻页与模型卡只讲 552B;196B Engram 只出现在技术报告正文与第三方权重文件。[推断]这不是造假(技术报告如实披露),但媒体与日报若只读新闻页,会系统性低估模型规模——这正是本条目日报发生的情况。
## 七、断言清单
| 断言 | 置信度 | 信源 URL | 核验方式 |
|---|---|---|---|
HF 仓库 deepseek-ai/DeepSeek-V4.1-Flash 存在 | [事实] | https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash | curl 直开 200,正文命中 |
| 创建 2026-09-10T02:17:58Z / 更新 2026-09-10T08:18:10Z | [事实] | https://huggingface.co/api/models/deepseek-ai/DeepSeek-V4.1-Flash | HF API JSON 逐字段读取 |
| 许可 MIT | [事实] | https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/raw/main/README.md | 模型卡 frontmatter + API tags |
| 骨干参数 552B | [事实] | 模型卡 README + 技术报告 PDF p.7 | 原文逐句核对 |
| Engram 参数 196B(骨干之外) | [事实] | 技术报告 PDF p.7 / p.21 | 原文「552B backbone parameters and 196B Engram parameters」 |
| 激活参数 prefill 8B / decode 16B | [事实] | 模型卡 README + 技术报告 p.7 | 原文逐句核对 |
| 40 层(20 编码器 + 20 解码器) | [事实] | https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/resolve/main/config.json | num_hidden_layers=40 + 技术报告 2.1 |
| 上下文 1,048,576 token | [事实] | config.json + https://api-docs.deepseek.com/quick_start/pricing | max_position_embeddings + 定价页 |
| 最大输出 384K | [事实] | https://api-docs.deepseek.com/quick_start/pricing | 定价页 MAX OUTPUT |
| 全局 KV cache 890 bytes/token ≈1/4 | [事实] | 技术报告 PDF 摘要 / p.37 | 原文数字逐项核对 |
| 持久化 KV cache ≈1/8 | [事实] | 技术报告 PDF p.19 | 原文核对 |
| 相对 V1 KV cache 缩小 437 倍 | [事实] | 技术报告 PDF p.1 + https://www.deepseek.com/news/deepseek-v4-1-flash/ | 两处一致 |
| CED:解码器全局 KV 由编码器终态投影 | [事实] | 技术报告 PDF 2.2 节 | 原文核对 |
| CSA2 三模式 + 层级稀疏索引器 | [事实] | 技术报告 PDF 2.3.1 / 2.3.2 | 原文核对 |
| FP4 主 KV(E2M1 + 每 16 通道 E4M3 scale) | [事实] | 技术报告 PDF 2.4.4 | 原文核对 |
| SWA Bounded Replay 只回放 n_win=128 | [事实] | 技术报告 PDF 3.2.2 | 原文核对 |
| 45T token 多模态预训练,34T 处扩展至 1M | [事实] | 技术报告 PDF 4.2.2 + 模型卡 | 原文核对 |
| 技术报告为 HF 托管 PDF,非 arXiv | [事实] | arXiv API all:"DeepSeek-V4.1-Flash" 返回 totalResults=0 | arXiv API 全库检索 |
| 官方发布日 2026-09-10 | [事实] | https://www.deepseek.com/news/deepseek-v4-1-flash/ + https://api-docs.deepseek.com/updates/ | 两处一手源一致 |
API 名 deepseek-flash,旧名路由 | [事实] | https://api-docs.deepseek.com/quick_start/pricing | 定价页脚注(1) + 更新日志 |
| V4 Pro 9-14 后继续提供、计费不变 | [事实] | 定价页脚注(2) + 更新日志 | 两处原文一致 |
| 新闻页仍写 V4 Pro 下线计划(矛盾未消) | [事实] | https://www.deepseek.com/news/deepseek-v4-1-flash/ | 本次 live 直开核对 |
| 降价 60% 仅缓存命中档 | [事实] | 定价页 + 9-11 报告(界面新闻/Edgen 交叉) | 与 9-11 纠正结论对齐 |
| 混合负载实降 34.7% | [推断] | 9-11 报告引 Edgen 口径 | 沿用 9-11 核算,本次未重算 |
| 「全面超越 V4 Pro」不成立于基准层 | [事实] | 模型卡 Instruct 表(GPQA 90.9<92.4、HLE 36.8<42.7) | 官方自表逐项比对 |
| 无独立基准复现 | [事实] | 官方自述「internal framework」+ 9-11 报告 SMF 一节 | 原文 + 前序报告 |
| 基准测试用 DeepSeek Harness minimal mode | [事实] | 模型卡 + https://api-docs.deepseek.com/updates/ | 两处原文 |
| 第三方 GGUF 含 188.83 GiB Engram 表 | [事实] | https://huggingface.co/antirez/deepseek-v4.1-flash-gguf | 第三方 README 原文 |
| 官方合作伙伴含 OpenCode | [事实] | https://www.deepseek.com/news/deepseek-v4-1-flash/ | 新闻页原文 |
| 大规模部署需 2k 卡 GPU | [事实] | https://www.deepseek.com/news/deepseek-v4-1-flash/ | 新闻页原文 |
| 机器之心 Week 37 列为本周事件 | [事实] | https://www.jiqizhixin.com/ | 首页文案命中「本周,深度求索开源 DeepSeek V4.1 Flash 模型」 |
| 机器之心 Week 37 通讯全文 | [待核实] | pro.jiqizhixin.com/inbox/dcc3c679-… | 直开 404,需登录 |
## 八、信源清单
## 九、待核实项与追踪过程
| 事项 | 状态 | 追踪过程 |
|---|---|---|
| 机器之心 Week 37 通讯全文 | ⚠️ 待核实 | 首页命中文案并取出跳转链接 https://pro.jiqizhixin.com/inbox/dcc3c679-f14a-4469-9f56-59052b4b4ef4;直开返回 404(需登录/已失效);站内搜索 /search?q= 返回 404;archive.today 对本站返回 429 限流。仅能确认首页把该发布列为 Week 37 本周事件,无法取得通讯正文。 |
| 「总参数」官方合计口径 | ⚠️ 待核实 | 技术报告分别写 552B 骨干 + 196B Engram,未给出”总参数”合计数。748B 为本次自行相加的推断,非官方表述。 |
| NL2Repo-Bench 数字不一致 | ⚠️ 待核实 | 更新日志 65.4 vs 模型卡 64.0。未见官方解释,可能为脚手架/版本差异。 |
| 独立基准复现(本次新增) | ⚠️ 待核实 | 除 9-11 已记录的 SMF Clearinghouse,本轮未见新的权威独立复现。HF 第三方多为量化/微调权重,非基准复现。 |
| 旧 V4 Flash 历史价目表原始快照 | ⚠️ 待核实 | 沿袭 9-11:旧价 ¥0.05/¥1.5/¥4.5 系由降幅百分比反推,原定价页历史版本未取得(Wayback 曾 429)。本次未再尝试。 |
| 官方新闻页与定价页矛盾何时修复 | ⚠️ 待核实 | 9-11 已记录,9-17 核验仍未修复。需持续跟进。 |
* 本报告为 2026-09-16 幸知日报 V1 深度调研子代理产出。原始抓取素材:tmp/swarm-materials/v1-deepseek-v41-flash/(含 HF API JSON、模型卡、config.json、定价页与新闻页正文、技术报告 PDF 及全文提取)。