幸知日报
← 文章

V1 深调:DeepSeek-V4.1-Flash 开源——CED 架构、KV Cache 压缩与 V4 Pro 去留线

调研目标:把 2026-09-16 幸知日报条目「DeepSeek-V4.1-Flash 开源」核到官方模型卡与技术报告原文,并厘清它与 9-11「V4 Pro 下线风波 → 官方称续服」线的连续/矛盾关系。 核验时间:2026-09-17 凌晨(北京时间)。 核验方式:全部走命令行抓取(curl),浏览器 MCP 本

幸知 调研报告 调研

#开源#DeepSeek#Flash#CED#Cache#Pro#MCP

# V1 深调:DeepSeek-V4.1-Flash 开源——CED 架构、KV Cache 压缩与 V4 Pro 去留线

调研目标:把 2026-09-16 幸知日报条目「DeepSeek-V4.1-Flash 开源」核到官方模型卡与技术报告原文,并厘清它与 9-11「V4 Pro 下线风波 → 官方称续服」线的连续/矛盾关系。 核验时间:2026-09-17 凌晨(北京时间)。 核验方式:全部走命令行抓取(curl),浏览器 MCP 本轮未使用;关键数字逐项与一手原文比对。


## 一、结论速览

  1. [事实] 条目本体核实无误,但口径需修正。 模型确实存在且为官方发布:Hugging Face 仓库 deepseek-ai/DeepSeek-V4.1-Flash2026-09-10 02:17:58 UTC 创建、08:18:10 UTC 最后更新(HF API 元数据),官方新闻页与更新日志均为 2026-09-10。日报写「页面最近更新 9-10」正确,但它是一条 9-10 的旧闻,不是 9-16 的新事件——9-11 深调已对同一发布做过完整底稿,9-16 条目实为机器之心 Week 37 通讯的回捞。

  2. [事实] 「552B 参数」是官方公开口径的”骨干参数”,不是总参数。 官方新闻页与模型卡均写「552B backbone parameters」,而技术报告第 2.1 节另行披露还有 196B Engram 参数has 552B backbone parameters and 196B Engram parameters)。即:公开话术的 552B 与完整技术口径的 552B+196B 是两套数,混用会低估模型规模。日报只写「552B 参数」,沿用了官方公开口径,未区分骨干/总参,也未提 Engram。

  3. [事实] 日报漏掉了本次发布最核心的卖点——激活参数非对称。 官方与技术报告一致写明:prefill 阶段每 token 激活 8B,decode 阶段激活 16Bactivating 8B parameters per token during prefill and 16B during decode)。日报只写「552B 参数 MoE」,未提激活参数,恰好丢了「小成本大智能」的关键(官方中文标题即「非对称模型结构,小成本大智能」)。

  4. [事实] CED 与 KV Cache 压缩的表述与官方一致。 40 层 Transformer = 20 层因果编码器 + 20 层解码器;解码器全局 KV cache 由编码器终态隐状态投影而来;全局 KV cache 降至 890 bytes/token(≈ V4-Flash 的 1/4),持久化 KV cache ≈ 1/8,相对初代 V1 缩小 437 倍。日报描述准确,仅「20 层因果编码器 + 20 层解码器」的总层数(40)未点明。

  5. [事实] 与 9-11 线的矛盾未消,且截至核验时仍挂在官网。 官方新闻页至今仍写「我们计划有序下线 V4 Pro」「9 月 14 日 12:00 之后请求路由到 V4.1 Flash」;而定价页脚注与更新日志写「为响应广大用户需求,决定 9-14 之后继续提供 V4 Pro API 服务,计费方式不变」。两处一手源并存,用户读新闻页会得到已作废的信息。这不是新矛盾,是 9-11 已记录的矛盾延续至今(9-17 仍未修复)

  6. [推断] 定价口径必须沿用 9-11 的纠正结论,不可回退到「全线降 60%」。 本次实核定价页:deepseek-flash(V4.1-Flash)与 deepseek-v4-pro 并列;「降 60%」仅指相对旧 V4 Flash 的缓存命中输入档(¥0.05→¥0.02);缓存未命中降约 33.3%,输出降约 11.1%;混合负载实降 34.7%。另有「相对 V4 Pro 降 77–80%」是另一套基准,与 60% 不可互换。


## 二、模型概况(官方模型卡逐项核对)

以下逐项来自 HF 模型卡原文(README.md,本次 live 重取 13110 字节,与 9-16 存档逐字一致)、HF API JSON、config.json 与官方技术报告 PDF(本次重下,sha256 与 9-16 存档完全一致,51 页)。

项目官方值口径说明置信度
仓库deepseek-ai/DeepSeek-V4.1-FlashHF 官方库[事实]
创建时间2026-09-10 02:17:58 UTCHF API createdAt[事实]
最后更新2026-09-10 08:18:10 UTCHF API lastModified[事实]
许可MIT模型卡 frontmatter license: mit + HF API tagslicense:mit[事实]
架构类型多模态 MoE(图文输入、文本自回归输出)pipeline_tag: image-text-to-text[事实]
骨干参数552B官方公开口径(backbone)[事实]
Engram 参数196B(技术报告另行披露)稀疏访问的条件记忆,非骨干[事实]
激活参数prefill 8B / decode 16B(非对称)本次发布核心卖点[事实]
层数40 层(20 编码器 + 20 解码器)config.json num_hidden_layers=40;技术报告 2.1[事实]
上下文长度1,048,576(1M)tokenconfig.json max_position_embeddings=1048576;定价页 CONTEXT LENGTH 1M[事实]
最大输出384K token定价页 MAX OUTPUT[事实]
RoPE 扩展YaRN,factor 16,原始 65536config.json rope_scaling[事实]
MoE 配置1 共享专家 + 384 路由专家,每 token 激活 6 个模型卡 + config.json + 技术报告 4.2.1[事实]
注意力64 查询头,1 个 KV 头,head_dim 512,SWA 窗口 128config.json;GQA 式极端压缩 KV 头[事实]
视觉塔DeepSeek-ViT,32 层,hidden 1024,patch 14,3×3 pixel-unshuffleconfig.json vision_config;技术报告 2.1.1[事实]
预训练语料45T token 多模态;稀疏注意力从零以 64K 序列训练,34T token 处扩展到 1M模型卡 + 技术报告 4.2.2[事实]
推理档位连续可调 reasoning effort 1–100(整数)模型卡 + 技术报告 5.1.4[事实]
技术报告HF 仓库内 DeepSeek_V41_Tech_Report.pdf,51 页非 arXiv(arXiv API 全库检索 0 命中)[事实]
提示词编码不提供 Jinja 模板,改发 encoding/encoding.py 参考实现 + deepseek-recipe Rust 工具模型卡 Prompt Encoding 节[事实]
生态数据downloads 366,459,likes 2,816(核验时)HF API[事实]

[事实] 模型卡标题即《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》,官方定位非常明确——这不是一次”参数更大”的发布,而是一次”同样能力、更小成本”的发布

[推断] 「552B 骨干 + 196B Engram」意味着完整权重规模约 748B。官方对外只讲 552B,属选择性披露;技术报告与第三方权重文件均能佐证 Engram 真实存在(见第四节 antirez GGUF)。


## 三、技术分析

### 3.1 Causal Encoder-Decoder(CED):把 prefill 砍掉近一半

[事实] 技术报告 2.2 节:CED 受 YoCo(Sun et al., 2024)启发,但做了结构性改进。核心机制是——解码器的全局 KV cache 直接由编码器终态(第 L/2 层,即因果编码器最后一层)隐状态投影而来,而不是每一解码层各自从自己的隐状态生成。这样大多数 prompt token 可以绕过完整的解码器计算,只保留层内滑动窗口注意力。

[事实] 收益:prefill 计算量近乎减半(“nearly halves prefill computation”),对 agentic 场景中”工具调用频繁、缓存频繁未命中”的输入密集型负载收益最大。这也是「输入激活 8B、输出激活 16B」非对称的由来——输入侧走便宜的编码器路径,输出侧才需要完整解码器。

[推断] 用官方自己的比喻:这是把”读长文档”和”写答案”的成本结构拆开了。过去两类工作共用一套昂贵的解码器前向,现在读的部分交给更便宜的编码器。对 agent 工作流(长上下文反复 prefill)是结构性降本,而非调参式优化。

### 3.2 KV Cache 压缩:两套数字,别搞混

[事实] 技术报告把 KV cache 明确分成两类,压缩比完全不同:

KV 类别存放位置V4.1-Flash 值相对 V4-Flash实现手段置信度
全局 KV cacheHBM(常驻)890 bytes/token≈1/4CSA2 跨层复用 + FP4 主 KV 量化[事实]
持久化 KV cacheSSD / 主机内存≈1/8SWA Bounded Replay(不再持久化 SWA KV)[事实]

[事实] 相对初代模型(DeepSeek-V1):全局 KV cache 缩小约 437 倍(技术报告摘要与官方新闻页一致)。

[事实] 持久化 KV cache 的 1/8 由两个乘法因子构成:① 持久化层不再存 SWA KV,几乎减半;② 其保留的全局 KV 再压到 V4 的 1/4(技术报告 3.2.1)。

### 3.3 CSA2:三种静态模式共享 KV

[事实] Compressed Sparse Attention 2(CSA2)给每个注意力层静态指定三种模式之一:

  • Full 模式:本层自算 main KV 与 indexer K,跑完整索引选出 Top-K。
  • Reindex 模式:复用前面层的 main KV 与 indexer K,但重新打分产生新的 Top-K。
  • Reuse 模式:直接复用前面层算好的 Top-K 索引,不跑索引器。

[事实] 编码器 18 层用 CSA2(压缩率 m=2),分 3 组各 6 层:每组首层 Full、其余 5 层 Reuse。解码器 20 层用 CSA2(m=1),分 5 组各 4 层:首组首层 Full + 3 层 Reuse;其余 4 组首层 Reindex + 3 层 Reuse(技术报告 4.2.1)。

[事实] 解码器另加 Hierarchical Sparse Indexer:首个 Full 层按块打分选出候选池(最多 2048 块 × 8 位置 = 16384 候选位置),后续索引层只在这个池内检索,把深层索引器成本从”随上下文线性”变为常数

[事实] FP4 主 KV 缓存:采用 OCP 标准 MXFP4 格式,选 E2M1 + 每 16 通道一个 E4M3 scale(仿 NVFP4 但省略二级全局 scale)。SWA KV 仍保留 FP8(对量化敏感)。相比 DeepSeek-V4 的 FP8 主 KV,存储再近乎减半。

### 3.4 SWA Bounded Replay:把”灾难性未命中”变成”优雅降级”

[事实] 精确重建 L 层 SWA KV 需回放 L×n_win 个 token,代价过高。SWA Bounded Replay 只回放最近 n_win(=128)个 token,接受近似状态。它有两个分支:Encoder SWA Bounded Replay(让前缀缓存只依赖全局 KV,从而把 SWA KV 移出持久化缓存)与 Decoder SWA Bounded Replay(把解码器前向限制在 n_win token,近乎再省一半 prefill)。

[事实] 官方承认这是近似重建(“not mathematically equivalent”),但在后训练阶段模拟了同样的回放做 train-aware 适配,实验显示对回答质量影响可忽略。

### 3.5 多模态:原生、从预训练一开始就融合

[事实] 视觉编码器 DeepSeek-ViT 从零训练,用 2D-RoPE 替代绝对位置编码、线性投影替代 patch 卷积(兼容 Muon 优化器)、3×3 pixel-unshuffle 把视觉 token 数降 9 倍(支持到约 1344×1344)。经 2 层 MLP projector 映射到语言骨干,从语言模型预训练一开始就与文本嵌入联合处理(模型卡 + 技术报告 2.1.1)。

[事实] 视觉塔训练分两阶段:SigLIP 式 sigmoid 对比学习(约 47B 图文对,限 224×224)→ 接 4B MoE LLM 做自回归微调(236B token,分辨率 544–1344),之后丢弃该 LLM 只保留视觉编码器。

[推断] 原生多模态的意义在于:V4 Pro 不支持视觉,V4.1-Flash 支持——官方把视觉能力下放到了更便宜的 Flash 档,而贵档反而没有。这与「Flash 全面超越 Pro」的叙事互相矛盾(见第六节)。


## 四、竞品与自家产品线对比

### 4.1 自家三代横评(官方基准表,Base 模型)

[事实] 数据来自模型卡 Evaluation Results 与官方技术报告 Table 1(两处一致):

维度DeepSeek-V4-Flash-BaseDeepSeek-V4-Pro-BaseDeepSeek-V4.1-Flash-Base
骨干参数284B1.6T552B
激活参数13B49B8B(prefill)/ 16B(decode)
MMLU-Pro68.373.574.1
SimpleQA-Verified30.155.242.3
LongBench-V244.751.545.2
HumanEval69.576.879.4
GSM8K90.892.693.0
MMMU-Pro56.5(原生多模态)

[事实] 官方自述:V4.1-Flash-Base 用约 1/3 的总参数、约 1/4 的激活参数,达到与 V4-Pro-Base 相当的世界知识/推理/编码能力(技术报告 1)。

### 4.2 Instruct 前沿对比(官方基准表摘)

基准Opus-5.0GPT-5.6 SolK3GLM-5.3DS-V4-ProDS-V4-FlashDS-V4.1-Flash
GPQA Diamond93.494.192.988.192.489.990.9
HLE56.344.543.542.0†42.7†37.8†36.8(39.1†)
Terminal-Bench 2.189.188.888.388.287.982.790.6
DeepSWE v1.174.073.067.566.962.754.474.2
CyberGym84.580.084.583.376.788.1
HLE w/ tools63.659.862.560.051.563.9
AutomationBench50.345.846.748.843.237.754.8

[事实] 规律清晰:V4.1-Flash 在 agentic/工具类基准上领先(含自家 V4 Pro),但在纯知识/推理类基准上落后 V4 Pro(GPQA 90.9 < 92.4,HLE 36.8 < 42.7,LongBench-V2 45.2 < 51.5)。

### 4.3 与同量级开源模型对比

[事实] 技术报告结论节自述:尽管参数规模显著小于 GLM-5.3 与 Kimi-K3,V4.1 在关键基准上达到可比、部分任务更优的水平。

[事实] 官方对第三方权重生态的佐证(第三方独立发布,非官方):antirez/deepseek-v4.1-flash-gguf(336,741 downloads)在 README 中写明——每个语言 GGUF 含 188.83 GiB 的原生 FP8 Engram 表,主权重 Q2 151.77 GiB / Q4 294.15 GiB,视觉编码器独立 0.90 GiB,且明确声明与 DeepSeek V4 Flash 权重及 DSpark 草稿器不通用。这是 Engram 参数真实存在、且与骨干分离的强第三方证据。

[推断] 188.83 GiB 的 FP8 Engram 表体量与 196B 参数(FP8 约 196 GB)在数量级上吻合,第三方实测反向印证了技术报告的 196B 口径。

### 4.4 API 定价与产品线(官方定价页,本次 live 实核)

[事实] 现价(单位:每 1M token,空闲档 = 高峰档一半;高峰为 UTC 周一至周五 01:00–04:00 与 06:00–10:00,等价北京时间 9:00–12:00、14:00–18:00):

档位deepseek-flash(V4.1-Flash)USDdeepseek-v4-pro USD
输入·缓存命中·空闲 / 高峰$0.003 / $0.006$0.022 / $0.044
输入·缓存未命中·空闲 / 高峰$0.15 / $0.30$0.66 / $1.32
输出·空闲 / 高峰$0.60 / $1.20$1.98 / $3.96
并发限制2500500

[事实] 模型版本:deepseek-flash = DeepSeek-V4.1-Flash;deepseek-v4-pro = DeepSeek-V4-Pro-0813。deepseek-flash 支持视觉,deepseek-v4-pro 不支持。

[事实] 旧名 deepseek-v4-flashdeepseek-v4-flash-vision-exp 仍接受,但对应模型已退役,请求路由到 V4.1-Flash 并按 Flash 价计费。

[事实] 降价口径(沿用 9-11 纠正结论,本次复核一致)

  • 相对旧 V4 Flash:缓存命中 −60%(¥0.05→¥0.02,仅此一档);缓存未命中 −33.3%;输出 −11.1%。
  • 相对 V4 Pro(同档位):缓存命中 −86.4%;缓存未命中 −77.3%(即「77–80%」口径的来源);输出 −69.7%。
  • 混合负载(100 万缓存命中 + 10 万缓存未命中 + 1 万输出,空闲档):¥0.245→¥0.16,−34.7%
  • [事实] 官方原话只说「API prices have been reduced accordingly / 我们相应下调了 V4.1 Flash 的定价」,未给任何百分比

## 五、行业研判

以下为研判,均标 [推断]

  1. [推断] 这条发布的主线不是”更大”,而是”更便宜地做长上下文 agent”。 CED 砍 prefill、CSA2+FP4 砍 KV、SWA Bounded Replay 砍持久化存储——三个优化都精确瞄准 agent 工作流的成本结构(长 prompt、频繁缓存未命中)。技术报告摘要第一句就点明「long-horizon agents 使负载日益 input-heavy」。这是为 agent 时代重写推理经济学,而非一次常规迭代。

  2. [推断] 开源前沿模型的竞争焦点正从”参数规模”转向”每 token 成本 × 上下文长度”。 V4.1-Flash 用 552B 骨干 + 8B/16B 激活,在 agentic 基准上压过 1.6T/49B 的自家 V4 Pro。这给同量级开源模型(GLM-5.3、Kimi-K3)的压力不在”分数”,而在”同等分数下的部署成本”。第三方 GGUF/量化版本(antirez、NVFP4、EXL3、MLX 等十余个)在两周内涌现,说明社区对”可本地/低成本部署”的需求被真实激活。

  3. [推断] API 价格战的下一战场是”缓存命中价”。 60% 的最大降幅落在缓存命中档,而不是输出档——这是 agent 场景中占比最高的成本项(官方新闻页原话:「在 Agent 使用场景中,缓存命中的费用往往占比较高」)。对高频工具调用的 agent,成本下降的体感会远大于「混合负载 −34.7%」这个平均数字。

  4. [推断] 官方把「V4.1-Pro」写进了路线图。 新闻页原话「至未来 V4.1 Pro 上线之前」暗示下一代 Pro 已在计划中;V4.1-Flash 是「全新模型结构系列中最小尺寸的模型」(官方原话)。即:CED/CSA2 架构大概率会向上扩展到更大模型,V4 Pro 的续服是过渡安排。

  5. [推断] 对本地部署者的实际门槛仍高。 官方明说大规模部署需「2k 卡 GPU + 存储集群」。第三方 Q4 GGUF 主权重 294 GiB,单机难承载;antirez 的方案要 512GB Mac 或双 128GB Mac + RDMA。“开源” ≠ “人人可跑”,实际仍是机构级部署。


## 六、争议与反例

  1. [事实] 「全面超越 V4 Pro」在基准层面不成立。 官方新闻页与更新日志写「在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro」,但官方自己的表格里:GPQA Diamond 90.9 < 92.4、HLE 36.8 < 42.7、SimpleQA-Verified 42.3 < 55.2、LongBench-V2 45.2 < 51.5。[推断] 准确表述应是「在 agentic 与成本维度超越,在知识/长上下文维度不及」——这是能力置换(更会调用工具,知识记忆更少),不是全面升级。9-11 深调已指出此点,本次复核不变。

  2. [事实] 官方两处一手源至今互相矛盾(截至 9-17)。 官方新闻页仍写「我们计划有序下线 V4 Pro 模型」「9 月 14 日 12:00 之后请求全部路由到 V4.1 Flash」;而定价页脚注与更新日志写「为响应广大用户需求,决定 9-14 之后继续提供 V4 Pro API 服务,计费方式保持不变」。[推断] 普通用户若只读新闻页,会误以为 V4 Pro 已下线并据此做迁移决策——这是会误导用户的实际风险,而非文字洁癖。9-11 报告已记录,两天后仍未修复。

  3. [事实] 全部基准均为官方自测,无独立复现。 所有分数出自「DeepSeek internal framework」,且 code agent 类基准使用 DeepSeek Harness minimal mode 作为脚手架(模型卡与更新日志均明示)。[推断] 自测脚手架对自家模型有利是结构性风险;更新日志 2026-08-21 条目也确认「DeepSeek family models were tested using the DeepSeek Harness minimal mode」。9-11 找到的唯一独立实测(SMF Clearinghouse)给出 80.9%,反低于其自测的 V4 Pro 81.5%,且该站自述未纳入评分公式——不足以推翻官方数字,但足以把”全面超越”降级为”分维度成立、需按用途选型”

  4. [事实] 官方基准表自身存在小口径不一致。 NL2Repo-Bench:更新日志写 65.4,模型卡 Instruct 表写 64.0[推断] 可能是评测脚手架或版本差异,但官方两处公开数字不一致本身值得注意(不影响主结论)。

  5. [事实] 「552B 参数」的对外口径隐去了 196B Engram。 官方新闻页与模型卡只讲 552B;196B Engram 只出现在技术报告正文与第三方权重文件。[推断] 这不是造假(技术报告如实披露),但媒体与日报若只读新闻页,会系统性低估模型规模——这正是本条目日报发生的情况。


## 七、断言清单

断言置信度信源 URL核验方式
HF 仓库 deepseek-ai/DeepSeek-V4.1-Flash 存在[事实]https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flashcurl 直开 200,正文命中
创建 2026-09-10T02:17:58Z / 更新 2026-09-10T08:18:10Z[事实]https://huggingface.co/api/models/deepseek-ai/DeepSeek-V4.1-FlashHF API JSON 逐字段读取
许可 MIT[事实]https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/raw/main/README.md模型卡 frontmatter + API tags
骨干参数 552B[事实]模型卡 README + 技术报告 PDF p.7原文逐句核对
Engram 参数 196B(骨干之外)[事实]技术报告 PDF p.7 / p.21原文「552B backbone parameters and 196B Engram parameters」
激活参数 prefill 8B / decode 16B[事实]模型卡 README + 技术报告 p.7原文逐句核对
40 层(20 编码器 + 20 解码器)[事实]https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/resolve/main/config.jsonnum_hidden_layers=40 + 技术报告 2.1
上下文 1,048,576 token[事实]config.json + https://api-docs.deepseek.com/quick_start/pricingmax_position_embeddings + 定价页
最大输出 384K[事实]https://api-docs.deepseek.com/quick_start/pricing定价页 MAX OUTPUT
全局 KV cache 890 bytes/token ≈1/4[事实]技术报告 PDF 摘要 / p.37原文数字逐项核对
持久化 KV cache ≈1/8[事实]技术报告 PDF p.19原文核对
相对 V1 KV cache 缩小 437 倍[事实]技术报告 PDF p.1 + https://www.deepseek.com/news/deepseek-v4-1-flash/两处一致
CED:解码器全局 KV 由编码器终态投影[事实]技术报告 PDF 2.2 节原文核对
CSA2 三模式 + 层级稀疏索引器[事实]技术报告 PDF 2.3.1 / 2.3.2原文核对
FP4 主 KV(E2M1 + 每 16 通道 E4M3 scale)[事实]技术报告 PDF 2.4.4原文核对
SWA Bounded Replay 只回放 n_win=128[事实]技术报告 PDF 3.2.2原文核对
45T token 多模态预训练,34T 处扩展至 1M[事实]技术报告 PDF 4.2.2 + 模型卡原文核对
技术报告为 HF 托管 PDF,非 arXiv[事实]arXiv API all:"DeepSeek-V4.1-Flash" 返回 totalResults=0arXiv API 全库检索
官方发布日 2026-09-10[事实]https://www.deepseek.com/news/deepseek-v4-1-flash/ + https://api-docs.deepseek.com/updates/两处一手源一致
API 名 deepseek-flash,旧名路由[事实]https://api-docs.deepseek.com/quick_start/pricing定价页脚注(1) + 更新日志
V4 Pro 9-14 后继续提供、计费不变[事实]定价页脚注(2) + 更新日志两处原文一致
新闻页仍写 V4 Pro 下线计划(矛盾未消)[事实]https://www.deepseek.com/news/deepseek-v4-1-flash/本次 live 直开核对
降价 60% 仅缓存命中档[事实]定价页 + 9-11 报告(界面新闻/Edgen 交叉)与 9-11 纠正结论对齐
混合负载实降 34.7%[推断]9-11 报告引 Edgen 口径沿用 9-11 核算,本次未重算
「全面超越 V4 Pro」不成立于基准层[事实]模型卡 Instruct 表(GPQA 90.9<92.4、HLE 36.8<42.7)官方自表逐项比对
无独立基准复现[事实]官方自述「internal framework」+ 9-11 报告 SMF 一节原文 + 前序报告
基准测试用 DeepSeek Harness minimal mode[事实]模型卡 + https://api-docs.deepseek.com/updates/两处原文
第三方 GGUF 含 188.83 GiB Engram 表[事实]https://huggingface.co/antirez/deepseek-v4.1-flash-gguf第三方 README 原文
官方合作伙伴含 OpenCode[事实]https://www.deepseek.com/news/deepseek-v4-1-flash/新闻页原文
大规模部署需 2k 卡 GPU[事实]https://www.deepseek.com/news/deepseek-v4-1-flash/新闻页原文
机器之心 Week 37 列为本周事件[事实]https://www.jiqizhixin.com/首页文案命中「本周,深度求索开源 DeepSeek V4.1 Flash 模型」
机器之心 Week 37 通讯全文[待核实]pro.jiqizhixin.com/inbox/dcc3c679-…直开 404,需登录

## 八、信源清单

标题URL日期性质
DeepSeek-V4.1-Flash 模型卡(HF)https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash2026-09-10primary
模型卡 README 原文https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/raw/main/README.md2026-09-10primary
HF 模型元数据 APIhttps://huggingface.co/api/models/deepseek-ai/DeepSeek-V4.1-Flash2026-09-10primary
模型 config.jsonhttps://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/resolve/main/config.json2026-09-10primary
官方技术报告 PDF(51 页)https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf2026-09-10primary
官方新闻页《DeepSeek V4.1 Flash:更强、更快、更普惠》https://www.deepseek.com/news/deepseek-v4-1-flash/2026-09-10primary
官方更新日志(Change Log)https://api-docs.deepseek.com/updates/2026-09-10primary
官方定价页 Models & Pricinghttps://api-docs.deepseek.com/quick_start/pricing2026-09-17 核验primary
机器之心首页(Week 37 通讯条目)https://www.jiqizhixin.com/2026-09-17 核验secondary
antirez GGUF 权重(第三方,含 Engram 表实证)https://huggingface.co/antirez/deepseek-v4.1-flash-gguf2026-09 核验secondary
HF 第三方权重生态检索https://huggingface.co/api/models?search=DeepSeek-V4.1-Flash2026-09-17 核验secondary
9-11 深调底稿(本库,含降价口径纠正)swarm_reports/2026-09-11-幸知日报/v1-deepseek-v41-flash/00-报告.md2026-09-11secondary
9-16 幸知日报(被核条目)30_Resources/新闻情报/日报/2026-09-16-RSS-幸知日报.md2026-09-16secondary

## 九、待核实项与追踪过程

事项状态追踪过程
机器之心 Week 37 通讯全文⚠️ 待核实首页命中文案并取出跳转链接 https://pro.jiqizhixin.com/inbox/dcc3c679-f14a-4469-9f56-59052b4b4ef4;直开返回 404(需登录/已失效);站内搜索 /search?q= 返回 404;archive.today 对本站返回 429 限流。仅能确认首页把该发布列为 Week 37 本周事件,无法取得通讯正文。
「总参数」官方合计口径⚠️ 待核实技术报告分别写 552B 骨干 + 196B Engram,未给出”总参数”合计数。748B 为本次自行相加的推断,非官方表述。
NL2Repo-Bench 数字不一致⚠️ 待核实更新日志 65.4 vs 模型卡 64.0。未见官方解释,可能为脚手架/版本差异。
独立基准复现(本次新增)⚠️ 待核实除 9-11 已记录的 SMF Clearinghouse,本轮未见新的权威独立复现。HF 第三方多为量化/微调权重,非基准复现。
旧 V4 Flash 历史价目表原始快照⚠️ 待核实沿袭 9-11:旧价 ¥0.05/¥1.5/¥4.5 系由降幅百分比反推,原定价页历史版本未取得(Wayback 曾 429)。本次未再尝试。
官方新闻页与定价页矛盾何时修复⚠️ 待核实9-11 已记录,9-17 核验仍未修复。需持续跟进。

* 本报告为 2026-09-16 幸知日报 V1 深度调研子代理产出。原始抓取素材:tmp/swarm-materials/v1-deepseek-v41-flash/(含 HF API JSON、模型卡、config.json、定价页与新闻页正文、技术报告 PDF 及全文提取)。

更多文章 →