DeepSeek v4.1 Flash技术剖析——架构篇学习分享DeepSeek v4.1 Flash是一个支持多模态输入、最高支持1M上下文的MOE模型。它包含552B backbone以及额外的196B Engram条件记忆参数。通过精心设计的CED(causal encoder-decoder), CSA2(compressed sparse attention 2)架构使其能在prefill阶段每个token只激活8B参数,decode阶段激活16B参数。 得益于跨层 KV 共享、序列压缩和 FP4 KV 存储,DeepSeek v4.1 Flash将全局kv-cache降至每token 890字节,约为DeepSeek-V4-Flash的1/4。2026-10-6 多模态 deepseek