- Published on
DeepSeek 发布 V4.1 Flash:更强推理、极致压缩、半价优惠
- Authors
- Name
- Liwink
- twitter.com
发布背景与核心定位
深度求索(DeepSeek)于 2026 年 9 月 10 日正式发布其全新架构家族中的最小模型——DeepSeek-V4.1-Flash。该模型面向高频、低延迟的推理场景,在保持 552B 总参数量的同时,通过创新性的非对称 MoE(混合专家)架构,实现了输入阶段仅激活 8B 参数、输出阶段激活 16B 参数的惊人效率。官方宣称,新架构旨在提供“更多智能,更少成本”,并在多项基准测试中显著超越前代。此外,V4.1 Flash 原生支持视觉理解能力,可处理多模态输入,为智能代理、实时对话等应用场景提供了更丰富的交互可能性。
核心架构:因果编码器-解码器与更聪明的不对称设计
DeepSeek V4.1 Flash 的核心技术亮点在于其“因果编码器-解码器架构”。传统 Transformer 模型在输入和输出阶段通常使用相同的参数量,而 DeepSeek 通过不对称设计,将输入处理的活跃参数压缩至 8B,输出阶段则采用 16B 活跃参数。这种设计背后逻辑是:理解输入(编码)比生成输出(解码)所需的计算量更小,因此可以针对性优化,减少无效资源占用。加之全新的预训练方法和更大规模的强化学习后训练,模型在推理速度、吞吐量以及最终生成质量上都取得了跃升。这一架构不仅适用于当前的小模型,也为未来扩展至更大规模的模型(如 V5)打下基础。
KV 缓存压缩:成本大幅降低
对于需要频繁调用模型的代理和 AI 应用,KV 缓存(键值缓存)的存储成本往往是运营大头。V4.1 Flash 在这方面带来革命性改进:相比上一代,KV 缓存所需的高带宽内存(HBM)仅为此前的四分之一,SSD 存储需求更是降至八分之一。这意味着在同样硬件配置下,模型可以承载更长的上下文、处理更多并发请求,同时显著削减因缓存命中产生的计费成本。DeepSeek 在推文中特别强调,“缓存命中费用通常占代理成本的很大一部分,压缩缓存能大幅降低这些成本”。
API 上线与灵活定价策略
V4.1 Flash 已在 DeepSeek API 平台正式上线,模型标识为 deepseek-flash,原生支持多模态输入。前代模型 V4-Flash 和 V4-Flash-Vision-Exp 即日起退役,但为了兼容性,旧请求标识符会临时路由至 V4.1 Flash,平稳过渡。在定价方面,DeepSeek 维持了峰谷定价策略:高峰时段按标准价格计费,低谷时段价格仅为高峰时的 50%。官方明确表示,更高效的架构使得服务器能够服务更多用户,而节省的成本将直接让利给开发者。鼓励用户将可灵活调度的推理工作负载安排至低谷时段,以获得最大性价比。
开源生态与社区合作
DeepSeek 延续其开放路线,V4.1 Flash 的模型权重已在 Hugging Face 上发布(仓库名 deepseek-ai/DeepSeek-V4.1-Flash),社区可以直接下载使用。官方表示将密切配合开源社区推进推理支持,并探索更多部署选项。对于有大规模部署需求的用户(如 2000 块 GPU 搭配存储集群),DeepSeek 开放了直接联系渠道,欢迎洽谈。社区反响热烈,Unsloth AI 第一时间祝贺,并指出 V4.1 Flash 拥有 196B 的“engram”(可能指嵌入维度或子模块参数),使其在保持性能的同时更易于本地运行,期待后续推出更小的模型供个人设备使用。
影响与展望
DeepSeek V4.1 Flash 的发布在社交媒体上引发巨大反响,首条推文获得超过 450 万次观看。作为新一代架构的先锋,该模型展示了不对称 MoE、极致缓存压缩、以及高效定价策略的融合成果。对于开发者而言,这不仅意味着更低的推理成本,也意味着在有限硬件资源下运行更大规模 AI 应用成为可能。随着 V4.1 Flash 的落地,DeepSeek 为下一代大模型(如 V5)的效率和成本控制树立了标杆。未来,我们有望看到更多基于该架构的模型系列,覆盖从端侧到云端的不同需求。
原标题:DeepSeek v4.1 Flash。 HN 原始发布时间:2026年9月10日星期四。当前记录为 946 分、528 条评论。