深度求索今日正式发布了全新模型结构系列中的最小尺寸成员——DeepSeek V4.1Flash。作为一款具备原生多模态视觉理解能力的轻量化模型,其设计初衷旨在实现更高的能力上限、更快的推理速度、更大的吞吐量,并具备向更大参数模型扩展的潜力。
在核心架构方面,DeepSeek V4.1Flash 采用了552B 参数的 MoE(混合专家)架构,并创新性地引入了全新的 Causal-Encoder-Decoder 结构。由于采用了输入和输出不对称的设计,其输入激活仅有8B,输出激活为16B,使得整体成本显著低于同尺寸的已知模型。配合全新的预训练方式以及更大规模的强化学习后训练,该模型在各项基准测试中的智能水平成功超越了包括 DeepSeek V4Pro 在内的一众旗舰模型。
在效率优化与成本控制上,新一代模型大幅压缩了 KV Cache 缓存的大小。相比上一代模型,V4.1Flash 对高带宽内存(HBM)的需求减少至1/4,对固态硬盘(SSD)的需求减少至1/8。尤其在 Agent 使用场景中,由于上下文存储和缓存命中的费用占比较高,这一压缩大幅降低了相关任务的实际使用成本。据统计,相对于初代模型,其 KV Cache 已经缩减至原来的1/437。
随着新模型的正式上线,DeepSeek 对相关产品线和计费策略进行了系统性调整。DeepSeek V4.1Flash 已同步上线 DeepSeek API,用户只需将模型名称更改为 deepseek-flash 即可调用。旧版本的 V4Flash 与 V4Flash Vision Exp 已正式下线,而旧模型名(deepseek-v4-flash 和 deepseek-v4-flash-vision-exp)目前被暂时路由到 V4.1Flash。鉴于 V4.1Flash 在性能、费用、速度和总用时上已全面超越 V4Pro,官方计划有序下线 V4Pro 模型:在2026年9月14日12:00之后至 V4.1Pro 上线之前,所有访问 deepseek-v4-pro 的请求将全部被路由至 V4.1Flash 并按其单价计费。目前,腾讯旗下的 WorkBuddy、CodeBuddy 以及 OpenCode 等官方合作伙伴已全量接入该模型。
得益于底层架构的创新,DeepSeek V4.1Flash 能够以更低的成本服务海量用户,官方也顺势下调了该模型的 API 定价。同时,为了更合理地调配计算资源,新定价延续了峰谷定价机制,闲时价格为高峰时段的一半,以鼓励用户灵活调整任务执行时间,新价格已于2026年9月10日12:00正式生效。





京公网安备 11011402013531号