(资料图片)
9月10日,DeepSeek正式发布并开源 DeepSeek V4.1 Flash 模型。
图注:DeepSeek-V4.1-Flash 与主流前沿模型在 Agentic Benchmark 上的性能对比
据介绍,V4.1 Flash 是其新模型结构系列中的小尺寸模型,采用552B 参数 MoE 架构和全新的 Causal Encoder-Decoder 结构,输入和输出激活参数分别为8B 和16B。该模型原生支持多模态视觉理解,可处理图像与文本输入,并以文本形式生成输出。
图注: DeepSeek 在减少上下文存储方面的持续进展
DeepSeek表示,V4.1 Flash 通过压缩 KV Cache 降低推理与存储成本,相比上一代模型,HBM 需求降至1/4,SSD 需求降至1/8;在 Agent 使用场景中,这一改动主要指向长上下文任务的缓存成本。DeepSeek 称,V4.1 Flash 在性能、费用、速度和总用时等指标上已超过 V4 Pro,并计划在北京时间9月14日12:00后,将 deepseek-v4-pro 请求临时路由至 V4.1 Flash,直至后续 V4.1 Pro 上线。
API 调用方面,开发者可将模型名改为 deepseek-flash 使用新模型;deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 将暂时路由到 V4.1 Flash。新价格自北京时间9月10日12:00生效,继续采用峰谷定价:高峰时段输入缓存命中、缓存未命中和输出价格分别为每百万 tokens 0.04元、2.0元和8.0元;空闲时段分别为0.02元、1.0元和4.0元。(袁宁)