DeepSeek-V4.1-Flash 是 DeepSeek 新架构系列中的小型模型,采用总计 552B 参数的 MoE 架构,输入侧激活 8B、输出侧激活 16B,并原生支持视觉理解。官方将它描述为更快、吞吐更高且 API 成本更低的版本,同时宣布旧模型标识会逐步改道到 V4.1-Flash。阅读 DeepSeek 官方公告与技术报告入口。

DeepSeek V4.1 Flash 上线:原生视觉,旧版 API 开始迁移 官方配图
图片来自 DeepSeek 的官方发布页面;点击图片可查看原始来源。

API 标识变更要留心

新接口使用 deepseek-flash。已退役的 V4-Flash 与 V4-Flash-Vision-Exp 不再是独立目标;为兼容而暂留的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 会路由到新版本。公告还规定,自 2026 年 9 月 14 日起,deepseek-v4-pro 请求也会转至 V4.1-Flash,并按 Flash 的费率计费,直到 V4.1-Pro 推出。若系统只按请求成功与否监控,可能不会发现模型已被替换。

适合先验证的能力

模型原生多模态输入使它可用于含图片的助手、图文问答和视觉界面分析;低延迟与更小 KV cache 则可能影响高并发和多轮 Agent 的成本。DeepSeek 表示,KV cache 相较前代需要的 HBM 和 SSD 存储分别降至四分之一和八分之一。评测和性能数字来自厂商及其列出的第三方测试,需用自己的提示、图片、并发量和工具链复测。视觉能力也不意味着所有旧接口参数都自动兼容。

切换时的回归测试

  1. 盘点代码、环境变量、供应商路由和监控中出现的每一个旧模型 ID。
  2. 用固定样例对比文本、图片理解、结构化输出、工具调用和拒答表现。
  3. 检查峰时与非高峰 API 费率。DeepSeek 保留峰谷定价,非高峰价格为峰时的一半;灵活批任务可考虑错峰,但先确认当前时间区间和账户费率。
  4. 逐步放量,记录模型实际 ID、延迟、错误率、缓存命中、输出质量和账单;保留回退配置。