DeepSeek V4.1 Flash 是值得测试的当前 Flash checkpoint,适合长上下文、原生图像输入、低价时段 API 或开放权重部署。最重要的细节是名字:官方 API 叫 deepseek-flash,而 deepseek-v4-flash 现在只是临时兼容别名。旧版 V4 Flash 评测可能对应另一套模型,即使代码仍然能运行。
时间锚点是 DeepSeek 2026 年 9 月 10 日发布和 9 月 20 日核对的价格表:552B MoE、prefill 激活 8B、decode 激活 16B、100 万上下文、最高 384K 输出、思考/非思考、原生视觉和峰谷价格。V4 Pro 是独立路线。先看 DeepSeek V4.1 Flash 模型页,再在实际客户端确认 ID。
快速判断
需要长上下文、视觉输入和可安排的 Agent 工作时可试。
新 API 使用
deepseek-flash;旧名是兼容路由,不是旧模型仍在服务的证据。官方分数要连同任务版本和 harness 阅读,不能合成一个独立排行榜。
API、开放权重、合作伙伴产品与 Tabbit 访问必须分开。
写入型 Agent 必须有 diff、测试和人工检查点。
规格一览
| 项目 | 2026-09-20 核对内容 | 边界 |
|---|---|---|
| 当前 API | deepseek-flash,版本 DeepSeek-V4.1-Flash | 仍需确认区域和账户。 |
| 旧名称 | deepseek-v4-flash 暂时路由到 V4.1 | 旧版评测不会自动适用。 |
| 架构 | 552B MoE;prefill 8B、decode 16B 激活 | 不直接预测延迟或本地吞吐。 |
| 上下文/输出 | 1M;最高 384K | 最大值不是每个客户端的有效值。 |
| 功能 | 视觉、JSON、工具、Responses/Anthropic API、非思考 FIM | 不同路线可能有不同开放程度。 |
| 并发 | 官方表列 2,500 | 账户、区域和服务会变化。 |
先读 什么是 Agent 浏览器区分浏览器会话与 API,再看 AI 浏览器比较 和 Tabbit Browser 实践。
新架构与官方结果
DeepSeek 介绍因果编码器—解码器结构,以 8B prefill、16B decode 的非对称路径减少缓存压力,并声称相比上一代只需四分之一 HBM、八分之一 SSD。Hugging Face 卡片提供 Transformers、vLLM、SGLang 和量化链接,但 552B 模型的硬件、监控和失败恢复仍需自行规划。任务材料可看 DeepSeek prompts,本文不复制长提示词。
官方更新日志列出 Terminal-Bench 2.1 90.6、DeepSWE 74.2、CyberGym 88.1、SEC-Bench Pro 62.8、HLE with tools 63.9、Chartography with tools 78.9、BabyVision with tools 89.6 和 Automation-Bench 54.8。它们使用不同任务、工具和版本,不能平均成一个分数。7 月 V4 Flash 0731 使用的 DeepSeek Harness、最高 effort、top-p 0.95、temperature 1 也不是自动适用于 V4.1 的设置。详细来源在 DeepSeek reviews。
V4 Flash、V4.1 Flash 与 V4 Pro
V4 Flash 0731 是历史版本;V4.1 Flash 是当前 deepseek-flash API 和开放权重;V4 Pro 是独立路线,DeepSeek 的过渡政策可能影响旧请求,但 Pro 分数不是 Flash 测量。旧 deepseek-v4-flash 会暂时路由到 V4.1 并按 Flash 收费。现有 DeepSeek V4 Flash 价格指南负责算费和迁移历史,本文只讨论当前 checkpoint 的能力和边界。评测设计可参考 Agent 深度研究。
价格与部署
官方表的每百万 token 价格是:谷时缓存命中/未命中输入 $0.003/$0.15、输出 $0.60;峰时 $0.006/$0.30/$1.20。峰时为周一至周五 UTC 01:00–04:00、06:00–10:00(中国公共假日除外),其余时间谷时。思考、非思考、输出、工具和重试都会影响任务成本。
MIT 开放权重适合想要控制代码和数据的团队,但开放权重不是硬件报价。OpenCode、WorkBuddy/CodeBuddy 等合作伙伴可能有自己的配额和账单。 浏览器自动化可以帮助设计任务,但不能把本地或 API 模型变成 Tabbit 可用模型。
社区观察、风险和自检
一个 r/opencode 用户报告用 OpenCode 在约十分钟内完成浏览器游戏,约 300K token、花费 $0.28,并公开了代码;但没有精确 prompt、API 模式、日志和验收标准。另一篇旧版 V4 Flash 0731 帖子称复杂网页调试约 30 分钟完成,评论讨论容量、本地硬件和幻觉;这条证据不用于 V4.1 结论。X 上曾有 Agent Arena 成本快照,但正文与表格出现 $0.07/$0.06 冲突,未作为当前价格。YouTube 只做了搜索,未用标题或播放量证明能力。
| 场景 | 第一个测试 | 验收 |
|---|---|---|
| 代码 Agent | 小仓库、固定问题和测试 | diff、测试和工具日志一致。 |
| 视觉抽取 | 已知标签的公开图片 | 每个值可追溯,不确定项明确保留。 |
| 长文档 | 多位置 needle 的日期语料 | 测量不同上下文长度的召回。 |
| 成本敏感批处理 | 峰/谷时重复任务并记录缓存 | 总成本包括输出和重试。 |
| 本地部署 | 量化服务试跑,记录显存与吞吐 | 硬件、延迟和恢复都可解释。 |
本文没有运行已登录的 DeepSeek V4.1 Flash Tabbit 任务,也没有 4–8 张合格截图,因此不声称 Tabbit 的选择器、有效上下文、视觉、延迟、配额或价格。若账户展示该模型,先从公开图片或文档提取五项事实和来源链接,人工核对后再授予权限。
结论
DeepSeek V4.1 Flash 是长上下文、多模态和成本敏感 Agent 试点的强候选。它的架构和 API 表解释了缓存密集型任务的吸引力,别名政策则提醒我们不能把旧 V4 Flash 或 V4 Pro 体验套到当前 checkpoint。新 API 使用 deepseek-flash,记录时段和模式,并用固定 fixture 验收。只有硬件计划真实时才选择本地权重;Tabbit 则要先确认实时选择器和产品条款。
来源
常见问题
DeepSeek V4.1 Flash 是什么?
它是 DeepSeek 当前的 Flash checkpoint,官方 API 名称为 `deepseek-flash`。它提供 100 万上下文、最高 384K 输出、思考与非思考模式、原生视觉、工具和结构化 API。
DeepSeek V4.1 Flash 与 V4 Flash 一样吗?
不一样。V4 Flash 和 V4 Flash Vision Exp 已退役,旧名称暂时作为兼容别名路由到 V4.1 Flash,因此旧版 benchmark 和价格不能直接代表当前 checkpoint。
DeepSeek V4.1 Flash 多少钱?
2026 年 9 月 20 日核对的官方表格显示,谷时缓存命中/未命中输入为每百万 0.003/0.15 美元,输出 0.60 美元;峰时为 0.006/0.30/1.20 美元。预算前需重新查看。
它适合代码 Agent 吗?
DeepSeek 更新日志报告 Terminal-Bench 2.1 为 90.6、DeepSWE v1.1 为 74.2。一个当前 Reddit 作品报告也很积极,但 prompt、harness 和验收条件不完整,仍需自行测试。
它是开源模型吗?
Hugging Face 卡片以 MIT 许可发布权重,并给出 Transformers、vLLM 和 SGLang 路径。开放权重不代表硬件成本低,也不证明 Tabbit 可用。
能在 Tabbit 使用吗?
本文没有执行已登录的 DeepSeek V4.1 Flash Tabbit 任务。请检查实时选择器和账户条款;API 名称与价格不能证明 Tabbit 可用。