Tabbit博客

DeepSeek V4.1 Flash:准确的模型身份、新架构与低价适用边界

DeepSeek V4.1 Flash 是当前 deepseek-flash 路线,提供 100 万上下文、原生视觉和时段价格;旧版 V4 Flash 与 V4 Pro 证据不能混用。

本文目录
  1. 快速判断
  2. 规格一览
  3. 新架构与官方结果
  4. V4 Flash、V4.1 Flash 与 V4 Pro
  5. 价格与部署
  6. 社区观察、风险和自检
  7. 结论
  8. 来源

DeepSeek V4.1 Flash 是值得测试的当前 Flash checkpoint,适合长上下文、原生图像输入、低价时段 API 或开放权重部署。最重要的细节是名字:官方 API 叫 deepseek-flash,而 deepseek-v4-flash 现在只是临时兼容别名。旧版 V4 Flash 评测可能对应另一套模型,即使代码仍然能运行。

时间锚点是 DeepSeek 2026 年 9 月 10 日发布和 9 月 20 日核对的价格表:552B MoE、prefill 激活 8B、decode 激活 16B、100 万上下文、最高 384K 输出、思考/非思考、原生视觉和峰谷价格。V4 Pro 是独立路线。先看 DeepSeek V4.1 Flash 模型页,再在实际客户端确认 ID。

快速判断

  • 需要长上下文、视觉输入和可安排的 Agent 工作时可试。

  • 新 API 使用 deepseek-flash;旧名是兼容路由,不是旧模型仍在服务的证据。

  • 官方分数要连同任务版本和 harness 阅读,不能合成一个独立排行榜。

  • API、开放权重、合作伙伴产品与 Tabbit 访问必须分开。

  • 写入型 Agent 必须有 diff、测试和人工检查点。

规格一览

项目2026-09-20 核对内容边界
当前 APIdeepseek-flash,版本 DeepSeek-V4.1-Flash仍需确认区域和账户。
旧名称deepseek-v4-flash 暂时路由到 V4.1旧版评测不会自动适用。
架构552B MoE;prefill 8B、decode 16B 激活不直接预测延迟或本地吞吐。
上下文/输出1M;最高 384K最大值不是每个客户端的有效值。
功能视觉、JSON、工具、Responses/Anthropic API、非思考 FIM不同路线可能有不同开放程度。
并发官方表列 2,500账户、区域和服务会变化。

先读 什么是 Agent 浏览器区分浏览器会话与 API,再看 AI 浏览器比较Tabbit Browser 实践

新架构与官方结果

DeepSeek 介绍因果编码器—解码器结构,以 8B prefill、16B decode 的非对称路径减少缓存压力,并声称相比上一代只需四分之一 HBM、八分之一 SSD。Hugging Face 卡片提供 Transformers、vLLM、SGLang 和量化链接,但 552B 模型的硬件、监控和失败恢复仍需自行规划。任务材料可看 DeepSeek prompts,本文不复制长提示词。

官方更新日志列出 Terminal-Bench 2.1 90.6、DeepSWE 74.2、CyberGym 88.1、SEC-Bench Pro 62.8、HLE with tools 63.9、Chartography with tools 78.9、BabyVision with tools 89.6 和 Automation-Bench 54.8。它们使用不同任务、工具和版本,不能平均成一个分数。7 月 V4 Flash 0731 使用的 DeepSeek Harness、最高 effort、top-p 0.95、temperature 1 也不是自动适用于 V4.1 的设置。详细来源在 DeepSeek reviews

V4 Flash、V4.1 Flash 与 V4 Pro

V4 Flash 0731 是历史版本;V4.1 Flash 是当前 deepseek-flash API 和开放权重;V4 Pro 是独立路线,DeepSeek 的过渡政策可能影响旧请求,但 Pro 分数不是 Flash 测量。旧 deepseek-v4-flash 会暂时路由到 V4.1 并按 Flash 收费。现有 DeepSeek V4 Flash 价格指南负责算费和迁移历史,本文只讨论当前 checkpoint 的能力和边界。评测设计可参考 Agent 深度研究

价格与部署

官方表的每百万 token 价格是:谷时缓存命中/未命中输入 $0.003/$0.15、输出 $0.60;峰时 $0.006/$0.30/$1.20。峰时为周一至周五 UTC 01:00–04:00、06:00–10:00(中国公共假日除外),其余时间谷时。思考、非思考、输出、工具和重试都会影响任务成本。

MIT 开放权重适合想要控制代码和数据的团队,但开放权重不是硬件报价。OpenCode、WorkBuddy/CodeBuddy 等合作伙伴可能有自己的配额和账单。 浏览器自动化可以帮助设计任务,但不能把本地或 API 模型变成 Tabbit 可用模型。

社区观察、风险和自检

一个 r/opencode 用户报告用 OpenCode 在约十分钟内完成浏览器游戏,约 300K token、花费 $0.28,并公开了代码;但没有精确 prompt、API 模式、日志和验收标准。另一篇旧版 V4 Flash 0731 帖子称复杂网页调试约 30 分钟完成,评论讨论容量、本地硬件和幻觉;这条证据不用于 V4.1 结论。X 上曾有 Agent Arena 成本快照,但正文与表格出现 $0.07/$0.06 冲突,未作为当前价格。YouTube 只做了搜索,未用标题或播放量证明能力。

场景第一个测试验收
代码 Agent小仓库、固定问题和测试diff、测试和工具日志一致。
视觉抽取已知标签的公开图片每个值可追溯,不确定项明确保留。
长文档多位置 needle 的日期语料测量不同上下文长度的召回。
成本敏感批处理峰/谷时重复任务并记录缓存总成本包括输出和重试。
本地部署量化服务试跑,记录显存与吞吐硬件、延迟和恢复都可解释。

本文没有运行已登录的 DeepSeek V4.1 Flash Tabbit 任务,也没有 4–8 张合格截图,因此不声称 Tabbit 的选择器、有效上下文、视觉、延迟、配额或价格。若账户展示该模型,先从公开图片或文档提取五项事实和来源链接,人工核对后再授予权限。

Tabbit Browser

结论

DeepSeek V4.1 Flash 是长上下文、多模态和成本敏感 Agent 试点的强候选。它的架构和 API 表解释了缓存密集型任务的吸引力,别名政策则提醒我们不能把旧 V4 Flash 或 V4 Pro 体验套到当前 checkpoint。新 API 使用 deepseek-flash,记录时段和模式,并用固定 fixture 验收。只有硬件计划真实时才选择本地权重;Tabbit 则要先确认实时选择器和产品条款。

来源

常见问题

DeepSeek V4.1 Flash 是什么?

它是 DeepSeek 当前的 Flash checkpoint,官方 API 名称为 `deepseek-flash`。它提供 100 万上下文、最高 384K 输出、思考与非思考模式、原生视觉、工具和结构化 API。

DeepSeek V4.1 Flash 与 V4 Flash 一样吗?

不一样。V4 Flash 和 V4 Flash Vision Exp 已退役,旧名称暂时作为兼容别名路由到 V4.1 Flash,因此旧版 benchmark 和价格不能直接代表当前 checkpoint。

DeepSeek V4.1 Flash 多少钱?

2026 年 9 月 20 日核对的官方表格显示,谷时缓存命中/未命中输入为每百万 0.003/0.15 美元,输出 0.60 美元;峰时为 0.006/0.30/1.20 美元。预算前需重新查看。

它适合代码 Agent 吗?

DeepSeek 更新日志报告 Terminal-Bench 2.1 为 90.6、DeepSWE v1.1 为 74.2。一个当前 Reddit 作品报告也很积极,但 prompt、harness 和验收条件不完整,仍需自行测试。

它是开源模型吗?

Hugging Face 卡片以 MIT 许可发布权重,并给出 Transformers、vLLM 和 SGLang 路径。开放权重不代表硬件成本低,也不证明 Tabbit 可用。

能在 Tabbit 使用吗?

本文没有执行已登录的 DeepSeek V4.1 Flash Tabbit 任务。请检查实时选择器和账户条款;API 名称与价格不能证明 Tabbit 可用。

下一步

让 Tabbit 与你并肩工作。

跨标签页调研、自动化重复的浏览器工作,让每一处上下文都触手可及。