Tabbit博客

LongCat 2.0:变化、使用方式,以及低价没有告诉你的事

LongCat 2.0 提供 100 万上下文、开放权重和低价 API,但工具兼容、数据条款与实际运维成本仍需单独核实。

本文目录
  1. 先看结论
  2. 规格和入口
  3. 主要变化
  4. 官方分数要连同测试条件阅读
  5. 四条路线必须分开
  6. 社区观察与未知风险
  7. 按场景自检
  8. Tabbit 的下一步
  9. 结论
  10. 来源

如果你需要长上下文、开放权重或低成本 Agent 路线,LongCat 2.0 值得做一次小试。但它不是“便宜的前沿模型”这么简单:路线、工具协议、数据条款和人工复核,和 token 单价同样重要。

本文的时间锚点是 2026 年 6 月 30 日的官方发布,以及 2026 年 9 月 20 日核对的模型卡:总参数 1.6T、激活约 480 亿、上下文 100 万 token、MIT 许可。当天查看的 OpenRouter 快照是输入/输出每百万 token 0.30/1.20 美元。这些数字与 Tabbit 会话、自托管机器和一方账户不是一回事。先看 LongCat 2.0 模型页,再按风险和任务选择路线。

先看结论

  • 官方发布开放权重、100 万上下文,并给出 Transformers、vLLM、SGLang 部署路径。

  • 官方分数可以说明测试覆盖范围,但不是中立排行榜;测试工具和任务集由发布方说明。

  • OpenRouter 的低价是有日期的供应商快照,不能替代数据政策、缓存和稳定性核查。

  • 社区既有“可靠工作马”的体验,也有代码 bug、长文重复和工具接入问题。

  • 在 Agent 循环中使用前,准备小型仓库、停止条件和人工验收。

规格和入口

问题2026-09-20 核对到的内容不能直接推出的结论
模型形态稀疏专家混合;总参数 1.6T、激活约 48B激活参数不等于你的延迟或总成本。
上下文官方卡片和 OpenRouter 均显示 1M客户端、序列化方式和记忆策略可能减少可用长度。
权重官方卡片列出 MIT 和下载权重你仍要承担硬件、服务、升级和安全。
代码信号Terminal-Bench 2.1 为 70.8,SWE-Bench Pro 为 59.5不保证你的仓库和工具结果。
API 快照OpenRouter 显示输入/输出 $0.30/$1.20,列出 AtlasCloud价格、供应商和遥测会变化。

阅读 什么是 Agent 浏览器 可以区分浏览器助手和 API 封装;需要更广泛比较时看 AI 浏览器比较,工作流细节可看 Tabbit Browser 实践

主要变化

技术公告介绍了 LongCat Sparse Attention,包括流式感知、跨层和分层索引;模型卡还提到 135B N-gram Embedding,以及在数千亿个 100 万上下文 token 上训练。对用户来说,它的目标是让长代码库、研究资料和 Agent 轨迹更容易保持在工作窗口中,而不是让每个 token 都承担相同的注意力成本。

官方还列出 Claude Code、OpenClaw 和 Hermes 集成,并给出 Transformers、vLLM、SGLang 示例。这说明发布方重视代码库编辑和工具任务,但不能保证每个 harness 都能解析相同的工具调用包装。具体任务材料请看 LongCat prompts,本文不复制系统提示词。

官方分数要连同测试条件阅读

基准LongCat 2.0
Terminal-Bench 2.170.8
SWE-Bench Pro59.5
SWE-Bench Multilingual77.3
FORTE73.2
BrowseComp79.9
RWSearch78.8
IFEval90.0

官方卡片说明,未标星分数是在统一内部 harness 中测得,比较模型的标星分数来自外部报告。技术公告写明 Terminal-Bench 使用 Claude Code、8c16g 沙箱、temperature 1、top-p 0.95、top-k -1 和 6 小时 Agent 超时;SWE-Bench 使用 Claude Code 与 4c8g 环境,并修正问题任务。FORTE 使用 15 个企业职业、45 分钟任务、2 CPU/4GB、500 秒 API 超时,最多十次重试。这些条件有助于复核,但仍不是独立复现。可在 LongCat review 查看逐条证据。

四条路线必须分开

自托管最适合不能离开控制域的代码和文档。官方卡片提供部署路径,但硬件、量化、批处理、监控和安全由你负责。API 路线的区域、支付、过期、发票、保留和 SLA 需要向实际供应商确认;eesel 的 2026-08-04 文章只能作为问题清单,而非今天的一方发票。

OpenRouter 在 2026-09-20 显示输入/输出 $0.30/$1.20、缓存读取 $0.006、1M 上下文和 AtlasCloud 单一供应商,并展示动态延迟与可用性。供应商账单不等于自托管成本,也不等于模型质量保证。

Tabbit 是另一种产品会话,选择器、配额、上下文政策和数据合同都可能独立变化。本次研究没有登录执行 LongCat 任务,也没有合格截图,因此不声称 Tabbit 内的质量、延迟、可用性或价格。先阅读 浏览器自动化,再决定是否测试。

社区观察与未知风险

7 月 Reddit 用户报告约 50M token 花费约 2 美元,并描述了缓存下的长任务;没有账单、地区和重复样本。8 月另一位用户在非思考角色扮演中称赞指令遵循和连贯性,但指出长故事会重复,并担心手机号和数据处理。X 上的物理加编程测试称 LongCat 的视觉物理结果最好,但没有公布完整 prompt 或评分规则。eesel 还转述了 Agent 构建应用的正面经历和代码 bug 的负面经历。这些材料支持小规模试验,不支持通用排名。可用 Agent 深度研究 设计自己的验收记录。

发布前仍需确认:当前供应商的保留、训练、驻留和 SLA;<longcat_tool_call> 是否被你的 harness 识别;英文查询是否稳定返回目标语言;以及自托管硬件、电费、监控和失败重试成本。1M 是最大窗口,不是必须填满、低价或稳定的承诺。

按场景自检

场景第一个测试不要假设
有 GPU 的平台团队在隔离环境运行量化版本,记录显存、吞吐和验收结果模型卡示例就是容量方案。
代码 Agent在小仓库执行固定 diff 和测试,逐条检查工具调用SWE-Bench 分数等于你的代码质量。
研究/RAG用有日期的文档集和引用评分检查来源长上下文消除了检索问题。
创作/角色扮演比较短续写和长续写中的重复次数一篇个人报告可以泛化。
隐私敏感企业先取得当前条款书面确认FAQ 没写就等于安全。

Tabbit 的下一步

如果账户展示 LongCat 2.0,可先打开一个公开文档页,要求提取五点并返回来源链接,再人工逐条核验。第一次不要授予写入权限或上传机密资料。记录模型 ID、日期、路线、上下文、延迟、工具事件、重试和修正结果;如果没有模型选择器,那是产品可用性结果,不应拿 API 试验代替。

Tabbit Browser

结论

LongCat 2.0 是值得试点的长上下文工作模型。开放权重和有日期的供应商快照降低了实验门槛,官方结果也覆盖了代码、浏览和指令任务;但工具兼容、实际质量和数据条款仍需在真实路线中验证。选择自托管、API、OpenRouter 或 Tabbit 时,比较完整的运行合同,不要只看每百万输入 token 的价格。更多证据可看 LongCat 评测集合

来源

常见问题

LongCat 2.0 是什么?

LongCat 2.0 是美团发布的 MIT 许可稀疏专家混合模型。官方卡片报告总参数 1.6 万亿、每个 token 约激活 480 亿参数,并提供 100 万 token 上下文。

LongCat 2.0 是开源模型吗?

官方 Hugging Face 卡片以 MIT 许可发布权重,并给出 Transformers、vLLM 与 SGLang 部署示例。开放权重不等于推理硬件、运维和支持免费。

LongCat 2.0 多少钱?

2026 年 9 月 20 日查看的 OpenRouter 页面显示输入每百万 token 0.30 美元、输出 1.20 美元。这是供应商快照,不是统一的一方价格,也不是 Tabbit 订阅报价。

LongCat 2.0 适合代码 Agent 吗?

官方表格在其说明的测试条件下给出 Terminal-Bench 2.1 70.8、SWE-Bench Pro 59.5。社区反馈并不一致,应先用可回滚仓库和验收测试做小规模试运行。

LongCat 2.0 会保护 API 数据吗?

本次核对的公开材料没有建立完整的保留、训练、数据驻留或 SLA 政策。发送机密代码或文档前,应向实际供应商确认当前条款。

能在 Tabbit 中使用 LongCat 2.0 吗?

本文没有执行已登录的 LongCat 2.0 Tabbit 任务。请查看实时模型选择器和账户条款,不要假设 API 账单、配额或可用性会自动继承。

下一步

让 Tabbit 与你并肩工作。

跨标签页调研、自动化重复的浏览器工作,让每一处上下文都触手可及。