如果你需要长上下文、开放权重或低成本 Agent 路线,LongCat 2.0 值得做一次小试。但它不是“便宜的前沿模型”这么简单:路线、工具协议、数据条款和人工复核,和 token 单价同样重要。
本文的时间锚点是 2026 年 6 月 30 日的官方发布,以及 2026 年 9 月 20 日核对的模型卡:总参数 1.6T、激活约 480 亿、上下文 100 万 token、MIT 许可。当天查看的 OpenRouter 快照是输入/输出每百万 token 0.30/1.20 美元。这些数字与 Tabbit 会话、自托管机器和一方账户不是一回事。先看 LongCat 2.0 模型页,再按风险和任务选择路线。
先看结论
官方发布开放权重、100 万上下文,并给出 Transformers、vLLM、SGLang 部署路径。
官方分数可以说明测试覆盖范围,但不是中立排行榜;测试工具和任务集由发布方说明。
OpenRouter 的低价是有日期的供应商快照,不能替代数据政策、缓存和稳定性核查。
社区既有“可靠工作马”的体验,也有代码 bug、长文重复和工具接入问题。
在 Agent 循环中使用前,准备小型仓库、停止条件和人工验收。
规格和入口
| 问题 | 2026-09-20 核对到的内容 | 不能直接推出的结论 |
|---|---|---|
| 模型形态 | 稀疏专家混合;总参数 1.6T、激活约 48B | 激活参数不等于你的延迟或总成本。 |
| 上下文 | 官方卡片和 OpenRouter 均显示 1M | 客户端、序列化方式和记忆策略可能减少可用长度。 |
| 权重 | 官方卡片列出 MIT 和下载权重 | 你仍要承担硬件、服务、升级和安全。 |
| 代码信号 | Terminal-Bench 2.1 为 70.8,SWE-Bench Pro 为 59.5 | 不保证你的仓库和工具结果。 |
| API 快照 | OpenRouter 显示输入/输出 $0.30/$1.20,列出 AtlasCloud | 价格、供应商和遥测会变化。 |
阅读 什么是 Agent 浏览器 可以区分浏览器助手和 API 封装;需要更广泛比较时看 AI 浏览器比较,工作流细节可看 Tabbit Browser 实践。
主要变化
技术公告介绍了 LongCat Sparse Attention,包括流式感知、跨层和分层索引;模型卡还提到 135B N-gram Embedding,以及在数千亿个 100 万上下文 token 上训练。对用户来说,它的目标是让长代码库、研究资料和 Agent 轨迹更容易保持在工作窗口中,而不是让每个 token 都承担相同的注意力成本。
官方还列出 Claude Code、OpenClaw 和 Hermes 集成,并给出 Transformers、vLLM、SGLang 示例。这说明发布方重视代码库编辑和工具任务,但不能保证每个 harness 都能解析相同的工具调用包装。具体任务材料请看 LongCat prompts,本文不复制系统提示词。
官方分数要连同测试条件阅读
| 基准 | LongCat 2.0 |
|---|---|
| Terminal-Bench 2.1 | 70.8 |
| SWE-Bench Pro | 59.5 |
| SWE-Bench Multilingual | 77.3 |
| FORTE | 73.2 |
| BrowseComp | 79.9 |
| RWSearch | 78.8 |
| IFEval | 90.0 |
官方卡片说明,未标星分数是在统一内部 harness 中测得,比较模型的标星分数来自外部报告。技术公告写明 Terminal-Bench 使用 Claude Code、8c16g 沙箱、temperature 1、top-p 0.95、top-k -1 和 6 小时 Agent 超时;SWE-Bench 使用 Claude Code 与 4c8g 环境,并修正问题任务。FORTE 使用 15 个企业职业、45 分钟任务、2 CPU/4GB、500 秒 API 超时,最多十次重试。这些条件有助于复核,但仍不是独立复现。可在 LongCat review 查看逐条证据。
四条路线必须分开
自托管最适合不能离开控制域的代码和文档。官方卡片提供部署路径,但硬件、量化、批处理、监控和安全由你负责。API 路线的区域、支付、过期、发票、保留和 SLA 需要向实际供应商确认;eesel 的 2026-08-04 文章只能作为问题清单,而非今天的一方发票。
OpenRouter 在 2026-09-20 显示输入/输出 $0.30/$1.20、缓存读取 $0.006、1M 上下文和 AtlasCloud 单一供应商,并展示动态延迟与可用性。供应商账单不等于自托管成本,也不等于模型质量保证。
Tabbit 是另一种产品会话,选择器、配额、上下文政策和数据合同都可能独立变化。本次研究没有登录执行 LongCat 任务,也没有合格截图,因此不声称 Tabbit 内的质量、延迟、可用性或价格。先阅读 浏览器自动化,再决定是否测试。
社区观察与未知风险
7 月 Reddit 用户报告约 50M token 花费约 2 美元,并描述了缓存下的长任务;没有账单、地区和重复样本。8 月另一位用户在非思考角色扮演中称赞指令遵循和连贯性,但指出长故事会重复,并担心手机号和数据处理。X 上的物理加编程测试称 LongCat 的视觉物理结果最好,但没有公布完整 prompt 或评分规则。eesel 还转述了 Agent 构建应用的正面经历和代码 bug 的负面经历。这些材料支持小规模试验,不支持通用排名。可用 Agent 深度研究 设计自己的验收记录。
发布前仍需确认:当前供应商的保留、训练、驻留和 SLA;<longcat_tool_call> 是否被你的 harness 识别;英文查询是否稳定返回目标语言;以及自托管硬件、电费、监控和失败重试成本。1M 是最大窗口,不是必须填满、低价或稳定的承诺。
按场景自检
| 场景 | 第一个测试 | 不要假设 |
|---|---|---|
| 有 GPU 的平台团队 | 在隔离环境运行量化版本,记录显存、吞吐和验收结果 | 模型卡示例就是容量方案。 |
| 代码 Agent | 在小仓库执行固定 diff 和测试,逐条检查工具调用 | SWE-Bench 分数等于你的代码质量。 |
| 研究/RAG | 用有日期的文档集和引用评分检查来源 | 长上下文消除了检索问题。 |
| 创作/角色扮演 | 比较短续写和长续写中的重复次数 | 一篇个人报告可以泛化。 |
| 隐私敏感企业 | 先取得当前条款书面确认 | FAQ 没写就等于安全。 |
Tabbit 的下一步
如果账户展示 LongCat 2.0,可先打开一个公开文档页,要求提取五点并返回来源链接,再人工逐条核验。第一次不要授予写入权限或上传机密资料。记录模型 ID、日期、路线、上下文、延迟、工具事件、重试和修正结果;如果没有模型选择器,那是产品可用性结果,不应拿 API 试验代替。
结论
LongCat 2.0 是值得试点的长上下文工作模型。开放权重和有日期的供应商快照降低了实验门槛,官方结果也覆盖了代码、浏览和指令任务;但工具兼容、实际质量和数据条款仍需在真实路线中验证。选择自托管、API、OpenRouter 或 Tabbit 时,比较完整的运行合同,不要只看每百万输入 token 的价格。更多证据可看 LongCat 评测集合。
来源
常见问题
LongCat 2.0 是什么?
LongCat 2.0 是美团发布的 MIT 许可稀疏专家混合模型。官方卡片报告总参数 1.6 万亿、每个 token 约激活 480 亿参数,并提供 100 万 token 上下文。
LongCat 2.0 是开源模型吗?
官方 Hugging Face 卡片以 MIT 许可发布权重,并给出 Transformers、vLLM 与 SGLang 部署示例。开放权重不等于推理硬件、运维和支持免费。
LongCat 2.0 多少钱?
2026 年 9 月 20 日查看的 OpenRouter 页面显示输入每百万 token 0.30 美元、输出 1.20 美元。这是供应商快照,不是统一的一方价格,也不是 Tabbit 订阅报价。
LongCat 2.0 适合代码 Agent 吗?
官方表格在其说明的测试条件下给出 Terminal-Bench 2.1 70.8、SWE-Bench Pro 59.5。社区反馈并不一致,应先用可回滚仓库和验收测试做小规模试运行。
LongCat 2.0 会保护 API 数据吗?
本次核对的公开材料没有建立完整的保留、训练、数据驻留或 SLA 政策。发送机密代码或文档前,应向实际供应商确认当前条款。
能在 Tabbit 中使用 LongCat 2.0 吗?
本文没有执行已登录的 LongCat 2.0 Tabbit 任务。请查看实时模型选择器和账户条款,不要假设 API 账单、配额或可用性会自动继承。