Tabbit部落格

LongCat 2.0:有哪些變化、如何使用,以及低價沒有說明的事

LongCat 2.0 提供 100 萬上下文、開放權重與低價 API,但工具相容性、資料條款和實際營運成本仍要分開核實。

本文目錄
  1. 先看結論
  2. 規格與入口
  3. 主要變化與測試條件
  4. 四條路線不要混在一起
  5. 社群觀察、風險與場景
  6. Tabbit 的下一步與結論
  7. 來源

如果你需要長上下文、開放權重或低成本 Agent 路線,LongCat 2.0 值得小規模試用。但它不是單純的「便宜前沿模型」:路線、工具協議、資料條款與人工複核,和 token 單價一樣重要。

本文以 2026 年 6 月 30 日官方發布,以及 2026 年 9 月 20 日查看的模型卡為時間錨點:總參數 1.6T、啟用約 480 億、100 萬 token 上下文和 MIT 授權。當日 OpenRouter 快照的輸入/輸出價格為每百萬 token 0.30/1.20 美元。這些數字不同於 Tabbit 會話、自託管機器或一方帳戶。先讀 LongCat 2.0 模型頁 (简体中文),再按風險和任務選擇路線。

先看結論

  • 官方提供開放權重、100 萬上下文,以及 Transformers、vLLM、SGLang 部署例子。

  • 官方分數能說明測試涵蓋範圍,但不是中立排行榜;測試工具和任務集由發布方說明。

  • OpenRouter 的低價是有日期的供應商快照,不能代替資料政策、快取和穩定性核查。

  • 社群既有稱讚它像可靠工作馬的經驗,也有程式錯誤、長文重複和工具接入問題。

  • 放進 Agent 循環前,準備小型儲存庫、停止條件和人工驗收。

規格與入口

問題2026-09-20 查看內容不能直接推出的事
模型形態稀疏專家混合;總參數 1.6T、啟用約 48B啟用參數不等於你的延遲或總成本。
上下文官方卡片和 OpenRouter 均列 1M客戶端、序列化和記憶策略可能降低可用長度。
權重官方列出 MIT 與下載權重硬體、服務、升級和安全仍由你負責。
程式訊號Terminal-Bench 2.1 70.8、SWE-Bench Pro 59.5不保證你的儲存庫和工具結果。
API 快照OpenRouter 顯示輸入/輸出 $0.30/$1.20,列 AtlasCloud價格、供應商與遙測會變動。

什麼是 Agent 瀏覽器 區分瀏覽器助手和 API 封裝;需要比較時看 AI 瀏覽器比較,工作流可看 Tabbit Browser 實務

主要變化與測試條件

技術公告介紹 LongCat Sparse Attention,包含串流感知、跨層和階層索引;模型卡還提到 135B N-gram Embedding,以及在數千億個 100 萬上下文 token 上訓練。其目標是讓長程式碼庫、研究資料和 Agent 軌跡更容易留在工作窗口,而不是讓每個 token 都使用相同的注意力成本。

官方列出 Claude Code、OpenClaw 和 Hermes 整合,也提供 Transformers、vLLM、SGLang 範例。這表示發布方重視程式庫編輯和工具任務,但不代表每個 harness 都能解析相同工具呼叫包裝。任務材料可看 LongCat prompts (简体中文),本文不複製系統提示詞。

官方表格列出 Terminal-Bench 2.1 70.8、SWE-Bench Pro 59.5、SWE-Bench Multilingual 77.3、FORTE 73.2、BrowseComp 79.9、RWSearch 78.8 和 IFEval 90.0。官方卡片說未標星分數來自統一內部 harness;技術公告補充 Terminal-Bench 使用 Claude Code、8c16g 沙箱和 6 小時 Agent 超時,SWE-Bench 使用 4c8g 並修正問題任務,FORTE 則是 15 個職業、45 分鐘任務、2 CPU/4GB 和最多十次重試。這些條件有助於重現,但仍不是獨立複測。詳細證據見 LongCat review (简体中文)

四條路線不要混在一起

自託管適合不能離開控制範圍的程式碼和文件,但你要負責硬體、量化、批次、監控、升級和安全。API 路線要確認地區、付款、到期、發票、保留、訓練和 SLA;eesel 的 2026-08-04 文章是問題清單,不是今日的一方發票。

2026-09-20 的 OpenRouter 頁面顯示輸入/輸出 $0.30/$1.20、快取讀取 $0.006、1M 上下文和 AtlasCloud 單一供應商,也展示動態延遲和可用性。供應商帳單不等於自託管成本,也不是品質保證。

Tabbit 是另一個產品會話,選擇器、配額、上下文政策和資料合約可能獨立變化。本次沒有登入執行 LongCat 任務,也沒有合格截圖,所以不聲稱 Tabbit 內的品質、延遲、可用性或價格。可先看 瀏覽器自動化

社群觀察、風險與場景

7 月 Reddit 使用者報告約 50M token 花費約 2 美元;沒有帳單、地區或重複樣本。8 月角色扮演使用者稱讚指令遵循與連貫性,但指出長故事會重複,並擔心電話要求和資料處理。X 的物理加程式測試稱 LongCat 的視覺物理結果最好,但沒有完整 prompt 或評分規則。eesel 還轉述 Agent 建構應用的正面經驗與程式 bug 的負面經驗。這些內容支持小規模試驗,不支持通用排名;可用 Agent 深度研究 設計自己的驗收。

發布前仍要確認保留、訓練、駐留與 SLA;<longcat_tool_call> 是否被你的 harness 識別;英文查詢是否穩定返回目標語言;以及自託管的硬體、電力、監控和重試成本。1M 是最大窗口,不是低價或穩定承諾。

場景第一個測試不要假設
平台團隊在隔離環境執行量化版本,記錄顯存、吞吐和驗收模型卡例子就是容量計畫。
程式 Agent小儲存庫、固定 diff 和測試,逐一檢查工具SWE-Bench 分數等於你的程式碼品質。
研究/RAG有日期的文件集和引用評分長上下文消除檢索問題。
隱私敏感企業先取得目前條款的書面確認FAQ 沒寫就是安全。

Tabbit 的下一步與結論

若帳戶顯示 LongCat 2.0,可先開啟公開文件頁,要求提取五點和來源連結,再人工核對。第一次不要授予寫入權限或上傳機密資料。記錄模型 ID、日期、路線、上下文、延遲、工具事件、重試和修正結果;若沒有選擇器,那是產品可用性結果,不要用 API 測試取代。

Tabbit Browser

LongCat 2.0 是值得試點的長上下文工作模型。開放權重和有日期的供應商快照降低實驗門檻,但工具相容性、實際品質和資料條款仍需在真正路線中確認。選擇自託管、API、OpenRouter 或 Tabbit 時,請比較完整營運合約,不要只看輸入 token 單價。更多條件見 LongCat 評測集合 (简体中文)

來源

常見問題

LongCat 2.0 是什麼?

LongCat 2.0 是美團發布的 MIT 授權稀疏專家混合模型。官方卡片報告總參數 1.6 兆、每個 token 約啟用 480 億參數,並提供 100 萬 token 上下文。

LongCat 2.0 是開源模型嗎?

官方 Hugging Face 卡片以 MIT 授權發布權重,並列出 Transformers、vLLM 與 SGLang 部署方式。開放權重不代表硬體、營運和支援沒有成本。

LongCat 2.0 的價格是多少?

2026 年 9 月 20 日查看的 OpenRouter 頁面顯示輸入每百萬 token 0.30 美元、輸出 1.20 美元。這是供應商快照,不是所有一方路線或 Tabbit 的統一報價。

LongCat 2.0 適合程式 Agent 嗎?

官方表格在其說明的條件下列出 Terminal-Bench 2.1 70.8 和 SWE-Bench Pro 59.5。社群回饋不一致,應先用可回滾的儲存庫和驗收測試試跑。

LongCat 2.0 會保護 API 資料嗎?

本次查看的公開資料沒有建立完整的保留、訓練、資料駐留或 SLA 政策。傳送機密程式碼或文件前,請向實際供應商確認條款。

可以在 Tabbit 使用 LongCat 2.0 嗎?

本文沒有執行已登入的 LongCat 2.0 Tabbit 任務。請查看即時選擇器和帳戶條款,不要假設 API 費用、配額或可用性會自動沿用。

下一步

讓 Tabbit 與你並肩工作。

跨分頁調研、自動化重複的瀏覽器工作,讓每一處上下文都觸手可及。