Claude Opus 5.5 是近来最容易做的 Opus 决定:把你默认的 Opus 工作切过去。Anthropic 于 2026 年 9 月 22 日发布它,定价每百万输入 4 美元、输出 20 美元——比 Opus 5 低 20%——并明确宣称它在"大多数工作上达到 Claude Fable 5.1 的水准",运行成本"比 Opus 5 低 40%"。发布次日的独立证据大体支持这个说法,但有两个保留:最高努力档下它的话足够多,多到能吃掉折扣;细看之下,它相对 Fable 5.1 的能力提升是渐进式的,不是新天花板。
这套定调不是凭空造出来的。发布几小时内,r/ClaudeAI 投票最高的帖子标题就是"Opus 5.5 is 40% cheaper while being 30% faster than opus 5"——775 个赞,社区把官方数字复述成了购买理由。同帖最高赞评论解释了反应为什么这么激烈:Opus 5"couldn't even communicate properly",人们"wasting even more time and tokens"跟它搏斗(u/Front_Raspberry_6488,226 赞;译:连正常沟通都做不到……浪费了更多时间和 token)。这篇测评负责分拣这些感受里哪些有证据支持。
下文所有事实都在 2026 年 9 月 23 日、发布次日逐一打开核对:Anthropic 发布页、Artificial Analysis 模型页和各条 Reddit 原帖。Claude Opus 5.5 模型主页承载提示词与证据库,它的测评证据卡是本文背后的一手记录。目前尚无 Opus 5.5 的定价页和替代品页,本文不链接不存在的兄弟页面。结尾会讨论这些发现对浏览器级工作流的意义——这类模型越来越多的活,正在那里发生。
核心结论
关键数字是 40%,而且它是工作量口径,不是牌面价。 价格降了 20%(4/20 美元),缓存读取降了 60%(0.20 美元/百万)。“运行成本低 40%”来自 Anthropic 自家的典型负载测试——SonarSource 在 Java 生成上独立测得输出 token 恰好少了 40%,而 Artificial Analysis 在最高努力档测得每个指数任务 5.98 美元。
一个独立榜第一,代价是话多。 Artificial Analysis 给 Opus 5.5(最高努力档)打出 58 分,212 个模型中排第 1;同时啰嗦程度排第 95:每个指数任务约 11.9 万输出 token,对比 GPT-6 Astra 最高档的约 2.7 万。
压垮 Opus 5 的沟通问题看起来修好了。 社区对 Opus 5 最大的抱怨是活干得不差、对话没法进行。首日声音普遍形容 5.5 快、自然、废话少;SonarSource 测得生成 Java 代码的注释占比从 10.5% 降到 3.1%。
代码更少,缺陷更密。 SonarSource 的预发布版测试中,代码量少 27.5%、问题总数少 42%,通过率持平,但每百万行缺陷密度从 576 升到 644,并发类缺陷升 44%。审查环节不能省。
METR 的判词:渐进式,不是跨越。 预部署评估在五项 AI 研发任务上测得相对 Fable 5.1 的小幅提升,判断类短板(前瞻、反馈循环、科研品味)依然存在。为经济性和打磨度买 5.5,撞到天花板再升级 Fable。
Claude Opus 5.5 到底是什么
Claude Opus 5.5 是 Anthropic 新的 Claude 5.5 系列的第一款模型,2026 年 9 月 22 日发布。API 模型 ID 为 claude-opus-5-5;发布页列出 Anthropic Claude Platform、AWS、Google Cloud 和 Microsoft Azure。文档口径是 100 万 token 上下文、最高 12.8 万 token 输出、自适应思考,默认努力档为 medium——这个细节比本文任何一行基准都重要。
| 问题 | 已发布口径(2026-09-23 核对) | 它不能证明什么 |
|---|---|---|
| 发布时间与模型 ID | 2026-09-22;claude-opus-5-5 | 每个客户端都暴露同一构建和努力档区间 |
| 输入 / 输出价格 | 每百万 token 4 美元 / 20 美元 | 思考和重试之后的单任务完成成本 |
| 缓存读 / 写 | 每百万 0.20 / 5 美元(Opus 5:0.50 / 6.25) | 所有负载普降 40% |
| 上下文与输出 | 输入 100 万,输出最高 12.8 万 | 每家供应商或套餐都给满窗口 |
| 努力档 | 自适应思考;默认 medium | 低努力档还能保住同样的分数(未按任务公布曲线) |
| 可用性 | Anthropic、AWS、Google Cloud、Azure | 消费端套餐;本文未核实 |
| 独立快照 | Artificial Analysis:58 分,212 个模型第 1(最高档) | 速度:AA 对该模型的延迟标为 N/A |
Anthropic 还给这次发布加了程序性注脚:这是该公司呼吁"pacing the frontier"(放缓前沿节奏)之后的第一款发布,发布前经过包括 Frontier Design 和 METR 在内的外部评估者测试。在 Anthropic 自家的自动化行为审计(约 2000 个场景)上,Opus 5.5 是"迄今测试过的表现最强的模型";一项围栏边界评估显示,越界尝试比 Opus 5 或 Mythos 5.1 少约 85%。这些安全声明值得记录,而且双向起作用:后文会展示安全护栏的介入如何在能力基准上变成零分。
本文回答的问题不是"它聪不聪明"——厂商发布表和独立榜第一已经回答了。而是:一款按主力机型定价、按旗舰水准宣传的模型,值不值得进入你的日常工作流——对比继续用 Opus 5 的费率、付 Fable 5.1 的价格,或者把机械性工作转给 GPT-5.6 Sol、MiMo-V2.6-Pro 这类更便宜的模型。
决定这篇测评的那个数字:40%
Anthropic 的定调句,已在发布页原文核对,值得逐字读:Opus 5.5 "performs at the level of Claude Fable 5.1 on most work and costs 40% less to run than Opus 5"(在大多数工作上达到 Fable 5.1 的水准,运行成本比 Opus 5 低 40%)。一句话里两个可检验的主张——接近旗舰的能力,主力机的经济性。
价格部分公开且简单:输入 5→4 美元,输出 25→20 美元,缓存读取 0.50→0.20 美元/百万。缓存读取对 Agent 工作影响最大,因为一次 40 个工具调用的运行会把缓存前缀重读 40 遍;0.20 美元——输入价的 5%,也就是 Artificial Analysis 标注的 95% 缓存折扣——让长会话在结构上变便宜。这正是 Fable 5.1 发布时缓存降价故事的延续,只是这次压得更低。
40% 部分藏满了细则,三项独立测量把它夹在中间:
兑现了: SonarSource 的 Java 生成测试(预发布构建、High 档)输出 1296 万 token,对比 Opus 5 的 2171 万——字面上的 40% 缩减——而通过率只差不到一个点(87.68% 对 88.6%)。代码更少、token 更少、功能结果相同。这是折扣按设计兑现的样子。
花掉了: Artificial Analysis 用最高努力档跑智能指数,测得每任务约 119,000 个输出 token——对比 Opus 5 最高档约 7.3 万、Fable 5.1 最高档约 7.8 万、GPT-6 Astra 最高档约 2.7 万——加权单任务成本 5.98 美元,啰嗦程度排 212 个模型中第 95。这是模型被允许全音量思考时,折扣被花掉的样子。
中间态: Anthropic 内部的并购分析任务 63 分钟完成,对比 Opus 5 的 93 分钟,"运行成本低 50%"——厂商自测,正好落在宣称值上。
调和这三条不是找矛盾,而是找到那个旋钮:努力档。默认 medium 有它的道理:40% 的折扣是真的,能不能拿到,基本取决于你的工作流反射性地用哪一档。 METR 的能力判读从另一侧支持同一结论——相对 Fable 5.1 只是渐进式提升,所以切换的理由是经济性和打磨度,不是新天花板。如果你的管线因为"最强模型配最高档"而无脑锁 max,你已经把自己重新定价回旗舰区。
排行榜之前,真实任务上发生了什么
首日最有用的证据不是基准行,而是三个有名字、有边界的建造故事。
一支 45 分钟一次成片的电影。 u/mshort3 在一个现成的创意项目里给 Claude Code 一句话——"Lets make a ~70s riso film of your own choosing, free range"——并报告 Opus 5.5 一次运行约 45 分钟产出了一支 78 秒的动画火车旅程(r/ClaudeAI,637 赞)。仓库公开,作者把功劳记给项目自带的技能和文档,而不只是模型。单次运行,没有中间状态日志。

一段提示词做出一分钟视频——附成本回执。 u/AzorAhai1TK 要求渲染"an average day at work… with a twist"——一个诡异版的一分钟职场视频,并报告模型在 Extra-High 档端到端写码加渲染约 45 分钟,用掉 $20/月套餐每周额度的约 4%(r/ClaudeAI)。数字自报,但这个额度数据点正是定价讨论需要的:创意型高努力运行不免费,也不算灾难。
Claude Code 里"night and day"的速度——作者自己贴了保留意见。 u/Lazy_Assistance_1137 说以前要查一阵子的 UI bug"in no time"就被定位,称提升"night and day"——紧接着自己泼冷水:"this could just be the classic day-one honeymoon phase, and in two weeks we'll all be back to posting 'did they nerf it?' threads"(r/ClaudeAI,273 赞;译:这可能只是经典的发布日蜜月期,两周后我们又会回去发"他们是不是削弱了它"的帖子)。最高赞回复只有一个词的深度:"It's crazy fast. I'm impressed."(u/capivara_de_pijama,96 赞;译:快得离谱,我服了。)

三个故事,各 n=1,无日志,无 token 计数(那 4% 除外)。它们证明的是:发布第一天,这个模型反复地、公开地、带着可打开的成品,完成长程、自主、多工具的创意建造。它们不能证明的是:这种完成的频率。这正是基准该补的位——看看它到底补了多少。
基准数据,以及该信几分
Anthropic 发布表,按 2026-09-22 发布原样记录。不同列可能来自不同运营方和榜单(GPT-6 Astra 与 GPT-5.6 Sol 的数字被 Anthropic 标注为来自 OpenAI 报告),请按行读,别做列间算术:
| 领域 / 基准 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Agent 编码:Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| Agent 编码:FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| Agent 编码:CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — | 41.7% |
| 知识工作:GDPval-AA v2.1 | 1846 | 1735 | 1708 | 1542 | 1588 |
| 业务流程:AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| 推理:Humanity's Last Exam(带工具) | 67.7% | 65.6% | 63.6% | 57.2% | — |
| Agent 科研:Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| 计算机使用:OSWorld 2.0(partial) | 81.8% | 80.7% | 74.0% | — | — |
| 图表识别:Chartography(带工具) | 89.0% | 88.4% | 83.4% | — | — |
然后是泼冷水三连。
误差范围是公开的,而且不窄。 Terminal-Bench 4.0 上 Opus 5.5 的标准误为 ±2.6 个百分点;Terminal-Bench-Science 为每模型 ±3.5–5 个百分点。TB-Science 上 Opus 5 → Opus 5.5(29.0% → 58.7%)的跳跃扛得住任何误差;同一行上与 GPT-6 Astra(64.6%)的差距也扛得住——方向对 Astra 有利。Anthropic 自己在页面上提醒:在当前能力水平下,基准分数差异未必能可靠地代表真实世界差距。这句话出自厂商之口,是本季所有发布表里最诚实的一行。
对比条件并不统一。 Terminal-Bench 各行使用 Claude Code 测试框架;AutomationBench 由 Zapier 运行并报告,未启用回退模型,安全护栏介入即记失败;GDPval-AA v2.1 的独立评分流程在页面上没有细说。被护栏介入的任务会记零分——一次策略结果被记成能力失误。这些都不让发布表变"错",但让它变成一组条件各异的快照,不是一场控制变量的比赛。
独立记录认形状,不认幅度。 Artificial Analysis 自家指数(v4.3.2,十项评测)给 Opus 5.5 最高档 58 分、212 个模型第 1,其中六项 outright 领先(Humanity's Last Exam 61.4%、SciCode 66.9%、GDPval-AA 1846、AA-Briefcase 1822——比 Fable 5.1 高 143 Elo),Terminal-Bench 4.0 以 59.6% 与 GPT-6 Astra xhigh 并列。SonarSource 的受控 Java 测试是最锋利的单个数据点:通过率与 Opus 5 相差不到一个点,同时代码量少 27.5%——而单位行数缺陷密度上升,后文展开。METR 的预部署评估历时 10 个工作日、五项 AI 研发任务,结论是相对 Fable 5.1 的提升为"incremental… rather than a discontinuous leap"(渐进式……而非断崖式跨越),在前瞻、反馈循环搭建、科研判断上没有大的进展。
泼完冷水还站得住的:对 Opus 5 的前后差距真实且巨大(TB-Science 29.0% → 58.7% 不是四舍五入的花招);独立榜第一有第二来源佐证;成本故事有一项完全独立的复现(SonarSource 的 token 数)。站不住的:任何"Opus 5.5 完胜 GPT-6 Astra"的说法——Anthropic 自己的表上 Opus 5.5 领先 Terminal-Bench 4.0、Astra 领先 Terminal-Bench-Science;Artificial Analysis 的独立 TB-4.0 运行里两者 59.6% 打平;我们的 GPT-6 Astra 测评另文讨论它自己的取舍。
Opus 5.5 真正好的地方
它终于像个同事一样说话
没有任何基准行能覆盖这条优点:Opus 5 是一款编码很强、却让人讨厌跟它对话的模型,而首日声音说 5.5 把对话本身修好了。r/ClaudeAI 锚点帖的高赞评论是对旧痛的清算——"Opus is fantastic, just until you have to talk to it"(u/Neon_Camouflage,61 赞;译:大部分项目工作上 Opus 很棒,直到你不得不跟它说话)——配上如释重负:"Heard Opus 5.5 is less verbose"(u/No-Temperature6597;译:听说 Opus 5.5 废话少了)。SonarSource 的分析器给这个行为变化上了数字:生成 Java 的注释占比从 10.5% 降到 3.1%,代码异味密度降 21%。受训哲学家的氛围检查(medium 档、无痕模式)形容它是"a model with polish and panache… It will happily cite back Theophrastus and Austin to you, but can't break the habit of wanting to get its hands dirty"(u/Wickywire;译:一个打磨光鲜、派头十足的模型……会愉快地给你引用泰奥弗拉斯托斯和奥斯汀,但改不了想撸起袖子动手干的习惯)。如果你靠写作和规划吃饭——不只是编译——这条升级比任何编码分数都重要。
Agent 跟进力,配 Opus 的价格
这是官方表的中心地带,而且立得住:Terminal-Bench 4.0 66.4%、TB-Science 58.7%(都在公布的误差带内),测试框架为 Claude Code;CursorBench 4.0 57.8%;OSWorld 2.0 partial 81.8% 覆盖计算机使用。内部案例在厂商证据里算异常具体的:季度财报任务上 18 份报告有 16 份通过了一个逐数字逐引用核对的评分器,而 Fable 5.1 和 Opus 5 的尝试都没过;虚构并购分析 63 分钟对 Opus 5 的 93 分钟,成本约一半。厂商自测,但任务形状——长程、多文件、重验证——正是终端分数测量的东西。对 Agent 研究与深度工作负载来说,4/20 美元配上这个侧写,是本次发布最硬的理由。
Medium 档的经济性是安静的头条
默认 medium 加 0.20 美元缓存读取,改变的是长会话的单位经济学,而牌面价看不出来。Artificial Analysis 把五个努力档中的四个放进了智能-成本帕累托前沿——唯一的例外是没人该反射性去选的那档——它的 5.98 美元/任务属于 max,不属于 medium。CodeRabbit 的管线测试发现 Standard 配置(较低档)在 80 个模式集上以更好的可执行精度和更少评论数击败了自家 Max 配置,Max 只在 13 个最难的 Signal 案例上拉开差距。三个独立来源的形状一致:这个模型的价值函数奖励刻意的努力档选择,惩罚条件反射。 对还在付 Opus 5 或 老 Opus 4.8 费率的团队,这次切换几乎是白捡的上行空间。
它咬人的地方
Max 档烧掉折扣
让 medium 便宜的那个旋钮,让 max 昂贵:AA 指数任务约 119k 输出 token(GPT-6 Astra max 的 4.4 倍、Fable 5.1 max 的 1.6 倍)、加权单任务 5.98 美元、啰嗦度第 95/212、整个评测累计 2.6 亿 token。CodeRabbit 在生产形状的工作里看到同样的形状:token 用量比自家基线高 49–60%,Max 在 OSS 集上 +57.6%、Signal 集上 +60.1%,换来的精度常常不需要。如果你的框架或习惯锁死 max,请按旗舰预算做规划;也可以看看 Gemini 3.8 Flash 测评里一个刻意节俭的对照,以及近期队列里单任务实测成本最低的 MiMo-V2.6-Pro。
代码更少,缺陷更密
SonarSource 的数字值得配上它别扭的标题:问题总数降 42%,但每百万行缺陷密度从 576 升到 644;并发/线程类——在生产环境而不是审查中暴露的那类——升 44% 成为最大类(295/mLOC)。三个最高严重级 BLOCKER 的密度全部下降,这确实让人安心,但形状很清楚:5.5 写的代码更紧凑,却不均匀地更安全。两个边界:该测试用的是预发布构建(SonarSource 会在正式版后重跑);CodeRabbit 的平行发现——OSS 集上新找出 11 个模式、漏掉基线能抓的 9 个——从审查侧说了同一件事。保留审查环节,把它挪到管线更前面,别删掉。
对 Fable 只是渐进,且未知仍是未知
METR 的评估是最不客气的独立判词,值得读两遍:五项 AI 研发任务全面小胜 Fable 5.1、没有证据支持完全自动化、判断形能力(前瞻、预测、反馈循环搭建、科研品味)没有大的进展。再加上真正未知的东西:没有可信的延迟数据(Artificial Analysis 对该模型速度标 N/A,所以本文不引用任何首 token 数字);消费端可用性未核实;带护栏的运行可能整题记零,意味着你测试框架的安全设置是你测得能力的一部分。一款只活了一天的模型,这些都随身携带。没有一条足以否决;每一条都在说:先做一次有度量的试点,而不是全量翻转。
社区原声
首日舆论沿两条轴分裂,不是一条。
轴一:终于快了——也终于能聊了。 速度帖及其回复是明确的欣喜;哲学访谈是同一件事的定性版,形容它"polish and panache"外加动手欲。围绕它重建工作流的用户概括了这个人群:喜欢 Opus 5 的产出、痛恨跟它的对话。

轴二:信任,但要验证——Opus 5 的疤痕组织。 锚点帖里的怀疑是具体的:人们被一款基准好看、沟通糟糕的模型烫过,不接受发布日数字当作结案。一条评论善意地解读设计意图——"Fable 5 & Opus 5 were designed & tested together with the intent being that you talk to Fable and it delegates execution to Opus agents"(u/canyonero7;译:Fable 5 和 Opus 5 是一起设计、一起测试的,意图就是你跟 Fable 说,它把执行派给 Opus)——这引出了关于 5.5 的真问题:它按执行模型定价,却被当成对话模型宣传,一款模型同时胜任两个角色,恰恰是发布日的狂欢无法证实的。

本文落点:切换决定上跟欢呼者站在一起——经济性一边倒,没必要把新工作留在 Opus 5 上;过程上跟怀疑者站在一起。蜜月期作者说得对,两周的日志会比上文任何一张表更有说服力;他也说得对,此刻它确实像一次真实的跨越。
裁决:切换你的 Opus 工作,保留纪律
| 工作负载形状 | 裁决 | 理由 | 主要保留 |
|---|---|---|---|
| 目前跑在 Opus 5 / 4.8 上的默认编码 Agent 工作 | 现在就切 | 价格低 20%、缓存读低 60%、沟通修复、TB-Science 29.0% → 58.7% | 锁定模型 ID;正式版重跑数据落地后再复核 |
| 最难的前沿与长程研究 | 升级到 Fable 5.1 | METR:渐进式;官方定调本身也是"Fable 的水准" | Fable 的成本与怪癖是另一个决定 |
| 无人值守长运行、批处理管线 | medium 档的好候选 | 0.20 美元缓存读 + 默认 medium;AA 帕累托前沿 5 档占 4 | 无可信延迟——押 SLA 前自测首响 |
| 交互式聊天产品 | 先测再上 | 延迟未知;高努力档的啰嗦度(第 95/212)直接打在体验和账单上 | AA 速度标 N/A;本文不引用任何数字 |
| 无审查的 Java 或大规模代码生成 | 用,但审查前移 | 通过率持平、输出更精、BLOCKER 密度全降 | 缺陷密度 576 → 644/mLOC;并发 +44% |
| 成本地板的自动化 | 对比更便宜的模型 | 4/20 美元对 Opus 级便宜,绝对值不便宜 | 机械活 MiMo 0.13 美元/任务或 Gemini 3.8 Flash 可能更合适 |
两条时效提示。第一,本文所有独立数字都是首日快照:SonarSource 测的是预发布构建并承诺正式版后重跑;Artificial Analysis 排名逐日变动。第二,家族梯队还在补位——Sonnet 5 和 Haiku 4.5 在这次发布之下,而 Anthropic 的"Claude 5.5 family"措辞说明还有后续成员。用锁定而不是习惯来规划模型路由。
一条实践路径:在工作发生的地方跑它
上文所有线索指向同一个形状:经济性奖励长程、多工具、刻意选档的运行;失败模式是不加监督的量;而未决问题——延迟、选择器可用性、数周后的稳定性——都只能靠跑一个有边界的任务来回答,不是再读一张表。这是浏览器形状的活:多页调研、抽取与自动化,由智能体浏览器托住会话的页面与上下文,让模型在里面干活——Tabbit Browser正是围绕这个循环构建的。
诚实的边界,与我们其他模型测评一致:本文未核实 Opus 5.5 是否出现在 Tabbit Browser 的实时模型选择器中,也不声称做过任何上手实测。请检查你账户的模型选择器,锁定模型 ID,给它一个可回退的小任务——一个带现成测试的多文件改动,或一份要求引用来源的调研包——并按"每个可接受结果的成本"对比 Opus 5,再决定切换你在乎的东西。
来源
Anthropic:Introducing Claude Opus 5.5——发布事实、定价、基准表、安全章节(2026-09-23 打开)
Artificial Analysis:Claude Opus 5.5 与发布文章——指数 58(第 1/212)、5.98 美元/任务、啰嗦度测量
METR:Predeployment evaluation of Claude Opus 5.5——"渐进式超过 Fable"判词
SonarSource:Evaluating Claude Opus 5.5 on Java code generation——通过率、token 与缺陷密度(预发布构建)
CodeRabbit:Opus 5.5 model review——召回/精度与 token 取舍
常见问题
Claude Opus 5.5 值不值得用?
值得作为默认的 Opus 级模型。它以每百万输入 4 美元、输出 20 美元的价格瞄准大多数工作上 Fable 5.1 的水准,比 Opus 5 便宜 20%,缓存读取低至 0.20 美元。最难的前沿任务仍建议留给 Fable 5.1,也不要条件反射地开最高努力档——实测显示那时的输出量会吃掉折扣。
Claude Opus 5.5 比 Opus 5 便宜吗?
牌面价格低 20%:输入 4 美元对 5 美元,输出 20 美元对 25 美元,缓存读取从 0.50 美元降到 0.20 美元(每百万 token)。Anthropic 基于自家测试称典型工作负载总成本约降 40%。实际省多少取决于努力档位和 token 结构,请用代表性任务实测。
Opus 5.5 比 Fable 5.1 强吗?
Anthropic 自己的说法是:Opus 5.5 在大多数工作上达到 Fable 5.1 的水准,同时运行成本更低。独立核查各有侧重:METR 认为 AI 研发任务上相对 Fable 5.1 只是渐进式提升,而 Artificial Analysis 给 Opus 5.5 打出 58 分,是其 212 个模型快照的第一名。结论是低价位上的接近持平,不是全面胜出。
Claude Opus 5.5 写代码行吗?
发布页报告 Terminal-Bench 4.0 得分 66.4%(标准误约 ±2.6 个百分点),CursorBench 4.0 为 57.8%。SonarSource 的 Java 受控测试发现它和 Opus 5 的通过率基本持平(87.68% 对 88.6%),代码更少但缺陷密度更高,所以保留代码审查环节,不要盲信输出。
为什么 Claude Opus 5.5 这么费 token?
在最高努力档,Artificial Analysis 测得每个智能指数任务约输出 119,000 个 token,是 GPT-6 Astra 最高档(约 27,000)的四倍多,啰嗦程度排 212 个模型中的第 95 位。默认努力档是 medium,且 SonarSource 在 Java 生成上实测输出 token 比 Opus 5 少 40%,因此消耗量取决于努力档位和工作负载。
Claude Opus 5.5 什么时候发布的,哪里能用?
Anthropic 于 2026 年 9 月 22 日发布,API 模型 ID 为 claude-opus-5-5,上下文 100 万 token,最高输出 12.8 万 token。发布页列出 Anthropic Claude Platform、AWS、Google Cloud 和 Microsoft Azure。消费端套餐的可用性本轮未核实。
能在 Tabbit Browser 里用 Claude Opus 5.5 吗?
本文未能核实 Opus 5.5 是否出现在 Tabbit 的实时模型选择器里,请勿据此规划。先查看你自己账户的模型选择器,跑一个可回退的小任务,再把工作流交给它。