Tabbit博客

Claude Opus 5.5 测评:直逼 Fable 的水准,便宜 40% 的运行成本

Claude Opus 5.5 发布次日测评:40% 成本下降到底覆盖什么、官方基准与三方实测逐条核对、优点缺点与社区原声,以及该不该从 Opus 5 升级。

本文目录
  1. 核心结论
  2. Claude Opus 5.5 到底是什么
  3. 决定这篇测评的那个数字:40%
  4. 排行榜之前,真实任务上发生了什么
  5. 基准数据,以及该信几分
  6. Opus 5.5 真正好的地方
  7. 它终于像个同事一样说话
  8. Agent 跟进力,配 Opus 的价格
  9. Medium 档的经济性是安静的头条
  10. 它咬人的地方
  11. Max 档烧掉折扣
  12. 代码更少,缺陷更密
  13. 对 Fable 只是渐进,且未知仍是未知
  14. 社区原声
  15. 裁决:切换你的 Opus 工作,保留纪律
  16. 一条实践路径:在工作发生的地方跑它
  17. 来源

Claude Opus 5.5 是近来最容易做的 Opus 决定:把你默认的 Opus 工作切过去。Anthropic 于 2026 年 9 月 22 日发布它,定价每百万输入 4 美元、输出 20 美元——比 Opus 5 低 20%——并明确宣称它在"大多数工作上达到 Claude Fable 5.1 的水准",运行成本"比 Opus 5 低 40%"。发布次日的独立证据大体支持这个说法,但有两个保留:最高努力档下它的话足够多,多到能吃掉折扣;细看之下,它相对 Fable 5.1 的能力提升是渐进式的,不是新天花板。

这套定调不是凭空造出来的。发布几小时内,r/ClaudeAI 投票最高的帖子标题就是"Opus 5.5 is 40% cheaper while being 30% faster than opus 5"——775 个赞,社区把官方数字复述成了购买理由。同帖最高赞评论解释了反应为什么这么激烈:Opus 5"couldn't even communicate properly",人们"wasting even more time and tokens"跟它搏斗(u/Front_Raspberry_6488,226 赞;译:连正常沟通都做不到……浪费了更多时间和 token)。这篇测评负责分拣这些感受里哪些有证据支持。

下文所有事实都在 2026 年 9 月 23 日、发布次日逐一打开核对:Anthropic 发布页Artificial Analysis 模型页和各条 Reddit 原帖。Claude Opus 5.5 模型主页承载提示词与证据库,它的测评证据卡是本文背后的一手记录。目前尚无 Opus 5.5 的定价页和替代品页,本文不链接不存在的兄弟页面。结尾会讨论这些发现对浏览器级工作流的意义——这类模型越来越多的活,正在那里发生。

核心结论

  • 关键数字是 40%,而且它是工作量口径,不是牌面价。 价格降了 20%(4/20 美元),缓存读取降了 60%(0.20 美元/百万)。“运行成本低 40%”来自 Anthropic 自家的典型负载测试——SonarSource 在 Java 生成上独立测得输出 token 恰好少了 40%,而 Artificial Analysis 在最高努力档测得每个指数任务 5.98 美元。

  • 一个独立榜第一,代价是话多。 Artificial Analysis 给 Opus 5.5(最高努力档)打出 58 分,212 个模型中排第 1;同时啰嗦程度排第 95:每个指数任务约 11.9 万输出 token,对比 GPT-6 Astra 最高档的约 2.7 万。

  • 压垮 Opus 5 的沟通问题看起来修好了。 社区对 Opus 5 最大的抱怨是活干得不差、对话没法进行。首日声音普遍形容 5.5 快、自然、废话少;SonarSource 测得生成 Java 代码的注释占比从 10.5% 降到 3.1%。

  • 代码更少,缺陷更密。 SonarSource 的预发布版测试中,代码量少 27.5%、问题总数少 42%,通过率持平,但每百万行缺陷密度从 576 升到 644,并发类缺陷升 44%。审查环节不能省。

  • METR 的判词:渐进式,不是跨越。 预部署评估在五项 AI 研发任务上测得相对 Fable 5.1 的小幅提升,判断类短板(前瞻、反馈循环、科研品味)依然存在。为经济性和打磨度买 5.5,撞到天花板再升级 Fable。

Claude Opus 5.5 到底是什么

Claude Opus 5.5 是 Anthropic 新的 Claude 5.5 系列的第一款模型,2026 年 9 月 22 日发布。API 模型 ID 为 claude-opus-5-5;发布页列出 Anthropic Claude Platform、AWS、Google Cloud 和 Microsoft Azure。文档口径是 100 万 token 上下文、最高 12.8 万 token 输出、自适应思考,默认努力档为 medium——这个细节比本文任何一行基准都重要。

问题已发布口径(2026-09-23 核对)它不能证明什么
发布时间与模型 ID2026-09-22;claude-opus-5-5每个客户端都暴露同一构建和努力档区间
输入 / 输出价格每百万 token 4 美元 / 20 美元思考和重试之后的单任务完成成本
缓存读 / 写每百万 0.20 / 5 美元(Opus 5:0.50 / 6.25)所有负载普降 40%
上下文与输出输入 100 万,输出最高 12.8 万每家供应商或套餐都给满窗口
努力档自适应思考;默认 medium低努力档还能保住同样的分数(未按任务公布曲线)
可用性Anthropic、AWS、Google Cloud、Azure消费端套餐;本文未核实
独立快照Artificial Analysis:58 分,212 个模型第 1(最高档)速度:AA 对该模型的延迟标为 N/A

Anthropic 还给这次发布加了程序性注脚:这是该公司呼吁"pacing the frontier"(放缓前沿节奏)之后的第一款发布,发布前经过包括 Frontier Design 和 METR 在内的外部评估者测试。在 Anthropic 自家的自动化行为审计(约 2000 个场景)上,Opus 5.5 是"迄今测试过的表现最强的模型";一项围栏边界评估显示,越界尝试比 Opus 5 或 Mythos 5.1 少约 85%。这些安全声明值得记录,而且双向起作用:后文会展示安全护栏的介入如何在能力基准上变成零分。

本文回答的问题不是"它聪不聪明"——厂商发布表和独立榜第一已经回答了。而是:一款按主力机型定价、按旗舰水准宣传的模型,值不值得进入你的日常工作流——对比继续用 Opus 5 的费率、付 Fable 5.1 的价格,或者把机械性工作转给 GPT-5.6 SolMiMo-V2.6-Pro 这类更便宜的模型。

决定这篇测评的那个数字:40%

Anthropic 的定调句,已在发布页原文核对,值得逐字读:Opus 5.5 "performs at the level of Claude Fable 5.1 on most work and costs 40% less to run than Opus 5"(在大多数工作上达到 Fable 5.1 的水准,运行成本比 Opus 5 低 40%)。一句话里两个可检验的主张——接近旗舰的能力,主力机的经济性。

价格部分公开且简单:输入 5→4 美元,输出 25→20 美元,缓存读取 0.50→0.20 美元/百万。缓存读取对 Agent 工作影响最大,因为一次 40 个工具调用的运行会把缓存前缀重读 40 遍;0.20 美元——输入价的 5%,也就是 Artificial Analysis 标注的 95% 缓存折扣——让长会话在结构上变便宜。这正是 Fable 5.1 发布时缓存降价故事的延续,只是这次压得更低。

40% 部分藏满了细则,三项独立测量把它夹在中间:

  1. 兑现了: SonarSource 的 Java 生成测试(预发布构建、High 档)输出 1296 万 token,对比 Opus 5 的 2171 万——字面上的 40% 缩减——而通过率只差不到一个点(87.68% 对 88.6%)。代码更少、token 更少、功能结果相同。这是折扣按设计兑现的样子。

  2. 花掉了: Artificial Analysis 用最高努力档跑智能指数,测得每任务约 119,000 个输出 token——对比 Opus 5 最高档约 7.3 万、Fable 5.1 最高档约 7.8 万、GPT-6 Astra 最高档约 2.7 万——加权单任务成本 5.98 美元,啰嗦程度排 212 个模型中第 95。这是模型被允许全音量思考时,折扣被花掉的样子。

  3. 中间态: Anthropic 内部的并购分析任务 63 分钟完成,对比 Opus 5 的 93 分钟,"运行成本低 50%"——厂商自测,正好落在宣称值上。

调和这三条不是找矛盾,而是找到那个旋钮:努力档。默认 medium 有它的道理:40% 的折扣是真的,能不能拿到,基本取决于你的工作流反射性地用哪一档。 METR 的能力判读从另一侧支持同一结论——相对 Fable 5.1 只是渐进式提升,所以切换的理由是经济性和打磨度,不是新天花板。如果你的管线因为"最强模型配最高档"而无脑锁 max,你已经把自己重新定价回旗舰区。

排行榜之前,真实任务上发生了什么

首日最有用的证据不是基准行,而是三个有名字、有边界的建造故事。

一支 45 分钟一次成片的电影。 u/mshort3 在一个现成的创意项目里给 Claude Code 一句话——"Lets make a ~70s riso film of your own choosing, free range"——并报告 Opus 5.5 一次运行约 45 分钟产出了一支 78 秒的动画火车旅程(r/ClaudeAI,637 赞)。仓库公开,作者把功劳记给项目自带的技能和文档,而不只是模型。单次运行,没有中间状态日志。

Reddit 用户 mshort3 的帖子,描述 Opus 5.5 用一句话提示约 45 分钟一次生成 riso 风格动画火车旅程,并附 GitHub 仓库链接
u/mshort3(r/ClaudeAI,2026-09-22):有脚手架项目里的一句提示,一次约 45 分钟的运行产出 78 秒短片。

原帖:r/ClaudeAI 1wnkvys

一段提示词做出一分钟视频——附成本回执。 u/AzorAhai1TK 要求渲染"an average day at work… with a twist"——一个诡异版的一分钟职场视频,并报告模型在 Extra-High 档端到端写码加渲染约 45 分钟,用掉 $20/月套餐每周额度的约 4%(r/ClaudeAI)。数字自报,但这个额度数据点正是定价讨论需要的:创意型高努力运行不免费,也不算灾难。

Claude Code 里"night and day"的速度——作者自己贴了保留意见。 u/Lazy_Assistance_1137 说以前要查一阵子的 UI bug"in no time"就被定位,称提升"night and day"——紧接着自己泼冷水:"this could just be the classic day-one honeymoon phase, and in two weeks we'll all be back to posting 'did they nerf it?' threads"(r/ClaudeAI,273 赞;译:这可能只是经典的发布日蜜月期,两周后我们又会回去发"他们是不是削弱了它"的帖子)。最高赞回复只有一个词的深度:"It's crazy fast. I'm impressed."(u/capivara_de_pijama,96 赞;译:快得离谱,我服了。)

Reddit 用户 Lazy_Assistance_1137 的帖子,称赞 Opus 5.5 在 Claude Code 中定位 UI bug 的速度,作者同时自己标注了发布日蜜月期的保留意见
u/Lazy_Assistance_1137(r/ClaudeAI,2026-09-22):night and day 的速度描述,作者自注可能是蜜月期。

原帖:r/ClaudeAI 1wnil7n

三个故事,各 n=1,无日志,无 token 计数(那 4% 除外)。它们证明的是:发布第一天,这个模型反复地、公开地、带着可打开的成品,完成长程、自主、多工具的创意建造。它们不能证明的是:这种完成的频率。这正是基准该补的位——看看它到底补了多少。

基准数据,以及该信几分

Anthropic 发布表,按 2026-09-22 发布原样记录。不同列可能来自不同运营方和榜单(GPT-6 Astra 与 GPT-5.6 Sol 的数字被 Anthropic 标注为来自 OpenAI 报告),请按行读,别做列间算术:

领域 / 基准Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Agent 编码:Terminal-Bench 4.066.4%55.8%52.3%57.9%37.3%
Agent 编码:FrontierCode v1.154.4%50.3%48.0%53.3%47.5%
Agent 编码:CursorBench 4.057.8%51.8%46.6%41.7%
知识工作:GDPval-AA v2.118461735170815421588
业务流程:AutomationBench40.0%31.4%26.9%41.4%28.8%
推理:Humanity's Last Exam(带工具)67.7%65.6%63.6%57.2%
Agent 科研:Terminal-Bench-Science 0.158.7%52.6%29.0%64.6%22.4%
计算机使用:OSWorld 2.0(partial)81.8%80.7%74.0%
图表识别:Chartography(带工具)89.0%88.4%83.4%

然后是泼冷水三连。

误差范围是公开的,而且不窄。 Terminal-Bench 4.0 上 Opus 5.5 的标准误为 ±2.6 个百分点;Terminal-Bench-Science 为每模型 ±3.5–5 个百分点。TB-Science 上 Opus 5 → Opus 5.5(29.0% → 58.7%)的跳跃扛得住任何误差;同一行上与 GPT-6 Astra(64.6%)的差距也扛得住——方向对 Astra 有利。Anthropic 自己在页面上提醒:在当前能力水平下,基准分数差异未必能可靠地代表真实世界差距。这句话出自厂商之口,是本季所有发布表里最诚实的一行。

对比条件并不统一。 Terminal-Bench 各行使用 Claude Code 测试框架;AutomationBench 由 Zapier 运行并报告,未启用回退模型,安全护栏介入即记失败;GDPval-AA v2.1 的独立评分流程在页面上没有细说。被护栏介入的任务会记零分——一次策略结果被记成能力失误。这些都不让发布表变"错",但让它变成一组条件各异的快照,不是一场控制变量的比赛。

独立记录认形状,不认幅度。 Artificial Analysis 自家指数(v4.3.2,十项评测)给 Opus 5.5 最高档 58 分、212 个模型第 1,其中六项 outright 领先(Humanity's Last Exam 61.4%、SciCode 66.9%、GDPval-AA 1846、AA-Briefcase 1822——比 Fable 5.1 高 143 Elo),Terminal-Bench 4.0 以 59.6% 与 GPT-6 Astra xhigh 并列。SonarSource 的受控 Java 测试是最锋利的单个数据点:通过率与 Opus 5 相差不到一个点,同时代码量少 27.5%——而单位行数缺陷密度上升,后文展开。METR 的预部署评估历时 10 个工作日、五项 AI 研发任务,结论是相对 Fable 5.1 的提升为"incremental… rather than a discontinuous leap"(渐进式……而非断崖式跨越),在前瞻、反馈循环搭建、科研判断上没有大的进展。

泼完冷水还站得住的:对 Opus 5 的前后差距真实且巨大(TB-Science 29.0% → 58.7% 不是四舍五入的花招);独立榜第一有第二来源佐证;成本故事有一项完全独立的复现(SonarSource 的 token 数)。站不住的:任何"Opus 5.5 完胜 GPT-6 Astra"的说法——Anthropic 自己的表上 Opus 5.5 领先 Terminal-Bench 4.0、Astra 领先 Terminal-Bench-Science;Artificial Analysis 的独立 TB-4.0 运行里两者 59.6% 打平;我们的 GPT-6 Astra 测评另文讨论它自己的取舍。

Opus 5.5 真正好的地方

它终于像个同事一样说话

没有任何基准行能覆盖这条优点:Opus 5 是一款编码很强、却让人讨厌跟它对话的模型,而首日声音说 5.5 把对话本身修好了。r/ClaudeAI 锚点帖的高赞评论是对旧痛的清算——"Opus is fantastic, just until you have to talk to it"(u/Neon_Camouflage,61 赞;译:大部分项目工作上 Opus 很棒,直到你不得不跟它说话)——配上如释重负:"Heard Opus 5.5 is less verbose"(u/No-Temperature6597;译:听说 Opus 5.5 废话少了)。SonarSource 的分析器给这个行为变化上了数字:生成 Java 的注释占比从 10.5% 降到 3.1%,代码异味密度降 21%。受训哲学家的氛围检查(medium 档、无痕模式)形容它是"a model with polish and panache… It will happily cite back Theophrastus and Austin to you, but can't break the habit of wanting to get its hands dirty"(u/Wickywire;译:一个打磨光鲜、派头十足的模型……会愉快地给你引用泰奥弗拉斯托斯和奥斯汀,但改不了想撸起袖子动手干的习惯)。如果你靠写作和规划吃饭——不只是编译——这条升级比任何编码分数都重要。

Agent 跟进力,配 Opus 的价格

这是官方表的中心地带,而且立得住:Terminal-Bench 4.0 66.4%、TB-Science 58.7%(都在公布的误差带内),测试框架为 Claude Code;CursorBench 4.0 57.8%;OSWorld 2.0 partial 81.8% 覆盖计算机使用。内部案例在厂商证据里算异常具体的:季度财报任务上 18 份报告有 16 份通过了一个逐数字逐引用核对的评分器,而 Fable 5.1 和 Opus 5 的尝试都没过;虚构并购分析 63 分钟对 Opus 5 的 93 分钟,成本约一半。厂商自测,但任务形状——长程、多文件、重验证——正是终端分数测量的东西。对 Agent 研究与深度工作负载来说,4/20 美元配上这个侧写,是本次发布最硬的理由。

Medium 档的经济性是安静的头条

默认 medium 加 0.20 美元缓存读取,改变的是长会话的单位经济学,而牌面价看不出来。Artificial Analysis 把五个努力档中的四个放进了智能-成本帕累托前沿——唯一的例外是没人该反射性去选的那档——它的 5.98 美元/任务属于 max,不属于 medium。CodeRabbit 的管线测试发现 Standard 配置(较低档)在 80 个模式集上以更好的可执行精度和更少评论数击败了自家 Max 配置,Max 只在 13 个最难的 Signal 案例上拉开差距。三个独立来源的形状一致:这个模型的价值函数奖励刻意的努力档选择,惩罚条件反射。 对还在付 Opus 5 或 老 Opus 4.8 费率的团队,这次切换几乎是白捡的上行空间。

它咬人的地方

Max 档烧掉折扣

让 medium 便宜的那个旋钮,让 max 昂贵:AA 指数任务约 119k 输出 token(GPT-6 Astra max 的 4.4 倍、Fable 5.1 max 的 1.6 倍)、加权单任务 5.98 美元、啰嗦度第 95/212、整个评测累计 2.6 亿 token。CodeRabbit 在生产形状的工作里看到同样的形状:token 用量比自家基线高 49–60%,Max 在 OSS 集上 +57.6%、Signal 集上 +60.1%,换来的精度常常不需要。如果你的框架或习惯锁死 max,请按旗舰预算做规划;也可以看看 Gemini 3.8 Flash 测评里一个刻意节俭的对照,以及近期队列里单任务实测成本最低的 MiMo-V2.6-Pro

代码更少,缺陷更密

SonarSource 的数字值得配上它别扭的标题:问题总数降 42%,但每百万行缺陷密度从 576 升到 644;并发/线程类——在生产环境而不是审查中暴露的那类——升 44% 成为最大类(295/mLOC)。三个最高严重级 BLOCKER 的密度全部下降,这确实让人安心,但形状很清楚:5.5 写的代码更紧凑,却不均匀地更安全。两个边界:该测试用的是预发布构建(SonarSource 会在正式版后重跑);CodeRabbit 的平行发现——OSS 集上新找出 11 个模式、漏掉基线能抓的 9 个——从审查侧说了同一件事。保留审查环节,把它挪到管线更前面,别删掉。

对 Fable 只是渐进,且未知仍是未知

METR 的评估是最不客气的独立判词,值得读两遍:五项 AI 研发任务全面小胜 Fable 5.1、没有证据支持完全自动化、判断形能力(前瞻、预测、反馈循环搭建、科研品味)没有大的进展。再加上真正未知的东西:没有可信的延迟数据(Artificial Analysis 对该模型速度标 N/A,所以本文不引用任何首 token 数字);消费端可用性未核实;带护栏的运行可能整题记零,意味着你测试框架的安全设置是你测得能力的一部分。一款只活了一天的模型,这些都随身携带。没有一条足以否决;每一条都在说:先做一次有度量的试点,而不是全量翻转。

社区原声

首日舆论沿两条轴分裂,不是一条。

轴一:终于快了——也终于能聊了。 速度帖及其回复是明确的欣喜;哲学访谈是同一件事的定性版,形容它"polish and panache"外加动手欲。围绕它重建工作流的用户概括了这个人群:喜欢 Opus 5 的产出、痛恨跟它的对话。

受训哲学学家用户 Wickywire 的 Reddit 帖子,用苏格拉底式访谈分享 Opus 5.5 medium 档的第一印象,形容它打磨光鲜、派头十足
u/Wickywire(r/ClaudeAI,2026-09-22):一次氛围检查而非基准——medium 档下的打磨与派头。

原帖:r/ClaudeAI 1wnkgie

轴二:信任,但要验证——Opus 5 的疤痕组织。 锚点帖里的怀疑是具体的:人们被一款基准好看、沟通糟糕的模型烫过,不接受发布日数字当作结案。一条评论善意地解读设计意图——"Fable 5 & Opus 5 were designed & tested together with the intent being that you talk to Fable and it delegates execution to Opus agents"(u/canyonero7;译:Fable 5 和 Opus 5 是一起设计、一起测试的,意图就是你跟 Fable 说,它把执行派给 Opus)——这引出了关于 5.5 的真问题:它按执行模型定价,却被当成对话模型宣传,一款模型同时胜任两个角色,恰恰是发布日的狂欢无法证实的。

Reddit 帖子标题为 Opus 5.5 比 Opus 5 便宜 40% 同时快 30%,高赞评论回顾 Opus 5 的沟通问题
锚点帖(r/ClaudeAI,2026-09-22):官方定调的社区版,压在 Opus 5 沟通口碑的废墟上。

原帖:r/ClaudeAI 1wnf7sb

本文落点:切换决定上跟欢呼者站在一起——经济性一边倒,没必要把新工作留在 Opus 5 上;过程上跟怀疑者站在一起。蜜月期作者说得对,两周的日志会比上文任何一张表更有说服力;他也说得对,此刻它确实像一次真实的跨越。

裁决:切换你的 Opus 工作,保留纪律

工作负载形状裁决理由主要保留
目前跑在 Opus 5 / 4.8 上的默认编码 Agent 工作现在就切价格低 20%、缓存读低 60%、沟通修复、TB-Science 29.0% → 58.7%锁定模型 ID;正式版重跑数据落地后再复核
最难的前沿与长程研究升级到 Fable 5.1METR:渐进式;官方定调本身也是"Fable 的水准"Fable 的成本与怪癖是另一个决定
无人值守长运行、批处理管线medium 档的好候选0.20 美元缓存读 + 默认 medium;AA 帕累托前沿 5 档占 4无可信延迟——押 SLA 前自测首响
交互式聊天产品先测再上延迟未知;高努力档的啰嗦度(第 95/212)直接打在体验和账单上AA 速度标 N/A;本文不引用任何数字
无审查的 Java 或大规模代码生成用,但审查前移通过率持平、输出更精、BLOCKER 密度全降缺陷密度 576 → 644/mLOC;并发 +44%
成本地板的自动化对比更便宜的模型4/20 美元对 Opus 级便宜,绝对值不便宜机械活 MiMo 0.13 美元/任务或 Gemini 3.8 Flash 可能更合适

两条时效提示。第一,本文所有独立数字都是首日快照:SonarSource 测的是预发布构建并承诺正式版后重跑;Artificial Analysis 排名逐日变动。第二,家族梯队还在补位——Sonnet 5 和 Haiku 4.5 在这次发布之下,而 Anthropic 的"Claude 5.5 family"措辞说明还有后续成员。用锁定而不是习惯来规划模型路由。

一条实践路径:在工作发生的地方跑它

上文所有线索指向同一个形状:经济性奖励长程、多工具、刻意选档的运行;失败模式是不加监督的量;而未决问题——延迟、选择器可用性、数周后的稳定性——都只能靠跑一个有边界的任务来回答,不是再读一张表。这是浏览器形状的活:多页调研、抽取与自动化,由智能体浏览器托住会话的页面与上下文,让模型在里面干活——Tabbit Browser正是围绕这个循环构建的。

诚实的边界,与我们其他模型测评一致:本文未核实 Opus 5.5 是否出现在 Tabbit Browser 的实时模型选择器中,也不声称做过任何上手实测。请检查你账户的模型选择器,锁定模型 ID,给它一个可回退的小任务——一个带现成测试的多文件改动,或一份要求引用来源的调研包——并按"每个可接受结果的成本"对比 Opus 5,再决定切换你在乎的东西。

Tabbit Browser

来源

常见问题

Claude Opus 5.5 值不值得用?

值得作为默认的 Opus 级模型。它以每百万输入 4 美元、输出 20 美元的价格瞄准大多数工作上 Fable 5.1 的水准,比 Opus 5 便宜 20%,缓存读取低至 0.20 美元。最难的前沿任务仍建议留给 Fable 5.1,也不要条件反射地开最高努力档——实测显示那时的输出量会吃掉折扣。

Claude Opus 5.5 比 Opus 5 便宜吗?

牌面价格低 20%:输入 4 美元对 5 美元,输出 20 美元对 25 美元,缓存读取从 0.50 美元降到 0.20 美元(每百万 token)。Anthropic 基于自家测试称典型工作负载总成本约降 40%。实际省多少取决于努力档位和 token 结构,请用代表性任务实测。

Opus 5.5 比 Fable 5.1 强吗?

Anthropic 自己的说法是:Opus 5.5 在大多数工作上达到 Fable 5.1 的水准,同时运行成本更低。独立核查各有侧重:METR 认为 AI 研发任务上相对 Fable 5.1 只是渐进式提升,而 Artificial Analysis 给 Opus 5.5 打出 58 分,是其 212 个模型快照的第一名。结论是低价位上的接近持平,不是全面胜出。

Claude Opus 5.5 写代码行吗?

发布页报告 Terminal-Bench 4.0 得分 66.4%(标准误约 ±2.6 个百分点),CursorBench 4.0 为 57.8%。SonarSource 的 Java 受控测试发现它和 Opus 5 的通过率基本持平(87.68% 对 88.6%),代码更少但缺陷密度更高,所以保留代码审查环节,不要盲信输出。

为什么 Claude Opus 5.5 这么费 token?

在最高努力档,Artificial Analysis 测得每个智能指数任务约输出 119,000 个 token,是 GPT-6 Astra 最高档(约 27,000)的四倍多,啰嗦程度排 212 个模型中的第 95 位。默认努力档是 medium,且 SonarSource 在 Java 生成上实测输出 token 比 Opus 5 少 40%,因此消耗量取决于努力档位和工作负载。

Claude Opus 5.5 什么时候发布的,哪里能用?

Anthropic 于 2026 年 9 月 22 日发布,API 模型 ID 为 claude-opus-5-5,上下文 100 万 token,最高输出 12.8 万 token。发布页列出 Anthropic Claude Platform、AWS、Google Cloud 和 Microsoft Azure。消费端套餐的可用性本轮未核实。

能在 Tabbit Browser 里用 Claude Opus 5.5 吗?

本文未能核实 Opus 5.5 是否出现在 Tabbit 的实时模型选择器里,请勿据此规划。先查看你自己账户的模型选择器,跑一个可回退的小任务,再把工作流交给它。

下一步

让 Tabbit 与你并肩工作。

跨标签页调研、自动化重复的浏览器工作,让每一处上下文都触手可及。