01
信息更干净
页面结构、可交互元素和状态以更少的冗余传给模型,Agent 不必在噪声里反复找目标,也就少烧 Token。
浏览器 Agent 基准测试 · 25 道题 × 3 次 × 3 套方案
Tabbit 是一款同时为人与 Agent 打造的 AI 浏览器。我们在一个详细的测评方案中对比了 Tabbit CLI 与 Codex 自带的 Chrome 接管方案以及 Vercel Labs 的 Agent Browser。结果是:在本次测试中,Tabbit CLI 速度最快,最节省 Token。
下载 Tabbit 浏览器后打开,在任意 Agent 中输入 /tabbit 就可以体验 Tabbit CLI 的 Browser-Use 方案
Tabbit最优
Codex Chrome
Agent Browser
向下滚动查看完整数据
只有三套方案面对同一份考卷、同样的条件,对比才有意义。下面是它们面对的到底是什么。
题目来自 BU Bench 题库 的 100 题集合,不是为这次实验临时编写的。我们从 5 个部分各抽取 5 道题;为减少针对性跑分,本页不公开具体题目。
| 题型 | 来源 | 题数 |
|---|---|---|
| 网页读取 | WebBench | 5 |
| 资料研究 | Mind2Web 2 | 5 |
| 网页交互 | BU Bench custom | 5 |
| 事实问答 | GAIA | 5 |
| 多步检索 | BrowseComp | 5 |
Wall time
从 Agent 进程启动到交出结果的实际时间,包含模型思考、浏览器操作和 CLI 等待,不含之后的评分时间。
中位用时
把多次用时排序后取中间值,比平均值更不容易被一次超时拉高。
P90
90% 的运行不超过这个时间,用来观察少数特别慢的长尾任务。
工具调用
该次运行中模型发出的全部工具调用,不只包含点击和导航。
Token
run.json 记录的模型输入和输出 token,用于比较资源消耗,不是美元价格。
每个正确答案的成本
该方案全部 75 次尝试消耗的时间、Token 和工具调用,除以最终答对的题数。
从固定题单到盲评结论,一共四步。
当 Agent 要批量跑任务时,正确率不是全部。每个正确答案要花多少代价,才决定账单和排队时间。
把一套方案 75 次尝试消耗的全部时间、Token 和工具调用,除以它最终答对的题数。
每个正确答案耗时
每个正确答案输入 Token
每个正确答案输出 Token
每个正确答案工具调用
Token 不是抽象数字——输入 Token 直接决定每一次调用的账单和上下文压力。三套方案用的是同一个模型,所以差距来自浏览器交给 Agent 的信息:信息更干净,操作路径更短。
每套方案全部 75 次运行,再看只看答对运行时的同一组数字。
| 方案 | 答对 / 75 | 中位耗时 | P90 耗时 | 总耗时 |
|---|---|---|---|---|
| Tabbit | 48 · 64.0% | 121.0s | 220.6s | 2.9h |
| Codex Chrome | 47 · 62.7% | 141.2s | 224.2s | 3.0h |
| Agent Browser | 45 · 60.0% | 209.6s | 489.0s | 5.3h |
| 方案 | 答对 / 75 | 中位耗时 | P90 耗时 | 平均耗时 |
|---|---|---|---|---|
| Tabbit | 48 · 64.0% | 118.3s | 225.6s | 137.0s |
| Codex Chrome | 47 · 62.7% | 131.6s | 226.7s | 140.0s |
| Agent Browser | 45 · 60.0% | 185.1s | 481.3s | 230.6s |
每套方案全部 75 次运行的总量,以及只看答对运行时的平均值。
| 指标 | 全部 75 次运行 | 只看答对的运行 |
|---|---|---|
| 输入 Token | 38.55M / 74.00M / 92.60M | 550K / 954K / 1.16M |
| 输出 Token | 356K / 361K / 462K | 5K / 5K / 6K |
| 工具调用 | 965 / 1,164 / 1,875 | 13.6 / 15.4 / 24.3 |
每个答案都由不知道方案名称的评分模型裁定,所以自报 completed 从来不算答对。
| 题型 | Tabbit | Codex Chrome |
|---|---|---|
| 网页读取 | 11 / 15 | 9 / 15 |
| 资料研究 | 8 / 15 | 8 / 15 |
| 网页交互 | 15 / 15 | 15 / 15 |
| 事实问答 | 5 / 15 | 5 / 15 |
| 多步检索 | 9 / 15 | 10 / 15 |
| 方案 | 优势 | 主要问题 |
|---|---|---|
| Tabbit | 完整 25 题正确率最高;每个正确答案的耗时、输入 Token 和工具调用都最低;P90 长尾最短。 | 主实验期间发生过 4 次运行故障。 |
| Codex Chrome | 多步检索最好;网页交互全部成功。 | 在三种方案都答对的运行上最慢、工具调用最多;每个正确答案的输入 Token 接近 Tabbit 的两倍。 |
| Agent Browser | 网页交互与多数成功题目数量居中;开源、可自行部署。 | 中位耗时、P90、总耗时和 Token 消耗都明显最高。 |
三套方案用的是同一个模型、同样的思考强度,所以差距发生在浏览器这一侧。
01
页面结构、可交互元素和状态以更少的冗余传给模型,Agent 不必在噪声里反复找目标,也就少烧 Token。
02
常见的导航、读取和填表动作被收敛成更少的步骤,模型不需要靠反复试错走到终点。
03
75 次运行共 965 次工具调用,比 Codex Chrome 少 17%,比 Agent Browser 少 49%。调用越少,上下文越省,长尾越短。

实验数据来自于 Tabbit 浏览器团队。详细实验过程记录不包含在本页面中,如需交流,欢迎联系 support@tabbit.ai。
按每个正确答案计算,Tabbit 平均 219.3 秒,Codex Chrome 是 227.9 秒;中位运行 121.0 秒对比 141.2 秒。差距更大的是成本:每个正确答案 803,144 输入 Token,对比 1,574,503,少 49%;工具调用少约 20%。
按每个正确答案计算,219.3 秒对比 422.9 秒,约快 1.9 倍;输入 Token 少 61%,工具调用约为一半。中位耗时 121.0 秒对比 209.6 秒。
75 次运行中 Tabbit 答对 48 次(64.0%),Codex Chrome 47 次(62.7%),Agent Browser 45 次(60.0%)。差距很小,前两名只差一次运行,因此不能据此认定某一套方案稳定更强。
每个答案都交给一个全新的评分会话,它看不到方案名称,也不会跨方案比较答案。它看到题目、最终状态、最终答案和提交的来源。自报 completed 不算答对。其中 10 道题提供标准答案,另外 15 道按题目要求检查最终回答。
题单、运行设置、各轮汇总、每个答案和评分结果都保存在核心数据包中。本页呈现的是汇总结果,不是重新跑一遍。
这是在一组具体条件下进行的实用对比,不是严格控制变量的科学基准测试。
即便存在这些限制,结果仍有方向性的参考价值:在本次测试条件下,Tabbit 完成任务更快,输入 Token 和工具调用也明显更少。速度与资源效率的差异比正确率的小幅差异更清晰,但仍建议用自己的真实任务进一步验证。
Tabbit 是一款同时为人与 Agent 打造的 AI 浏览器。本次测评中,Tabbit CLI 对比 Codex 自带的 Chrome 接管方案与 Vercel Labs 的 Agent Browser,完成任务最快,也最节省 Token。
下载 Tabbit 浏览器后打开,在任意 Agent 中输入 /tabbit 就可以体验 Tabbit CLI 的 Browser-Use 方案