返回:选工具首页

模型能力比较 · 公开证据版

先告诉你谁强,再给你看依据

能力按公开同榜比较;价格单独看,不把两者硬凑成一个总分。

查看评判标准
能力数据:Arena.ai最近榜单快照 2026-08-13价格核验 2026-08-14API 输入 / 输出,每百万 tokens

三个关键能力结论

名次是榜单快照,不等于模型的永久强弱
01

中文能力

原榜单

海外Claude Opus 5#11575

国内Qwen 3.8 Max#41556

在这次同榜快照中,Claude 名次在前;Qwen 是本页国内模型里名次最高的一个。

02

编程能力

原榜单

海外Claude Opus 5#11691

国内Kimi K3 Max / Qwen 3.8 Max#2 / #31674 / 1669

在同一 WebDev 快照里,Claude、Kimi、Qwen 分列前三;名次只代表这张公开榜单。

03

Agent 工具

原榜单

海外Claude Opus 5 / GPT-5.6 Sol#1 / #517.96% / 10.12%

国内Kimi K3 Max / GLM 5.2 Max#2 / #1015.55% / 8.39%

Claude 为 17.96% ± 3.18%,Kimi 为 15.55% ± 2.06%;区间重叠,不能断言确定差距。

完整证据矩阵

横向比模型,纵向看八种能力

点击维度可在手机上逐项阅读
中文能力在中文理解、表达和开放任务中,用户更偏好哪一个?
Arena Chinese · 2026-08-12
模型API 价格
海外Claude Opus 5查看详情 #51498High#11506Max#51520High#11691Max#117.96%± 3.18%确认成功#11575High#61297High#71507High$5 / $25输入 / 输出
国内Qwen 3.8 Max查看详情 #121481#61492#81516#31669Preliminary暂无同榜值#41556#21301#61507¥12 / ¥36中国站标准价
国内Kimi K3 Max查看详情 #101484#161477#71516#21674#215.55%± 2.06%确认成功#201525暂无同榜值#101501$3 / $15缓存命中输入 $0.30
海外GPT-5.6 Sol查看详情 #131481xHigh暂无同榜值#15xHigh#71622xHigh#510.12%确认成功#91543xHigh#221280xHigh#201490xHigh$5 / $30输入 / 输出
国内GLM 5.2 Max查看详情 #311465暂无同榜值#37#91587#108.39%确认成功#241521暂无同榜值#351480$1.40 / $4.40输入 / 输出
国内DeepSeek V4 Pro查看详情 #461454暂无同榜值#48#471445暂无同榜值#541495暂无同榜值#451473$0.435 / $0.878 月 16 日 16:00 UTC 起调价
海外Gemini 3.5 Flash High查看详情 #281468暂无同榜值#25#311506暂无同榜值#221524#171283#281483$0.75 / $4.502026 年 12 月 31 日前优惠价

更多模型资料

有详情,但不硬塞进八维排名

下面这些模型暂时没有足够的同榜数据,所以只保留用途、价格和官网入口,不用“待检测”冒充比较结果。

怎么读这张表

只在同一榜单内比较,不制造虚假的总分

  1. 分维度看名次中文、编程和 Agent 来自不同公开榜单,不能直接相加。
  2. 保留模型档位High、Max、xHigh 等推理档位会影响结果,表内没有把它们悄悄抹掉。
  3. 保留日期和区间每个维度都标出快照日期;榜单给出统计区间时一并展示,区间重叠就不宣称确定领先。
  4. 价格不算能力价格只回答调用成本;聊天会员、Coding 套餐与 API 不能混着报价。
  5. 缺数据就留空“—”代表没有找到同一榜单里的对应值,不代表模型一定不支持。

第二篇 · 把能力换成实际用途

不同用途,到底应该选哪个模型?

写作、办公、编程、Agent、长材料、多模态和低预算,分别给出建议。
继续看用途建议