EN 中文

Qwen3.8 27B Competitive Intelligence ReportQwen3.8 27B 全模型竞争情报报告

A complete audit of all 610 models on Artificial Analysis Intelligence Index v4.1.1, organised around Qwen3.8 27B (II = 52.02) as the benchmark anchor. 围绕 Qwen3.8 27B(II = 52.02)作为基准锚点,对 Artificial Analysis Intelligence Index v4.1.1 上全部 610 个模型进行系统审计。

Source: artificialanalysis.ai · Generated: 2026-08 · Methodology: 9-benchmark composite II (GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR) · Costs shown where publicly disclosed; N/A means no public price 数据来源: artificialanalysis.ai · 生成时间: 2026-08 · 评测方法: 9 项基准综合(GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR)· 价格仅显示公开报价;"暂无"表示未公开

Anchor Model基准模型

52.02Intelligence IndexIntelligence Index

Qwen3.8 27B · Alibaba, China · 27B params · Released 2026-08-14阿里巴巴 (中国) · 27B 参数 · 发布 2026-08-14

Public prices: input $0.45 / 1M tok, output $3.20 / 1M tok, cache hit $0.05 / 1M tok. No public per-task cost. 公开计费(按 1M tokens):输入 $0.45、输出 $3.20、缓存命中 $0.05。未公开每任务成本。

Output tokens / task: 47,166 (reasoning 37,214 + answer 9,952) 每任务输出 tokens:47,166(其中推理 37,214 + 答案 9,952)

Reasoning model · Open weights · OPEN 推理型模型 · 开源权重 · 开源

Position in the Index总分定位

Total models模型总数610
With II score含 II 分数597
Unique model families独立模型族421
Rank排名~ top 25全球前 25
Quantile分位数~ 96th percentile约 96 百分位
Open-weight peers强过它的开源only 5仅 5 open models are stronger个开源模型
Closed peers强过它的闭源14 closed共 14 are stronger个闭源模型

Verdict结论

Open-weight frontier at 27B.27B 级别的开源前沿。 Qwen3.8 27B is the highest-scoring 27B-class dense model (open or closed) and ties or beats every Anthropic Sonnet, every GPT-5.x pre-Luna, every GPT-5.2 / 5.3 / 5.4, and ties GPT-5.6 Luna (the OpenAI "small reasoning" tier) to within 0.30 II. Qwen3.8 27B 是当前 27B 稠密模型(开源/闭源)最高分。它与所有 Anthropic Sonnet、所有 GPT-5.x pre-Luna、GPT-5.2 / 5.3 / 5.4 持平或领先,并把 OpenAI 的"小型推理"档 GPT-5.6 Luna 压到仅 0.30 II 之外。
Headline:头条: Anthropic Opus 5 (63.05), Claude Fable 5 (62.07), GPT-5.6 Sol (60.93), and Grok 4.6 (60.92) are the only 4 models more than 8 II points ahead. 仅 Claude Opus 5(63.05)、Claude Fable 5(62.07)、GPT-5.6 Sol(60.93)、Grok 4.6(60.92)这 4 个模型在 II 上领先 Qwen3.8 27B 超过 8 分。

Distribution of the 420 unique families420 个独立模型族的分布

Grouping by base name (stripping reasoning-level suffixes like (max), (xhigh), (high), (medium), (low), (Non-reasoning), and date suffixes), and reporting the strongest variant's II. Qwen3.8 27B itself is excluded from the totals. 按基础名分组(去除推理档位后缀如 (max)(xhigh)(high)(medium)(low)(Non-reasoning) 与日期后缀),取每族最强变体的 II。Qwen3.8 27B 本身不计入总数。

Stronger强于 Qwen

16
II > 54.02
2 open开源 · 14 closed闭源

Similar实力相当

8
II ∈ [50.02, 54.02]
3 open开源 · 5 closed闭源

Weaker弱于 Qwen

396
II < 50.02
Of top 60:前 60 中: 37 open开源 · 23 closed闭源

Competitive position on the II scale (0 – 70)在 II 标尺(0 – 70)上的竞争位置

Qwen 52
0
10
20
30
40
50
57
60
70
Qwen3.8 27B
Stronger open更强开源
Stronger closed更强闭源
Similar (± 2 II)相当 (± 2 II)

Stronger强于 16 models above Qwen3.8 27B (II > 54.02) 16 个模型超过 Qwen3.8 27B (II > 54.02)

Anthropic dominates with 5 entries. Only 2 open-weight models surpass Qwen3.8 27B: Kimi K3 and Qwen3.8 2.4T A95B. Anthropic 一家占据 5 席。仅 2 个开源模型能稳压 Qwen3.8 27B:Kimi K3 与 Qwen3.8 2.4T A95B。

II Δ Name名称 Creator厂商 Country国家 Params参数 Type类型 Cost成本
63.05 +11.03
Claude Opus 5
high, low, medium, xhigh
Anthropic US large closedR $2.3369
62.07 +10.05
Claude Fable 5
Anthropic US large closedR $3.1396
60.93 +8.91
GPT-5.6 Sol
Non-reasoning, high, low, medium
OpenAI US large closedR $1.2312
60.92 +8.90
Grok 4.6
SpaceXAI US large closedR $0.8367
59.70 +7.68
Kimi K3
low
Kimi CN 2800B openR $0.8375
59.51 +7.49
GLM-5.3
Z AI CN 753B closedR $0.6829
58.08 +6.06
Qwen3.8 Max
Alibaba CN large closedR $1.1320
57.70 +5.68
Qwen3.8 2.4T A95B
Alibaba CN 2400B openR $1.0919
57.33 +5.31
Claude Opus 4.8
Anthropic US large closedR $2.0315
56.76 +4.74
Muse Spark 1.2
Meta US large closedR $0.3992
56.58 +4.56
GPT-5.6 Terra
Non-reasoning, high, low, medium
OpenAI US large closedR $0.5080
56.31 +4.29
GPT-5.5
Non-reasoning, high, low, medium
OpenAI US large closedR $1.1747
56.03 +4.01
Gemini 3.7 Flash
low, medium
Google US large closedR $0.4022
55.76 +3.74
Grok 4.5
SpaceXAI US large closedR $0.3601
55.26 +3.24
Claude Sonnet 5
Non-reasoning
Anthropic US large closedR $1.7173
54.96 +2.94
Claude Opus 4.7
Non-reasoning, high
Anthropic US large closedR $2.2285
63.05 +11.03
Claude Opus 5
high, low, medium, xhigh
Anthropic 美国 large 闭源推理 $2.3369
62.07 +10.05
Claude Fable 5
Anthropic 美国 large 闭源推理 $3.1396
60.93 +8.91
GPT-5.6 Sol
Non-reasoning, high, low, medium
OpenAI 美国 large 闭源推理 $1.2312
60.92 +8.90
Grok 4.6
SpaceXAI 美国 large 闭源推理 $0.8367
59.70 +7.68
Kimi K3
low
Kimi 中国 2800B 开源推理 $0.8375
59.51 +7.49
GLM-5.3
Z AI 中国 753B 闭源推理 $0.6829
58.08 +6.06
Qwen3.8 Max
Alibaba 中国 large 闭源推理 $1.1320
57.70 +5.68
Qwen3.8 2.4T A95B
Alibaba 中国 2400B 开源推理 $1.0919
57.33 +5.31
Claude Opus 4.8
Anthropic 美国 large 闭源推理 $2.0315
56.76 +4.74
Muse Spark 1.2
Meta 美国 large 闭源推理 $0.3992
56.58 +4.56
GPT-5.6 Terra
Non-reasoning, high, low, medium
OpenAI 美国 large 闭源推理 $0.5080
56.31 +4.29
GPT-5.5
Non-reasoning, high, low, medium
OpenAI 美国 large 闭源推理 $1.1747
56.03 +4.01
Gemini 3.7 Flash
low, medium
Google 美国 large 闭源推理 $0.4022
55.76 +3.74
Grok 4.5
SpaceXAI 美国 large 闭源推理 $0.3601
55.26 +3.24
Claude Sonnet 5
Non-reasoning
Anthropic 美国 large 闭源推理 $1.7173
54.96 +2.94
Claude Opus 4.7
Non-reasoning, high
Anthropic 美国 large 闭源推理 $2.2285

Highlights — stronger强者要点

Claude Opus 5 (63.05, $2.34)Claude Opus 5(63.05,$2.34) is the current SOTA, +11.03 ahead of Qwen3.8 27B. Anthropic holds the top 2 spots (Opus 5 and Fable 5). 是当前 SOTA,比 Qwen3.8 27B 高 +11.03。Anthropic 拿下前 2 席(Opus 5 与 Fable 5)。
Open-weight ceiling:开源天花板: Kimi K3 (59.70) and Qwen3.8 2.4T A95B (57.70) are the only opens above Qwen3.8 27B. The 2.4T-A95B is the same Qwen3.8 family but in MoE 2.4T-total / 95B-active form — the obvious "next step up" within Qwen family. Kimi K3(59.70)与 Qwen3.8 2.4T A95B(57.70)是仅有的两个在 Qwen3.8 27B 之上的开源。2.4T-A95B 属于同一 Qwen3.8 家族,但采用 MoE 2.4T 总参数 / 95B 激活——是 Qwen 家族向上发展的"下一步"。
OpenAI's 4 modelsOpenAI 4 个模型 above Qwen3.8 27B: GPT-5.6 Sol (60.93), GPT-5.6 Terra (56.58), GPT-5.5 (56.31). All reasoning tier, ranging $0.51 to $1.23 / task. 在 Qwen3.8 27B 之上:GPT-5.6 Sol(60.93)、GPT-5.6 Terra(56.58)、GPT-5.5(56.31)。均为推理档,定价 $0.51 – $1.23 / 任务。

Similar相当 8 models in the ± 2 II band (II in [50.02, 54.02]) 8 个模型在 ± 2 II 区间 (II ∈ [50.02, 54.02])

The "dead heat" zone. Qwen3.8 27B sits between GPT-5.6 Luna (above) and Gemini 3.5 Flash (below). "贴身肉搏"区。Qwen3.8 27B 夹在 GPT-5.6 Luna(强侧)与 Gemini 3.5 Flash(弱侧)之间。

II Δ Name名称 Creator厂商 Country国家 Params参数 Type类型 Cost成本
52.02 ± 0
Qwen3.8 27B
the anchor model
Alibaba CHINA 27B openR N/A
53.20 +1.18
DeepSeek V4 Pro 0813
DeepSeek CN 1600B openR $0.2521
53.20 +1.18
Muse Spark 1.1
Meta US large closedR $0.2923
53.12 +1.10
GPT-5.4
Non-reasoning, low
OpenAI US large closedR $1.1038
52.64 +0.62
GLM-5.2
Z AI CN 753B openR $0.4445
52.32 +0.30
GPT-5.6 Luna
Non-reasoning, high, low, medium
OpenAI US medium closedR $0.0471
51.96 -0.06
Gemini 3.5 Flash
medium, minimal
Google US large closedR $0.6934
51.77 -0.25
DeepSeek V4 Flash 0731
DeepSeek CN 284B openR $0.1122
51.58 -0.44
Gemini 3.6 Flash
Google US large closedR $0.3442
52.02 ± 0
Qwen3.8 27B
基准锚点
阿里巴巴 中国 27B 开源推理 暂无
53.20 +1.18
DeepSeek V4 Pro 0813
DeepSeek 中国 1600B 开源推理 $0.2521
53.20 +1.18
Muse Spark 1.1
Meta 美国 large 闭源推理 $0.2923
53.12 +1.10
GPT-5.4
Non-reasoning, low
OpenAI 美国 large 闭源推理 $1.1038
52.64 +0.62
GLM-5.2
Z AI 中国 753B 开源推理 $0.4445
52.32 +0.30
GPT-5.6 Luna
Non-reasoning, high, low, medium
OpenAI 美国 medium 闭源推理 $0.0471
51.96 -0.06
Gemini 3.5 Flash
medium, minimal
Google 美国 large 闭源推理 $0.6934
51.77 -0.25
DeepSeek V4 Flash 0731
DeepSeek 中国 284B 开源推理 $0.1122
51.58 -0.44
Gemini 3.6 Flash
Google 美国 large 闭源推理 $0.3442

Highlights — similar相当区间要点

4 opens vs 4 closeds该区间 4 开源 vs 4 闭源 in the ± 2 II band. DeepSeek V4 Pro 0813 (53.20) and Meta Muse Spark 1.1 (53.20) tie for the top of this band. 。DeepSeek V4 Pro 0813(53.20)与 Meta Muse Spark 1.1(53.20)并列首位。
OpenAI's closest equal: GPT-5.6 Luna (52.32, $0.05).OpenAI 最近的对等:GPT-5.6 Luna(52.32,$0.05)。 This is OpenAI's "small reasoning" tier — almost identical cost profile to Qwen3.8 27B per task, just 0.30 II ahead. 这是 OpenAI 的"小型推理"档——成本结构与 Qwen3.8 27B 几乎一致,仅高 0.30 II。
Google's closest equal: Gemini 3.5 Flash (51.96, $0.69).Google 最近的对等:Gemini 3.5 Flash(51.96,$0.69)。 Just 0.06 II below Qwen3.8 27B — within margin of error. 仅比 Qwen3.8 27B 低 0.06 II——误差范围内。
DeepSeek V4 Pro 0813 (53.20, $0.25)DeepSeek V4 Pro 0813(53.20,$0.25) is the highest-scoring open-weight model with public pricing that's directly comparable to Qwen3.8 27B. 是公开定价下与 Qwen3.8 27B 最直接可比、得分最高的开源模型。

Weaker弱于 Top 60 weaker models — the "obvious beats" (best variant shown) 前 60 个弱于 Qwen 的模型 — "明显落败"(每族最强变体)

The 396 weaker models are split into a sample of the top 60 here. Notice that even top-tier closed models like Claude Opus 4.6, GPT-5.2, and Claude Sonnet 4.6 (max) fall below Qwen3.8 27B. 396 个弱于 Qwen3.8 27B 的模型,这里展示前 60 个。值得注意的是,即便是顶级闭源模型 Claude Opus 4.6GPT-5.2Claude Sonnet 4.6 (max) 都低于 Qwen3.8 27B。

Premium weaker (II 35 – 50)高端弱于(II 35 – 50)

II Δ Name名称 Creator厂商 Country国家 Params参数 Type类型 Cost成本
48.37 -3.65
Claude Sonnet 4.6
Non-reasoning, Non-reasoning, Low Effort
Anthropic US large closedR $1.2182
47.74 -4.28
Gemini 3.1 Pro Preview
Google US large closedR $0.3346
47.36 -4.66
Motif 3
Beta
Motif Technologies KR 314B c/oR N/A
46.71 -5.31
Qwen3.7 Max
Alibaba CN large closedR $0.5413
45.51 -6.51
GPT-5.3 Codex
OpenAI US large closedR N/A
45.40 -6.62
MiniMax-M3
MiniMax CN 428B openR $0.1387
45.27 -6.75
DeepSeek V4 Pro
, high
DeepSeek CN 1600B openR $0.0474
45.14 -6.88
Kimi K2.6
Kimi CN 1000B openR $0.3653
44.93 -7.09
Claude Opus 4.6
high
Anthropic US large closedR N/A
44.25 -7.77
Muse Spark
Meta US closedR N/A
43.34 -8.68
GPT-5.2
, medium
OpenAI US large closedR N/A
43.02 -9.00
Kimi K2.7 Code
Kimi CN 1000B openR $0.2220
42.88 -9.14
MiMo-V2.5-Pro
Xiaomi CN 1023B openR $0.0339
42.29 -9.73
Inkling
Thinking Machines US 975B openR $0.3389
42.21 -9.81
Hy3
Tencent CN 299B openR $0.0357
42.12 -9.90
DeepSeek V4 Flash
, high
DeepSeek CN 284B openR $0.0673
41.87 -10.15
Claude Opus 4.5
Anthropic US large closedR N/A
41.74 -10.28
Nex-N2-Pro
Nex AGI CN 397B openR N/A
41.64 -10.38
Solar Pro 4
Upstage KR medium closedR $0.2231
41.37 -10.65
MiMo-V2-Pro
Xiaomi CN closedR N/A
41.22 -10.80
GPT-5.2 Codex
OpenAI US large closedR N/A
41.18 -10.84
Inkling Small
Thinking Machines US 266B openR $0.0735
41.07 -10.95
Qwen3.6 Max Preview
Alibaba CN large closedR N/A
40.97 -11.05
GLM-5.1
Z AI CN 744B openR $0.3042
40.94 -11.08
GPT-5.4 mini
, medium
OpenAI US large closedR $0.4948
40.65 -11.37
Grok Build 0.1 0616
SpaceXAI US large closedR $0.2252
40.61 -11.41
Gemini 3 Pro Preview
low
Google US large closedR N/A
40.55 -11.47
GLM-5
Z AI CN 744B openR N/A
40.49 -11.53
Qwen3.6 Plus
Alibaba CN large closedR $0.3569
39.85 -12.17
JT-4.1 Flash 236B A21B
China Mobile CN 236B closed N/A
39.71 -12.31
GPT-5.4 nano
OpenAI US medium closedR $0.1493
39.71 -12.31
Agnes 2.5 Pro Alpha
Sapiens AI SG medium closedR N/A
39.37 -12.65
Qwen3.7 Plus
Alibaba CN medium closedR $0.2424
39.05 -12.97
GLM-5-Turbo
Z AI CN closedR N/A
38.87 -13.15
MiniMax-M2.7
MiniMax CN 230B openR $0.0777
38.74 -13.28
Gemini 3 Flash
Google US large closedR N/A
38.32 -13.70
Nemotron 3 Ultra
NVIDIA US 550B openR $0.3827
38.04 -13.98
MiMo-V2.5
Xiaomi CN 310B openR $0.0104
37.95 -14.07
Grok 4.3
Non-reasoning, low, medium
SpaceXAI US large closedR $0.1454
37.95 -14.07
Grok 4.20 0309 v2
SpaceXAI US large closedR N/A
37.82 -14.20
Ling 3.0 Flash
InclusionAI CN 124B openR $0.0377
37.70 -14.32
Qwen3.6 27B
Alibaba CN 27.8B openR $0.2918
37.47 -14.55
GPT-5.1
OpenAI US large closedR $0.3040
37.44 -14.58
Grok 4.20 0309
SpaceXAI US large closedR N/A
37.44 -14.58
Gemini 3.5 Flash-Lite
Google US medium closedR $0.0965
37.43 -14.59
Solar Open2 250B
Upstage KR 250B openR N/A
37.39 -14.63
Claude 4.5 Sonnet
Anthropic US large closedR $0.4643
37.32 -14.70
MiMo-V2-Omni-0327
Xiaomi CN closedR N/A
37.04 -14.98
GPT-5 Codex
OpenAI US large closedR N/A
36.02 -16.00
Kimi K2.5
Kimi CN 1000B openR $0.0964
35.87 -16.15
MiMo-V2-Omni
Xiaomi CN closedR N/A
35.60 -16.42
GPT-5.1 Codex
OpenAI US large closedR N/A
35.35 -16.67
GLM 5V Turbo
Z AI CN closedR N/A
35.31 -16.71
GPT-5
ChatGPT, low, medium, minimal
OpenAI US large closedR $0.2572
35.06 -16.96
Muse Glimmer
Meta US 30B openR $0.0732
35.01 -17.01
A.X-K2
SK Telecom KR 692B openR N/A
48.37 -3.65
Claude Sonnet 4.6
Non-reasoning, Non-reasoning, Low Effort
Anthropic 美国 large 闭源推理 $1.2182
47.74 -4.28
Gemini 3.1 Pro Preview
Google 美国 large 闭源推理 $0.3346
47.36 -4.66
Motif 3
Beta
Motif Technologies 韩国 314B 推理 N/A
46.71 -5.31
Qwen3.7 Max
Alibaba 中国 large 闭源推理 $0.5413
45.51 -6.51
GPT-5.3 Codex
OpenAI 美国 large 闭源推理 N/A
45.40 -6.62
MiniMax-M3
MiniMax 中国 428B 开源推理 $0.1387
45.27 -6.75
DeepSeek V4 Pro
, high
DeepSeek 中国 1600B 开源推理 $0.0474
45.14 -6.88
Kimi K2.6
Kimi 中国 1000B 开源推理 $0.3653
44.93 -7.09
Claude Opus 4.6
high
Anthropic 美国 large 闭源推理 N/A
44.25 -7.77
Muse Spark
Meta 美国 闭源推理 N/A
43.34 -8.68
GPT-5.2
, medium
OpenAI 美国 large 闭源推理 N/A
43.02 -9.00
Kimi K2.7 Code
Kimi 中国 1000B 开源推理 $0.2220
42.88 -9.14
MiMo-V2.5-Pro
Xiaomi 中国 1023B 开源推理 $0.0339
42.29 -9.73
Inkling
Thinking Machines 美国 975B 开源推理 $0.3389
42.21 -9.81
Hy3
Tencent 中国 299B 开源推理 $0.0357
42.12 -9.90
DeepSeek V4 Flash
, high
DeepSeek 中国 284B 开源推理 $0.0673
41.87 -10.15
Claude Opus 4.5
Anthropic 美国 large 闭源推理 N/A
41.74 -10.28
Nex-N2-Pro
Nex AGI 中国 397B 开源推理 N/A
41.64 -10.38
Solar Pro 4
Upstage 韩国 medium 闭源推理 $0.2231
41.37 -10.65
MiMo-V2-Pro
Xiaomi 中国 闭源推理 N/A
41.22 -10.80
GPT-5.2 Codex
OpenAI 美国 large 闭源推理 N/A
41.18 -10.84
Inkling Small
Thinking Machines 美国 266B 开源推理 $0.0735
41.07 -10.95
Qwen3.6 Max Preview
Alibaba 中国 large 闭源推理 N/A
40.97 -11.05
GLM-5.1
Z AI 中国 744B 开源推理 $0.3042
40.94 -11.08
GPT-5.4 mini
, medium
OpenAI 美国 large 闭源推理 $0.4948
40.65 -11.37
Grok Build 0.1 0616
SpaceXAI 美国 large 闭源推理 $0.2252
40.61 -11.41
Gemini 3 Pro Preview
low
Google 美国 large 闭源推理 N/A
40.55 -11.47
GLM-5
Z AI 中国 744B 开源推理 N/A
40.49 -11.53
Qwen3.6 Plus
Alibaba 中国 large 闭源推理 $0.3569
39.85 -12.17
JT-4.1 Flash 236B A21B
China Mobile 中国 236B 闭源 N/A
39.71 -12.31
GPT-5.4 nano
OpenAI 美国 medium 闭源推理 $0.1493
39.71 -12.31
Agnes 2.5 Pro Alpha
Sapiens AI 新加坡 medium 闭源推理 N/A
39.37 -12.65
Qwen3.7 Plus
Alibaba 中国 medium 闭源推理 $0.2424
39.05 -12.97
GLM-5-Turbo
Z AI 中国 闭源推理 N/A
38.87 -13.15
MiniMax-M2.7
MiniMax 中国 230B 开源推理 $0.0777
38.74 -13.28
Gemini 3 Flash
Google 美国 large 闭源推理 N/A
38.32 -13.70
Nemotron 3 Ultra
NVIDIA 美国 550B 开源推理 $0.3827
38.04 -13.98
MiMo-V2.5
Xiaomi 中国 310B 开源推理 $0.0104
37.95 -14.07
Grok 4.3
Non-reasoning, low, medium
SpaceXAI 美国 large 闭源推理 $0.1454
37.95 -14.07
Grok 4.20 0309 v2
SpaceXAI 美国 large 闭源推理 N/A
37.82 -14.20
Ling 3.0 Flash
InclusionAI 中国 124B 开源推理 $0.0377
37.70 -14.32
Qwen3.6 27B
Alibaba 中国 27.8B 开源推理 $0.2918
37.47 -14.55
GPT-5.1
OpenAI 美国 large 闭源推理 $0.3040
37.44 -14.58
Grok 4.20 0309
SpaceXAI 美国 large 闭源推理 N/A
37.44 -14.58
Gemini 3.5 Flash-Lite
Google 美国 medium 闭源推理 $0.0965
37.43 -14.59
Solar Open2 250B
Upstage 韩国 250B 开源推理 N/A
37.39 -14.63
Claude 4.5 Sonnet
Anthropic 美国 large 闭源推理 $0.4643
37.32 -14.70
MiMo-V2-Omni-0327
Xiaomi 中国 闭源推理 N/A
37.04 -14.98
GPT-5 Codex
OpenAI 美国 large 闭源推理 N/A
36.02 -16.00
Kimi K2.5
Kimi 中国 1000B 开源推理 $0.0964
35.87 -16.15
MiMo-V2-Omni
Xiaomi 中国 闭源推理 N/A
35.60 -16.42
GPT-5.1 Codex
OpenAI 美国 large 闭源推理 N/A
35.35 -16.67
GLM 5V Turbo
Z AI 中国 闭源推理 N/A
35.31 -16.71
GPT-5
ChatGPT, low, medium, minimal
OpenAI 美国 large 闭源推理 $0.2572
35.06 -16.96
Muse Glimmer
Meta 美国 30B 开源推理 $0.0732
35.01 -17.01
A.X-K2
SK Telecom 韩国 692B 开源推理 N/A

Mid-tier weaker (II 25 – 35)中端弱于(II 25 – 35)

II Δ Name名称 Creator厂商 Country国家 Params参数 Type类型 Cost成本
34.60 -17.42
Qwen3.5 27B
Alibaba CN 27.8B openR N/A
34.54 -17.48
Claude 4.1 Opus
Anthropic US large closedR N/A
34.47 -17.55
MiniMax-M2.5
MiniMax CN 230B openR N/A
34.46 -17.56
GLM-4.7
Z AI CN 357B openR $0.3586
34.60 -17.42
Qwen3.5 27B
Alibaba 中国 27.8B 开源推理 N/A
34.54 -17.48
Claude 4.1 Opus
Anthropic 美国 large 闭源推理 N/A
34.47 -17.55
MiniMax-M2.5
MiniMax 中国 230B 开源推理 N/A
34.46 -17.56
GLM-4.7
Z AI 中国 357B 开源推理 $0.3586

Distribution of all 396 weaker models by II band全部 396 个弱于 Qwen 的模型:按 II 分段分布

8
21
27
30
20
30
41
55
76
88
II 45-50
II 40-45
II 35-40
II 30-35
II 25-30
II 20-25
II 15-20
II 10-15
II < 10

Final Insights总结洞察

1. Headline for Qwen3.8 27B.1. Qwen3.8 27B 的头条定位。 It is the highest-scoring 27B dense model in the world. Only MoE models with hundreds of billions of total parameters (Claude Opus 5, Claude Fable 5, GPT-5.6 Sol/Terra, Grok 4.6, Kimi K3, GLM-5.3, Qwen3.8 Max, Qwen3.8 2.4T A95B, Claude Opus 4.8, Muse Spark 1.2, GPT-5.5, Gemini 3.7 Flash, Grok 4.5, Claude Sonnet 5, Claude Opus 4.7) reliably beat it. 它是全球得分最高的 27B 稠密模型。只有参数量数百亿的 MoE 模型(Claude Opus 5、Claude Fable 5、GPT-5.6 Sol/Terra、Grok 4.6、Kimi K3、GLM-5.3、Qwen3.8 Max、Qwen3.8 2.4T A95B、Claude Opus 4.8、Muse Spark 1.2、GPT-5.5、Gemini 3.7 Flash、Grok 4.5、Claude Sonnet 5、Claude Opus 4.7)能稳定胜过它。
2. The Chinese open-source ecosystem collided at 52 II.2. 中国开源阵营在 52 II 撞线。 DeepSeek V4 Pro 0813 (53.20), GLM-5.2 (52.64), DeepSeek V4 Flash 0731 (51.77) — all within 2 II of Qwen3.8 27B. The structural difference between top-tier opens and mid-tier closed (Anthropic Sonnet 4.6 at 48.37, GPT-5.2 at 43.34) is now ~10 II, not 20+. DeepSeek V4 Pro 0813(53.20)、GLM-5.2(52.64)、DeepSeek V4 Flash 0731(51.77)——全部在 ± 2 II 之内。顶级开源与中端闭源(Anthropic Sonnet 4.6 在 48.37、GPT-5.2 在 43.34)的差距已缩减到 约 10 II,而非 20+。
3. Anthropic's flagship is heavier than Qwen3.8 27B.3. Anthropic 旗舰跑不过 Qwen3.8 27B。 Claude Opus 4.6 (max, 44.93) is +7 II behind. The premium Anthropic tier (Opus 5 family) lands at 60-63, requiring ~9 II jump to escape Qwen3.8 27B's reach. Claude Opus 4.6(max,44.93)落后 7 II。Anthropic 高端档(Opus 5 家族)落在 60-63,要跳出 Qwen3.8 27B 的射程需要 ~9 II 的跃迁。
4. Open-weight wins above Qwen3.8 27B rating:4. 强过 Qwen3.8 27B 的开源只有 2 个: Only Kimi K3 (59.70) and Qwen3.8 2.4T A95B (57.70). All 14 closed models above Qwen3.8 27B are from Anthropic, OpenAI, SpaceXAI, Google, Z AI, or Alibaba-closed. Kimi K3(59.70)与 Qwen3.8 2.4T A95B(57.70)。其余 14 个在 Qwen 之上的都是 Anthropic、OpenAI、SpaceXAI、Google、Z AI、阿里闭源。
5. Qwen3.8 27B vs Qwen3.x legacy.5. Qwen3.8 27B vs Qwen3.x 历史。 Qwen3.5 27B scores 34.60 — Qwen3.8 27B is +17.42 ahead. Qwen3.6 27B scores 37.70 — Qwen3.8 27B is +14.32 ahead. Qwen3.7 Max (closed) at 46.71 — Qwen3.8 27B is +5.31 ahead. The Qwen3.8 generation absorbed a generational leap. Qwen3.5 27B 得分 34.60 —— Qwen3.8 27B 领先 +17.42。Qwen3.6 27B 得分 37.70 —— Qwen3.8 27B 领先 +14.32。Qwen3.7 Max(闭源)46.71 —— Qwen3.8 27B 领先 +5.31。Qwen3.8 这一代完成了一次代际跃迁。
6. Cost comparison.6. 成本对比。 All comparable top-tier models charge $0.05-$1.50 per task. Qwen3.8 27B has no public per-task cost (only raw token prices: $0.45 in / $3.20 out / $0.05 cache per 1M tokens). For an open-weight model with 47k output tokens / task and reasoning-heavy inference, real-world cost is dominated by the output token rate. 所有可比顶级模型每任务定价 $0.05 – $1.50。Qwen3.8 27B 无公开每任务定价(仅 raw token 价格:$0.45 in / $3.20 out / $0.05 cache 每 1M tokens)。作为单任务 47k 输出 token 的推理型开源模型,实际使用成本主要被输出 token 主导。