AI大模型周榜:阿里千问3.8-Max空降前五,字节即梦5.0生图第六
Arena(arena.ai)平台 AI 大模型 2026 年第 31 周排行榜发布,本期统计周期为 2026 年 7 月 27 日至 8 月 2 日。
本周榜单迎来大量新模型更新,国产模型表现突出。阿里 qwen3.8-max 首次亮相即进入综合榜 Top 5,月之暗面 kimi-k3-max 位列综合榜第 13 名,字节跳动 seedream-5.0-pro 排名上升 5 位进入 AI 生图榜 Top 6,多款国产模型在细分榜单取得亮眼成绩。整体来看,本周国产模型在头部梯队占位进一步提升,与海外顶级模型差距继续缩小。
本周综合榜头部几乎被 Anthropic 新品包揽,claude-fable-5 以 1509 分蝉联榜首,第二到第四名分别为 claude-opus-4-6-thinking(1505 分)、claude-opus-4-7-thinking(1502 分)、claude-opus-4-6(1497 分),分数差距均在 30 分以内,在统计误差范围内视为接近。阿里最新发布的 qwen3.8-max 以 1496 分位列第 5 名,仅比榜首低 13 分,成为目前排名最高的国产模型。
国产模型在本次综合榜中已有多款进入前 25 名,梯队分布如下:
- 阿里 qwen3.8-max 排名第 5,ELO 1496 分,为本次新入榜模型;
- 月之暗面 kimi-k3-max 排名第 13,ELO 1485 分,本次新入榜;
- 阿里 qwen3.7-max-preview 排名第 22,ELO 1475 分,排名持平。
代码榜方面,claude-fable-5 以 1553 分从第二名升至榜首,claude-opus-4-7-thinking 以 1552 分紧随其后,两款模型分差仅 1 分,在统计误差范围内并列。头部前 8 名中,月之暗面 kimi-k3-max 以 1531 分排在第 8 名,阿里 qwen3.8-max 以 1530 分位列第 10 名,国产模型首次有两款同时杀入代码榜 Top 10,进步显著。
国产模型在代码榜的具体排名如下:
- 月之暗面 kimi-k3-max 排名第 8,ELO 1531 分,本次新入榜,预发布状态;
- 阿里 qwen3.8-max 排名第 10,ELO 1530 分,本次新入榜,预发布状态;
- 阿里 qwen3.7-max-preview 排名第 17,ELO 1525 分,排名持平;
- 智谱 glm-5.1 排名第 28,ELO 1518 分,较上周下降 7 位;
- 小米 mimo-v2.5-pro 排名第 29,ELO 1518 分,排名下降 5 位。
在 前端开发榜 中,claude-opus-5-max 以 1705 分守住榜首,月之暗面 kimi-k3-max 以 1676 分位列第二,阿里 qwen3.8-max 以 1668 分排名第四。国产模型共有三款进入 Top 8,占据半壁江山。kimi-k3-max 仅落后榜首 29 分,在统计误差范围内与头部海外模型接近。
国产模型整体处于中上游,具体排名如下:
- 月之暗面 kimi-k3-max:第 2 名,ELO 1676 分,预发布状态
- 阿里 qwen3.8-max:第 4 名,ELO 1668 分,预发布状态
- 智谱 glm-5.2-max:第 7 名,ELO 1586 分
- 字节跳动 seed-2.1-pro-preview:第 19 名,ELO 1527 分,预发布状态
- 阿里 qwen3.7-max-20260517:第 23 名,ELO 1517 分
智能体榜采用百分比信号评分体系,本周 Claude Fable 5 (High) 以 12.58% 的净提升度稳居第一,Claude Opus 5 (Max) 和 Claude Opus 5 (High) 分列二、三位,头部格局基本稳定。Anthropic 旗下模型占据前七名中的五席,在智能体任务领域仍保持明显优势。工具幻觉率最低的模型是腾讯 hy3,仅为 0.33%;可控性最强的模型是 Nemotron 3 Ultra,达到 20.73%。
国产模型在智能体榜的排名和净提升度如下:
- MiniMax minimax-m3:第 33 名,净提升度 2.55%,任务确认成功率 5.67%
- 深度求索 DeepSeek V4 Flash:第 34 名,净提升度 2.96%,任务确认成功率 4.9%
- 小米 Mimo V2.5 Pro:第 32 名,净提升度 2.52%,任务确认成功率 3.81%
- 阿里 Qwen3.7 Max:第 25 名,净提升度 0.53%,任务确认成功率 1.95%
- 月之暗面 Kimi K3 (Max):第 5 名,净提升度 9.91%,任务确认成功率 14.23%,进入智能体榜 Top 5
AI 生图榜本周的最大亮点是字节跳动 seedream-5.0-pro 排名上升 5 位,从第 11 名升至第 6 名,ELO 分数达到 1257 分,仅落后榜首 gpt-image-2 (medium) 124 分,成功进入 Top 6,成为排名最高的国产 AI 生图模型。
另有多款国产模型进入前 30 名,hunyuan-image-3.0 排名第 25,seedream-4.5 排名第 28,整体表现稳定。
本周 Arena AI 大模型周榜迎来密集更新,大量新模型首次入榜。国产模型整体取得突破性进展:阿里 qwen3.8-max 首次亮相即进入综合榜 Top 5,代码榜和前端开发榜也均有国产模型进入 Top 10;字节跳动 seedream-5.0-pro 排名大幅提升,进入 AI 生图榜 Top 6;月之暗面 kimi-k3-max 也在智能体榜进入 Top 5。
在 AI 视频榜中,头部格局保持稳定。gemini-omni-flash 以 1513 分继续排名第一,字节跳动 dreamina-seedance-2.0-720p 以 1479 分守住第二,阿里 happyhorse-1.0 以 1428 分排名第四。两款国产模型稳居前五,表现稳定,国产模型共有 7 款进入前 30,整体占据中上游位置。
综合来看,国产大模型在多个维度持续缩小与海外顶级模型的差距,后续新品发布值得期待。






