PAIBAOWORK · B2B DIGITAL GROWTHB2B 建站 · WhatsApp 客户沟通 · AI CRM

AI TOOLS · 月度榜单

LLM 月度榜单2026 年 8 月

按月整理公开评测与厂商官方动态,帮助团队快速看清每个品类的领先者与变化。本期数据截至 2026-08-09,每月更新一次。

QUICK ANSWER

本期速览

截至 2026-08-09,Claude Opus 5(Anthropic)以 Intelligence Index 63(最大模式)领衔 Artificial Analysis 总榜,超过 Claude Fable 5(62)、GPT-5.6 Sol(OpenAI,61)与开源模型 Kimi K3(Moonshot AI,60)。Opus 5 定价 $5 输入 / $25 输出每百万 tokens。

Text Generation & Reasoning

文本生成与综合推理

8 月 9 日抓取 Artificial Analysis:Claude Opus 5 仍居榜首,但整条前沿带分数上移——Opus 5 max 63(7 月刊 61)、Fable 5 with fallback 62、GPT-5.6 Sol max 61、开源 Kimi K3 max 60。Muse Spark 1.2(xhigh)以 57 新进中前排,Grok 4.5 high 为 56。

当前领先 Claude Opus 5 Anthropic

本月变化AA Intelligence Index 前四相对 7 月刊普遍 +2~3 分。Muse Spark 1.2 新进中前排;DeepSeek V4 Flash 0731 报 52 分。

怎么选默认前沿主力仍是 Opus 5($5/$25);Mythos-class 天花板是 Fable 5;OpenAI 分层回应是 Sol;开源进前沿带仍是 Kimi K3。

  1. 1

    Claude Opus 5 Anthropic

    仍居 AA Intelligence Index 榜首——现为 63(max),高于 7 月刊的 61。

    • Intelligence Index:63(max)
    • SWE-bench Verified 约 96%
    • $5 / $25 每百万 tokens
    • 1M 上下文
    • 发布日期 2026-07-24
    63
  2. 2

    Claude Fable 5 Anthropic

    AA 将 Fable 5(with fallback)报在 62——8 月分数重估后总榜第 2。

    • Intelligence Index:62(with fallback)
    • Mythos-class 安全防护
    • 1M+ 上下文 · 自适应推理
    • 发布日期 2026-06-09
    62
  3. 3

    GPT-5.6 Sol OpenAI

    Sol max 在 AA 升至 61;仍是 OpenAI 旗舰档。

    • Intelligence Index:61(max)
    • Terminal-Bench 2.1:88.8%
    • $5 / $30 每百万 tokens
    • 1M 上下文
    • 2026-07-09 全面开放
    61
  4. 4

    Kimi K3 Moonshot AI

    开源 K3 max 达到 60——全球第 4,距 Opus 5 仅 3 分。

    • Intelligence Index:60(开源第 1)
    • 2.8T MoE · 1M 上下文
    • LMArena WebDev 第 1(7 月)
    • 开放权重 · $3/$15 每百万
    • 发布日期 2026-07-17
    60
  5. 5

    Muse Spark 1.2 Muse

    新进中前排,AA Index 57(xhigh)——改写了 7 月 top-5 结构。

    • Intelligence Index:57(xhigh)
    • 相对 7 月 top 档为新面孔
    • 闭源竞争者
    57
  6. 6

    Grok 4.5 xAI

    AA high 模式 56 分;仍是 $2/$6 的便宜常驻推理之选。

    • Intelligence Index:56(high)
    • 激进定价:$2 / $6 每百万
    • 常驻推理 · 1M 上下文
    • 发布日期 2026-07-08
    56

截至 2026-08-09,Claude Opus 5(Anthropic)以 Intelligence Index 63(最大模式)领衔 Artificial Analysis 总榜,超过 Claude Fable 5(62)、GPT-5.6 Sol(OpenAI,61)与开源模型 Kimi K3(Moonshot AI,60)。Opus 5 定价 $5 输入 / $25 输出每百万 tokens。

Image Generation

图像生成

GPT Image 2(high)把 Artificial Analysis 文生图 Arena 领先扩大到 ELO 1357(7 月刊 1338)。Reve 2.1 以 1314 居第 2。Google Nano Banana 2(Gemini 3.1 Flash Image Preview)以 1307 杀进前 3。Seedream 5.0 Pro 报 1266。

当前领先 GPT Image 2 OpenAI

本月变化GPT Image 2 high 1338→1357;Nano Banana 2 新进前 3;Seedream 5.0 Pro 仍是前排中国生产选项。

怎么选质量+生态选 GPT Image 2;分层生成性价比选 Reve 2.1;Google 预览栈选 Nano Banana 2;中文排版选 Seedream 5.0 Pro。

  1. 1

    GPT Image 2 OpenAI

    AA 文生图 Arena ELO 1357(high)——质量与生态双冠继续扩大。

    • AA 文生图 Arena ELO:1357(第 1)
    • 按 token 计费
    • Batch API 50% 折扣
    • 高保真输入
    1357
  2. 2

    Reve 2.1 Reve

    以 ELO 1314 稳居第 2,分层生成。

    • AA 文生图 Arena ELO:1314(第 2)
    • 分层生成
    • $24 / 千图
    • 首发即一线质量
    1314
  3. 3

    Nano Banana 2 Google

    Gemini 3.1 Flash Image Preview 品牌——以 1307 新进 AA 前 3。

    • AA 文生图 Arena ELO:1307(第 3)
    • Gemini 3.1 Flash Image Preview
    • Google 全家桶集成
    1307
  4. 4

    MAI-Image-2.5 Microsoft

    企业图像默认选项,ELO 1298。

    • AA 文生图 Arena ELO:1298
    • 企业集成
    • 微软栈
    1298
  5. 5

    Seedream 5.0 Pro ByteDance

    中国生产向首选,ELO 1266,文字渲染强。

    • AA 文生图 Arena ELO:1266
    • 图层分离
    • 文字渲染强
    1266

截至 2026-08-09,GPT Image 2(OpenAI,high)以 ELO 1357 居 Artificial Analysis 文生图 Arena 榜首,领先 Reve 2.1(1314)与 Nano Banana 2 / Gemini 3.1 Flash Image Preview(Google,1307)。Seedream 5.0 Pro(字节跳动)为 1266。

Video Generation

视频生成

Gemini Omni Flash 以 ELO 1244(7 月 1240)继续拿下 AA 文生视频(含音频)榜首。MiniMax H3 以 1240 冲到第 2。Dreamina Seedance 2.0 720p 第 3(1224);Wan2.7-260612 与 HappyHorse-1.1 进入前 5。Sora API 关停日仍为 2026-09-24。

当前领先 Gemini Omni Flash Google

本月变化含音频榜:Gemini Omni Flash 1240→1244;MiniMax H3 从 Seedance 手中夺走第 2;Seedance 2.0 仍居第 3。

怎么选音画同步竞技场选 Gemini Omni Flash;强势挑战者选 MiniMax H3;字节生产线选 Seedance 2.0。

  1. 1

    Gemini Omni Flash Google

    AA 含音频视频榜 #1,ELO 1244——音画同步王冠仍在。

    • AA 含音频视频榜 #1 · ELO 1244
    • 无音频榜亦 #1 · ELO 1324
    • 原生音画同步
    • Gemini Omni 全家桶
    1244
  2. 2

    MiniMax H3 MiniMax

    AA 含音频视频榜新第 2,ELO 1240——8 月视频最大变量。

    • AA 含音频视频榜 #2 · ELO 1240
    • 无音频榜 #2 · ELO 1306
    • 相对 7 月场次快速攀升
    1240
  3. 3

    Seedance 2.0 ByteDance

    Dreamina Seedance 2.0 720p ELO 1224——仍是字节生产主力。

    • AA 含音频视频榜 #3 · ELO 1224
    • 生产线成熟
    • 多模态参考
    1224
  4. 4

    Wan2.7-260612 Alibaba

    阿里 Wan2.7-260612 含音频榜 ELO 1161。

    • AA 含音频视频榜 ELO:1161
    • 阿里云原生
    1161
  5. 5

    Kling 3.0 Pro Kuaishou 快手

    仍是亚太短视频性价比线;顶端名次战在 H3/Seedance 之间。

    • 原生 4K/60fps 线
    • Turbo 迭代速度
    • 原生抖音 / TikTok 风格
    1110

截至 2026-08-09,Gemini Omni Flash(Google)以 ELO 1244 领跑 Artificial Analysis 文生视频(含音频),领先 MiniMax H3(1240)与 Dreamina Seedance 2.0 720p(字节跳动,1224)。OpenAI Sora API 仍计划于 2026-09-24 停服。

Code Generation & Agentic Coding

代码生成与 Agentic Coding

Claude Opus 5 仍以 7 月 SWE-bench Verified 高水位(约 96%)领跑 agentic coding。Kimi K3 守住开源 / LMArena WebDev 人气榜(1679)。GPT-5.6 Sol 仍以 88.8% 领跑 Terminal-Bench 2.1。8 月 9 日核查未发现更干净的公开数字超越 Opus 5。

当前领先 Claude Opus 5 Anthropic

本月变化王座未易主:Opus 5 仍是 SWE-bench 领先;Kimi K3 仍是 WebDev 第 1;AA 总榜 Opus/Kimi 现为 63/60。

怎么选最难重构选 Opus 5;开源前端与部署选 Kimi K3;Mythos 天花板选 Fable 5;沙盒终端 Agent 选 GPT-5.6 Sol。

  1. 1

    Claude Opus 5 Anthropic

    SWE-bench Verified 约 96% 高水位仍在;AA Index 现为 63。

    • SWE-bench Verified:约 96%(第 1)
    • AA Intelligence Index:63
    • $5 / $25 每百万 tokens
    • 长程 agentic 编辑
    96
  2. 2

    Kimi K3 Moonshot AI

    开源 WebDev 竞技场王者 1679;AA Index 60。

    • LMArena WebDev:1679(第 1)
    • AA Intelligence Index:60
    • 开放权重 · 2.8T MoE
    • $3 / $15 每百万 tokens
    1679
  3. 3

    Claude Fable 5 Anthropic

    Mythos-class 编码天花板;AA 总榜 62。

    • SWE-bench Verified:95%
    • Mythos-class agentic coding
    • 1M+ 上下文
    95
  4. 4

    GPT-5.6 Sol OpenAI

    沙盒终端 Agent 最强——Terminal-Bench 2.1 88.8%。

    • Terminal-Bench 2.1:88.8%(第 1)
    • SWE-bench Pro:64.6%
    • 内置沙盒 Shell
    88.8

截至 2026-08-09,Claude Opus 5(Anthropic)仍以 7 月 24 日发布测得的 SWE-bench Verified 约 96% 领跑 agentic coding。Kimi K3(Moonshot AI)以 ELO 1679 守住 LMArena WebDev;GPT-5.6 Sol 以 88.8% 领跑 Terminal-Bench 2.1。

Voice / Speech

语音 / 音频

speech-to-speech 王位未变——OpenAI Realtime 2 仍领跑 agentic 语音。AA TTS 上 Qwen-Audio-3.0-TTS-Plus 以 ELO 1229 继续第 1(7 月 1234,王冠未易主,分数微漂)。Speechify Simba 3.2 第 2(1227),Gemini 3.1 Flash TTS 第 3(1210)。

当前领先 Realtime 2 OpenAI

本月变化TTS 冠军仍是 Qwen-Audio-3.0-TTS-Plus;Elo 1234→1229。Agentic S2S 仍是 Realtime 2。

怎么选agentic 语音选 Realtime 2;纯 TTS 质量选 Qwen-Audio-3.0-TTS-Plus;角色克隆选 ElevenLabs v3。

  1. 1

    Realtime 2 OpenAI

    仍是 agentic 语音默认——可配置推理 speech-to-speech。

    • 可配置推理
    • speech-to-speech agent
    • 流式翻译 + STT 变体
    • 发布日期 2026-05-07
  2. 2

    Qwen-Audio-3.0-TTS-Plus Alibaba

    AA TTS 第 1,ELO 1229——组件级 TTS 王冠仍在中国厂商。

    • AA TTS ELO:1229(第 1)
    • 多语言 + 中日韩强势
    • 阿里云原生
    1229
  3. 3

    Simba 3.2 Speechify

    AA TTS 第 2,ELO 1227——紧咬 Qwen。

    • AA TTS ELO:1227(第 2)
    • 消费级朗读音质
    1227
  4. 4

    ElevenLabs v3 ElevenLabs

    仍是角色声音克隆默认;Scribe v2 realtime STT 仍在栈内。

    • 角色声音克隆 SOTA
    • Scribe v2 realtime STT
    • Music v2 API
    • 100+ 语言

截至 2026-08-09,OpenAI Realtime 2 仍是 agentic 语音 speech-to-speech 领先模型。阿里 Qwen-Audio-3.0-TTS-Plus 以 ELO 1229 居 Artificial Analysis TTS 榜首,领先 Speechify Simba 3.2(1227)与 Gemini 3.1 Flash TTS(1210)。

Music Generation

音乐生成

截至 8 月 9 日核查,Suno v6 仍未发布。Suno v5.5 仍是整曲默认。ElevenLabs Music v2(6 月 15 日起 API)与 Udio v3 分轨仍是录音棚向备选;Lyria 仍走 Gemini Omni 跨模态路径。

当前领先 Suno v5.5 Suno

本月变化王座未变。Suno v6 仍未官宣/上线。

怎么选整曲选 Suno v5.5;分轨棚用选 Udio v3;授权 API 音乐选 ElevenLabs Music v2;跨模态走 Gemini Omni 调 Lyria。

  1. 1

    Suno v5.5 Suno

    仍是 Suno 最新已发布版本——整曲连贯与歌词韵律最佳。

    • 整曲连贯 SOTA
    • 歌词韵律最佳
    • 多语言演唱
    • 风格迁移
  2. 2

    Udio v3 Udio

    录音棚级混音,分轨输出。

    • 分轨输出
    • 录音棚级混音
    • 电子曲风强势
    • DAW 友好
  3. 3

    ElevenLabs Music v2 ElevenLabs

    自 6 月 15 日起的 API 优先授权曲库音乐生成。

    • API 优先的音乐生成
    • 授权曲库
    • Music Finetunes API
    • 与语音栈集成

截至 2026-08-09,Suno v5.5 仍是领先的音乐生成模型——Suno v6 仍未发布。ElevenLabs Music v2 继续提供 API(自 2026-06-15);Udio v3 在分轨棚用工作流上保持领先。

Vision / Multimodal Understanding

视觉 / 多模态理解

Claude Fable 5 仍以 7 月重算的 LMArena Vision ELO 1327 居首——8 月 9 日未确认到更高的公开 Vision 数字。AA 总智能 Opus 5 为 63、Fable 5 为 62,多模态理解仍偏 Anthropic。Gemini 3.6 Flash(Index 52)是 Google 快速多模态选项。

当前领先 Claude Fable 5 Anthropic

本月变化Vision 王冠未变(Fable 5 @ 1327)。Gemini 3.6 Flash 出现在 AA 总榜 52 分。

怎么选OCR/文档/图表选 Anthropic;图像支撑推理选 GPT-5.6 Sol;视频理解选 Gemini 线。

  1. 1

    Claude Fable 5 Anthropic

    LMArena Vision 第 1(1327);AA 总榜 62。

    • LMArena Vision ELO:1327(第 1)
    • AA Intelligence Index:62
    • OCR + 文档理解 SOTA
    • 1M+ 上下文
    1327
  2. 2

    Claude Opus 5 Anthropic

    多模态旗舰,AA 总榜第 1(63)。

    • AA Intelligence Index:63(总榜第 1)
    • 文档问答 + 图表
    • $5 / $25 每百万 tokens
    63
  3. 3

    GPT-5.6 Sol OpenAI

    图像支撑推理,AA Index 61。

    • AA Intelligence Index:61
    • 图像支撑推理
    • 1M 上下文
    61
  4. 4

    Gemini 3.6 Flash Google

    AA 总榜新报 52——Google 快速多模态栈之选。

    • AA Intelligence Index:52
    • AA 上输出速度快
    • Gemini 多模态栈
    52

截至 2026-08-09,Claude Fable 5(Anthropic)仍以 ELO 1327 居 LMArena Vision 榜首;Claude Opus 5(AA Index 63)与 GPT-5.6 Sol(AA Index 61)在总智能上紧随。Gemini 3.6 Flash 在 Artificial Analysis Intelligence Index 上为 52。

Open-Source / Open-Weights

开源 / 开放权重

Kimi K3 max 达到 AA Intelligence Index 60——仍是开源第 1、全球第 4,距 Opus 5(63)仅 3 分。DeepSeek V4 Flash 0731 在不调价($0.14/$0.28)情况下升至 52。GLM-5.2 max 约 53;MiniMax-M3 为 45。

当前领先 Kimi K3 Moonshot AI

本月变化Kimi K3 57→60;DeepSeek V4 Flash 0731 47→52;开源王冠未易主。

怎么选前沿开源部署选 Kimi K3;纯性价比选 DeepSeek V4 Flash 0731;端侧多模态选 Gemma 4 12B。

  1. 1

    Kimi K3 Moonshot AI

    开源第 1,AA Index 60——全球第 4,距 Opus 5 仅 3 分。

    • AA Intelligence Index:60(开源第 1)
    • 2.8T MoE · 1M 上下文
    • LMArena WebDev 第 1
    • $3 / $15 每百万 tokens
    60
  2. 2

    DeepSeek V4 Flash 0731 DeepSeek

    0731 刷新至 Index 52,价格仍 $0.14/$0.28——开源性价比之王。

    • AA Intelligence Index:52
    • $0.14 入 / $0.28 出 每百万
    • MIT 开放权重 · 1M 上下文
    52
  3. 3

    GLM-5.2 Zhipu AI

    AA max 约 53——强势开源中文备选。

    • AA Intelligence Index:约 53(max)
    • 已开放按量 API
    53
  4. 4

    Gemma 4 12B Google

    Apache 2.0 端侧多模态默认。

    • Apache 2.0 · 开放权重
    • 256K 上下文 · 原生多模态
    • 16GB 显存可跑

截至 2026-08-09,Kimi K3(Moonshot AI)以 Artificial Analysis Intelligence Index 60 居开源权重模型榜首——全球第 4,距闭源前沿 Claude Opus 5(63)仅 3 分。DeepSeek V4 Flash 0731 为 52 分,定价 $0.14/$0.28 每百万 tokens。

Cost-Effectiveness / Value

性价比 / 价格性能比

DeepSeek V4 Flash 0731 成为新的性价比头条:Intelligence Index 52,价格仍是让 Flash 在 7 月以 47 分称王的 $0.14/$0.28。MiniMax-M3 仍是 Index 45 的便宜高编码档。Kimi K3 有 Index 60 但 $3/$15——偏质量而非纯每美元智能。

当前领先 DeepSeek V4 Flash 0731 DeepSeek · 上期领先:DeepSeek V4 Flash

本月变化领导者名称更新为 V4 Flash 0731;Index 47→52 且价格不变。MiniMax-M3 仍是 7 月叙事中的 SWE-bench 性价比选项。

怎么选超大批量低成本选 V4 Flash 0731;预算内更强开源推理选 GLM / K 系次旗舰;能接受 $15 输出则 Kimi K3 接近前沿。

  1. 1

    DeepSeek V4 Flash 0731 DeepSeek

    Index 52、$0.14/$0.28——0731 刷新后仍是每美元智能之王。

    • AA Intelligence Index:52
    • $0.14 入 / $0.28 出 每百万
    • 混合成本仍约旗舰 1/10
    • MIT 开放权重 · 1M 上下文
    52
  2. 2

    MiniMax-M3 MiniMax

    AA Index 45——便宜高编码性价比档。

    • AA Intelligence Index:45
    • 编码每美元强
    • 标准 API 价位档
    45
  3. 3

    GLM-5.2 Zhipu AI

    绝对价格高于 Flash,指数更高(max 约 53)。

    • AA Intelligence Index:约 53(max)
    • 按量 API
    53
  4. 4

    Kimi K3 Moonshot AI

    不是最便宜——但是 $3/$15 下最好的开源质量(Index 60)。

    • AA Intelligence Index:60
    • $3 / $15 每百万 tokens
    • 开源接近前沿
    60

截至 2026-08-09,DeepSeek V4 Flash 0731 以 Artificial Analysis Intelligence Index 52、$0.14 输入 / $0.28 输出(每百万 tokens)领跑性价比——价格未变,指数相对 7 月刊的 47 上升。

TRENDS

本月趋势洞察

从各品类的变化里,最值得记住的几件事。

01

前沿分数整体上移

相对 7 月刊,Artificial Analysis Intelligence Index 前四普遍上升约 2~3 分(Opus 63、Fable 62、Sol 61、Kimi 60),顶端王冠未易主。

02

DeepSeek Flash 0731 性价比跃迁

DeepSeek V4 Flash 0731 在价格仍为 $0.14/$0.28 的情况下达到 Index 52——开源便宜档变强但没有变贵。

03

MiniMax H3 杀入视频领奖台

MiniMax H3 以 ELO 1240 占据 AA 文生视频(含音频)第 2,夹在 Gemini Omni Flash(1244)与 Seedance 2.0(1224)之间。

04

Google Nano Banana 2 杀进图像前 3

Nano Banana 2(Gemini 3.1 Flash Image Preview)以 AA 文生图 Arena ELO 1307 亮相,仅次于 GPT Image 2 与 Reve 2.1。

05

Sora 关停倒计时仍在

OpenAI Sora API 关停日仍为 2026-09-24;视频需求继续向 Gemini Omni、MiniMax H3 与 Seedance 集中。

FAQ

常见问题

如果您还有具体问题,欢迎预约一对一沟通。

榜单多久更新一次?

每月更新一次。新一期数据发布后,本页会在下一次站点更新时同步。

榜单数据来自哪里?

整理自 Artificial Analysis、LMArena、SWE-bench 等公开榜单与各厂商官方公告,页面底部列出全部来源与统计日期。

可以直接按榜单选模型吗?

榜单反映公开评测表现,实际选择还应结合您的任务类型、预算和数据边界;欢迎预约诊断一起评估。

不同类目之间的分数可以互相比较吗?

不建议。各榜单的评分体系不同,请以同一类目内的相对排名为主。

免费咨询

留个联系方式,我们帮你梳理

不确定阿里国际站、独立站还是 SaaS 更适合?留下信息或 预约诊断,我们结合你的产品、市场和预算给建站与获客建议。

BOOK A CONSULTATION

想判断哪类模型真正适合您的业务?

带上您的团队场景、预算与数据边界,一起评估最值得先试用的方向。

预约业务诊断
体验 AI 销售