前沿分数整体上移
相对 7 月刊,Artificial Analysis Intelligence Index 前四普遍上升约 2~3 分(Opus 63、Fable 62、Sol 61、Kimi 60),顶端王冠未易主。
QUICK ANSWER
截至 2026-08-09,Claude Opus 5(Anthropic)以 Intelligence Index 63(最大模式)领衔 Artificial Analysis 总榜,超过 Claude Fable 5(62)、GPT-5.6 Sol(OpenAI,61)与开源模型 Kimi K3(Moonshot AI,60)。Opus 5 定价 $5 输入 / $25 输出每百万 tokens。
Text Generation & Reasoning
8 月 9 日抓取 Artificial Analysis:Claude Opus 5 仍居榜首,但整条前沿带分数上移——Opus 5 max 63(7 月刊 61)、Fable 5 with fallback 62、GPT-5.6 Sol max 61、开源 Kimi K3 max 60。Muse Spark 1.2(xhigh)以 57 新进中前排,Grok 4.5 high 为 56。
本月变化AA Intelligence Index 前四相对 7 月刊普遍 +2~3 分。Muse Spark 1.2 新进中前排;DeepSeek V4 Flash 0731 报 52 分。
怎么选默认前沿主力仍是 Opus 5($5/$25);Mythos-class 天花板是 Fable 5;OpenAI 分层回应是 Sol;开源进前沿带仍是 Kimi K3。
仍居 AA Intelligence Index 榜首——现为 63(max),高于 7 月刊的 61。
AA 将 Fable 5(with fallback)报在 62——8 月分数重估后总榜第 2。
Sol max 在 AA 升至 61;仍是 OpenAI 旗舰档。
开源 K3 max 达到 60——全球第 4,距 Opus 5 仅 3 分。
新进中前排,AA Index 57(xhigh)——改写了 7 月 top-5 结构。
AA high 模式 56 分;仍是 $2/$6 的便宜常驻推理之选。
截至 2026-08-09,Claude Opus 5(Anthropic)以 Intelligence Index 63(最大模式)领衔 Artificial Analysis 总榜,超过 Claude Fable 5(62)、GPT-5.6 Sol(OpenAI,61)与开源模型 Kimi K3(Moonshot AI,60)。Opus 5 定价 $5 输入 / $25 输出每百万 tokens。
Image Generation
GPT Image 2(high)把 Artificial Analysis 文生图 Arena 领先扩大到 ELO 1357(7 月刊 1338)。Reve 2.1 以 1314 居第 2。Google Nano Banana 2(Gemini 3.1 Flash Image Preview)以 1307 杀进前 3。Seedream 5.0 Pro 报 1266。
本月变化GPT Image 2 high 1338→1357;Nano Banana 2 新进前 3;Seedream 5.0 Pro 仍是前排中国生产选项。
怎么选质量+生态选 GPT Image 2;分层生成性价比选 Reve 2.1;Google 预览栈选 Nano Banana 2;中文排版选 Seedream 5.0 Pro。
AA 文生图 Arena ELO 1357(high)——质量与生态双冠继续扩大。
以 ELO 1314 稳居第 2,分层生成。
Gemini 3.1 Flash Image Preview 品牌——以 1307 新进 AA 前 3。
企业图像默认选项,ELO 1298。
中国生产向首选,ELO 1266,文字渲染强。
截至 2026-08-09,GPT Image 2(OpenAI,high)以 ELO 1357 居 Artificial Analysis 文生图 Arena 榜首,领先 Reve 2.1(1314)与 Nano Banana 2 / Gemini 3.1 Flash Image Preview(Google,1307)。Seedream 5.0 Pro(字节跳动)为 1266。
Video Generation
Gemini Omni Flash 以 ELO 1244(7 月 1240)继续拿下 AA 文生视频(含音频)榜首。MiniMax H3 以 1240 冲到第 2。Dreamina Seedance 2.0 720p 第 3(1224);Wan2.7-260612 与 HappyHorse-1.1 进入前 5。Sora API 关停日仍为 2026-09-24。
本月变化含音频榜:Gemini Omni Flash 1240→1244;MiniMax H3 从 Seedance 手中夺走第 2;Seedance 2.0 仍居第 3。
怎么选音画同步竞技场选 Gemini Omni Flash;强势挑战者选 MiniMax H3;字节生产线选 Seedance 2.0。
AA 含音频视频榜 #1,ELO 1244——音画同步王冠仍在。
AA 含音频视频榜新第 2,ELO 1240——8 月视频最大变量。
Dreamina Seedance 2.0 720p ELO 1224——仍是字节生产主力。
阿里 Wan2.7-260612 含音频榜 ELO 1161。
仍是亚太短视频性价比线;顶端名次战在 H3/Seedance 之间。
截至 2026-08-09,Gemini Omni Flash(Google)以 ELO 1244 领跑 Artificial Analysis 文生视频(含音频),领先 MiniMax H3(1240)与 Dreamina Seedance 2.0 720p(字节跳动,1224)。OpenAI Sora API 仍计划于 2026-09-24 停服。
Code Generation & Agentic Coding
Claude Opus 5 仍以 7 月 SWE-bench Verified 高水位(约 96%)领跑 agentic coding。Kimi K3 守住开源 / LMArena WebDev 人气榜(1679)。GPT-5.6 Sol 仍以 88.8% 领跑 Terminal-Bench 2.1。8 月 9 日核查未发现更干净的公开数字超越 Opus 5。
本月变化王座未易主:Opus 5 仍是 SWE-bench 领先;Kimi K3 仍是 WebDev 第 1;AA 总榜 Opus/Kimi 现为 63/60。
怎么选最难重构选 Opus 5;开源前端与部署选 Kimi K3;Mythos 天花板选 Fable 5;沙盒终端 Agent 选 GPT-5.6 Sol。
SWE-bench Verified 约 96% 高水位仍在;AA Index 现为 63。
开源 WebDev 竞技场王者 1679;AA Index 60。
Mythos-class 编码天花板;AA 总榜 62。
沙盒终端 Agent 最强——Terminal-Bench 2.1 88.8%。
截至 2026-08-09,Claude Opus 5(Anthropic)仍以 7 月 24 日发布测得的 SWE-bench Verified 约 96% 领跑 agentic coding。Kimi K3(Moonshot AI)以 ELO 1679 守住 LMArena WebDev;GPT-5.6 Sol 以 88.8% 领跑 Terminal-Bench 2.1。
Voice / Speech
speech-to-speech 王位未变——OpenAI Realtime 2 仍领跑 agentic 语音。AA TTS 上 Qwen-Audio-3.0-TTS-Plus 以 ELO 1229 继续第 1(7 月 1234,王冠未易主,分数微漂)。Speechify Simba 3.2 第 2(1227),Gemini 3.1 Flash TTS 第 3(1210)。
本月变化TTS 冠军仍是 Qwen-Audio-3.0-TTS-Plus;Elo 1234→1229。Agentic S2S 仍是 Realtime 2。
怎么选agentic 语音选 Realtime 2;纯 TTS 质量选 Qwen-Audio-3.0-TTS-Plus;角色克隆选 ElevenLabs v3。
仍是 agentic 语音默认——可配置推理 speech-to-speech。
AA TTS 第 1,ELO 1229——组件级 TTS 王冠仍在中国厂商。
AA TTS 第 2,ELO 1227——紧咬 Qwen。
仍是角色声音克隆默认;Scribe v2 realtime STT 仍在栈内。
截至 2026-08-09,OpenAI Realtime 2 仍是 agentic 语音 speech-to-speech 领先模型。阿里 Qwen-Audio-3.0-TTS-Plus 以 ELO 1229 居 Artificial Analysis TTS 榜首,领先 Speechify Simba 3.2(1227)与 Gemini 3.1 Flash TTS(1210)。
Music Generation
截至 8 月 9 日核查,Suno v6 仍未发布。Suno v5.5 仍是整曲默认。ElevenLabs Music v2(6 月 15 日起 API)与 Udio v3 分轨仍是录音棚向备选;Lyria 仍走 Gemini Omni 跨模态路径。
本月变化王座未变。Suno v6 仍未官宣/上线。
怎么选整曲选 Suno v5.5;分轨棚用选 Udio v3;授权 API 音乐选 ElevenLabs Music v2;跨模态走 Gemini Omni 调 Lyria。
仍是 Suno 最新已发布版本——整曲连贯与歌词韵律最佳。
录音棚级混音,分轨输出。
自 6 月 15 日起的 API 优先授权曲库音乐生成。
截至 2026-08-09,Suno v5.5 仍是领先的音乐生成模型——Suno v6 仍未发布。ElevenLabs Music v2 继续提供 API(自 2026-06-15);Udio v3 在分轨棚用工作流上保持领先。
Vision / Multimodal Understanding
Claude Fable 5 仍以 7 月重算的 LMArena Vision ELO 1327 居首——8 月 9 日未确认到更高的公开 Vision 数字。AA 总智能 Opus 5 为 63、Fable 5 为 62,多模态理解仍偏 Anthropic。Gemini 3.6 Flash(Index 52)是 Google 快速多模态选项。
本月变化Vision 王冠未变(Fable 5 @ 1327)。Gemini 3.6 Flash 出现在 AA 总榜 52 分。
怎么选OCR/文档/图表选 Anthropic;图像支撑推理选 GPT-5.6 Sol;视频理解选 Gemini 线。
LMArena Vision 第 1(1327);AA 总榜 62。
多模态旗舰,AA 总榜第 1(63)。
图像支撑推理,AA Index 61。
AA 总榜新报 52——Google 快速多模态栈之选。
截至 2026-08-09,Claude Fable 5(Anthropic)仍以 ELO 1327 居 LMArena Vision 榜首;Claude Opus 5(AA Index 63)与 GPT-5.6 Sol(AA Index 61)在总智能上紧随。Gemini 3.6 Flash 在 Artificial Analysis Intelligence Index 上为 52。
Open-Source / Open-Weights
Kimi K3 max 达到 AA Intelligence Index 60——仍是开源第 1、全球第 4,距 Opus 5(63)仅 3 分。DeepSeek V4 Flash 0731 在不调价($0.14/$0.28)情况下升至 52。GLM-5.2 max 约 53;MiniMax-M3 为 45。
本月变化Kimi K3 57→60;DeepSeek V4 Flash 0731 47→52;开源王冠未易主。
怎么选前沿开源部署选 Kimi K3;纯性价比选 DeepSeek V4 Flash 0731;端侧多模态选 Gemma 4 12B。
开源第 1,AA Index 60——全球第 4,距 Opus 5 仅 3 分。
0731 刷新至 Index 52,价格仍 $0.14/$0.28——开源性价比之王。
AA max 约 53——强势开源中文备选。
Apache 2.0 端侧多模态默认。
截至 2026-08-09,Kimi K3(Moonshot AI)以 Artificial Analysis Intelligence Index 60 居开源权重模型榜首——全球第 4,距闭源前沿 Claude Opus 5(63)仅 3 分。DeepSeek V4 Flash 0731 为 52 分,定价 $0.14/$0.28 每百万 tokens。
Cost-Effectiveness / Value
DeepSeek V4 Flash 0731 成为新的性价比头条:Intelligence Index 52,价格仍是让 Flash 在 7 月以 47 分称王的 $0.14/$0.28。MiniMax-M3 仍是 Index 45 的便宜高编码档。Kimi K3 有 Index 60 但 $3/$15——偏质量而非纯每美元智能。
本月变化领导者名称更新为 V4 Flash 0731;Index 47→52 且价格不变。MiniMax-M3 仍是 7 月叙事中的 SWE-bench 性价比选项。
怎么选超大批量低成本选 V4 Flash 0731;预算内更强开源推理选 GLM / K 系次旗舰;能接受 $15 输出则 Kimi K3 接近前沿。
Index 52、$0.14/$0.28——0731 刷新后仍是每美元智能之王。
AA Index 45——便宜高编码性价比档。
绝对价格高于 Flash,指数更高(max 约 53)。
不是最便宜——但是 $3/$15 下最好的开源质量(Index 60)。
截至 2026-08-09,DeepSeek V4 Flash 0731 以 Artificial Analysis Intelligence Index 52、$0.14 输入 / $0.28 输出(每百万 tokens)领跑性价比——价格未变,指数相对 7 月刊的 47 上升。
TRENDS
从各品类的变化里,最值得记住的几件事。
相对 7 月刊,Artificial Analysis Intelligence Index 前四普遍上升约 2~3 分(Opus 63、Fable 62、Sol 61、Kimi 60),顶端王冠未易主。
DeepSeek V4 Flash 0731 在价格仍为 $0.14/$0.28 的情况下达到 Index 52——开源便宜档变强但没有变贵。
MiniMax H3 以 ELO 1240 占据 AA 文生视频(含音频)第 2,夹在 Gemini Omni Flash(1244)与 Seedance 2.0(1224)之间。
Nano Banana 2(Gemini 3.1 Flash Image Preview)以 AA 文生图 Arena ELO 1307 亮相,仅次于 GPT Image 2 与 Reve 2.1。
OpenAI Sora API 关停日仍为 2026-09-24;视频需求继续向 Gemini Omni、MiniMax H3 与 Seedance 集中。
FAQ
如果您还有具体问题,欢迎预约一对一沟通。
每月更新一次。新一期数据发布后,本页会在下一次站点更新时同步。
整理自 Artificial Analysis、LMArena、SWE-bench 等公开榜单与各厂商官方公告,页面底部列出全部来源与统计日期。
榜单反映公开评测表现,实际选择还应结合您的任务类型、预算和数据边界;欢迎预约诊断一起评估。
不建议。各榜单的评分体系不同,请以同一类目内的相对排名为主。
BOOK A CONSULTATION
带上您的团队场景、预算与数据边界,一起评估最值得先试用的方向。