Opus 5 以半价夺回王座
Mythos-class Fable 5 发布仅六周后,Anthropic 又推出 Opus 5(7 月 24 日):Intelligence Index 61,$5/$25——用 Opus 档的价格给到接近 Mythos 的智能。前沿迭代节奏已按周计算,Anthropic 包揽总榜前三(Opus 5 max、Opus 5 xhigh、Fable 5)。
QUICK ANSWER
截至 2026-07-27,Claude Opus 5(Anthropic,2026-07-24 发布)以 Intelligence Index 61(最大模式)领衔 Artificial Analysis 总榜,超过 Claude Fable 5(60)、GPT-5.6 Sol(OpenAI,59)与开源模型 Kimi K3(Moonshot AI,57)。Opus 5 定价 $5 输入 / $25 输出每百万 tokens——约为 Mythos-class 梯队的一半。
Text Generation & Reasoning
7 月 24 日 Anthropic 发布 Claude Opus 5,以 61 分(最大模式)夺回 Artificial Analysis Intelligence Index 榜首——领先自家 Mythos-class 的 Fable 5(60)一分。OpenAI GPT-5.6 Sol 落在 59,Moonshot 的开源 Kimi K3 以 57 分杀进前沿梯队。
本月变化2026 年 7 月 24 日发布。AA Intelligence Index:61(max)/ 60(xhigh),$5/$25 每百万 tokens——约为 Mythos-class 梯队一半价格。
怎么选Opus 5 成为前沿默认主力;Fable 5 守住 Mythos-class 天花板;GPT-5.6 Sol 是 OpenAI 的分层回应;Kimi K3 是首个进入前沿梯队的开源模型。
7 月 24 日发布。以 61 分夺回 AA Intelligence Index 榜首——价格只有 Mythos-class 梯队的一半。
6 月 9 日 Mythos-class 首发;Opus 5 发布后居总榜第 2(60 分)。6 月曾短暂出口管制,6 月 23 日恢复。
6 月 26 日预览,7 月 9 日全面开放。Sol/Terra/Luna 分层家族;Sol max 得分 59,Terminal-Bench 2.1 达 88.8%。
7 月 17 日发布。2.8T 参数开源权重 MoE——首个进入前沿梯队的开源模型,同时登顶 LMArena WebDev。
7 月 8 日发布,$2/$6 每百万 tokens——前沿梯队里最便宜的推理模型。
截至 2026-07-27,Claude Opus 5(Anthropic,2026-07-24 发布)以 Intelligence Index 61(最大模式)领衔 Artificial Analysis 总榜,超过 Claude Fable 5(60)、GPT-5.6 Sol(OpenAI,59)与开源模型 Kimi K3(Moonshot AI,57)。Opus 5 定价 $5 输入 / $25 输出每百万 tokens——约为 Mythos-class 梯队的一半。
Image Generation
GPT Image 2 现在连 Artificial Analysis 文生图 Arena 质量榜也登顶了(ELO 1338)——质量与生态双冠。Reve 2.1 发布当天空降第 2(ELO 1301),字节 Seedream 5.0 Pro 进前 10,Black Forest 的 FLUX 3 限量发布,成为首个图/视频/音频 omni 模型。
本月变化Recraft V4.1 跌出第一梯队;Reve 2.1(7 月 9 日)与 Seedream 5.0 Pro(7 月 8 日)新进榜;FLUX 3(7 月 23 日)限量发布。
怎么选质量 + 生态选 GPT Image 2;分层生成、$24/千图选 Reve 2.1;文字渲染选 Seedream 5.0 Pro;企业版权安全仍选 Firefly。
登顶 AA 文生图 Arena(ELO 1338),叠加既有生态与定价优势。
7 月 9 日发布。凭借分层生成与 $24/千图的颠覆性定价,发布当天空降 AA 榜第 2。
7 月 8 日发布。图层分离 + 顶级文字渲染,跻身 AA 榜前 10。
截至 2026-07-27,GPT Image 2(OpenAI)以 ELO 1338 居 Artificial Analysis 文生图 Arena 榜首,领先 Reve 2.1(1301,2026-07-09 发布)与 MAI-Image-2.5(微软,1269),Seedream 5.0 Pro(字节跳动,1239)居前十。Black Forest Labs 于 2026-07-23 限量发布 FLUX 3——覆盖图像、20 秒视频与音频的 omni 模型。
Video Generation
Google Gemini Omni Flash 以 ELO 1240 拿下 Artificial Analysis 文生视频 Arena(含音频),终结 Seedance 2.0 的连冠(1225)。字节的回击已经在路上:Seedance 2.5(7 月 16 日起灰度)带来原生 30 秒 4K/10bit 生成,尚未入榜。OpenAI 正式退场——Sora 接口 将于 9 月 24 日关停。
本月变化Arena 榜首易主:Seedance 2.0 → Gemini Omni Flash(1240 vs 1225);Seedance 2.5 自 7 月 16 日灰度上线;Sora 接口 9 月 24 日停服。
怎么选音画同步竞技场最强选 Gemini Omni Flash;30 秒 4K 生产选 Seedance 2.5;亚太短视频性价比选 Kling 3.0。
以 ELO 1240 登顶 AA 文生视频 Arena(含音频)——Google 首个拿下音画同步冠军的模型。
2.0 以 ELO 1225 退居第 2;2.5(原生 30 秒、4K/10bit、50 个参考输入)自 7 月 16 日灰度,尚未入榜。
6 月 17 日 Turbo 升级,守住亚太短视频性价比位;3.0 线原生 4K/60fps。
截至 2026-07-27,Gemini Omni Flash(Google)领跑文生视频,在 Artificial Analysis 文生视频 Arena(含音频)以 ELO 1240 居第 1,领先 Seedance 2.0(字节跳动,1225)与 Wan 2.7(阿里巴巴,1160)。字节跳动于 2026-07-16 开始灰度 Seedance 2.5,支持原生 30 秒 4K/10bit 输出。OpenAI Sora 接口 将于 2026-09-24 停止服务。
Code Generation & Agentic Coding
Claude Opus 5(7 月 24 日)把 SWE-bench Verified 推到约 96%——历史新高;同时 Moonshot 的开源 Kimi K3 以 1679 分杀上 LMArena WebDev 榜首,成为第一个登顶前端代码竞技场的中国模型。代码前沿一分为二:基准榜归 Anthropic,人气榜归 Kimi。
本月变化Opus 5 登顶 SWE-bench Verified(约 96%,7 月 24 日);Kimi K3 登顶 LMArena WebDev(1679,7 月 16 日),领先 Fable 5(1631)与 GPT-5.6 Sol(1618)。
怎么选最难重构与长程 Agent 选 Opus 5;Mythos-class 天花板选 Fable 5;前端开发与开源部署选 Kimi K3;沙盒终端 Agent 选 GPT-5.6 Sol。
发布当天 SWE-bench Verified 约 96%(独立评测最高 97.0%)——代码新前沿。
以 1679 分登顶 LMArena WebDev——首个居该榜第 1 的中国模型。开放权重,独立评测 SWE-bench Verified 93.4%。
SWE-bench Verified 95%;最难多文件、长程任务的 Mythos-class 天花板。
Terminal-Bench 2.1 达 88.8%——沙盒终端 Agent 最强;SWE-bench Pro 64.6%。
截至 2026-07-27,Claude Opus 5(Anthropic,2026-07-24 发布)以 SWE-bench Verified 约 96% 领跑 agentic coding,为历史最高分。Kimi K3(Moonshot AI,开放权重)以 ELO 1679 登顶 LMArena WebDev——首个居该榜第 1 的中国模型——领先 Claude Fable 5(1631)与 GPT-5.6 Sol(OpenAI,1618)。GPT-5.6 Sol 同时以 88.8% 领跑 Terminal-Bench 2.1,是沙盒终端 Agent 最强。
Voice / Speech
speech-to-speech 王位没有变化——OpenAI Realtime 2 仍领跑 agentic 语音。但组件级冠军都换成了中国厂商:阿里 Qwen-Audio-3.0-TTS-Plus 登顶 AA TTS 榜(ELO 1234),Fun-Realtime-ASR-preview 以 1.7% WER 领跑 STT。ElevenLabs 以 Music v2 和 Scribe v2 realtime 回应。
本月变化TTS 冠军:Fun-Realtime-TTS → Qwen-Audio-3.0-TTS-Plus(1234);STT 冠军:MAI-Transcribe-1.5 → Fun-Realtime-ASR-preview(1.7% WER)。
怎么选agentic 语音选 Realtime 2;纯 TTS 质量选 Qwen-Audio-3.0-TTS-Plus;转录选 Fun-Realtime-ASR;角色声音克隆选 ElevenLabs v3。
仍是 agentic 语音默认选择。可配置推理 speech-to-speech,配套 translate / Whisper 流式变体。
以 ELO 1234 登顶 AA TTS 榜——中国厂商首个 TTS 冠军。
AA TTS 滑到第 11,但仍是角色声音克隆默认;新增 Scribe v2 realtime 与 Music v2 接口。
截至 2026-07-27,OpenAI Realtime 2 仍是 agentic 语音 speech-to-speech 领先模型。阿里 Qwen-Audio-3.0-TTS-Plus 以 ELO 1234 居 Artificial Analysis TTS 榜首,领先 Speechify Simba 3.2(1230)与 Gemini 3.1 Flash TTS(1215)。Fun-Realtime-ASR-preview 以 1.7% WER 领跑语音转文字,领先 ElevenLabs Scribe v2(2.2%)。
Music Generation
更正上月判断:Suno v6 最终没有发布——v5.5 仍是线上默认与类目第一。真正的动作在别处:ElevenLabs Music v2 于 6 月 15 日上线 接口,Google Lyria 继续借 Gemini Omni 走跨模态 any-to-music 路线。
本月变化Suno v6 错过传闻中的 6 月窗口,至今未官宣;v5.5 稳居第 1。ElevenLabs Music v2 经 接口 入场。
怎么选整曲生成选 Suno v5.5;录音棚级分轨选 Udio v3;授权曲库业务流程选 ElevenLabs Music v2;跨模态走 Gemini Omni 调 Lyria。
仍是 Suno 最新版本——v6 并未发布。整曲连贯与歌词韵律最佳。
录音棚级混音,分轨输出。
6 月 15 日上线 接口。基于授权曲库的音乐生成,支持微调。
截至 2026-07-27,Suno v5.5 仍是领先的音乐生成模型——传闻中的 Suno v6 并未发布。ElevenLabs 于 2026-06-15 将 Music v2 上线 接口;Udio v3 在录音棚级混音与分轨输出上保持领先。Google Lyria 已并入 Gemini Omni,承担跨模态(图/视频/音乐)业务流程。
Vision / Multimodal Understanding
Fable 5 以 1327 ELO 拿下 LMArena Vision 榜首,终结 Opus 4.7 一代的霸榜。Opus 5 与 GPT-5.6 Sol 在身后约 15 分以内紧咬——视觉榜头部第一次变成真正的三厂竞赛。
本月变化Vision 第 1 易主:Opus 4.7-thinking(1309)→ Fable 5(1327,7 月 12 日按新票仓重算)。
怎么选OCR / 文档问答 / 图表理解选 Anthropic;图像支撑的推理链选 GPT-5.6 Sol;视频理解选 Gemini 3.1 Pro。
以 1327 分登顶 LMArena Vision(7 月 12 日按新票仓重算)——同时领跑文本竞技场。
新多模态旗舰,Vision 榜上距 Fable 5 仅约 15 ELO。
视频理解与长时序推理最佳。
截至 2026-07-27,Claude Fable 5(Anthropic)以 ELO 1327 居 LMArena Vision 榜首,Claude Opus 5 与 GPT-5.6 Sol(OpenAI)在约 15 分以内紧随其后。Fable 5 同时占据文本竞技场第 1。Gemini 3.1 Pro(Google)仍是视频理解领先者。
Open-Source / Open-Weights
Moonshot 的 Kimi K3(7 月 17 日)成为新的开源之王:2.8T 参数 MoE,AA Intelligence Index 57——全球第 3,首个进入前沿梯队的开源模型,距 Opus 5 仅 4 分,还 outright 登顶 LMArena WebDev。代价是输出定价涨到 $15/百万,接近 K2.6 的 4 倍。
本月变化Kimi K3(57)从 K2.6(54)手中接过开源王座;K2.7 Code(1T/32B MoE)6 月中补强编程线;DeepSeek V4 满血版仍只是传闻。
怎么选前沿级开源部署选 Kimi K3;同生态、输出价仅 1/4 选 K2.6;便宜推理选 DeepSeek V4 Pro;端侧多模态选 Gemma 4 12B。
AA Intelligence Index 57 居开源榜首——全球第 3,距闭源前沿仅 4 分。同时登顶 LMArena WebDev。
前任开源之王,现在是 K 系的性价比之选:Index 54,输出价仅为 K3 的 1/4。
MIT 开源权重,AA Intelligence Index 52——便宜的前沿级推理默认。满血 V4 仍只是传闻。
Apache 2.0 开放权重。encoder-free 原生多模态,256K 上下文,16GB 笔记本即可本地跑。
截至 2026-07-27,Kimi K3(Moonshot AI,2026-07-17 发布)以 Artificial Analysis Intelligence Index 57 居开源权重模型榜首——全球第 3,距闭源前沿(Claude Opus 5,61)仅 4 分。该 2.8T 参数 MoE 提供 1M token 上下文,定价 $3/$15 每百万 tokens,并在 LMArena WebDev 排名第 1。Kimi K2.6(54)与 DeepSeek V4 Pro(MIT,52)组成开源第一梯队其余席位;Google Gemma 4 12B(Apache 2.0)仍是端侧多模态首选。
每美元智能
性价比之战进入僵持:DeepSeek 自 4 月起没动过价格,V4 Flash 仍以混合约 $0.06 / 百万 tokens 提供 Intelligence Index 47——同级旗舰的十分之一。两件事值得注意:旧的 deepseek-chat/reasoner 别名 7 月 24 日退役(需迁移到 deepseek-v4-flash/pro);MiniMax M3 上市促销结束,回到 $0.60/$2.40 标准价。
本月变化头部厂商无调价;DeepSeek 旧别名 7 月 24 日退役;MiniMax M3 促销结束;GLM-5.2 开放按量 接口。
怎么选超大批量低成本选 V4 Flash;要更强推理又想省钱选 V4 Pro;要最便宜的 SWE-bench 80%+ 选 MiniMax M3;想分散厂商选 Qwen3.7 Plus。
每美元智能之王,自 4 月未调价。Index 47,$0.14/$0.28 每百万 tokens——约为同档 Flash 旗舰的十分之一。
高智能 + 低价象限的最佳平衡。Intelligence Index 52,$0.435/$0.87——仅为同档旗舰的零头。
SWE-bench Verified 80%+ 里最便宜的模型。上市促销结束,现为 $0.60/$2.40 标准价。
截至 2026-07-27,DeepSeek V4 Flash 以 Artificial Analysis Intelligence Index 47、$0.14 输入 / $0.28 输出(每百万 tokens)领跑性价比——混合成本约 $0.06 / 百万,约为同级旗舰的十分之一。价格自 4 月未变;旧 deepseek-chat 与 deepseek-reasoner 别名于 2026-07-24 退役。MiniMax M3($0.60/$2.40)是 SWE-bench Verified 80% 以上最便宜的模型;GLM-5.2 已开放按量 接口($1.40/$4.40)。
TRENDS
从各品类的变化里,最值得记住的几件事。
Mythos-class Fable 5 发布仅六周后,Anthropic 又推出 Opus 5(7 月 24 日):Intelligence Index 61,$5/$25——用 Opus 档的价格给到接近 Mythos 的智能。前沿迭代节奏已按周计算,Anthropic 包揽总榜前三(Opus 5 max、Opus 5 xhigh、Fable 5)。
Moonshot 2.8T 参数的 Kimi K3(7 月 17 日)拿到 Intelligence Index 57——全球第 3,距 Opus 5 仅 4 分——并登顶 LMArena WebDev,成为首个领跑该榜的中国模型。开源权重不再低人一档,而是进入前沿带。
Sol/Terra/Luna 家族(6 月 26 日预览,7 月 9 日 GA)把前沿拆成价格-性能分层。Sol max 拿到 Intelligence Index 59 并领跑 Terminal-Bench 2.1(88.8%)——有竞争力,但这是 OpenAI 第一次处于追赶位置,而不是定调位置。
Gemini Omni Flash 终结 Seedance 2.0 在 AA 视频榜的连冠(1240 对 1225)。字节 Seedance 2.5(原生 30 秒 4K)已在灰度放量,而 OpenAI 彻底退出战场——Sora 接口 将于 9 月 24 日停服。
市场普遍预期 6 月发布的 Suno v6 最终没有落地——v5.5 仍是第一。与此同时 ElevenLabs Music v2 借 接口 悄然入场,主打授权曲库。音乐是本月唯一前沿停滞的类目。
阿里 Qwen-Audio-3.0-TTS-Plus 拿下 AA TTS 冠军(ELO 1234),Fun-Realtime-ASR-preview 领跑 STT(1.7% WER)。OpenAI 仍占据 speech-to-speech agent 层,但语音的「卖水生意」已转移到中国厂商手中。
DeepSeek 自 4 月未调价——V4 Flash 混合约 $0.06 仍领跑每美元智能。本月看点是结构性的:旧别名 7 月 24 日退役,MiniMax M3 促销结束,GLM-5.2 开放按量。传闻 OpenAI 正考虑大幅降价,但尚未落地。
FAQ
如果您还有具体问题,欢迎预约一对一沟通。
每月更新一次。新一期数据发布后,本页会在下一次站点更新时同步。
整理自 Artificial Analysis、LMArena、SWE-bench 等公开榜单与各厂商官方公告,页面底部列出全部来源与统计日期。
榜单反映公开评测表现,实际选择还应结合您的任务类型、预算和数据边界;欢迎预约诊断一起评估。
不建议。各榜单的评分体系不同,请以同一类目内的相对排名为主。
BOOK A CONSULTATION
带上您的团队场景、预算与数据边界,一起评估最值得先试用的方向。