PAIBAOWORK · B2B DIGITAL GROWTHB2B 建站 · WhatsApp 客户沟通 · AI CRM

AI TOOLS · 月度榜单

LLM 月度榜单2026 年 7 月

按月整理公开评测与厂商官方动态,帮助团队快速看清每个品类的领先者与变化。本期数据截至 2026-07-27,每月更新一次。

QUICK ANSWER

本期速览

截至 2026-07-27,Claude Opus 5(Anthropic,2026-07-24 发布)以 Intelligence Index 61(最大模式)领衔 Artificial Analysis 总榜,超过 Claude Fable 5(60)、GPT-5.6 Sol(OpenAI,59)与开源模型 Kimi K3(Moonshot AI,57)。Opus 5 定价 $5 输入 / $25 输出每百万 tokens——约为 Mythos-class 梯队的一半。

Text Generation & Reasoning

文本生成与综合推理

7 月 24 日 Anthropic 发布 Claude Opus 5,以 61 分(最大模式)夺回 Artificial Analysis Intelligence Index 榜首——领先自家 Mythos-class 的 Fable 5(60)一分。OpenAI GPT-5.6 Sol 落在 59,Moonshot 的开源 Kimi K3 以 57 分杀进前沿梯队。

当前领先 Claude Opus 5 Anthropic · 上期领先:Claude Fable 5

本月变化2026 年 7 月 24 日发布。AA Intelligence Index:61(max)/ 60(xhigh),$5/$25 每百万 tokens——约为 Mythos-class 梯队一半价格。

怎么选Opus 5 成为前沿默认主力;Fable 5 守住 Mythos-class 天花板;GPT-5.6 Sol 是 OpenAI 的分层回应;Kimi K3 是首个进入前沿梯队的开源模型。

  1. 1

    Claude Opus 5 Anthropic

    7 月 24 日发布。以 61 分夺回 AA Intelligence Index 榜首——价格只有 Mythos-class 梯队的一半。

    • Intelligence Index:61(max)/ 60(xhigh)
    • SWE-bench Verified 约 96%
    • $5 / $25 每百万 tokens
    • 1M 上下文
    • 发布日期 2026-07-24
    61
  2. 2

    Claude Fable 5 Anthropic

    6 月 9 日 Mythos-class 首发;Opus 5 发布后居总榜第 2(60 分)。6 月曾短暂出口管制,6 月 23 日恢复。

    • Intelligence Index:60
    • Humanity's Last Exam:53%
    • Mythos-class 安全防护
    • 1M+ 上下文 · 自适应推理
    • 发布日期 2026-06-09
    60
  3. 3

    GPT-5.6 Sol OpenAI

    6 月 26 日预览,7 月 9 日全面开放。Sol/Terra/Luna 分层家族;Sol max 得分 59,Terminal-Bench 2.1 达 88.8%。

    • Intelligence Index:59(max)
    • Terminal-Bench 2.1:88.8%
    • $5 / $30 每百万 tokens
    • 1M 上下文
    • 2026-07-09 全面开放
    59
  4. 4

    Kimi K3 Moonshot AI

    7 月 17 日发布。2.8T 参数开源权重 MoE——首个进入前沿梯队的开源模型,同时登顶 LMArena WebDev。

    • Intelligence Index:57(开源第 1)
    • 2.8T MoE · 1M 上下文
    • LMArena WebDev 第 1
    • 开放权重
    • 发布日期 2026-07-17
    57
  5. 5

    Grok 4.5 xAI

    7 月 8 日发布,$2/$6 每百万 tokens——前沿梯队里最便宜的推理模型。

    • 激进定价:$2 / $6 每百万
    • 常驻推理 · 1M 上下文
    • agentic 与工具调用强
    • 发布日期 2026-07-08
    53

截至 2026-07-27,Claude Opus 5(Anthropic,2026-07-24 发布)以 Intelligence Index 61(最大模式)领衔 Artificial Analysis 总榜,超过 Claude Fable 5(60)、GPT-5.6 Sol(OpenAI,59)与开源模型 Kimi K3(Moonshot AI,57)。Opus 5 定价 $5 输入 / $25 输出每百万 tokens——约为 Mythos-class 梯队的一半。

Image Generation

图像生成

GPT Image 2 现在连 Artificial Analysis 文生图 Arena 质量榜也登顶了(ELO 1338)——质量与生态双冠。Reve 2.1 发布当天空降第 2(ELO 1301),字节 Seedream 5.0 Pro 进前 10,Black Forest 的 FLUX 3 限量发布,成为首个图/视频/音频 omni 模型。

当前领先 GPT Image 2 OpenAI · 上期领先:GPT Image-2

本月变化Recraft V4.1 跌出第一梯队;Reve 2.1(7 月 9 日)与 Seedream 5.0 Pro(7 月 8 日)新进榜;FLUX 3(7 月 23 日)限量发布。

怎么选质量 + 生态选 GPT Image 2;分层生成、$24/千图选 Reve 2.1;文字渲染选 Seedream 5.0 Pro;企业版权安全仍选 Firefly。

  1. 1

    GPT Image 2 OpenAI

    登顶 AA 文生图 Arena(ELO 1338),叠加既有生态与定价优势。

    • AA 文生图 Arena ELO:1338(第 1)
    • 按 token 计费
    • Batch 接口 50% 折扣
    • 高保真输入
    • 发布日期 2026-04-21
    1338
  2. 2

    Reve 2.1 Reve

    7 月 9 日发布。凭借分层生成与 $24/千图的颠覆性定价,发布当天空降 AA 榜第 2。

    • AA 文生图 Arena ELO:1301(第 2)
    • 分层生成
    • $24 / 千图
    • 首发即一线质量
    1301
  3. 3

    Seedream 5.0 Pro ByteDance

    7 月 8 日发布。图层分离 + 顶级文字渲染,跻身 AA 榜前 10。

    • AA 文生图 Arena ELO:1239(前 10)
    • 图层分离
    • 文字渲染强
    • $90 / 千图
    1239

截至 2026-07-27,GPT Image 2(OpenAI)以 ELO 1338 居 Artificial Analysis 文生图 Arena 榜首,领先 Reve 2.1(1301,2026-07-09 发布)与 MAI-Image-2.5(微软,1269),Seedream 5.0 Pro(字节跳动,1239)居前十。Black Forest Labs 于 2026-07-23 限量发布 FLUX 3——覆盖图像、20 秒视频与音频的 omni 模型。

Video Generation

视频生成

Google Gemini Omni Flash 以 ELO 1240 拿下 Artificial Analysis 文生视频 Arena(含音频),终结 Seedance 2.0 的连冠(1225)。字节的回击已经在路上:Seedance 2.5(7 月 16 日起灰度)带来原生 30 秒 4K/10bit 生成,尚未入榜。OpenAI 正式退场——Sora 接口 将于 9 月 24 日关停。

当前领先 Gemini Omni Flash Google · 上期领先:Seedance 2.0

本月变化Arena 榜首易主:Seedance 2.0 → Gemini Omni Flash(1240 vs 1225);Seedance 2.5 自 7 月 16 日灰度上线;Sora 接口 9 月 24 日停服。

怎么选音画同步竞技场最强选 Gemini Omni Flash;30 秒 4K 生产选 Seedance 2.5;亚太短视频性价比选 Kling 3.0。

  1. 1

    Gemini Omni Flash Google

    以 ELO 1240 登顶 AA 文生视频 Arena(含音频)——Google 首个拿下音画同步冠军的模型。

    • AA 含音频视频榜 #1 · ELO 1240
    • 原生音画同步
    • Gemini Omni 全家桶集成
    • 接口 现成可用
    1240
  2. 2

    Seedance 2.0 / 2.5 ByteDance

    2.0 以 ELO 1225 退居第 2;2.5(原生 30 秒、4K/10bit、50 个参考输入)自 7 月 16 日灰度,尚未入榜。

    • AA 含音频视频榜 ELO:1225(第 2)
    • 2.5:原生 30 秒 4K/10bit
    • 多模态输入(文/图/音/视频)
    • 双分支扩散 Transformer
    1225
  3. 3

    Kling 3.0 Pro Kuaishou 快手

    6 月 17 日 Turbo 升级,守住亚太短视频性价比位;3.0 线原生 4K/60fps。

    • AA 含音频视频榜 ELO:1110
    • 3.0 Turbo:最快迭代
    • 原生 4K/60fps(3.0 线)
    • 原生抖音 / TikTok 风格
    1110

截至 2026-07-27,Gemini Omni Flash(Google)领跑文生视频,在 Artificial Analysis 文生视频 Arena(含音频)以 ELO 1240 居第 1,领先 Seedance 2.0(字节跳动,1225)与 Wan 2.7(阿里巴巴,1160)。字节跳动于 2026-07-16 开始灰度 Seedance 2.5,支持原生 30 秒 4K/10bit 输出。OpenAI Sora 接口 将于 2026-09-24 停止服务。

Code Generation & Agentic Coding

代码生成与 Agentic Coding

Claude Opus 5(7 月 24 日)把 SWE-bench Verified 推到约 96%——历史新高;同时 Moonshot 的开源 Kimi K3 以 1679 分杀上 LMArena WebDev 榜首,成为第一个登顶前端代码竞技场的中国模型。代码前沿一分为二:基准榜归 Anthropic,人气榜归 Kimi。

当前领先 Claude Opus 5 Anthropic · 上期领先:Claude Fable 5

本月变化Opus 5 登顶 SWE-bench Verified(约 96%,7 月 24 日);Kimi K3 登顶 LMArena WebDev(1679,7 月 16 日),领先 Fable 5(1631)与 GPT-5.6 Sol(1618)。

怎么选最难重构与长程 Agent 选 Opus 5;Mythos-class 天花板选 Fable 5;前端开发与开源部署选 Kimi K3;沙盒终端 Agent 选 GPT-5.6 Sol。

  1. 1

    Claude Opus 5 Anthropic

    发布当天 SWE-bench Verified 约 96%(独立评测最高 97.0%)——代码新前沿。

    • SWE-bench Verified:约 96%(第 1)
    • $5 / $25 每百万 tokens
    • 长程 agentic 编辑
    • 1M 上下文
    • 发布日期 2026-07-24
    96
  2. 2

    Kimi K3 Moonshot AI

    以 1679 分登顶 LMArena WebDev——首个居该榜第 1 的中国模型。开放权重,独立评测 SWE-bench Verified 93.4%。

    • LMArena WebDev:1679(第 1)
    • 开放权重 · 2.8T MoE
    • SWE-bench Verified:93.4%
    • $3 / $15 每百万 tokens
    • 发布日期 2026-07-17
    1679
  3. 3

    Claude Fable 5 Anthropic

    SWE-bench Verified 95%;最难多文件、长程任务的 Mythos-class 天花板。

    • SWE-bench Verified:95%
    • Mythos-class agentic coding
    • 1M+ 上下文
    • 6 月出口暂停后已恢复
    95
  4. 4

    GPT-5.6 Sol OpenAI

    Terminal-Bench 2.1 达 88.8%——沙盒终端 Agent 最强;SWE-bench Pro 64.6%。

    • Terminal-Bench 2.1:88.8%(第 1)
    • SWE-bench Pro:64.6%
    • 内置沙盒 Shell
    • 2026-07-09 全面开放
    88.8

截至 2026-07-27,Claude Opus 5(Anthropic,2026-07-24 发布)以 SWE-bench Verified 约 96% 领跑 agentic coding,为历史最高分。Kimi K3(Moonshot AI,开放权重)以 ELO 1679 登顶 LMArena WebDev——首个居该榜第 1 的中国模型——领先 Claude Fable 5(1631)与 GPT-5.6 Sol(OpenAI,1618)。GPT-5.6 Sol 同时以 88.8% 领跑 Terminal-Bench 2.1,是沙盒终端 Agent 最强。

Voice / Speech

语音 / 音频

speech-to-speech 王位没有变化——OpenAI Realtime 2 仍领跑 agentic 语音。但组件级冠军都换成了中国厂商:阿里 Qwen-Audio-3.0-TTS-Plus 登顶 AA TTS 榜(ELO 1234),Fun-Realtime-ASR-preview 以 1.7% WER 领跑 STT。ElevenLabs 以 Music v2 和 Scribe v2 realtime 回应。

当前领先 Realtime 2 OpenAI · 上期领先:ElevenLabs v3

本月变化TTS 冠军:Fun-Realtime-TTS → Qwen-Audio-3.0-TTS-Plus(1234);STT 冠军:MAI-Transcribe-1.5 → Fun-Realtime-ASR-preview(1.7% WER)。

怎么选agentic 语音选 Realtime 2;纯 TTS 质量选 Qwen-Audio-3.0-TTS-Plus;转录选 Fun-Realtime-ASR;角色声音克隆选 ElevenLabs v3。

  1. 1

    Realtime 2 OpenAI

    仍是 agentic 语音默认选择。可配置推理 speech-to-speech,配套 translate / Whisper 流式变体。

    • 可配置推理
    • speech-to-speech agent
    • 流式翻译变体
    • 流式 STT 变体
    • 发布日期 2026-05-07
  2. 2

    Qwen-Audio-3.0-TTS-Plus Alibaba

    以 ELO 1234 登顶 AA TTS 榜——中国厂商首个 TTS 冠军。

    • AA TTS ELO:1234(第 1)
    • 2026 年 7 月发布
    • 多语言 + 中日韩强势
    • 阿里云原生
    1234
  3. 3

    ElevenLabs v3 ElevenLabs

    AA TTS 滑到第 11,但仍是角色声音克隆默认;新增 Scribe v2 realtime 与 Music v2 接口。

    • 角色声音克隆 SOTA
    • Scribe v2 realtime STT(2.2% WER)
    • Music v2 接口(6 月 15 日)
    • 100+ 语言

截至 2026-07-27,OpenAI Realtime 2 仍是 agentic 语音 speech-to-speech 领先模型。阿里 Qwen-Audio-3.0-TTS-Plus 以 ELO 1234 居 Artificial Analysis TTS 榜首,领先 Speechify Simba 3.2(1230)与 Gemini 3.1 Flash TTS(1215)。Fun-Realtime-ASR-preview 以 1.7% WER 领跑语音转文字,领先 ElevenLabs Scribe v2(2.2%)。

Music Generation

音乐生成

更正上月判断:Suno v6 最终没有发布——v5.5 仍是线上默认与类目第一。真正的动作在别处:ElevenLabs Music v2 于 6 月 15 日上线 接口,Google Lyria 继续借 Gemini Omni 走跨模态 any-to-music 路线。

当前领先 Suno v5.5 Suno

本月变化Suno v6 错过传闻中的 6 月窗口,至今未官宣;v5.5 稳居第 1。ElevenLabs Music v2 经 接口 入场。

怎么选整曲生成选 Suno v5.5;录音棚级分轨选 Udio v3;授权曲库业务流程选 ElevenLabs Music v2;跨模态走 Gemini Omni 调 Lyria。

  1. 1

    Suno v5.5 Suno

    仍是 Suno 最新版本——v6 并未发布。整曲连贯与歌词韵律最佳。

    • 整曲连贯 SOTA
    • 歌词韵律最佳
    • 多语言演唱
    • 风格迁移
  2. 2

    Udio v3 Udio

    录音棚级混音,分轨输出。

    • 分轨输出
    • 录音棚级混音
    • 电子曲风强势
    • DAW 友好
  3. 3

    ElevenLabs Music v2 ElevenLabs

    6 月 15 日上线 接口。基于授权曲库的音乐生成,支持微调。

    • 接口 优先的音乐生成
    • 授权曲库
    • Music Finetunes 接口
    • 与 ElevenLabs 语音栈集成

截至 2026-07-27,Suno v5.5 仍是领先的音乐生成模型——传闻中的 Suno v6 并未发布。ElevenLabs 于 2026-06-15 将 Music v2 上线 接口;Udio v3 在录音棚级混音与分轨输出上保持领先。Google Lyria 已并入 Gemini Omni,承担跨模态(图/视频/音乐)业务流程。

Vision / Multimodal Understanding

视觉 / 多模态理解

Fable 5 以 1327 ELO 拿下 LMArena Vision 榜首,终结 Opus 4.7 一代的霸榜。Opus 5 与 GPT-5.6 Sol 在身后约 15 分以内紧咬——视觉榜头部第一次变成真正的三厂竞赛。

当前领先 Claude Fable 5 Anthropic · 上期领先:Claude Opus 4.7-thinking

本月变化Vision 第 1 易主:Opus 4.7-thinking(1309)→ Fable 5(1327,7 月 12 日按新票仓重算)。

怎么选OCR / 文档问答 / 图表理解选 Anthropic;图像支撑的推理链选 GPT-5.6 Sol;视频理解选 Gemini 3.1 Pro。

  1. 1

    Claude Fable 5 Anthropic

    以 1327 分登顶 LMArena Vision(7 月 12 日按新票仓重算)——同时领跑文本竞技场。

    • LMArena Vision ELO:1327(第 1)
    • 文本竞技场同居第 1
    • OCR + 文档理解 SOTA
    • 1M+ 上下文
    1327
  2. 2

    Claude Opus 5 Anthropic

    新多模态旗舰,Vision 榜上距 Fable 5 仅约 15 ELO。

    • 前沿多模态理解
    • 文档问答 + 图表
    • $5 / $25 每百万 tokens
    • 发布日期 2026-07-24
  3. 3

    Gemini 3.1 Pro Google

    视频理解与长时序推理最佳。

    • 视频理解 SOTA
    • 长时序推理
    • 集成 Robotics-ER 1.6
    • 200 万 token+ 多模态

截至 2026-07-27,Claude Fable 5(Anthropic)以 ELO 1327 居 LMArena Vision 榜首,Claude Opus 5 与 GPT-5.6 Sol(OpenAI)在约 15 分以内紧随其后。Fable 5 同时占据文本竞技场第 1。Gemini 3.1 Pro(Google)仍是视频理解领先者。

Open-Source / Open-Weights

开源 / 开放权重

Moonshot 的 Kimi K3(7 月 17 日)成为新的开源之王:2.8T 参数 MoE,AA Intelligence Index 57——全球第 3,首个进入前沿梯队的开源模型,距 Opus 5 仅 4 分,还 outright 登顶 LMArena WebDev。代价是输出定价涨到 $15/百万,接近 K2.6 的 4 倍。

当前领先 Kimi K3 Moonshot AI · 上期领先:Kimi K2.6

本月变化Kimi K3(57)从 K2.6(54)手中接过开源王座;K2.7 Code(1T/32B MoE)6 月中补强编程线;DeepSeek V4 满血版仍只是传闻。

怎么选前沿级开源部署选 Kimi K3;同生态、输出价仅 1/4 选 K2.6;便宜推理选 DeepSeek V4 Pro;端侧多模态选 Gemma 4 12B。

  1. 1

    Kimi K3 Moonshot AI

    AA Intelligence Index 57 居开源榜首——全球第 3,距闭源前沿仅 4 分。同时登顶 LMArena WebDev。

    • AA Intelligence Index:57(开源第 1)
    • 2.8T MoE · 1M 上下文
    • LMArena WebDev 第 1
    • $3 / $15 每百万 tokens
    • 发布日期 2026-07-17
    57
  2. 2

    Kimi K2.6 Moonshot AI

    前任开源之王,现在是 K 系的性价比之选:Index 54,输出价仅为 K3 的 1/4。

    • AA Intelligence Index:54
    • 开源权重
    • 输出约 $4 / 百万(K3 为 $15)
    • 中英双强
    54
  3. 3

    DeepSeek V4 Pro DeepSeek

    MIT 开源权重,AA Intelligence Index 52——便宜的前沿级推理默认。满血 V4 仍只是传闻。

    • AA Intelligence Index:52
    • MIT 许可 · 开放权重
    • $0.435 / $0.87 每百万
    • 1M tokens 上下文
    52
  4. 4

    Gemma 4 12B Google

    Apache 2.0 开放权重。encoder-free 原生多模态,256K 上下文,16GB 笔记本即可本地跑。

    • Apache 2.0 · 开放权重
    • 256K 上下文 · 原生多模态
    • 16GB 显存可跑
    • MMLU-Pro 77.2 · GPQA-Diamond 78.8

截至 2026-07-27,Kimi K3(Moonshot AI,2026-07-17 发布)以 Artificial Analysis Intelligence Index 57 居开源权重模型榜首——全球第 3,距闭源前沿(Claude Opus 5,61)仅 4 分。该 2.8T 参数 MoE 提供 1M token 上下文,定价 $3/$15 每百万 tokens,并在 LMArena WebDev 排名第 1。Kimi K2.6(54)与 DeepSeek V4 Pro(MIT,52)组成开源第一梯队其余席位;Google Gemma 4 12B(Apache 2.0)仍是端侧多模态首选。

每美元智能

性价比 / 价格性能比

性价比之战进入僵持:DeepSeek 自 4 月起没动过价格,V4 Flash 仍以混合约 $0.06 / 百万 tokens 提供 Intelligence Index 47——同级旗舰的十分之一。两件事值得注意:旧的 deepseek-chat/reasoner 别名 7 月 24 日退役(需迁移到 deepseek-v4-flash/pro);MiniMax M3 上市促销结束,回到 $0.60/$2.40 标准价。

当前领先 DeepSeek V4 Flash DeepSeek

本月变化头部厂商无调价;DeepSeek 旧别名 7 月 24 日退役;MiniMax M3 促销结束;GLM-5.2 开放按量 接口。

怎么选超大批量低成本选 V4 Flash;要更强推理又想省钱选 V4 Pro;要最便宜的 SWE-bench 80%+ 选 MiniMax M3;想分散厂商选 Qwen3.7 Plus。

  1. 1

    DeepSeek V4 Flash DeepSeek

    每美元智能之王,自 4 月未调价。Index 47,$0.14/$0.28 每百万 tokens——约为同档 Flash 旗舰的十分之一。

    • AA Intelligence Index:47
    • $0.14 输入 / $0.28 输出 每百万
    • 混合 ≈ $0.06 / 百万
    • MIT 开源权重 · 1M 上下文
    47
  2. 2

    DeepSeek V4 Pro DeepSeek

    高智能 + 低价象限的最佳平衡。Intelligence Index 52,$0.435/$0.87——仅为同档旗舰的零头。

    • AA Intelligence Index:52
    • $0.435 输入 / $0.87 输出 每百万
    • 前沿级推理
    • MIT 开源权重
    52
  3. 3

    MiniMax M3 MiniMax

    SWE-bench Verified 80%+ 里最便宜的模型。上市促销结束,现为 $0.60/$2.40 标准价。

    • SWE-bench Verified:80%+
    • $0.60 输入 / $2.40 输出 每百万
    • 最便宜的 agentic 可用梯队
    • 开放权重

截至 2026-07-27,DeepSeek V4 Flash 以 Artificial Analysis Intelligence Index 47、$0.14 输入 / $0.28 输出(每百万 tokens)领跑性价比——混合成本约 $0.06 / 百万,约为同级旗舰的十分之一。价格自 4 月未变;旧 deepseek-chat 与 deepseek-reasoner 别名于 2026-07-24 退役。MiniMax M3($0.60/$2.40)是 SWE-bench Verified 80% 以上最便宜的模型;GLM-5.2 已开放按量 接口($1.40/$4.40)。

TRENDS

本月趋势洞察

从各品类的变化里,最值得记住的几件事。

01

Opus 5 以半价夺回王座

Mythos-class Fable 5 发布仅六周后,Anthropic 又推出 Opus 5(7 月 24 日):Intelligence Index 61,$5/$25——用 Opus 档的价格给到接近 Mythos 的智能。前沿迭代节奏已按周计算,Anthropic 包揽总榜前三(Opus 5 max、Opus 5 xhigh、Fable 5)。

02

Kimi K3:开源进入前沿梯队

Moonshot 2.8T 参数的 Kimi K3(7 月 17 日)拿到 Intelligence Index 57——全球第 3,距 Opus 5 仅 4 分——并登顶 LMArena WebDev,成为首个领跑该榜的中国模型。开源权重不再低人一档,而是进入前沿带。

03

GPT-5.6:OpenAI 的分层回应

Sol/Terra/Luna 家族(6 月 26 日预览,7 月 9 日 GA)把前沿拆成价格-性能分层。Sol max 拿到 Intelligence Index 59 并领跑 Terminal-Bench 2.1(88.8%)——有竞争力,但这是 OpenAI 第一次处于追赶位置,而不是定调位置。

04

视频王座归 Google,字节迅速回击

Gemini Omni Flash 终结 Seedance 2.0 在 AA 视频榜的连冠(1240 对 1225)。字节 Seedance 2.5(原生 30 秒 4K)已在灰度放量,而 OpenAI 彻底退出战场——Sora 接口 将于 9 月 24 日停服。

05

没等到的那款音乐模型

市场普遍预期 6 月发布的 Suno v6 最终没有落地——v5.5 仍是第一。与此同时 ElevenLabs Music v2 借 接口 悄然入场,主打授权曲库。音乐是本月唯一前沿停滞的类目。

06

中国厂商包揽语音组件冠军

阿里 Qwen-Audio-3.0-TTS-Plus 拿下 AA TTS 冠军(ELO 1234),Fun-Realtime-ASR-preview 领跑 STT(1.7% WER)。OpenAI 仍占据 speech-to-speech agent 层,但语音的「卖水生意」已转移到中国厂商手中。

07

性价比之战进入僵持

DeepSeek 自 4 月未调价——V4 Flash 混合约 $0.06 仍领跑每美元智能。本月看点是结构性的:旧别名 7 月 24 日退役,MiniMax M3 促销结束,GLM-5.2 开放按量。传闻 OpenAI 正考虑大幅降价,但尚未落地。

FAQ

常见问题

如果您还有具体问题,欢迎预约一对一沟通。

榜单多久更新一次?

每月更新一次。新一期数据发布后,本页会在下一次站点更新时同步。

榜单数据来自哪里?

整理自 Artificial Analysis、LMArena、SWE-bench 等公开榜单与各厂商官方公告,页面底部列出全部来源与统计日期。

可以直接按榜单选模型吗?

榜单反映公开评测表现,实际选择还应结合您的任务类型、预算和数据边界;欢迎预约诊断一起评估。

不同类目之间的分数可以互相比较吗?

不建议。各榜单的评分体系不同,请以同一类目内的相对排名为主。

BOOK A CONSULTATION

想判断哪类模型真正适合您的业务?

带上您的团队场景、预算与数据边界,一起评估最值得先试用的方向。

预约业务诊断
体验 AI 销售