首页 / LLM 月度榜单
AI TOOLS · 月度榜单
LLM 月度榜单2026 年 6 月
按月整理公开评测与厂商官方动态,帮助团队快速看清每个品类的领先者与变化。本期数据截至 2026-06-10,每月更新一次。
LEADERBOARD MONTH
2026-06
LLM 榜单 模型对比 月度更新 公开评测
更新于 2026-06-10 · 数据来自页面底部列出的公开来源
截至 2026-06-10,Claude Fable 5(Anthropic,2026-06-09 发布)以 Intelligence Index v4.0 综合得分 65(自适应推理最大模式)领衔 Artificial Analysis 总榜,超过 Claude Opus 4.8(61.4)、GPT-5.5 xhigh(OpenAI,60.2)、Gemini 3.1 Pro(Google,57)与 Grok 4.3(xAI,53)。Fable 5 是首个公开发布的 Mythos-class 模型,Humanity's Last Exam 得 53%——领先次席 7 分以上。
Text Generation & Reasoning
文本生成与综合推理
6 月 9 日 Anthropic 发布 Claude Fable 5——首个面向公众的 Mythos-class 模型,一上线即以 65 分登顶 Artificial Analysis Intelligence Index v4.0,领先 Opus 4.8 四分。推理前沿如今整段被 Anthropic 占据。
当前领先
Claude Fable 5
Anthropic · 上期领先:Claude Opus 4.8
本月变化 2026 年 6 月 9 日发布。AA Intelligence Index v4.0:65(自适应推理,最大模式)——领先 Opus 4.8(61.4)与 GPT-5.5 xhigh(60.2)四分;Gemini 3.1 Pro(57)与 Grok 4.3(53)紧随其后。
怎么选 Fable 5 属于 Opus 之上的 Mythos-class 梯队,附带额外安全限制;Opus 4.8 仍是高并发、成本敏感场景的默认主力。
1
Claude Fable 5 Anthropic
6 月 9 日发布。首个公开的 Mythos-class 模型——以 65 分登顶 AA Intelligence Index v4.0,Humanity's Last Exam 得 53%(领先 7 分以上)。
Intelligence Index v4.0:65(第 1) Humanity's Last Exam:53% AA-Omniscience 创历史最高分 1M+ 上下文 · 自适应推理 发布日期 2026-06-09
65
2
Claude Opus 4.8 Anthropic
5 月 28 日发布。自适应推理 + 最大努力模式;现居 AA Intelligence Index v4.0 第 2,仅次于 Fable 5。
Intelligence Index v4.0:61.4 分 自适应推理(Adaptive Reasoning) 编码与 agentic 任务相比 4.7 全面升级 长任务一致性 发布日期 2026-05-28
61.4
3
GPT-5.5 OpenAI
4 月 24 日发布。1M token 上下文,原生支持 MCP + Skills + 计算机操作 + 托管 Shell。
Intelligence Index v4.0(xhigh):60.2 分 1M token 上下文 原生 MCP + Skills 内置 computer use 工具搜索 + Web 搜索 发布日期 2026-04-24
60.2
4
Gemini 3.1 Pro Google
强势 agentic 前沿,配套 Antigravity 2.0 平台。
Intelligence Index v4.0:57 分 与 Antigravity 2.0 agentic 平台原生集成 并列 GPT-5.5 medium 与 Qwen3.7 Max
57
5
Grok 4.3 xAI
4 月 30 日发布。AA Intelligence Index 53,常驻推理、1M 上下文、激进定价——前沿四强里最便宜的一个。
Intelligence Index v4.0:53 常驻推理 · 1M 上下文 输入/输出较 Grok 4.20 便宜约 40%/60% agentic 与工具调用强
53
截至 2026-06-10,Claude Fable 5(Anthropic,2026-06-09 发布)以 Intelligence Index v4.0 综合得分 65(自适应推理最大模式)领衔 Artificial Analysis 总榜,超过 Claude Opus 4.8(61.4)、GPT-5.5 xhigh(OpenAI,60.2)、Gemini 3.1 Pro(Google,57)与 Grok 4.3(xAI,53)。Fable 5 是首个公开发布的 Mythos-class 模型,Humanity's Last Exam 得 53%——领先次席 7 分以上。
当前领先
GPT Image 2
OpenAI · 上期领先:GPT Image-2
本月变化 2026 年 4 月 21 日发布。token 计费,Batch API 50% 折扣。
怎么选 Recraft V4.1 在 AA 文生图竞技场上质量第一;GPT Image 2 在生态和定价透明度上胜出。
1
GPT Image 2 OpenAI
4 月 21 日发布。SOTA 质量 + token 计费 + Batch API 半价。
按 token 计费 Batch API 50% 折扣 灵活尺寸 高保真输入 发布日期 2026-04-21
None
2
Recraft V4.1 Recraft
在 Artificial Analysis 文生图竞技场质量第一。
AA 文生图质量榜首 强势 control / 风格迁移 设计师级输出
None
3
Adobe Firefly Image 4 Adobe
完全使用授权数据训练;商用版权安全的企业级首选。
训练数据全部授权 企业商用赔付保障 原生集成 Creative Cloud
None
截至 2026-06-10,GPT Image 2(OpenAI,2026-04-21 发布)是部署量最大的基础图像模型,采用 token 计费,Batch API 五折。Recraft V4.1 占据 Artificial Analysis 文生图质量榜首;Adobe Firefly 仍是企业版权安全的默认选择。
当前领先
Seedance 2.0
ByteDance · 上期领先:Veo 3.5
本月变化 Seedance 2.0 稳居含音频文生视频 Arena 第 1;Sora 2 因 OpenAI 关停 Sora 应用(2026-04-26)退出榜单。
怎么选 音画同步与多镜头叙事选 Seedance 2.0;电影级画质选 Veo 3.5;性价比选 Kling 4。
1
Seedance 2.0 ByteDance
登顶 Artificial Analysis 文生视频 Arena(含音频)ELO 1215——领先 Veo。原生音画联合生成:从文/图/音/视频输入产出 15 秒多镜头、音画同步片段。
AA 含音频视频榜 #1 · ELO 1215 15 秒多镜头 · 音画同步 多模态输入(文/图/音/视频) 双分支扩散 Transformer
1215
2
Veo 3.5 Google
电影级输出,时序连贯最佳。
1080p 输出 物理仿真稳定 长镜头时序连贯 原生 Gemini API 集成
None
3
Kling 4 Kuaishou 快手
亚太短视频广告创意一家独大;行业最快迭代节奏。
原生 9:16 竖屏 最快编辑迭代 原生抖音 / TikTok 风格 低延迟生成
None
截至 2026-06-10,Seedance 2.0(字节跳动)领跑文生视频,在 Artificial Analysis 文生视频 Arena(含音频)以 ELO 1215 居第 1——领先 Google Veo。它从文/图/音/视频输入产出 15 秒多镜头、原生音画同步片段。Veo 3.5(Google)领跑无声电影级画质,Kling 4(快手)守住性价比梯队;OpenAI Sora 应用已于 2026-04-26 停服,退出榜单。
Code Generation & Agentic Coding
代码生成与 Agentic Coding
Claude Fable 5 于 6 月 9 日发布,一上线即以 80.3% 登顶 SWE-bench Pro——在同一未污染多语言基准上领先 Opus 4.8(69.2%)约 11 分。Pro 分数显著低于已污染的 Verified 集,所以 80% 才是诚实的新前沿水位。
当前领先
Claude Fable 5
Anthropic · 上期领先:Claude Opus 4.8
本月变化 Fable 5 于 6 月 9 日以 80.3% 登顶 SWE-bench Pro;Opus 4.8(69.2%)第 2,GPT-5.3 Codex 第 3。
怎么选 最难的多文件重构与长程 Agent 选 Fable 5;成本敏感默认选 Opus 4.8;沙盒终端 Agent 选 GPT-5.3 Codex;IDE 原生结对编程选 Cursor Composer 2.5。
1
Claude Fable 5 Anthropic
SWE-bench Pro 以 80.3% 居第 1(6 月 9 日发布)——领先全场 11 分。Mythos-class agentic coding,专攻最难的多文件、长程任务。
SWE-bench Pro:80.3%(第 1) 领先 Opus 4.8 11 分 长程 agentic 编辑 1M+ 上下文 · Mythos-class 发布日期 2026-06-09
80.3
2
Claude Opus 4.8 Anthropic
SWE-bench Pro 以 69.2% 居第 2(6 月 8 日更新),仅次于 Fable 5。多文件重构、代码审查与长程 agentic 编辑的成本敏感默认选择。
SWE-bench Pro:69.2%(第 2) 多文件重构 SOTA 代码审查最佳 支持视觉感知编码
69.2
3
GPT-5.3 Codex (xhigh) OpenAI
SWE-bench Pro 第 3(6 月 8 日)。专门化终端代码 Agent;AA Intelligence Index 54。
AA Intelligence Index:54 内置沙盒 Shell agentic 循环强势 Terminal-Bench 最佳
54
4
Cursor Composer 2.5 Cursor
AA Coding Agent Index 第 3。IDE 原生结对,多文件上下文。
AA Coding Agent Index:第 3 名 IDE 原生上下文 多文件编辑 原生 diff 工作流
None
截至 2026-06-10,Claude Fable 5(Anthropic,2026-06-09 发布)领跑 agentic coding,在 SWE-bench Pro 榜以 80.3% 居第 1——领先 Claude Opus 4.8(69.2%)与 GPT-5.3 Codex(OpenAI)约 11 分。SWE-bench Pro 使用 1,865 个未污染的多语言任务,分数显著低于仅 Python 的 Verified 集。Cursor Composer 2.5 在 AA Coding Agent Index 上位列 IDE 原生编码 Agent 前列。
当前领先
Realtime 2
OpenAI · 上期领先:ElevenLabs v3
本月变化 Realtime 2 系列 5 月 7 日上线(gpt-realtime-2 / -translate / -whisper)。
怎么选 agentic 语音选 Realtime 2;角色声音克隆选 ElevenLabs v3;纯 TTS 质量选 Fun-Realtime-TTS;转录选 MAI-Transcribe-1.5。
1
Realtime 2 OpenAI
5 月 7 日正式版。可配置推理 speech-to-speech,配套 translate / Whisper 流式变体。
可配置推理 speech-to-speech agent 流式翻译变体 流式 STT 变体 发布日期 2026-05-07
None
2
ElevenLabs v3 ElevenLabs
角色声音克隆与有声书制作的行业默认。
角色声音克隆 SOTA 100+ 语言 长篇有声书质量 情感控制
None
3
Fun-Realtime-TTS Fun (Alibaba DAMO)
AA TTS 榜首。
AA TTS 榜首 200ms 内延迟 多说话人流式 中日韩强势
None
截至 2026-06-10,OpenAI Realtime 2(2026-05-07 发布)是 agentic 语音 speech-to-speech 领先模型,支持可配置推理。Fun-Realtime-TTS 居 Artificial Analysis TTS 榜首;MAI-Transcribe-1.5 在 STT 准确率-速度上领先。ElevenLabs v3 在角色声音克隆方面仍占主导。
当前领先
Suno v6
Suno · 上期领先:Suno v5.5
本月变化 Suno v6 预计 6 月底滚动发布;v5.5 仍为线上默认。
怎么选 整曲生成选 Suno v6;录音棚级分轨选 Udio v3;跨模态生成(图/视频/音乐)走 Gemini Omni 调 Lyria。
1
Suno v6 Suno
预计 6 月底滚动发布。整曲连贯与歌词韵律最佳。
None
2
Udio v3 Udio
录音棚级混音,分轨输出。
None
3
Lyria (via Gemini Omni) Google
已并入 Gemini Omni,支持任意输入到音乐 + 跨模态。
Gemini Omni 原生 跨模态生成 图/视频 → 音乐工作流
None
截至 2026-06-10,Suno v6(预计 6 月底滚动发布)在整曲生成与歌词韵律上领先;v5.5 仍是线上默认。Udio v3 在录音棚级混音与分轨输出上领先。Google Lyria 已并入 Gemini Omni,承担跨模态(图/视频/音乐)工作流。
Vision / Multimodal Understanding
视觉 / 多模态理解
Anthropic 用 Opus 4.7-thinking、4.6-thinking、4.7 横扫 LMArena Vision 前 3。Opus 4.8 因刚发布尚未上 Arena ELO,预计 6 月底巩固冠军。
当前领先
Claude Opus 4.7-thinking
Anthropic · 上期领先:GPT-4o Vision
本月变化 LMArena Vision 前 3 全部 Anthropic(1309 / 1303 / 1298 ELO)。
怎么选 OCR / 文档问答 / 图表理解选 Anthropic;图像支撑的推理链选 GPT-5.5;视频理解选 Gemini 3.1 Pro。
1
Claude Opus 4.7-thinking Anthropic
LMArena Vision 居首。OCR + 图表 + 文档理解最佳。
LMArena Vision ELO:1309 OCR SOTA 图表理解 文档问答
1309
2
GPT-5.5 OpenAI
图像支撑的推理链最强;原生 computer-use 视觉管线。
图像推理链最佳 Computer use 视觉 1M token 多模态 发布日期 2026-04-24
None
3
Gemini 3.1 Pro Google
视频理解与长时序推理最佳。
视频理解 SOTA 长时序推理 集成 Robotics-ER 1.6 200 万 token+ 多模态
None
截至 2026-06-10,Claude Opus 4.7-thinking(Anthropic,LMArena Vision ELO 1309)在视觉与多模态理解领域领先,其次为 Opus 4.6-thinking(1303)与 Opus 4.7(1298)—— Anthropic 横扫 Vision Arena 前 3。Opus 4.8 因刚发布暂未上 Arena ELO。GPT-5.5 在图像支撑的推理链上领先;Gemini 3.1 Pro 在视频理解上领先。
Open-Source / Open-Weights
开源 / 开放权重
Kimi K2.6(Moonshot)以 AA Intelligence Index 54 居开源权重榜首——距前沿闭源仅 7 分。DeepSeek V4 Pro(MIT,52)是开源推理第 2,Google 新发的 Gemma 4 12B(Apache 2.0,2026-06-03)把原生多模态塞进 16GB 笔记本即可运行的体量。开源与闭源的差距是有史以来最窄的一次。
当前领先
Kimi K2.6
Moonshot AI · 上期领先:Llama 4
本月变化 Kimi K2.6(54)登顶开源;DeepSeek V4 Pro(52)第 2;Gemma 4 12B 带来 16GB 笔记本可跑的多模态。
怎么选 通用开源部署选 Kimi K2.6;想要便宜的前沿级推理选 DeepSeek V4 Pro;端侧多模态选 Gemma 4 12B;中文自托管选 Qwen3.7 Plus。
1
Kimi K2.6 Moonshot AI
AA Intelligence Index 开源权重榜首。距闭源前沿仅 7 分。
AA Intelligence Index:54 开源权重 中英双强 长上下文保持力
54
2
DeepSeek V4 Pro DeepSeek
MIT 开源权重,AA Intelligence Index 52——全榜第 3,开源推理模型第 2(仅次于 Kimi K2.6)。
AA Intelligence Index:52(全榜#3) MIT 许可 · 开放权重 MoE 1.6T 总参 / 49B 激活 1M tokens 上下文
52
3
Gemma 4 12B Google
2026-06-03 发布,Apache 2.0 开放权重。encoder-free 原生多模态(文/图/音/视频),256K 上下文,16GB 笔记本即可本地跑——性能逼近上代 27B。
Apache 2.0 · 开放权重 256K 上下文 · 原生多模态 16GB 显存可跑 MMLU-Pro 77.2 · GPQA-Diamond 78.8
—
4
Qwen3.7 Plus Alibaba
中文自托管部署的最佳开源选择。
AA Intelligence Index:53 最佳中文开源 工具调用强 开放权重
53
截至 2026-06-10,Kimi K2.6(Moonshot AI)以 Artificial Analysis Intelligence Index 54 居开源权重模型榜首,距前沿闭源(Claude Opus 4.8,61)仅 7 分。DeepSeek V4 Pro(DeepSeek,MIT 许可)以 Intelligence Index 52(全榜第 3 / 共 89)居开源模型第 2。Google 于 2026-06-03 以 Apache 2.0 发布 Gemma 4 12B——encoder-free 多模态、256K 上下文、16GB 内存即可运行。Qwen3.7 Plus(阿里巴巴,53)撑起中国开源第一梯队。
Cost-Effectiveness / Value
性价比 / 价格性能比
2026 的性价比之战由中国开源军团主导。DeepSeek V4 Flash 以约 1/10 的价格拿到逼近旗舰的智能(Index 47),混合成本约 $0.06 / 百万 tokens。榜单点明一条警示:「Flash」「mini」标签不等于便宜——Gemini 3.5 Flash 智能分高达 55,但跑完整套 Intelligence Index 的成本高出 20 倍以上。
当前领先
DeepSeek V4 Flash
DeepSeek
本月变化 新增类目。DeepSeek V4 Flash 领跑每美元智能;开源模型包揽性价比梯队。
怎么选 超大批量低成本场景选 DeepSeek V4 Flash;要更强推理又想省钱选 V4 Pro;想避免单一厂商依赖选 Qwen3.7 Plus。
1
DeepSeek V4 Flash DeepSeek
每美元智能之王。AA Intelligence Index 47,$0.14/$0.28 每百万 tokens——约为同档 Flash 旗舰的十分之一,cache 命中价为 2026 一线模型最低。
AA Intelligence Index:47 $0.14 输入 / $0.28 输出 每百万 混合 ≈ $0.06 / 百万 MIT 开源权重 · 1M 上下文
47
2
DeepSeek V4 Pro DeepSeek
高智能 + 低价象限的最佳平衡。Intelligence Index 52(全榜前 3),$0.435/$0.87——仅为 GPT-5.5、Claude Opus 等同档旗舰的零头。
AA Intelligence Index:52(全榜#3) $0.435 输入 / $0.87 输出 每百万 全榜智能前 3 MIT 开源权重
52
3
Qwen3.7 Plus Alibaba
让性价比之战不被单一厂商垄断。Intelligence Index 53,$0.40 输入——分数高于 V4 Pro;代价是输出更贵、出速更慢。
AA Intelligence Index:53 $0.40 输入 / $1.16 输出 每百万 性价比梯队最高分 中文与工具调用强
53
截至 2026-06-10,DeepSeek V4 Flash(DeepSeek)以 Artificial Analysis Intelligence Index 47、$0.14 输入 / $0.28 输出(每百万 tokens)领跑性价比——混合成本约 $0.06 / 百万 tokens,约为同档 Flash 旗舰的十分之一。DeepSeek V4 Pro(Index 52,$0.435/$0.87)与 Qwen3.7 Plus(阿里巴巴,Index 53,$0.40/$1.16)共同组成性价比第一梯队。注意「Flash」「mini」并不代表便宜:Gemini 3.5 Flash 智能 55,但跑一遍 Intelligence Index 的成本高出 20 倍以上。
TRENDS
本月趋势洞察 从各品类的变化里,最值得记住的几件事。
01 Anthropic Mythos-class Fable 5 横扫推理 + 代码 Claude Fable 5(Mythos-class,6 月 9 日)以 65 分登顶 AA Intelligence Index、以 80.3% 登顶 SWE-bench Pro 代码榜(领先约 11 分);Opus 4.8 在两榜均居第 2,Opus 4.7-thinking 仍占据 LMArena Vision 与 Document。GPT-4 时代 OpenAI 之后,首次有一家厂商如此完整地同时掌控推理 + 视觉 + 代码。
02 GPT-5.5 带来 1M 上下文 + 原生 MCP/Skills OpenAI 4 月 24 日发布的 GPT-5.5 标配 1M token 上下文 + 原生 MCP + Skills + 托管 Shell + computer use + 工具搜索 + Web 搜索——把 API 本身做成了 agent 运行时。
03 Google Gemini Omni —— 任意输入到任意输出 5 月发布的 Gemini Omni 把图、音、视频统一在一套生成栈里;配套 Antigravity 2.0 平台把 Gemini 3.5 做成 agentic 底座。Google 押的不是单模型最聪明,而是整套栈最一体化。
04 开源与闭源差距收窄到 7 分 Kimi K2.6(54)距 Claude Opus 4.8(61)在 AA Intelligence Index 上仅 7 分。Meta 的 muse-spark 杀进 LMArena 总榜前 5(1489 ELO)。闭源护城河有史以来最窄。
05 AA Top 15 里有 5 家中国厂商 Qwen3.7 Max(阿里,57)、MiniMax-M3(55)、Kimi K2.6(Moonshot,54)、MiMo-V2.5-Pro(小米,54)、Qwen3.7 Plus(阿里,53)全部进入 AA Intelligence Index 前 15——中国厂商不再是「追赶」,已经进入前沿。
06 亚 200ms 语音 Agent 进入商品化阶段 OpenAI Realtime 2(5 月 7 日)+ Gemini 3.1 Flash TTS(4 月)+ Fun-Realtime-TTS 把实时语音 Agent 从研究推向生产。带推理的 speech-to-speech 已是基础能力。
07 性价比之战是一场中国开源叙事 DeepSeek V4 Flash 以混合 ~$0.06 / 百万 tokens 拿下 Intelligence Index 47——DeepSeek 与 Qwen 的开源权重模型已包揽每美元智能榜首,而 Gemini 3.5 Flash 这类「Flash/mini」闭源模型跑一遍 Index 的成本高出 20 倍以上。
FAQ
常见问题 如果您还有具体问题,欢迎预约一对一沟通。
榜单多久更新一次? 每月更新一次。新一期数据发布后,本页会在下一次站点更新时同步。
榜单数据来自哪里? 整理自 Artificial Analysis、LMArena、SWE-bench 等公开榜单与各厂商官方公告,页面底部列出全部来源与统计日期。
可以直接按榜单选模型吗? 榜单反映公开评测表现,实际选择还应结合您的任务类型、预算和数据边界;欢迎预约诊断一起评估。
不同类目之间的分数可以互相比较吗? 不建议。各榜单的评分体系不同,请以同一类目内的相对排名为主。
免费咨询
留个联系方式,我们帮你梳理 不确定阿里国际站、独立站还是 SaaS 更适合?留下信息或 预约诊断 ,我们结合你的产品、市场和预算给建站与获客建议。
BOOK A CONSULTATION
想判断哪类模型真正适合您的业务? 带上您的团队场景、预算与数据边界,一起评估最值得先试用的方向。
预约业务诊断 ↗