国内外大模型综合混排
综合 Artificial Analysis、Code Arena、SuperCLUE 等多源权威榜单的全球大模型实力排名
📊 全球大模型综合实力混排榜
综合来源:Artificial Analysis / Code Arena / SuperCLUE / LMSYS · 2026年6月
| # | 模型 | 厂商 | 地区 | 综合得分 | 状态 | 核心亮点 |
|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 国外 | LMSYS 99 | 新发布不开源 | LMSYS Arena 99分,SWE-bench 95.5%,因出口管制曾下线 |
| 2 | GPT-5.2 (high) | OpenAI | 国外 | AAI 51 | 不开源 | 全能均衡,生态成熟,Codex周活500万+ |
| 3 | GLM-5.2 | 智谱 AI | 国内 | AAI 51 / CA 1595 | 新发布开源 | Code Arena全球可用第1,编程第4,智能体第2,Design Arena第1 |
| 4 | Claude Opus 4.5 | Anthropic | 国外 | AAI 50 | 不开源 | 长文本与安全严谨性突出,幻觉少 |
| 5 | 豆包 Doubao-Seed-2.1 Pro | 字节跳动 | 国内 | 国产第1 | 新发布不开源 | 性能接近GPT-5.5,日均180万亿Tokens调用,月活3.45亿 |
| 6 | GPT-5.2 Codex (high) | OpenAI | 国外 | AAI 49 | 不开源 | 编程专项优化,SWE-bench 95.5% |
| 7 | Gemini 3 Pro (high) | 国外 | AAI 48 | 不开源 | 多模态与搜索整合最强,速度快 | |
| 8 | Kimi K2.6 | 月之暗面 | 国内 | AAI 47 | 不开源 | 超长上下文和Agent能力突出,性价比极高 |
| 9 | 通义千问 Qwen3.7-Max | 阿里巴巴 | 国内 | CA 1540+ | 不开源 | 唯一突破1540分的国产模型,企业级生态完善 |
| 10 | DeepSeek V4-Pro | 深度求索 | 国内 | 本地70.48 | 开源 | 开源第1,数学71.93,代码74.95,智能体78.12,V4.1即将发布 |
| 11 | Claude Mythos 5 | Anthropic | 国外 | — | 新发布不开源 | 与Fable 5共享架构,首次开放Mythos级能力 |
| 12 | Gemini 3.1 Pro | 国外 | — | 不开源 | 多模态能力持续增强,与Google生态深度整合 | |
| 13 | Llama 4 | Meta | 国外 | — | 开源 | 开源旗舰,本地部署首选之一 |
| 14 | 文心一言 Ernie 5.0 | 百度 | 国内 | LMSYS 1446 | 不开源 | 国家队选手,稳扎稳打,中文理解能力强 |
| 15 | Gemma 4 | 国外 | — | 开源 | 轻量开源模型,端侧部署友好 |
国内 AI 大模型
国产大模型权威排名与厂商最新动态
📊 SuperCLUE 中文大模型综合排名 + Code Arena 编程能力
数据来源:SuperCLUE / Code Arena · 2026年6月
| # | 模型 | 厂商 | 综合排名 | Code Arena | 状态 | 亮点 |
|---|---|---|---|---|---|---|
| 1 | 豆包 Doubao-Seed-2.1 Pro | 字节跳动 | 国产第1(月活3.45亿) | — | 新发布不开源 | 性能接近 GPT-5.5,日均 180 万亿 Tokens 调用 |
| 2 | GLM-5.2 | 智谱 AI | Artificial Analysis 第4(51分) | 1595(全球可用第1) | 新发布开源 | 开源模型 SOTA,编程全球第4,智能体第2,Design Arena 第1 |
| 3 | Kimi K2.6 | 月之暗面 | Artificial Analysis 第5 | — | 不开源 | 超长上下文和 Agent 能力突出,性价比极高 |
| 4 | 通义千问 Qwen3.7-Max | 阿里巴巴 | 国产第1梯队 | 1540+(全球第4) | 不开源 | 唯一突破 1540 分的国产模型,企业级生态完善 |
| 5 | DeepSeek V4-Pro | 深度求索 | 开源第1(本地横评) | 74.95(代码) | 开源 | 总分 70.48,数学 71.93,智能体 78.12,V4.1即将发布 |
| 6 | 文心一言 Ernie 5.0 | 百度 | LMSYS 1446分 | — | 不开源 | 国家队选手,稳扎稳打,中文理解能力强 |
| 7 | MiniMax M3 | MiniMax | 国产第1梯队 | — | 不开源 | 中文任务接近 GPT-4o 水平,多模态能力突出 |
| 8 | 腾讯混元 | 腾讯 | 国产第2梯队 | — | 不开源 | 背靠腾讯生态,微信 AI 助手「小微」灰度上线 |
| 9 | 讯飞星火 | 科大讯飞 | 国产第2梯队 | — | 不开源 | A股第一,多语种实时翻译,达沃斯现场跑通 |
| 10 | 天工大模型 | 昆仑万维 | 国产第9 | — | 不开源 | AI Agent 国内 Top3~5,海外商业化 A 股第一 |
模型发布
2026-06-17
智谱 AI 开源 GLM-5.2,Code Arena 全球可用模型第一
智谱 AI 正式开源旗舰模型 GLM-5.2。在百万开发者盲测的 Code Arena 编程榜单中取得 1595 分,总榜第二,由于排名第一的 Claude Fable 5 被出口管制封锁,GLM-5.2 实际成为全球可商用模型第一。在 Artificial Analysis 综合榜单上拿到 51 分,位列开源模型 SOTA,全球排名第四。编程能力单项第四,智能体能力第二,Design Arena 网页设计榜单直接第一。
模型发布
2026-06-23
字节豆包 2.1 Pro 发布,性能直逼 GPT-5.5
在 2026 年火山引擎 Force 大会上,字节跳动旗下豆包大模型最新旗舰版本 Doubao-Seed-2.1 Pro 正式亮相。官方 Benchmark 数据显示,其性能已接近 GPT-5.5、Claude Opus 4.7 以及 Gemini 3.1 Pro。豆包大模型日均 Tokens 调用量达 180 万亿,对比上线时增长超 1500 倍。豆包已从「追赶者」进化至「规模化运营者」。
模型发布
2026-06-24
阿里千问开源 Qwen-AgentWorld 原生语言世界模型
阿里千问团队正式开源 Qwen-AgentWorld,号称首个原生语言世界模型(LWM),可在文本、代码、网页、办公、移动、桌面、具身等七大领域统一模拟智能体交互环境。环境建模从预训练阶段即作为目标,贯穿 CPT → SFT → RL 全流程,被视为 Agent 时代的基础设施级开源工作。
即将发布
2026-06-23
DeepSeek V4.1 即将发布,迭代节奏加速至两个月一更
据 The Information 爆料,DeepSeek 计划在 6 月推出 V4.1 版本。从 V4 到 V4.1,间隔不到两个月。国产大模型的迭代节奏已从「半年一更」加速进入「两个月一更」。DeepSeek V4-Pro 在本地大模型横评中以 70.48 总分排名第一,数学 71.93、代码 74.95、智能体 78.12。
优惠信息
2026-06-24
豆包专业版上线,标准套餐 68 元/月
字节豆包专业版今日上线,基于豆包 2.1 系列大模型,标准套餐连续包月 68 元。专业版接入全新「办公任务模式」,可执行 Agent 类任务、操作本地文件。免费用户也可体验 2.1 Turbo 版本的办公模式。这是国内大模型从聊天向 Agent 生产力工具加速转型的关键信号。豆包 Q1 月活达 3.45 亿,超过千问与 DeepSeek 之和。
免费福利
2026-06-17
智谱 GLM-5.2 模型免费用,开源即巅峰
智谱 AI 开源 GLM-5.2 的同时宣布模型可免费使用。该模型在 Artificial Analysis 综合榜单上拿到 51 分,位列开源模型 SOTA,全球排名冲到第四。编程能力单项第四,智能体能力第二,Design Arena 网页设计榜单直接第一——超过了 Claude Fable 5。开源模型吊打闭源成为现实。
来源:智谱 AI 官方
技术突破
2026-06-24
虚幻引擎 5.8 收官发布,MegaLights 转正
Epic Games 发布 UE 5.8,这是虚幻引擎 5 计划内的最后一个大版本,下一站直接迈向 UE6。本次更新中 MegaLights 进入生产可用状态,MetaHuman 升级到人群系统级别,并新增无标记动捕能力,AIGC 内容生产门槛进一步降低。对 Unity MCP 生态也是重要信号:游戏引擎与 AI 的融合正在加速。
国外 AI 大模型
国际权威榜单排名与引擎厂商最新动态
📊 Artificial Analysis Intelligence Index v4.0 综合排名
数据来源:Artificial Analysis · 2026年6月
| # | 模型 | 厂商 | 综合得分 | 状态 | 亮点 |
|---|---|---|---|---|---|
| 1 | GPT-5.2 (high) | OpenAI | 51 | 不开源 | 全能均衡,生态成熟,Codex周活500万+ |
| 2 | Claude Opus 4.5 | Anthropic | 50 | 不开源 | 长文本与安全严谨性突出,幻觉少 |
| 3 | GPT-5.2 Codex (high) | OpenAI | 49 | 不开源 | 编程专项优化,SWE-bench 95.5% |
| 4 | Gemini 3 Pro (high) | 48 | 不开源 | 多模态与搜索整合最强,速度快 | |
| 5 | Kimi K2.5 | Moonshot AI | 47 | 不开源 | 性价比极高,比Claude Opus 4.5便宜数倍 |
| 6 | Claude Fable 5 | Anthropic | — | 新发布不开源 | Anthropic最强模型,LMSYS Arena 99分,因出口管制曾下线 |
| 7 | Claude Mythos 5 | Anthropic | — | 新发布不开源 | 与Fable 5共享架构,安全配置不同,首次开放Mythos级能力 |
| 8 | Gemini 3.1 Pro | — | 不开源 | 多模态能力持续增强,与Google生态深度整合 | |
| 9 | Llama 4 | Meta | — | 开源 | 开源旗舰,本地部署首选之一 |
| 10 | Gemma 4 | — | 开源 | 轻量开源模型,端侧部署友好 |
模型发布
2026-06-09
Anthropic 发布 Claude Fable 5 与 Mythos 5
Anthropic 同时发布两款旗舰模型,首次将 Mythos 级能力开放给普通用户。Fable 5 在软件工程、知识工作、视觉识别、科学研究和长上下文处理等多个领域刷新纪录,LMSYS Arena 达 99 分,SWE-bench Verified 达 95.5%。但因美国出口管制要求,曾短暂下线所有用户访问。
企业合作
2026-06-22
OpenAI 签下三星 12 万员工大单
OpenAI 签下史上最大企业订单——三星 12 万员工全面接入 ChatGPT 企业版与 Codex。Codex 周活跃用户突破 500 万,其中非开发者增速是程序员的 3 倍。三星同步启动「AI 大转型」:总裁层集训、全员 AI 教育、新设 AI 专职组织。
技术突破
2026-06-15
GitHub Agent HQ 集成 Claude 与 Codex 多代理编码
GitHub 在 Agent HQ 中加入 Anthropic Claude 和 OpenAI Codex,Copilot 用户可实现多代理编码工作流。多个 AI Agent 可协同完成复杂开发任务,标志着 AI 编码从单工具辅助进入多 Agent 协作时代。
来源:The Verge
行业动态
2026-06-23
AI 芯片股重挫,万亿资本开支遭遇回报拷问
纳指重挫 2.33%,英伟达跌 3.50%,AMD 大跌 7.52%。核心逻辑:AI 万亿资本开支何时兑现回报。当华尔街开始追问「这些投入什么时候产生实质性利润」,市场情绪天平随之倾斜。OpenAI 与 Anthropic 双双冲刺 IPO,AI 行业即将公开财务底牌。
数据隐忧
2026-06-20
科学家用 AI 训练 AI,数据质量成新灰犀牛
《新科学家》调查报道:受雇于 Scale AI、Outlier 等数据标注平台的工作人员,正在用 ChatGPT 完成「提供高质量人类数据」的任务。如果「人类标注」实际由 AI 生成,模型学到的可能是一代代自我循环的「二手知识」,数据溯源和标注质量监管成为产业核心课题。