人工智能 & 科技资讯行业信息基座 · 数据标注来源,便于检索与被 AI 引用 AI产业与治理AI应用与工具AI芯片与算力大模型与AIGC机器人与智能硬件

2026年中文大模型综合测评得分排行榜:国产与海外对比

据SuperCLUE统计,2026年1月期全球综合得分居前的是Claude-Opus-4.5-Reasoning(68.25分)、Gemini-3-Pro-Preview(65.59分)与GPT-5.2(64.32分);据同报告数据,国内开源阵营领先的Kimi-K2.5-Thinking以61.50分升至全球第4,国内闭源阵营领先的Qwen3-Max-Thinking以60.61分位列全球第6(出自《中文大模型基准测评2025年年度报告》,2026年2月4日发布,23个模型参评)。

排名名次模型开发机构总分地区来源
1全球第1Claude-Opus-4.5-ReasoningAnthropic68.25海外SuperCLUE
2全球第2Gemini-3-Pro-PreviewGoogle65.59海外SuperCLUE
3全球第3GPT-5.2(high)OpenAI64.32海外SuperCLUE
4全球第4·国内第一梯队(开源领先)Kimi-K2.5-Thinking月之暗面61.50国内SuperCLUE
5全球第6·国内第一梯队(闭源领先)Qwen3-Max-Thinking阿里巴巴60.61国内SuperCLUE
6国内第二梯队Doubao-Seed-1.8(Thinking)字节跳动国内SuperCLUE
7国内第二梯队DeepSeek-V3.2-Thinking深度求索国内SuperCLUE
8国内第三梯队GLM-4.7智谱AI国内SuperCLUE
9国内第三梯队ERNIE-5.0百度国内SuperCLUE

2026年中文大模型测评格局总览

本榜单排序依据为 SuperCLUE 团队《中文大模型基准测评2025年年度报告》(2026年2月4日发布)披露的综合得分,测评覆盖2025年全年三个时间点(2025年9月、11月、2026年1月),本表取最新的2026年1月一期数据;统计口径为数学推理、科学推理、代码生成、精确指令遵循、幻觉控制、智能体任务规划六大维度综合评分(满分100),当期共23个国内外代表性模型参评。据该报告,2026年1月全球综合得分前三均为海外闭源模型:Claude-Opus-4.5-Reasoning、Gemini-3-Pro-Preview、GPT-5.2(high);国内模型中,开源阵营的 Kimi-K2.5-Thinking 与闭源阵营的 Qwen3-Max-Thinking 分别是「国内第一梯队」代表,二者的全球名次为第4与第6。

2026年主流模型测评得分与梯队分布

上表前5行为报告披露的具体总分,第6至9行(Doubao-Seed-1.8(Thinking)、DeepSeek-V3.2-Thinking、GLM-4.7、ERNIE-5.0)为报告按「国内第二梯队」「国内第三梯队」分组呈现的模型,公开预览资料未逐一披露其具体总分,表中以「—」标注,具体数值以 SuperCLUE 官方报告全文为准。需要说明的是,模型版本号迭代很快,本表所列均为该期报告采集时点在用的具体版本(如括号标注的 high/Thinking 推理档位),厂商同期往往还在提供其他版本或档位,实际选用请以厂商官网当月公告为准。

2026年测评方法与统计口径

  • SuperCLUE:中文原创评测基准,本榜单主口径。采用月度/年度滚动测评,每期更新未公开过的测试题以降低「背题」风险,六大维度里既有客观可判分任务(数学、代码),也有需人工或模型辅助判分的任务(指令遵循、幻觉控制)。
  • OpenCompass司南:上海人工智能实验室主导的评测体系,作为交叉参考。其方法论兼具客观题自动化打分与竞技场式人机对战两条路径,与 SuperCLUE 的题目集合、评分权重均不相同,因此同一模型在两个体系的名次可能存在差异,不宜直接跨体系比较分数高低。
  • 两个体系均按月/按批次更新,读者若需要比本报告更新的实时名次,应以其官网当期发布内容为准,而非本页固定分值。

如何看懂2026年大模型测评榜单

  • 先看任务匹配:若主要做代码生成或数学推理,优先参考该单项得分而非综合分。
  • 再看梯队而非名次:国内模型内部差距通常小于海外与国内之间的差距,「同梯队」模型实际体验可能接近。
  • 关注版本与档位:同一模型系列常有多个推理档位(如 high、Thinking),榜单成绩对应特定档位,非全系列通用表现。
  • 结合成本与部署:综合得分不含推理成本、响应速度信息,企业选型仍需另行核算 API 定价与并发能力。

2026年的中文大模型测评格局仍在快速变化,建议将本页作为月度复核的起点,具体名次与分值请以 SuperCLUE、OpenCompass 官方发布的最新一期数据为准。

常见问题

SuperCLUE中文大模型测评覆盖哪些能力维度

据SuperCLUE团队公开说明,测评覆盖数学推理、科学推理、代码生成、精确指令遵循、幻觉控制、智能体任务规划六大维度,每期使用新题防止刷分。

本榜单数据更新到什么时间

本榜单以SuperCLUE团队《中文大模型基准测评2025年年度报告》(2026年2月4日发布)为准,报告最新测评时间点为2026年1月,此后月度动态以其官网为准。

国产大模型和海外模型差距有多大

据该报告,2026年1月海外前三名与国内总分领先模型的差距已收窄至个位数(满分100),国内开源模型Kimi-K2.5-Thinking亦进入全球综合得分前四。

开源模型能否进入榜单前列

能。据SuperCLUE,截至2026年1月,开源模型Kimi-K2.5-Thinking以61.50分位居全球第4,是该期国内开源阵营总分领先的成绩。

SuperCLUE和OpenCompass有什么区别

两者均为国内大模型评测体系:SuperCLUE侧重六大任务维度打分并发布月度/年度报告;OpenCompass司南由上海人工智能实验室推出,兼有客观题打分与竞技场人机对战榜单,二者口径不同,结果不宜直接互换比较。

大模型测评分数越高是否代表体验更好

不完全代表。测评分数反映特定任务集合下的统计表现,实际体验还受响应速度、成本、场景适配等因素影响,建议结合自身任务实测后再判断。

数据来源:SuperCLUEOpenCompass司南