C-Eval中文大模型评测基准
权威中文AI能力评估套件

涵盖52个学科、13948道多选题,从初中到大学专业水平,全面评估大语言模型的中文理解与推理能力。 C-Eval榜单为中文大模型研发提供权威的能力评测标准。

C-Eval评测体系核心能力

从学科覆盖到难度分级,C-Eval为中文大模型提供全面、权威、标准化的能力评估方案

52个学科全面覆盖

C-Eval评测基准涵盖人文、社科、理工、医学、法律等52个学科领域,构建完整的中文知识评测体系,全面检验大模型的多学科知识掌握能力。

四阶难度分级评测

从初中到高中、大学再到专业考试,C-Eval设置四个难度级别,精准评估大模型在不同知识深度下的中文理解与逻辑推理表现。

中文语境深度优化

针对中文语言特点设计的13948道高质量多选题,覆盖中文特有的语言表达、文化背景与知识体系,准确评测模型的中文原生能力。

权威CEval榜单排名

提供实时更新的C-Eval榜单,展示国内外主流大模型的评测排名,为模型选型与技术研发提供客观、公正、权威的参考依据。

标准化模型评估

建立严格的模型评估流程与标准化测试指标,支持少样本学习、零样本学习等多种评测设置,确保C-Eval评测结果的科学性与可复现性。

开源评测工具链

提供完整的开源评测工具、数据集与提交平台,支持开发者快速进行大模型能力测试,促进中文大模型评测基准的持续完善与社区共建。

C-Eval评测数据规模

用数据定义中文大模型评测标准

52

个学科领域

13948

道评测题目

4

个难度级别

24/7

榜单更新

准备好评测您的大模型性能了吗?

加入C-Eval中文大模型评测体系,获取权威的模型能力评估报告与CEval榜单排名

立即参与评测