52个学科全面覆盖
C-Eval评测基准涵盖人文、社科、理工、医学、法律等52个学科领域,构建完整的中文知识评测体系,全面检验大模型的多学科知识掌握能力。
从学科覆盖到难度分级,C-Eval为中文大模型提供全面、权威、标准化的能力评估方案
C-Eval评测基准涵盖人文、社科、理工、医学、法律等52个学科领域,构建完整的中文知识评测体系,全面检验大模型的多学科知识掌握能力。
从初中到高中、大学再到专业考试,C-Eval设置四个难度级别,精准评估大模型在不同知识深度下的中文理解与逻辑推理表现。
针对中文语言特点设计的13948道高质量多选题,覆盖中文特有的语言表达、文化背景与知识体系,准确评测模型的中文原生能力。
提供实时更新的C-Eval榜单,展示国内外主流大模型的评测排名,为模型选型与技术研发提供客观、公正、权威的参考依据。
建立严格的模型评估流程与标准化测试指标,支持少样本学习、零样本学习等多种评测设置,确保C-Eval评测结果的科学性与可复现性。
提供完整的开源评测工具、数据集与提交平台,支持开发者快速进行大模型能力测试,促进中文大模型评测基准的持续完善与社区共建。
用数据定义中文大模型评测标准
52
个学科领域
13948
道评测题目
4
个难度级别
24/7
榜单更新
加入C-Eval中文大模型评测体系,获取权威的模型能力评估报告与CEval榜单排名
立即参与评测