

AGI-Eval(agi-eval.cn)是上海交通大学、同济大学、华东师范大学与DataWhale等高校和机构合作发布的大模型评测社区。该平台以“评测助力,让AI成为人类更好的伙伴”为使命,专门设计用于评估基础模型在人类认知和问题解决相关任务中的一般能力。平台整合公开学术评测集、官方自建评测集及用户自建评测集,提供模型能力得分排名榜单、人机评测比赛以及Data Studio数据协作工具。其评测维度涵盖综合能力与各专项能力,旨在通过科学的评测体系帮助研究者和开发者理解模型在现实场景中的适用性与有效性。
功能亮点
- 大模型榜单:基于通用评测方案提供业内大语言模型能力得分排名,涵盖综合评测和各能力项评测,数据透明并定期更新。
- 人机评测比赛:深入模型评测世界,通过协作模式构建人机协同评测方案,辅助技术发展。
- 公开学术评测集:整合行业公开学术评测数据,支持用户直接下载使用,便于学术对比。
- 官方自建评测集:提供覆盖多领域的官方评测数据,用于标准化模型能力验证。
- 用户自建评测集:平台支持上传个人评测集,共建开源社区,自动与人工评测方式相结合。
- Data Studio数据工具:依托3W众包用户平台回收高质量真实数据,支持单条、扩写、Arena等多种数据收集方式,搭配机审与人审多重审核机制。
快速上手
使用AGI-Eval进行模型评测或数据协作,只需几个简单步骤即可开始。
- 访问官网并注册账号:打开agi-eval.cn,根据提示完成账号创建,即可进入平台主页。
- 选择评测集或工具:在评测集模块中浏览或下载所需数据集,或进入Data Studio开始数据收集与分析。
- 查看榜单或提交评测:参考大模型榜单比较模型表现,或参与人机评测比赛提交自定义任务。
适合谁用
AGI-Eval的使用者主要包括AI领域的研究人员、NLP算法开发者、大模型评估从业者及高校师生。其典型场景包括:衡量多个主流大模型在特定任务上的能力差异,验证新开发模型的文本生成质量,或在科研实验中作为评估新方法性能的基准工具。同时,对数据标注和众包感兴趣的团队可利用Data Studio回收高多样性的真实数据。
综合小结
综上,AGI-Eval作为一个由多所高校和机构联合维护的评测平台,其特点在于将公开学术数据与官方自建数据结合,并引入用户自建集以增强社区参与度。平台提供透明的模型榜单和详尽的数据收集工具,适合需要系统性评估或灵活构建评测方案的用户。需要注意的是,部分功能如私有数据集托管、人机评测比赛的具体规则,需在平台内进一步确认。
| 平台名称 | 核心功能 | 数据特点 | 适用场景 |
|---|---|---|---|
| AGI-Eval | 榜单、人机评测、数据工具 | 学术与自建结合,支持用户上传 | 科研评估、模型对比 |
| SuperCLUE | 中文大模型能力测试 | 聚焦中文语境,多维度测评 | 中文模型基准测试 |
| C-Eval | 中文知识推理评测 | 覆盖多学科题目 | 模型学科能力测试 |
内容由变脸导航网友情收录,若发现链接打不开或信息有误,请通过网站反馈渠道告知我们。
数据统计
数据评估
本站变脸导航网提供的AGI-Eval | AI大模型评测社区都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由变脸导航网实际控制,在2026年9月2日 上午2:53收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,变脸导航网不承担任何责任。
为这篇文章评分
相关导航


咖图AI:AI图像设计就用它

OpenCompass–大模型开放评测

AI图片生成 妙话AI

PromptFolder | AI提示词生成管理工具

Open LLM Leaderboard | 开源大模型排行

Atoms–AI团队自动构建业务

