中文测评数据集
提供CLUE及相关中文任务数据集,并支持通过数据集搜索入口查找资源。
CLUE中文语言理解基准测评
中文语言理解与大模型测评基准CLUE致力于服务中文语言理解、任务研究与产业应用,通过整理和发布中文任务、标准化测评及相关基础设施,推动中文自然语言处理发展。内容体系涵盖代表性数据集、基线模型、语料库、论文、工具包和排行榜。
从基础任务到行业能力测评,提供公开的测评基准、数据资源、排行榜和研究资料。
提供CLUE及相关中文任务数据集,并支持通过数据集搜索入口查找资源。
覆盖中文语言理解、推理、代码、数学、智能体、安全、多模态和行业场景等测评方向。
提供总排行榜、分类榜、阅读理解榜、语义匹配榜、零样本学习榜和小模型榜等公开榜单。
持续发布中文大模型年度、季度及专项能力测评报告,记录不同任务和模型的测评结果。
提供CLUE项目地址、KgCLUE项目、论文及相关工具和研究资料入口。
汇集中文大模型、智能体、多模态与行业场景的最新测评动态。
网站更新大模型竞技场与大模型分析功能。
发布《中文大模型基准测评2025年9月报告》。
发布面向世界模型的中文测评方案。
提供数据集搜索、项目代码、论文、常见问题和各类测评报告入口。