AI工具集
/
AI模型评测
/ MMLU
MMLU
大规模多任务语言理解基准
分类:
AI模型评测
搜索官网
MMLU是什么?
MMLU是一款AI模型评测工具,大规模多任务语言理解基准。暂未收录官网地址,可通过上方按钮搜索。想找更多同类工具,可以看看AI模型评测分类。
更多AI模型评测
MagicArena
— 字节推出的视觉生成模型对战平台
Open LLM Leaderboard
— Hugging Face推出的开源大模型排行榜单
C-Eval
— 一个全面的中文基础模型评估套件
FlagEval
— 智源研究院推出的FlagEval(天秤)大模型评测平台
SuperCLUE
— 中文通用大模型综合性测评基准
AGI-Eval
— AI大模型评测社区
OpenCompass
— 上海人工智能实验室推出的大模型开放评测体系
CMMLU
— 一个综合性的大模型中文评估基准
MMBench
— 全方位的多模态大模型能力评测体系
HELM
— 斯坦福大学推出的大模型评测体系
LMArena
— AI模型评估平台
LLMEval3
— 由复旦大学NLP实验室推出的大模型评测基准