MMLU (Massive Multitask Language Understanding) — LLM 评估与基准测试 Dataset

The gold-standard multi-subject benchmark: 16k multiple-choice questions spanning 57 subjects from STEM and humanities to law, medicine, and social sciences. Every major LLM is evaluated on MMLU. A model scoring >80% is considered strong; GPT-4 scores ~87%, Llama 3 70B ~82%.

Dataset Details

Providercais
Category评估与基准测试
Size16k Questions
LicenseMIT
Downloads12M
TagsBenchmark, Multiple-Choice, 57-Subjects, STEM, Reasoning
from datasets import load_dataset
ds = load_dataset("cais/mmlu")

相关数据集

常见问题

MMLU (Massive Multitask Language Understanding) 可以商用吗?
可以——MMLU (Massive Multitask Language Understanding) 采用 MIT 宽松许可证,允许商业使用,包括训练用于产品的模型。发布前请查看数据集卡片中的署名要求。
MMLU (Massive Multitask Language Understanding) 有多少数据?需要全部使用吗?
MMLU (Massive Multitask Language Understanding) 包含 16k Questions。它是评估基准,用于完整地衡量模型——切勿混入训练数据,否则基准分数将失去意义。
MMLU (Massive Multitask Language Understanding) 最适合做什么?
Benchmarking general knowledge - never train on it。它属于数据集中心的「评估与基准测试」板块,那里有替代和互补的数据集。

← 全部数据集 | Fine-Tuning Guide