MT-Bench — LLM 评估与基准测试 Dataset

Multi-turn benchmark with 80 challenging questions across 8 domains (writing, reasoning, math, coding, STEM, humanities, roleplay, extraction). Uses GPT-4-as-judge to score responses, enabling automated preference evaluation. Powers the Chatbot Arena leaderboard methodology.

Dataset Details

Providerlmsys
Category评估与基准测试
Size80 Questions
LicenseApache 2.0
Downloads900k
TagsBenchmark, Multi-Turn, LLM-Judge, GPT-4, Chatbot-Arena
from datasets import load_dataset
ds = load_dataset("lmsys/mt_bench_human_judgments")

相关数据集

常见问题

MT-Bench 可以商用吗?
可以——MT-Bench 采用 Apache 2.0 宽松许可证,允许商业使用,包括训练用于产品的模型。发布前请查看数据集卡片中的署名要求。
MT-Bench 有多少数据?需要全部使用吗?
MT-Bench 包含 80 Questions。它是评估基准,用于完整地衡量模型——切勿混入训练数据,否则基准分数将失去意义。
MT-Bench 最适合做什么?
Judging multi-turn chat quality with LLM-as-judge。它属于数据集中心的「评估与基准测试」板块,那里有替代和互补的数据集。

← 全部数据集 | Fine-Tuning Guide