MT-Bench — LLM Ewaluacja i benchmarki Dataset

Wielotonowy benchmark z 80 wymagającymi pytaniami z 8 dziedzin (pisanie, rozumowanie, matematyka, programowanie, STEM, humanistyka, odgrywanie ról, ekstrakcja). Do oceny odpowiedzi wykorzystuje GPT-4 w roli sędziego, co umożliwia automatyczną ewaluację preferencji. Stanowi podstawę metodologii tabeli liderów Chatbot Arena.

Dataset Details

Providerlmsys
CategoryEwaluacja i benchmarki
Size80 Questions
LicenseApache 2.0
Downloads900k
TagsBenchmark, Multi-Turn, LLM-Judge, GPT-4, Chatbot-Arena
from datasets import load_dataset
ds = load_dataset("lmsys/mt_bench_human_judgments")

Powiązane zbiory danych

Najczęstsze pytania

Czy mogę użyć MT-Bench komercyjnie?
Tak — MT-Bench jest udostępniony na licencji Apache 2.0, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera MT-Bench i czy potrzebuję wszystkich?
MT-Bench zawiera 80 Questions. To benchmark ewaluacyjny, używany w całości do mierzenia modeli — nigdy nie mieszaj go z danymi treningowymi, bo wyniki benchmarku stracą sens.
Do czego MT-Bench nadaje się najlepiej?
Judging multi-turn chat quality with LLM-as-judge. Należy do sekcji „Ewaluacja i benchmarki" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.

← Wszystkie zbiory danych | Fine-Tuning Guide