44 tys. zadań z rozumowania zdroworozsądkowego inspirowanych wyzwaniem Winograd Schema. Sprawdza, czy modele potrafią rozstrzygnąć niejednoznaczność zaimków, korzystając z wiedzy o świecie. Wymaga rozumienia przyczynowości i fizycznego zdrowego rozsądku, czego sama statystyka języka nie uchwyci. Wchodzi w skład Open LLM Leaderboard.
Dataset Details
Provider
allenai
Category
Ewaluacja i benchmarki
Size
44k Problems
License
Apache 2.0
Downloads
3M
Tags
Benchmark, Commonsense-Reasoning, Winograd, NLU
from datasets import load_dataset
ds = load_dataset("allenai/winogrande")
MT-Bench — Judging multi-turn chat quality with LLM-as-judge
HumanEval — Benchmarking Python code generation - never train on it
SWE-bench — Benchmarking real-world software engineering - never train on it
Najczęstsze pytania
Czy mogę użyć Winogrande komercyjnie?
Tak — Winogrande jest udostępniony na licencji Apache 2.0, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera Winogrande i czy potrzebuję wszystkich?
Winogrande zawiera 44k Problems. To benchmark ewaluacyjny, używany w całości do mierzenia modeli — nigdy nie mieszaj go z danymi treningowymi, bo wyniki benchmarku stracą sens.
Do czego Winogrande nadaje się najlepiej?
Benchmarking commonsense reasoning. Należy do sekcji „Ewaluacja i benchmarki" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.