Ręcznie opracowany przez OpenAI benchmark programowania w Pythonie: 164 zadania z sygnaturami funkcji, docstringami i testami jednostkowymi. Modele ocenia się miarą Pass@k — prawdopodobieństwem wygenerowania co najmniej jednego poprawnego rozwiązania w k próbach. Definitywny benchmark zdolności generowania kodu.
Dataset Details
Provider
OpenAI
Category
Ewaluacja i benchmarki
Size
164 Problems
License
MIT
Downloads
5M
Tags
Benchmark, Python, Code-Correctness, Unit-Tests
from datasets import load_dataset
ds = load_dataset("openai/openai_humaneval")
Powiązane zbiory danych
SWE-bench — Benchmarking real-world software engineering - never train on it
MT-Bench — Judging multi-turn chat quality with LLM-as-judge
Najczęstsze pytania
Czy mogę użyć HumanEval komercyjnie?
Tak — HumanEval jest udostępniony na licencji MIT, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera HumanEval i czy potrzebuję wszystkich?
HumanEval zawiera 164 Problems. To benchmark ewaluacyjny, używany w całości do mierzenia modeli — nigdy nie mieszaj go z danymi treningowymi, bo wyniki benchmarku stracą sens.
Do czego HumanEval nadaje się najlepiej?
Benchmarking Python code generation - never train on it. Należy do sekcji „Ewaluacja i benchmarki" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.