HumanEval — LLM Ewaluacja i benchmarki Dataset
OpenAI's hand-crafted Python coding benchmark: 164 programming problems with function signatures, docstrings, and unit tests. Models are evaluated by Pass@k — the probability of generating at least one correct solution in k tries. The definitive benchmark for code generation ability.
Dataset Details
| Provider | OpenAI |
| Category | Ewaluacja i benchmarki |
| Size | 164 Problems |
| License | MIT |
| Downloads | 5M |
| Tags | Benchmark, Python, Code-Correctness, Unit-Tests |
from datasets import load_dataset
ds = load_dataset("openai/openai_humaneval")
Powiązane zbiory danych
Najczęstsze pytania
Czy mogę użyć HumanEval komercyjnie?
Tak — HumanEval jest udostępniony na licencji MIT, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera HumanEval i czy potrzebuję wszystkich?
HumanEval zawiera 164 Problems. To benchmark ewaluacyjny, używany w całości do mierzenia modeli — nigdy nie mieszaj go z danymi treningowymi, bo wyniki benchmarku stracą sens.
Do czego HumanEval nadaje się najlepiej?
Benchmarking Python code generation - never train on it. Należy do sekcji „Ewaluacja i benchmarki" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.
← Wszystkie zbiory danych | Fine-Tuning Guide