2294 rzeczywiste zgłoszenia z GitHuba wraz ze zweryfikowanymi łatkami, pochodzące z 12 popularnych repozytoriów pythonowych. Wzorcowy benchmark do oceny LLM-ów w praktycznych zadaniach inżynierii oprogramowania — pisania realnego kodu naprawiającego prawdziwe błędy w produkcyjnych bazach kodu.
Tak — SWE-bench jest udostępniony na licencji MIT, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera SWE-bench i czy potrzebuję wszystkich?
SWE-bench zawiera 2,294 Tasks. To benchmark ewaluacyjny, używany w całości do mierzenia modeli — nigdy nie mieszaj go z danymi treningowymi, bo wyniki benchmarku stracą sens.
Do czego SWE-bench nadaje się najlepiej?
Benchmarking real-world software engineering - never train on it. Należy do sekcji „Ewaluacja i benchmarki" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.