Największy otwarty zbiór kodu, jaki kiedykolwiek zebrano: 900 miliardów tokenów w ponad 600 językach programowania pozyskanych z GitHuba, z mechanizmem rezygnacji dla deweloperów. Zasila StarCoder2 i jest podstawowym korpusem pretreningowym dla modeli kodujących. Zawiera repozytoria na permisywnych licencjach, po deduplikacji i deduplikacji przybliżonej.
Dataset Details
Provider
BigCode
Category
Kod
Size
900B Tokens
License
Various (per-file)
Downloads
350k
Tags
Source-Code, 600+ Languages, GitHub, BigCode
from datasets import load_dataset
ds = load_dataset("bigcode/the-stack-v2")
Najpierw sprawdź warunki — The Stack v2 jest dystrybuowany na licencji „Various (per-file)" (niestandardowej lub mieszanej). Przeczytaj uważnie kartę zbioru przed użyciem w produkcie komercyjnym.
Ile danych zawiera The Stack v2 i czy potrzebuję wszystkich?
The Stack v2 zawiera 900B Tokens. Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego The Stack v2 nadaje się najlepiej?
Pretraining code models across 600+ programming languages. Należy do sekcji „Kod" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.