The Stack v2 — LLM Kod Dataset

The largest open code dataset ever assembled: 900 billion tokens across 600+ programming languages sourced from GitHub, with an opt-out mechanism for developers. Powers StarCoder2 and is the go-to pretraining corpus for code LLMs. Includes permissively-licensed repos with deduplication and near-deduplication passes.

Dataset Details

ProviderBigCode
CategoryKod
Size900B Tokens
LicenseVarious (per-file)
Downloads350k
TagsSource-Code, 600+ Languages, GitHub, BigCode
from datasets import load_dataset
ds = load_dataset("bigcode/the-stack-v2")

Powiązane zbiory danych

Najczęstsze pytania

Czy mogę użyć The Stack v2 komercyjnie?
Najpierw sprawdź warunki — The Stack v2 jest dystrybuowany na licencji „Various (per-file)" (niestandardowej lub mieszanej). Przeczytaj uważnie kartę zbioru przed użyciem w produkcie komercyjnym.
Ile danych zawiera The Stack v2 i czy potrzebuję wszystkich?
The Stack v2 zawiera 900B Tokens. Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego The Stack v2 nadaje się najlepiej?
Pretraining code models across 600+ programming languages. Należy do sekcji „Kod" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.

← Wszystkie zbiory danych | Fine-Tuning Guide