The Stack v2 — LLM Kod Dataset
The largest open code dataset ever assembled: 900 billion tokens across 600+ programming languages sourced from GitHub, with an opt-out mechanism for developers. Powers StarCoder2 and is the go-to pretraining corpus for code LLMs. Includes permissively-licensed repos with deduplication and near-deduplication passes.
Dataset Details
| Provider | BigCode |
| Category | Kod |
| Size | 900B Tokens |
| License | Various (per-file) |
| Downloads | 350k |
| Tags | Source-Code, 600+ Languages, GitHub, BigCode |
from datasets import load_dataset
ds = load_dataset("bigcode/the-stack-v2")
Powiązane zbiory danych
Najczęstsze pytania
Czy mogę użyć The Stack v2 komercyjnie?
Najpierw sprawdź warunki — The Stack v2 jest dystrybuowany na licencji „Various (per-file)" (niestandardowej lub mieszanej). Przeczytaj uważnie kartę zbioru przed użyciem w produkcie komercyjnym.
Ile danych zawiera The Stack v2 i czy potrzebuję wszystkich?
The Stack v2 zawiera 900B Tokens. Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego The Stack v2 nadaje się najlepiej?
Pretraining code models across 600+ programming languages. Należy do sekcji „Kod" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.
← Wszystkie zbiory danych | Fine-Tuning Guide