FineWeb — LLM Pretrening Dataset

The gold standard for English web data. Massive, cleaned, and deduplicated dataset derived from CommonCrawl. Used to train some of the best open models including Llama 3.

Dataset Details

ProviderHuggingFaceFW
CategoryPretrening
Size15 TB
LicenseODC-By 1.0
Downloads2.5M
TagsWeb, English, Cleaned, CommonCrawl
from datasets import load_dataset
ds = load_dataset("HuggingFaceFW/fineweb")

Powiązane zbiory danych

Najczęstsze pytania

Czy mogę użyć FineWeb komercyjnie?
Tak — FineWeb jest udostępniony na licencji ODC-By 1.0, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera FineWeb i czy potrzebuję wszystkich?
FineWeb zawiera 15 TB. Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego FineWeb nadaje się najlepiej?
Pretraining or continued pretraining on high-quality English web text. Należy do sekcji „Pretrening" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.

← Wszystkie zbiory danych | Fine-Tuning Guide