FineWeb 2 — LLM Pretrening Dataset

Metodologia filtrowania jakości z FineWeb rozszerzona na ponad 1000 języków (1868 par język–pismo) — około 8 TB skompresowanego, zdeduplikowanego tekstu z sieci (~3 biliony słów) ze 96 migawek CommonCrawl. Pipeline'y dla poszczególnych języków zostały dostrojone i zwalidowane tak, by dane po filtracji wypadały lepiej od niefiltrowanych w treningach ablacyjnych. Domyślny wielojęzyczny korpus pretreningowy dla otwartych modeli.

Dataset Details

ProviderHuggingFaceFW
CategoryPretrening
Size8TB Compressed
LicenseODC-By 1.0
Downloadsn/a
TagsMultilingual, CommonCrawl, Deduplicated, 1000+ Languages
from datasets import load_dataset
ds = load_dataset("HuggingFaceFW/fineweb-2")

Powiązane zbiory danych

Najczęstsze pytania

Czy mogę użyć FineWeb 2 komercyjnie?
Tak — FineWeb 2 jest udostępniony na licencji ODC-By 1.0, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera FineWeb 2 i czy potrzebuję wszystkich?
FineWeb 2 zawiera 8TB Compressed. Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego FineWeb 2 nadaje się najlepiej?
Pretraining or continued pretraining in languages other than English. Należy do sekcji „Pretrening" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.

← Wszystkie zbiory danych | Fine-Tuning Guide