FineWeb — LLM Pretrening Dataset
The gold standard for English web data. Massive, cleaned, and deduplicated dataset derived from CommonCrawl. Used to train some of the best open models including Llama 3.
Dataset Details
| Provider | HuggingFaceFW |
| Category | Pretrening |
| Size | 15 TB |
| License | ODC-By 1.0 |
| Downloads | 2.5M |
| Tags | Web, English, Cleaned, CommonCrawl |
from datasets import load_dataset
ds = load_dataset("HuggingFaceFW/fineweb")
Powiązane zbiory danych
- FineWeb 2 — Pretraining or continued pretraining in languages other than English
- Cosmopedia — Synthetic-textbook pretraining for small models (the SmolLM recipe)
- SlimPajama — Efficient English pretraining on a heavily deduplicated corpus
Najczęstsze pytania
Czy mogę użyć FineWeb komercyjnie?
Tak — FineWeb jest udostępniony na licencji ODC-By 1.0, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera FineWeb i czy potrzebuję wszystkich?
FineWeb zawiera 15 TB. Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego FineWeb nadaje się najlepiej?
Pretraining or continued pretraining on high-quality English web text. Należy do sekcji „Pretrening" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.
← Wszystkie zbiory danych | Fine-Tuning Guide