SlimPajama — LLM 预训练 Dataset

A heavily deduplicated and cleaned version of RedPajama. It removes low-quality and repetitive data to improve training efficiency.

Dataset Details

ProviderCerebras
Category预训练
Size627B Tokens
LicenseApache 2.0
Downloads150k
TagsEnglish, Deduplicated, CommonCrawl
from datasets import load_dataset
ds = load_dataset("cerebras/SlimPajama-627B")

相关数据集

常见问题

SlimPajama 可以商用吗?
可以——SlimPajama 采用 Apache 2.0 宽松许可证,允许商业使用,包括训练用于产品的模型。发布前请查看数据集卡片中的署名要求。
SlimPajama 有多少数据?需要全部使用吗?
SlimPajama 包含 627B Tokens。通常不需要全部:风格和格式微调只需几百到几千条样本——先加载切片(如 split="train[:1000]"),质量到达瓶颈时再扩大规模。
SlimPajama 最适合做什么?
Efficient English pretraining on a heavily deduplicated corpus。它属于数据集中心的「预训练」板块,那里有替代和互补的数据集。

← 全部数据集 | Fine-Tuning Guide