LLM 训练数据集中心

作者: Jakub Rusinowski · 最后更新: 2026年7月21日

47 个精选开放数据集,用于 LLM 微调与训练——指令微调、推理轨迹、函数调用、偏好数据等。每个条目都包含准确的许可证、规模和 load_dataset() 代码片段。

从这里开始: 一小时微调你的第一个 LLM · 微调参考指南(SFT、LoRA 与 DPO) · 检测你的 GPU 能否微调

对比全部 47 个数据集

点击列标题排序。点击数据集名称查看完整卡片,含许可证详情、样例数据和代码。

数据集类别规模许可证最适合
FineWeb预训练15 TBODC-By 1.0Pretraining or continued pretraining on high-quality English web text
Cosmopedia预训练25B TokensApache 2.0Synthetic-textbook pretraining for small models (the SmolLM recipe)
Python-Edu指令 / SFT400 GBMITContinued pretraining for Python code understanding
OpenHermes 2.5指令 / SFT1M RowsApache 2.0The default general-purpose SFT mix for 7B-13B fine-tunes
UltraFeedback偏好(RLHF / DPO)64k RowsMITThe default DPO preference set to run after any SFT pass
LLaVA Instruct视觉158k SamplesCC-BY-NC 4.0Adding image understanding to an open LLM (the LLaVA recipe)
SlimPajama预训练627B TokensApache 2.0Efficient English pretraining on a heavily deduplicated corpus
Databricks Dolly 15k指令 / SFT15k RowsCC-BY-SA 3.0Commercially safe instruction tuning - fully human-written
Stanford Alpaca指令 / SFT52k RowsCC-BY-NC 4.0Learning the classic instruction format; research only (CC BY-NC)
ShareGPT 52K指令 / SFT52k ConversationsCC-BY-NC 4.0Teaching natural multi-turn dialogue (non-commercial)
WizardLM Evol Instruct 70k指令 / SFT70k RowsApache 2.0Boosting complex-instruction handling with Evol-Instruct data
LIMA: Less Is More for Alignment指令 / SFT1k RowsCC-BY-NC-SA 4.0Style and format alignment with a tiny curated set - quality over quantity
Smoltalk指令 / SFT1M RowsApache 2.0General SFT for small models (the SmolLM2 recipe)
The Stack v2代码900B TokensVarious (per-file)Pretraining code models across 600+ programming languages
Magicoder-OSS-Instruct-75K代码75k RowsMITCode instruction tuning grounded in real open-source snippets
CodeFeedback-Filtered-Instruction代码74k RowsApache 2.0Training coding models that respond to execution feedback
MMLU (Massive Multitask Language Understanding)评估与基准测试16k QuestionsMITBenchmarking general knowledge - never train on it
HumanEval评估与基准测试164 ProblemsMITBenchmarking Python code generation - never train on it
Winogrande评估与基准测试44k ProblemsApache 2.0Benchmarking commonsense reasoning
MT-Bench评估与基准测试80 QuestionsApache 2.0Judging multi-turn chat quality with LLM-as-judge
Anthropic HH-RLHF偏好(RLHF / DPO)170k PairsMITSafety-focused preference training (helpfulness and harmlessness)
DPO Mix 7K偏好(RLHF / DPO)7k PairsApache 2.0A small, balanced DPO starter set
MetaMathQA推理395K PairsMITBoosting GSM8K/MATH-style math skills in 7B models
Orca Math Word Problems推理200K ProblemsMITGrade-school math word problems for small models
Open-Platypus指令 / SFT25K QuestionsCC BY NC 4.0A quick STEM and logic boost on a small budget (non-commercial)
OpenOrca指令 / SFT4.2M SamplesMITExplanation-style SFT at scale (the Orca recipe)
Infinity-Instruct指令 / SFT7.5M InstructionsApache 2.0Large-scale general SFT when you need millions of samples
Magpie-Align指令 / SFT3M PairsApache 2.0Fresh synthetic SFT data without seed data or scraping
HelpSteer2偏好(RLHF / DPO)21K SamplesCC BY 4.0Training reward models with fine-grained quality ratings
Nectar偏好(RLHF / DPO)183K PromptsApache 2.0Reward-model training with 7-way ranked responses
Tulu 3 SFT Mix指令 / SFT939K SamplesODC-BYReproducing a state-of-the-art fully open post-training recipe
SWE-bench评估与基准测试2,294 TasksMITBenchmarking real-world software engineering - never train on it
MATH (Hendrycks)评估与基准测试12,500 ProblemsMITBenchmarking competition math ability
NuminaMath推理860K ProblemsApache 2.0Chain-of-thought math fine-tuning up to olympiad level
WebInstruct指令 / SFT220M PairsCC BY-SA 4.0Web-scale instruction mining for domain skills
LMSYS-Chat-1M指令 / SFT1M ConversationsCC BY-NC 4.0Studying real-world usage patterns across 25 models (non-commercial)
WildChat-1M指令 / SFT1M ChatsAI2 ImpACTTraining on real user conversations; safety and robustness research
No Robots指令 / SFT10k RowsCC BY-NC 4.0Your first fine-tune — small, clean, 100% human-written SFT data (non-commercial license)
SmolTalk 2指令 / SFT3 Subsets (Mid 4.8M Rows)Apache 2.0Reproducing a complete modern post-training pipeline (mid-training → SFT → preference) for small models
OpenThoughts3-1.2M推理1.2M RowsApache 2.0Distilling strong math/code/science reasoning into 7B–32B models
s1K-1.1推理1k RowsApache 2.0Cheap, fast reasoning fine-tunes — 1k samples means minutes of training, not days
Glaive Function Calling v2智能体与函数调用113k RowsApache 2.0Teaching a model basic function-calling: when to call, what JSON to emit, how to use results
xLAM Function Calling 60k智能体与函数调用60k RowsCC BY 4.0High-precision tool calling — every sample was verified by actually executing the API call
Hermes Function Calling v1智能体与函数调用12k SamplesApache 2.0Models that must return valid structured JSON — for agents, extraction, and tool pipelines
FineWeb 2预训练8TB CompressedODC-By 1.0Pretraining or continued pretraining in languages other than English
Aya Dataset多语言204k RowsApache 2.0Instruction-tuning in non-English languages with real human-written data
OpenCodeReasoning推理735k SamplesCC BY 4.0Fine-tuning coding models that show their reasoning before writing the solution

如何选择数据集

让数据集匹配任务,而不是反过来。想让模型遵循指令或学会你的语气? 使用指令/SFT 数据集——从 No Robots(人工编写)或 Dolly 15k(可商用)开始。想改进模型对答案的排序和表达? 你需要 DPO 偏好数据集:UltraFeedback 是默认选择,HelpSteer2 提供细粒度质量评分。

要训练数学或编程「思考」模型? 在推理轨迹上微调:OpenThoughts3 覆盖面广,NuminaMath 专注数学,OpenCodeReasoning 专注代码。要构建调用 API 的智能体? 函数调用是一项独立技能——Glaive v2 打基础,xLAM 追求精度。非英语用户? 指令数据用 Aya,继续预训练用 FineWeb 2

两条最省时间的规则:训练前先查许可证(CC BY-NC 数据集不能用于商业产品);起步规模比你想的更小——1,000 个高质量样本胜过 100,000 个嘈杂样本。拿不准时,跟着一小时微调你的第一个 LLM 的完整流程走,它用的正是这些数据集。

指令 / SFT (18)

指令数据集(SFT 数据集)是「提示–回复」对,用于监督微调——教会基础模型遵循指令、按你的格式回答或采用特定语气的第一步,也是最重要的一步。规模从 1k 条人工精选样本(LIMA)到数百万条合成混合数据(Infinity-Instruct)不等。

推理 (6)

推理数据集保存完整的思维链——得出答案的逐步「思考」过程,而不仅是最终回复。在从强推理模型(DeepSeek R1、QwQ)蒸馏出的轨迹上微调,是小型本地模型学会在回答前推演数学、代码和科学问题的方法。

智能体与函数调用 (3)

智能体数据集教模型调用函数和工具:读取 JSON schema、判断何时需要调用、输出有效参数并使用返回结果。这是本地 AI 智能体的核心技能——必须专门训练,通用对话数据无法产生可靠的工具调用。

偏好(RLHF / DPO) (5)

偏好数据集包含一个提示及经过排序或评分的回复——被选中的答案和被拒绝的答案。它们驱动 RLHF、奖励模型和 DPO:在 SFT 之后教模型分辨两个看似合理的答案中人类真正偏好哪一个。应在指令微调之后使用,而不是替代它。

预训练 (4)

预训练语料是海量原始文本集合——数万亿 token 的过滤网页文本、教科书和代码——用于从零训练基础模型,或在新语言、新领域上继续预训练。消费级 GPU 无法在这些数据上微调,但它们决定了开源基础模型的知识边界。

多语言 (1)

多语言数据集把指令遵循和预训练质量带到英语之外——从 65 种语言的人工标注指令对(Aya)到 1,000 多种语言的质量过滤网页文本(FineWeb 2)。如果你的用户不用英语提问,这些必不可少。

代码 (3)

代码数据集涵盖从海量宽松许可源码语料(The Stack v2)到基于真实开源代码合成的指令对。用它们让模型专精你的技术栈、提升补全质量,或训练本地编程助手。

视觉 (1)

视觉(多模态)数据集将图像与文本指令配对,让语言模型学会「看」。LLaVA 风格的指令集是为开源 LLM 添加图像理解能力的标准配方。

评估与基准测试 (6)

评估数据集是基准测试——MMLU、HumanEval、SWE-bench——用于衡量模型,而不是训练模型。切勿混入训练数据:基准污染会虚增分数,也是严谨评审首先检查的问题。

常见问题

微调聊天机器人应该用什么数据集?
从指令/SFT 数据集开始。No Robots(1 万条人工编写样本)是最干净的入门数据集,Databricks Dolly 15k 是可商用的替代选择。要改善多轮对话行为可加入 UltraChat 或 WildChat,然后用 UltraFeedback 等偏好数据集配合 DPO 打磨语气。
SFT 数据集和 DPO 数据集有什么区别?
SFT 数据集包含模型直接模仿学习的「提示–回复」对(监督微调)。DPO/偏好数据集包含一个提示加一个被选中和一个被拒绝的答案,模型学习偏好更好的那个。典型流程先 SFT 后 DPO——例如先用 Tulu 3 SFT,再用 UltraFeedback。
Alpaca 可以商用吗?
不可以——Stanford Alpaca 采用 CC BY-NC 4.0 非商业许可证,因为它由 OpenAI 的 text-davinci-003 生成。商业微调请改用 Databricks Dolly 15k(CC BY-SA 3.0)、Tulu 3 SFT Mix(ODC-BY)或 OpenHermes 2.5(MIT)。
微调数据集需要多大?
质量胜过数量。LIMA 证明 1,000 条精选样本就能对齐 65B 模型,s1K 用 1k 样本在推理任务上做到了同样的事。改变风格和格式通常 200–1,000 条优质样本就够;学习新领域技能则以 1 万–10 万条为目标。先小规模起步再评估。
什么是推理轨迹数据集?
推理轨迹数据集不仅保存最终答案,还保存完整思维链——每个解答之前的逐步思考。在轨迹上微调(OpenThoughts3、NuminaMath-CoT、OpenCodeReasoning)能把大模型的推理能力蒸馏进小型本地模型,让它们回答前先「思考」。
哪些数据集能配合 Unsloth 使用?
这里任何标准格式的数据集经过简单格式化都能用于 Unsloth:Alpaca 风格(instruction/output 列)、ShareGPT 风格(conversations)或 ChatML messages。常见的 Unsloth 入门数据集是 No Robots、Alpaca 和 Dolly 15k——我们的一小时微调指南演示了如何在 6GB GPU 上用 SFTTrainer 加载它们。