Centrum zbiorów danych treningowych LLM

Autor: Jakub Rusinowski · Ostatnia aktualizacja: 21 lipca 2026

47 wyselekcjonowanych otwartych zbiorów danych do fine-tuningu i treningu LLM — instrukcje, ślady rozumowania, wywoływanie funkcji, dane preferencji i więcej. Każdy wpis zawiera dokładną licencję, rozmiar i fragment kodu load_dataset().

Zacznij tutaj: Zrób fine-tuning pierwszego LLM w godzinę · Kompendium fine-tuningu (SFT, LoRA i DPO) · Sprawdź, czy Twoje GPU podoła fine-tuningowi

Porównaj wszystkie 47 zbiorów danych

Kliknij nagłówek kolumny, aby posortować. Kliknij nazwę zbioru, aby zobaczyć pełną kartę z licencją, przykładowymi danymi i kodem.

Zbiór danychKategoriaRozmiarLicencjaNajlepszy do
FineWebPretrening15 TBODC-By 1.0Pretraining or continued pretraining on high-quality English web text
CosmopediaPretrening25B TokensApache 2.0Synthetic-textbook pretraining for small models (the SmolLM recipe)
Python-EduInstrukcje / SFT400 GBMITContinued pretraining for Python code understanding
OpenHermes 2.5Instrukcje / SFT1M RowsApache 2.0The default general-purpose SFT mix for 7B-13B fine-tunes
UltraFeedbackPreferencje (RLHF / DPO)64k RowsMITThe default DPO preference set to run after any SFT pass
LLaVA InstructWizja158k SamplesCC-BY-NC 4.0Adding image understanding to an open LLM (the LLaVA recipe)
SlimPajamaPretrening627B TokensApache 2.0Efficient English pretraining on a heavily deduplicated corpus
Databricks Dolly 15kInstrukcje / SFT15k RowsCC-BY-SA 3.0Commercially safe instruction tuning - fully human-written
Stanford AlpacaInstrukcje / SFT52k RowsCC-BY-NC 4.0Learning the classic instruction format; research only (CC BY-NC)
ShareGPT 52KInstrukcje / SFT52k ConversationsCC-BY-NC 4.0Teaching natural multi-turn dialogue (non-commercial)
WizardLM Evol Instruct 70kInstrukcje / SFT70k RowsApache 2.0Boosting complex-instruction handling with Evol-Instruct data
LIMA: Less Is More for AlignmentInstrukcje / SFT1k RowsCC-BY-NC-SA 4.0Style and format alignment with a tiny curated set - quality over quantity
SmoltalkInstrukcje / SFT1M RowsApache 2.0General SFT for small models (the SmolLM2 recipe)
The Stack v2Kod900B TokensVarious (per-file)Pretraining code models across 600+ programming languages
Magicoder-OSS-Instruct-75KKod75k RowsMITCode instruction tuning grounded in real open-source snippets
CodeFeedback-Filtered-InstructionKod74k RowsApache 2.0Training coding models that respond to execution feedback
MMLU (Massive Multitask Language Understanding)Ewaluacja i benchmarki16k QuestionsMITBenchmarking general knowledge - never train on it
HumanEvalEwaluacja i benchmarki164 ProblemsMITBenchmarking Python code generation - never train on it
WinograndeEwaluacja i benchmarki44k ProblemsApache 2.0Benchmarking commonsense reasoning
MT-BenchEwaluacja i benchmarki80 QuestionsApache 2.0Judging multi-turn chat quality with LLM-as-judge
Anthropic HH-RLHFPreferencje (RLHF / DPO)170k PairsMITSafety-focused preference training (helpfulness and harmlessness)
DPO Mix 7KPreferencje (RLHF / DPO)7k PairsApache 2.0A small, balanced DPO starter set
MetaMathQARozumowanie395K PairsMITBoosting GSM8K/MATH-style math skills in 7B models
Orca Math Word ProblemsRozumowanie200K ProblemsMITGrade-school math word problems for small models
Open-PlatypusInstrukcje / SFT25K QuestionsCC BY NC 4.0A quick STEM and logic boost on a small budget (non-commercial)
OpenOrcaInstrukcje / SFT4.2M SamplesMITExplanation-style SFT at scale (the Orca recipe)
Infinity-InstructInstrukcje / SFT7.5M InstructionsApache 2.0Large-scale general SFT when you need millions of samples
Magpie-AlignInstrukcje / SFT3M PairsApache 2.0Fresh synthetic SFT data without seed data or scraping
HelpSteer2Preferencje (RLHF / DPO)21K SamplesCC BY 4.0Training reward models with fine-grained quality ratings
NectarPreferencje (RLHF / DPO)183K PromptsApache 2.0Reward-model training with 7-way ranked responses
Tulu 3 SFT MixInstrukcje / SFT939K SamplesODC-BYReproducing a state-of-the-art fully open post-training recipe
SWE-benchEwaluacja i benchmarki2,294 TasksMITBenchmarking real-world software engineering - never train on it
MATH (Hendrycks)Ewaluacja i benchmarki12,500 ProblemsMITBenchmarking competition math ability
NuminaMathRozumowanie860K ProblemsApache 2.0Chain-of-thought math fine-tuning up to olympiad level
WebInstructInstrukcje / SFT220M PairsCC BY-SA 4.0Web-scale instruction mining for domain skills
LMSYS-Chat-1MInstrukcje / SFT1M ConversationsCC BY-NC 4.0Studying real-world usage patterns across 25 models (non-commercial)
WildChat-1MInstrukcje / SFT1M ChatsAI2 ImpACTTraining on real user conversations; safety and robustness research
No RobotsInstrukcje / SFT10k RowsCC BY-NC 4.0Your first fine-tune — small, clean, 100% human-written SFT data (non-commercial license)
SmolTalk 2Instrukcje / SFT3 Subsets (Mid 4.8M Rows)Apache 2.0Reproducing a complete modern post-training pipeline (mid-training → SFT → preference) for small models
OpenThoughts3-1.2MRozumowanie1.2M RowsApache 2.0Distilling strong math/code/science reasoning into 7B–32B models
s1K-1.1Rozumowanie1k RowsApache 2.0Cheap, fast reasoning fine-tunes — 1k samples means minutes of training, not days
Glaive Function Calling v2Agenty i wywoływanie funkcji113k RowsApache 2.0Teaching a model basic function-calling: when to call, what JSON to emit, how to use results
xLAM Function Calling 60kAgenty i wywoływanie funkcji60k RowsCC BY 4.0High-precision tool calling — every sample was verified by actually executing the API call
Hermes Function Calling v1Agenty i wywoływanie funkcji12k SamplesApache 2.0Models that must return valid structured JSON — for agents, extraction, and tool pipelines
FineWeb 2Pretrening8TB CompressedODC-By 1.0Pretraining or continued pretraining in languages other than English
Aya DatasetWielojęzyczne204k RowsApache 2.0Instruction-tuning in non-English languages with real human-written data
OpenCodeReasoningRozumowanie735k SamplesCC BY 4.0Fine-tuning coding models that show their reasoning before writing the solution

Jak wybrać zbiór danych

Dopasuj zbiór danych do zadania, nie odwrotnie. Chcesz nauczyć model wykonywania poleceń lub swojego tonu? Użyj zbioru instrukcji/SFT — zacznij od No Robots (pisany przez ludzi) lub Dolly 15k (bezpieczny komercyjnie). Chcesz poprawić sposób, w jaki model wybiera i formułuje odpowiedzi? Potrzebujesz zbioru preferencji do DPO: UltraFeedback to wybór domyślny, a HelpSteer2 dodaje szczegółowe oceny jakości.

Budujesz model „myślący" do matematyki lub kodu? Trenuj na śladach rozumowania: OpenThoughts3 dla szerokiego zakresu, NuminaMath do matematyki, OpenCodeReasoning do kodu. Tworzysz agenta wywołującego API? Wywoływanie funkcji to osobna umiejętność — Glaive v2 na start, xLAM, gdy liczy się precyzja. Użytkownicy nieanglojęzyczni? Aya do instrukcji, FineWeb 2 do kontynuacji pretreningu.

Dwie zasady oszczędzają najwięcej czasu: sprawdź licencję przed treningiem (zbiory CC BY-NC nie mogą trafić do produktu komercyjnego) i zacznij od mniejszej skali, niż myślisz — 1000 dobrych przykładów bije 100 000 zaszumionych. W razie wątpliwości przejdź godzinny przewodnik Zrób fine-tuning pierwszego LLM, który korzysta dokładnie z tych zbiorów.

Instrukcje / SFT (18)

Zbiory instrukcji (SFT) to pary „polecenie–odpowiedź" używane w nadzorowanym fine-tuningu — pierwszym i najważniejszym kroku uczenia modelu bazowego wykonywania poleceń, odpowiadania w Twoim formacie lub przyjmowania określonego tonu. Rozpiętość: od 1 tys. ręcznie pisanych przykładów (LIMA) po wielomilionowe mieszanki syntetyczne (Infinity-Instruct).

Rozumowanie (6)

Zbiory rozumowania przechowują pełne łańcuchy myślowe — „myślenie" krok po kroku prowadzące do odpowiedzi — a nie tylko końcowe odpowiedzi. Fine-tuning na śladach destylowanych z silnych modeli (DeepSeek R1, QwQ) to sposób, w jaki małe lokalne modele uczą się rozwiązywać zadania z matematyki, kodu i nauk ścisłych, zanim odpowiedzą.

Agenty i wywoływanie funkcji (3)

Zbiory agentowe uczą model wywoływania funkcji i narzędzi: czytania schematu JSON, decydowania, kiedy wywołanie jest potrzebne, generowania poprawnych argumentów i korzystania z wyniku. To kluczowa umiejętność lokalnych agentów AI — trzeba ją trenować osobno, bo ogólne dane konwersacyjne nie dadzą niezawodnych wywołań narzędzi.

Preferencje (RLHF / DPO) (5)

Zbiory preferencji zawierają polecenie oraz uszeregowane lub ocenione odpowiedzi — wybraną i odrzuconą. Zasilają RLHF, modele nagrody i DPO: krok po SFT, który uczy model, którą z dwóch sensownych odpowiedzi ludzie naprawdę wolą. Stosuj je po fazie instrukcyjnej, nie zamiast niej.

Pretrening (4)

Korpusy pretreningowe to ogromne kolekcje surowego tekstu — biliony tokenów przefiltrowanych stron WWW, podręczników i kodu — używane do trenowania modeli bazowych od zera lub kontynuacji pretreningu w nowym języku czy domenie. Na konsumenckim GPU nie zrobisz na nich fine-tuningu, ale to one wyznaczają wiedzę otwartych modeli bazowych.

Wielojęzyczne (1)

Zbiory wielojęzyczne przenoszą jakość instrukcji i pretreningu poza angielski — od ręcznie anotowanych par instrukcji w 65 językach (Aya) po przefiltrowany jakościowo tekst z sieci w ponad 1000 języków (FineWeb 2). Niezbędne, jeśli Twoi użytkownicy nie piszą po angielsku.

Kod (3)

Zbiory kodu obejmują zarówno ogromne korpusy źródeł na liberalnych licencjach (The Stack v2), jak i pary instrukcji syntetyzowane z prawdziwego otwartego kodu. Użyj ich, by wyspecjalizować model pod swój stack, poprawić jakość uzupełnień lub wytrenować lokalnego asystenta programisty.

Wizja (1)

Zbiory wizyjne (multimodalne) łączą obrazy z instrukcjami tekstowymi, ucząc modele językowe „widzenia". Zbiory instrukcji w stylu LLaVA to standardowy przepis na dodanie rozumienia obrazów do otwartego LLM.

Ewaluacja i benchmarki (6)

Zbiory ewaluacyjne to benchmarki — MMLU, HumanEval, SWE-bench — służące do mierzenia modeli, nie do ich trenowania. Nigdy nie mieszaj ich z danymi treningowymi: kontaminacja benchmarków sztucznie zawyża wyniki i jest pierwszą rzeczą sprawdzaną przez uważnych recenzentów.

Najczęstsze pytania

Jakiego zbioru danych użyć do fine-tuningu chatbota?
Zacznij od zbioru instrukcji/SFT. No Robots (10 tys. przykładów pisanych przez ludzi) to najczystszy pierwszy zbiór, a Databricks Dolly 15k to bezpieczna komercyjnie alternatywa. Dla zachowań wieloturowych dodaj UltraChat lub WildChat, a potem doszlifuj ton zbiorem preferencji, np. UltraFeedback z DPO.
Czym różnią się zbiory SFT od DPO?
Zbiory SFT zawierają pary „polecenie–odpowiedź", które model uczy się naśladować (nadzorowany fine-tuning). Zbiory DPO/preferencji zawierają polecenie oraz odpowiedź wybraną i odrzuconą — model uczy się preferować lepszą. Typowy potok to najpierw SFT, potem DPO — np. Tulu 3 SFT, a następnie UltraFeedback.
Czy mogę użyć Alpaki komercyjnie?
Nie — Stanford Alpaca ma licencję CC BY-NC 4.0 (niekomercyjną), bo została wygenerowana modelem text-davinci-003 OpenAI. Do komercyjnego fine-tuningu użyj Databricks Dolly 15k (CC BY-SA 3.0), Tulu 3 SFT Mix (ODC-BY) lub OpenHermes 2.5 (MIT).
Jak duży powinien być zbiór do fine-tuningu?
Jakość bije ilość. LIMA pokazała, że 1000 wyselekcjonowanych przykładów wystarczy do wyrównania modelu 65B, a s1K zrobił to samo dla rozumowania. Do zmiany stylu i formatu zwykle wystarcza 200–1000 dobrych przykładów; nowe umiejętności domenowe wymagają 10–100 tys. Zacznij od małej skali i oceniaj.
Czym jest zbiór ze śladami rozumowania?
Zbiór ze śladami rozumowania przechowuje nie tylko końcowe odpowiedzi, ale pełny łańcuch myślowy — myślenie krok po kroku przed każdym rozwiązaniem. Fine-tuning na śladach (OpenThoughts3, NuminaMath-CoT, OpenCodeReasoning) destyluje zdolność rozumowania z dużych modeli do małych lokalnych, które „myślą", zanim odpowiedzą.
Które zbiory działają z Unsloth?
Każdy zbiór w standardowym formacie zadziała z Unsloth po lekkim sformatowaniu: styl Alpaca (kolumny instruction/output), styl ShareGPT (conversations) lub wiadomości ChatML. Popularne zbiory startowe dla Unsloth to No Robots, Alpaca i Dolly 15k — nasz godzinny przewodnik pokazuje, jak załadować je w SFTTrainer na GPU 6 GB.