Autor: Jakub Rusinowski · Ostatnia aktualizacja: 21 lipca 2026
47 wyselekcjonowanych otwartych zbiorów danych do fine-tuningu i treningu LLM — instrukcje, ślady rozumowania, wywoływanie funkcji, dane preferencji i więcej. Każdy wpis zawiera dokładną licencję, rozmiar i fragment kodu load_dataset().
Zacznij tutaj: Zrób fine-tuning pierwszego LLM w godzinę · Kompendium fine-tuningu (SFT, LoRA i DPO) · Sprawdź, czy Twoje GPU podoła fine-tuningowi
Kliknij nagłówek kolumny, aby posortować. Kliknij nazwę zbioru, aby zobaczyć pełną kartę z licencją, przykładowymi danymi i kodem.
| Zbiór danych | Kategoria | Rozmiar | Licencja | Najlepszy do |
|---|---|---|---|---|
| FineWeb | Pretrening | 15 TB | ODC-By 1.0 | Pretraining or continued pretraining on high-quality English web text |
| Cosmopedia | Pretrening | 25B Tokens | Apache 2.0 | Synthetic-textbook pretraining for small models (the SmolLM recipe) |
| Python-Edu | Instrukcje / SFT | 400 GB | MIT | Continued pretraining for Python code understanding |
| OpenHermes 2.5 | Instrukcje / SFT | 1M Rows | Apache 2.0 | The default general-purpose SFT mix for 7B-13B fine-tunes |
| UltraFeedback | Preferencje (RLHF / DPO) | 64k Rows | MIT | The default DPO preference set to run after any SFT pass |
| LLaVA Instruct | Wizja | 158k Samples | CC-BY-NC 4.0 | Adding image understanding to an open LLM (the LLaVA recipe) |
| SlimPajama | Pretrening | 627B Tokens | Apache 2.0 | Efficient English pretraining on a heavily deduplicated corpus |
| Databricks Dolly 15k | Instrukcje / SFT | 15k Rows | CC-BY-SA 3.0 | Commercially safe instruction tuning - fully human-written |
| Stanford Alpaca | Instrukcje / SFT | 52k Rows | CC-BY-NC 4.0 | Learning the classic instruction format; research only (CC BY-NC) |
| ShareGPT 52K | Instrukcje / SFT | 52k Conversations | CC-BY-NC 4.0 | Teaching natural multi-turn dialogue (non-commercial) |
| WizardLM Evol Instruct 70k | Instrukcje / SFT | 70k Rows | Apache 2.0 | Boosting complex-instruction handling with Evol-Instruct data |
| LIMA: Less Is More for Alignment | Instrukcje / SFT | 1k Rows | CC-BY-NC-SA 4.0 | Style and format alignment with a tiny curated set - quality over quantity |
| Smoltalk | Instrukcje / SFT | 1M Rows | Apache 2.0 | General SFT for small models (the SmolLM2 recipe) |
| The Stack v2 | Kod | 900B Tokens | Various (per-file) | Pretraining code models across 600+ programming languages |
| Magicoder-OSS-Instruct-75K | Kod | 75k Rows | MIT | Code instruction tuning grounded in real open-source snippets |
| CodeFeedback-Filtered-Instruction | Kod | 74k Rows | Apache 2.0 | Training coding models that respond to execution feedback |
| MMLU (Massive Multitask Language Understanding) | Ewaluacja i benchmarki | 16k Questions | MIT | Benchmarking general knowledge - never train on it |
| HumanEval | Ewaluacja i benchmarki | 164 Problems | MIT | Benchmarking Python code generation - never train on it |
| Winogrande | Ewaluacja i benchmarki | 44k Problems | Apache 2.0 | Benchmarking commonsense reasoning |
| MT-Bench | Ewaluacja i benchmarki | 80 Questions | Apache 2.0 | Judging multi-turn chat quality with LLM-as-judge |
| Anthropic HH-RLHF | Preferencje (RLHF / DPO) | 170k Pairs | MIT | Safety-focused preference training (helpfulness and harmlessness) |
| DPO Mix 7K | Preferencje (RLHF / DPO) | 7k Pairs | Apache 2.0 | A small, balanced DPO starter set |
| MetaMathQA | Rozumowanie | 395K Pairs | MIT | Boosting GSM8K/MATH-style math skills in 7B models |
| Orca Math Word Problems | Rozumowanie | 200K Problems | MIT | Grade-school math word problems for small models |
| Open-Platypus | Instrukcje / SFT | 25K Questions | CC BY NC 4.0 | A quick STEM and logic boost on a small budget (non-commercial) |
| OpenOrca | Instrukcje / SFT | 4.2M Samples | MIT | Explanation-style SFT at scale (the Orca recipe) |
| Infinity-Instruct | Instrukcje / SFT | 7.5M Instructions | Apache 2.0 | Large-scale general SFT when you need millions of samples |
| Magpie-Align | Instrukcje / SFT | 3M Pairs | Apache 2.0 | Fresh synthetic SFT data without seed data or scraping |
| HelpSteer2 | Preferencje (RLHF / DPO) | 21K Samples | CC BY 4.0 | Training reward models with fine-grained quality ratings |
| Nectar | Preferencje (RLHF / DPO) | 183K Prompts | Apache 2.0 | Reward-model training with 7-way ranked responses |
| Tulu 3 SFT Mix | Instrukcje / SFT | 939K Samples | ODC-BY | Reproducing a state-of-the-art fully open post-training recipe |
| SWE-bench | Ewaluacja i benchmarki | 2,294 Tasks | MIT | Benchmarking real-world software engineering - never train on it |
| MATH (Hendrycks) | Ewaluacja i benchmarki | 12,500 Problems | MIT | Benchmarking competition math ability |
| NuminaMath | Rozumowanie | 860K Problems | Apache 2.0 | Chain-of-thought math fine-tuning up to olympiad level |
| WebInstruct | Instrukcje / SFT | 220M Pairs | CC BY-SA 4.0 | Web-scale instruction mining for domain skills |
| LMSYS-Chat-1M | Instrukcje / SFT | 1M Conversations | CC BY-NC 4.0 | Studying real-world usage patterns across 25 models (non-commercial) |
| WildChat-1M | Instrukcje / SFT | 1M Chats | AI2 ImpACT | Training on real user conversations; safety and robustness research |
| No Robots | Instrukcje / SFT | 10k Rows | CC BY-NC 4.0 | Your first fine-tune — small, clean, 100% human-written SFT data (non-commercial license) |
| SmolTalk 2 | Instrukcje / SFT | 3 Subsets (Mid 4.8M Rows) | Apache 2.0 | Reproducing a complete modern post-training pipeline (mid-training → SFT → preference) for small models |
| OpenThoughts3-1.2M | Rozumowanie | 1.2M Rows | Apache 2.0 | Distilling strong math/code/science reasoning into 7B–32B models |
| s1K-1.1 | Rozumowanie | 1k Rows | Apache 2.0 | Cheap, fast reasoning fine-tunes — 1k samples means minutes of training, not days |
| Glaive Function Calling v2 | Agenty i wywoływanie funkcji | 113k Rows | Apache 2.0 | Teaching a model basic function-calling: when to call, what JSON to emit, how to use results |
| xLAM Function Calling 60k | Agenty i wywoływanie funkcji | 60k Rows | CC BY 4.0 | High-precision tool calling — every sample was verified by actually executing the API call |
| Hermes Function Calling v1 | Agenty i wywoływanie funkcji | 12k Samples | Apache 2.0 | Models that must return valid structured JSON — for agents, extraction, and tool pipelines |
| FineWeb 2 | Pretrening | 8TB Compressed | ODC-By 1.0 | Pretraining or continued pretraining in languages other than English |
| Aya Dataset | Wielojęzyczne | 204k Rows | Apache 2.0 | Instruction-tuning in non-English languages with real human-written data |
| OpenCodeReasoning | Rozumowanie | 735k Samples | CC BY 4.0 | Fine-tuning coding models that show their reasoning before writing the solution |
Dopasuj zbiór danych do zadania, nie odwrotnie. Chcesz nauczyć model wykonywania poleceń lub swojego tonu? Użyj zbioru instrukcji/SFT — zacznij od No Robots (pisany przez ludzi) lub Dolly 15k (bezpieczny komercyjnie). Chcesz poprawić sposób, w jaki model wybiera i formułuje odpowiedzi? Potrzebujesz zbioru preferencji do DPO: UltraFeedback to wybór domyślny, a HelpSteer2 dodaje szczegółowe oceny jakości.
Budujesz model „myślący" do matematyki lub kodu? Trenuj na śladach rozumowania: OpenThoughts3 dla szerokiego zakresu, NuminaMath do matematyki, OpenCodeReasoning do kodu. Tworzysz agenta wywołującego API? Wywoływanie funkcji to osobna umiejętność — Glaive v2 na start, xLAM, gdy liczy się precyzja. Użytkownicy nieanglojęzyczni? Aya do instrukcji, FineWeb 2 do kontynuacji pretreningu.
Dwie zasady oszczędzają najwięcej czasu: sprawdź licencję przed treningiem (zbiory CC BY-NC nie mogą trafić do produktu komercyjnego) i zacznij od mniejszej skali, niż myślisz — 1000 dobrych przykładów bije 100 000 zaszumionych. W razie wątpliwości przejdź godzinny przewodnik Zrób fine-tuning pierwszego LLM, który korzysta dokładnie z tych zbiorów.
Zbiory instrukcji (SFT) to pary „polecenie–odpowiedź" używane w nadzorowanym fine-tuningu — pierwszym i najważniejszym kroku uczenia modelu bazowego wykonywania poleceń, odpowiadania w Twoim formacie lub przyjmowania określonego tonu. Rozpiętość: od 1 tys. ręcznie pisanych przykładów (LIMA) po wielomilionowe mieszanki syntetyczne (Infinity-Instruct).
Zbiory rozumowania przechowują pełne łańcuchy myślowe — „myślenie" krok po kroku prowadzące do odpowiedzi — a nie tylko końcowe odpowiedzi. Fine-tuning na śladach destylowanych z silnych modeli (DeepSeek R1, QwQ) to sposób, w jaki małe lokalne modele uczą się rozwiązywać zadania z matematyki, kodu i nauk ścisłych, zanim odpowiedzą.
Zbiory agentowe uczą model wywoływania funkcji i narzędzi: czytania schematu JSON, decydowania, kiedy wywołanie jest potrzebne, generowania poprawnych argumentów i korzystania z wyniku. To kluczowa umiejętność lokalnych agentów AI — trzeba ją trenować osobno, bo ogólne dane konwersacyjne nie dadzą niezawodnych wywołań narzędzi.
Zbiory preferencji zawierają polecenie oraz uszeregowane lub ocenione odpowiedzi — wybraną i odrzuconą. Zasilają RLHF, modele nagrody i DPO: krok po SFT, który uczy model, którą z dwóch sensownych odpowiedzi ludzie naprawdę wolą. Stosuj je po fazie instrukcyjnej, nie zamiast niej.
Korpusy pretreningowe to ogromne kolekcje surowego tekstu — biliony tokenów przefiltrowanych stron WWW, podręczników i kodu — używane do trenowania modeli bazowych od zera lub kontynuacji pretreningu w nowym języku czy domenie. Na konsumenckim GPU nie zrobisz na nich fine-tuningu, ale to one wyznaczają wiedzę otwartych modeli bazowych.
Zbiory wielojęzyczne przenoszą jakość instrukcji i pretreningu poza angielski — od ręcznie anotowanych par instrukcji w 65 językach (Aya) po przefiltrowany jakościowo tekst z sieci w ponad 1000 języków (FineWeb 2). Niezbędne, jeśli Twoi użytkownicy nie piszą po angielsku.
Zbiory kodu obejmują zarówno ogromne korpusy źródeł na liberalnych licencjach (The Stack v2), jak i pary instrukcji syntetyzowane z prawdziwego otwartego kodu. Użyj ich, by wyspecjalizować model pod swój stack, poprawić jakość uzupełnień lub wytrenować lokalnego asystenta programisty.
Zbiory wizyjne (multimodalne) łączą obrazy z instrukcjami tekstowymi, ucząc modele językowe „widzenia". Zbiory instrukcji w stylu LLaVA to standardowy przepis na dodanie rozumienia obrazów do otwartego LLM.
Zbiory ewaluacyjne to benchmarki — MMLU, HumanEval, SWE-bench — służące do mierzenia modeli, nie do ich trenowania. Nigdy nie mieszaj ich z danymi treningowymi: kontaminacja benchmarków sztucznie zawyża wyniki i jest pierwszą rzeczą sprawdzaną przez uważnych recenzentów.