SmolTalk 2 — LLM Instrukcje / SFT Dataset

W pełni otwarty korpus post-treningowy stojący za SmolLM3-3B, podzielony na trzy podzbiory odpowiadające fazom treningu modelu: mid-training (4,8 mln wierszy), SFT (odkażona mieszanka ~24 zbiorów, w tym OpenThoughts, Tulu 3, OpenHermes i danych wielojęzycznych) oraz preferencje (447 tys. wierszy do APO). Następca SmolTalk — kompletna, odtwarzalna receptura nowoczesnego post-treningu małych modeli, z obsługą trybu z rozumowaniem i bez.

Dataset Details

ProviderHuggingFaceTB
CategoryInstrukcje / SFT
Size3 Subsets (Mid 4.8M Rows)
LicenseApache 2.0
Downloadsn/a
TagsPost-Training, SmolLM3, Reasoning, Multilingual, 2025
from datasets import load_dataset
ds = load_dataset("HuggingFaceTB/smoltalk2")

Fine-tuning z tym zbiorem danych

Szacowany VRAM do fine-tuningu z QLoRA (model bazowy 4-bit + adaptery LoRA), przy zachowawczych ustawieniach:

7B QLoRA~6GB VRAM
13B QLoRA~10GB VRAM

Sprawdź, czy Twoje GPU to udźwignie →

Pierwszy fine-tuning? Przejdź przewodnik krok po kroku: Zrób fine-tuning pierwszego LLM w godzinę

Powiązane zbiory danych

Najczęstsze pytania

Czy mogę użyć SmolTalk 2 komercyjnie?
Tak — SmolTalk 2 jest udostępniony na licencji Apache 2.0, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera SmolTalk 2 i czy potrzebuję wszystkich?
SmolTalk 2 zawiera 3 Subsets (Mid 4.8M Rows). Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego SmolTalk 2 nadaje się najlepiej?
Reproducing a complete modern post-training pipeline (mid-training → SFT → preference) for small models. Należy do sekcji „Instrukcje / SFT" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.

← Wszystkie zbiory danych | Fine-Tuning Guide