Wysokiej jakości syntetyczny zbiór danych z 2025 roku, stworzony do trenowania rodziny małych modeli językowych SmolLM2. Milion przykładów pokrywających różnorodne zadania, wygenerowanych ze starannym filtrowaniem jakości. Dowodzi, że małe modele (1,7B, 360M) mogą osiągać mocne wyniki przy odpowiednich danych treningowych.
Dataset Details
Provider
HuggingFaceTB
Category
Instrukcje / SFT
Size
1M Rows
License
Apache 2.0
Downloads
600k
Tags
Synthetic, 2025, Small-Models, High-Quality
from datasets import load_dataset
ds = load_dataset("HuggingFaceTB/smoltalk")
Fine-tuning z tym zbiorem danych
Szacowany VRAM do fine-tuningu z QLoRA (model bazowy 4-bit + adaptery LoRA), przy zachowawczych ustawieniach:
SmolTalk 2 — Reproducing a complete modern post-training pipeline (mid-training → SFT → preference) for
No Robots — Your first fine-tune — small, clean, 100% human-written SFT data (non-commercial license)
Python-Edu — Continued pretraining for Python code understanding
OpenHermes 2.5 — The default general-purpose SFT mix for 7B-13B fine-tunes
Najczęstsze pytania
Czy mogę użyć Smoltalk komercyjnie?
Tak — Smoltalk jest udostępniony na licencji Apache 2.0, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera Smoltalk i czy potrzebuję wszystkich?
Smoltalk zawiera 1M Rows. Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego Smoltalk nadaje się najlepiej?
General SFT for small models (the SmolLM2 recipe). Należy do sekcji „Instrukcje / SFT" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.