Smoltalk — LLM Instrukcje / SFT Dataset

Wysokiej jakości syntetyczny zbiór danych z 2025 roku, stworzony do trenowania rodziny małych modeli językowych SmolLM2. Milion przykładów pokrywających różnorodne zadania, wygenerowanych ze starannym filtrowaniem jakości. Dowodzi, że małe modele (1,7B, 360M) mogą osiągać mocne wyniki przy odpowiednich danych treningowych.

Dataset Details

ProviderHuggingFaceTB
CategoryInstrukcje / SFT
Size1M Rows
LicenseApache 2.0
Downloads600k
TagsSynthetic, 2025, Small-Models, High-Quality
from datasets import load_dataset
ds = load_dataset("HuggingFaceTB/smoltalk")

Fine-tuning z tym zbiorem danych

Szacowany VRAM do fine-tuningu z QLoRA (model bazowy 4-bit + adaptery LoRA), przy zachowawczych ustawieniach:

7B QLoRA~6GB VRAM
13B QLoRA~10GB VRAM

Sprawdź, czy Twoje GPU to udźwignie →

Pierwszy fine-tuning? Przejdź przewodnik krok po kroku: Zrób fine-tuning pierwszego LLM w godzinę

Powiązane zbiory danych

Najczęstsze pytania

Czy mogę użyć Smoltalk komercyjnie?
Tak — Smoltalk jest udostępniony na licencji Apache 2.0, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera Smoltalk i czy potrzebuję wszystkich?
Smoltalk zawiera 1M Rows. Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego Smoltalk nadaje się najlepiej?
General SFT for small models (the SmolLM2 recipe). Należy do sekcji „Instrukcje / SFT" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.

← Wszystkie zbiory danych | Fine-Tuning Guide