W pełni otwarty korpus post-treningowy stojący za SmolLM3-3B, podzielony na trzy podzbiory odpowiadające fazom treningu modelu: mid-training (4,8 mln wierszy), SFT (odkażona mieszanka ~24 zbiorów, w tym OpenThoughts, Tulu 3, OpenHermes i danych wielojęzycznych) oraz preferencje (447 tys. wierszy do APO). Następca SmolTalk — kompletna, odtwarzalna receptura nowoczesnego post-treningu małych modeli, z obsługą trybu z rozumowaniem i bez.
Smoltalk — General SFT for small models (the SmolLM2 recipe)
Tulu 3 SFT Mix — Reproducing a state-of-the-art fully open post-training recipe
Python-Edu — Continued pretraining for Python code understanding
OpenHermes 2.5 — The default general-purpose SFT mix for 7B-13B fine-tunes
Najczęstsze pytania
Czy mogę użyć SmolTalk 2 komercyjnie?
Tak — SmolTalk 2 jest udostępniony na licencji Apache 2.0, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera SmolTalk 2 i czy potrzebuję wszystkich?
SmolTalk 2 zawiera 3 Subsets (Mid 4.8M Rows). Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego SmolTalk 2 nadaje się najlepiej?
Reproducing a complete modern post-training pipeline (mid-training → SFT → preference) for small models. Należy do sekcji „Instrukcje / SFT" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.