Python-Edu — LLM Instrukcje / SFT Dataset
A curated collection of high-quality Python tutorials, documentation, and clean code examples for training coding assistants.
Dataset Details
| Provider | OpenCoder |
| Category | Instrukcje / SFT |
| Size | 400 GB |
| License | MIT |
| Downloads | 120k |
| Tags | Code, Python, Tutorials |
from datasets import load_dataset
ds = load_dataset("")
Pierwszy fine-tuning? Przejdź przewodnik krok po kroku: Zrób fine-tuning pierwszego LLM w godzinę
Powiązane zbiory danych
- The Stack v2 — Pretraining code models across 600+ programming languages
- Cosmopedia — Synthetic-textbook pretraining for small models (the SmolLM recipe)
- OpenHermes 2.5 — The default general-purpose SFT mix for 7B-13B fine-tunes
- Databricks Dolly 15k — Commercially safe instruction tuning - fully human-written
Najczęstsze pytania
Czy mogę użyć Python-Edu komercyjnie?
Tak — Python-Edu jest udostępniony na licencji MIT, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera Python-Edu i czy potrzebuję wszystkich?
Python-Edu zawiera 400 GB. Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego Python-Edu nadaje się najlepiej?
Continued pretraining for Python code understanding. Należy do sekcji „Instrukcje / SFT" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.
← Wszystkie zbiory danych | Fine-Tuning Guide