Magicoder-OSS-Instruct-75K — LLM Kod Dataset
Uses real open-source code snippets as seeds to generate diverse coding problems and solutions with GPT-4. The OSS-Instruct method produces more realistic, grounded coding tasks than purely synthetic approaches. Magicoder-S-DS-6.7B trained on this data surpassed GPT-3.5-Turbo on HumanEval.
Dataset Details
| Provider | ise-uiuc |
| Category | Kod |
| Size | 75k Rows |
| License | MIT |
| Downloads | 250k |
| Tags | Code-Generation, GPT-4, OSS-Grounded, Python |
from datasets import load_dataset
ds = load_dataset("ise-uiuc/Magicoder-OSS-Instruct-75K")
Fine-tuning z tym zbiorem danych
Szacowany VRAM do fine-tuningu z QLoRA (model bazowy 4-bit + adaptery LoRA), przy zachowawczych ustawieniach:
| 7B QLoRA | ~6GB VRAM |
| 13B QLoRA | ~10GB VRAM |
Sprawdź, czy Twoje GPU to udźwignie →
Powiązane zbiory danych
Najczęstsze pytania
Czy mogę użyć Magicoder-OSS-Instruct-75K komercyjnie?
Tak — Magicoder-OSS-Instruct-75K jest udostępniony na licencji MIT, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera Magicoder-OSS-Instruct-75K i czy potrzebuję wszystkich?
Magicoder-OSS-Instruct-75K zawiera 75k Rows. Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego Magicoder-OSS-Instruct-75K nadaje się najlepiej?
Code instruction tuning grounded in real open-source snippets. Należy do sekcji „Kod" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.
← Wszystkie zbiory danych | Fine-Tuning Guide