Wykorzystuje prawdziwe fragmenty kodu open-source jako zalążki do generowania różnorodnych zadań programistycznych i rozwiązań przy pomocy GPT-4. Metoda OSS-Instruct daje bardziej realistyczne, osadzone w rzeczywistości zadania niż podejścia czysto syntetyczne. Model Magicoder-S-DS-6.7B wytrenowany na tych danych przewyższył GPT-3.5-Turbo na HumanEval.
Dataset Details
Provider
ise-uiuc
Category
Kod
Size
75k Rows
License
MIT
Downloads
250k
Tags
Code-Generation, GPT-4, OSS-Grounded, Python
from datasets import load_dataset
ds = load_dataset("ise-uiuc/Magicoder-OSS-Instruct-75K")
Fine-tuning z tym zbiorem danych
Szacowany VRAM do fine-tuningu z QLoRA (model bazowy 4-bit + adaptery LoRA), przy zachowawczych ustawieniach:
The Stack v2 — Pretraining code models across 600+ programming languages
Najczęstsze pytania
Czy mogę użyć Magicoder-OSS-Instruct-75K komercyjnie?
Tak — Magicoder-OSS-Instruct-75K jest udostępniony na licencji MIT, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera Magicoder-OSS-Instruct-75K i czy potrzebuję wszystkich?
Magicoder-OSS-Instruct-75K zawiera 75k Rows. Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego Magicoder-OSS-Instruct-75K nadaje się najlepiej?
Code instruction tuning grounded in real open-source snippets. Należy do sekcji „Kod" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.