Magicoder-OSS-Instruct-75K — LLM Kod Dataset

Uses real open-source code snippets as seeds to generate diverse coding problems and solutions with GPT-4. The OSS-Instruct method produces more realistic, grounded coding tasks than purely synthetic approaches. Magicoder-S-DS-6.7B trained on this data surpassed GPT-3.5-Turbo on HumanEval.

Dataset Details

Providerise-uiuc
CategoryKod
Size75k Rows
LicenseMIT
Downloads250k
TagsCode-Generation, GPT-4, OSS-Grounded, Python
from datasets import load_dataset
ds = load_dataset("ise-uiuc/Magicoder-OSS-Instruct-75K")

Fine-tuning z tym zbiorem danych

Szacowany VRAM do fine-tuningu z QLoRA (model bazowy 4-bit + adaptery LoRA), przy zachowawczych ustawieniach:

7B QLoRA~6GB VRAM
13B QLoRA~10GB VRAM

Sprawdź, czy Twoje GPU to udźwignie →

Powiązane zbiory danych

Najczęstsze pytania

Czy mogę użyć Magicoder-OSS-Instruct-75K komercyjnie?
Tak — Magicoder-OSS-Instruct-75K jest udostępniony na licencji MIT, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera Magicoder-OSS-Instruct-75K i czy potrzebuję wszystkich?
Magicoder-OSS-Instruct-75K zawiera 75k Rows. Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego Magicoder-OSS-Instruct-75K nadaje się najlepiej?
Code instruction tuning grounded in real open-source snippets. Należy do sekcji „Kod" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.

← Wszystkie zbiory danych | Fine-Tuning Guide