395 tys. wysokiej jakości par pytanie–odpowiedź z matematyki, powstałych przez rozszerzenie GSM8K i MATH metodami przepisywania odpowiedzi, rozumowania wstecznego i FOBAR. Zasila modele MetaMath, które wyraźnie przewyższają modele bazowe w benchmarkach matematycznych.
Dataset Details
Provider
meta-math
Category
Rozumowanie
Size
395K Pairs
License
MIT
Downloads
1.2M
Tags
Math, Reasoning, GSM8K, MATH, Augmented
from datasets import load_dataset
ds = load_dataset("meta-math/MetaMathQA")
Fine-tuning z tym zbiorem danych
Szacowany VRAM do fine-tuningu z QLoRA (model bazowy 4-bit + adaptery LoRA), przy zachowawczych ustawieniach:
NuminaMath — Chain-of-thought math fine-tuning up to olympiad level
OpenThoughts3-1.2M — Distilling strong math/code/science reasoning into 7B–32B models
s1K-1.1 — Cheap, fast reasoning fine-tunes — 1k samples means minutes of training, not days
Najczęstsze pytania
Czy mogę użyć MetaMathQA komercyjnie?
Tak — MetaMathQA jest udostępniony na licencji MIT, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera MetaMathQA i czy potrzebuję wszystkich?
MetaMathQA zawiera 395K Pairs. Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego MetaMathQA nadaje się najlepiej?
Boosting GSM8K/MATH-style math skills in 7B models. Należy do sekcji „Rozumowanie" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.