Zaledwie 1000 ultrastarannie dobranych pytań ze śladami rozumowania — wyselekcjonowanych z 59 tys. kandydatów pod kątem trudności, różnorodności i jakości, ze śladami wygenerowanymi ponownie przez DeepSeek R1 w wydaniu 1.1. Fine-tuning Qwen2.5-32B na s1K (26 minut na 16 kartach H100) w połączeniu z „budget forcing” podczas wnioskowania pozwolił przewyższyć o1-preview w matematyce konkursowej. LIMA świata rozumowania: dowód, że jakość danych bije ilość.
| Provider | SimpleScaling |
| Category | Rozumowanie |
| Size | 1k Rows |
| License | Apache 2.0 |
| Downloads | n/a |
| Tags | Curated, Test-Time-Scaling, Quality-over-Quantity, R1-Traces, 2025 |
from datasets import load_dataset
ds = load_dataset("simplescaling/s1K-1.1")
Szacowany VRAM do fine-tuningu z QLoRA (model bazowy 4-bit + adaptery LoRA), przy zachowawczych ustawieniach:
| 7B QLoRA | ~6GB VRAM |
| 13B QLoRA | ~10GB VRAM |
Sprawdź, czy Twoje GPU to udźwignie →
Pierwszy fine-tuning? Przejdź przewodnik krok po kroku: Zrób fine-tuning pierwszego LLM w godzinę