Anthropic HH-RLHF — LLM Preferencje (RLHF / DPO) Dataset

170k human preference comparisons between two AI assistant responses, with one labeled 'chosen' (helpful, harmless) and one 'rejected'. The dataset that defined RLHF alignment for chat assistants. Used to train early Claude models and became the standard reference for alignment research and DPO fine-tuning.

Dataset Details

ProviderAnthropic
CategoryPreferencje (RLHF / DPO)
Size170k Pairs
LicenseMIT
Downloads2.8M
TagsRLHF, Alignment, Safety, Helpfulness, Human-Feedback
from datasets import load_dataset
ds = load_dataset("Anthropic/hh-rlhf")

Fine-tuning z tym zbiorem danych

Szacowany VRAM do fine-tuningu z QLoRA (model bazowy 4-bit + adaptery LoRA), przy zachowawczych ustawieniach:

7B QLoRA~6GB VRAM
13B QLoRA~10GB VRAM

Sprawdź, czy Twoje GPU to udźwignie →

Pierwszy fine-tuning? Przejdź przewodnik krok po kroku: Zrób fine-tuning pierwszego LLM w godzinę

Powiązane zbiory danych

Najczęstsze pytania

Czy mogę użyć Anthropic HH-RLHF komercyjnie?
Tak — Anthropic HH-RLHF jest udostępniony na licencji MIT, liberalnej licencji pozwalającej na użycie komercyjne, w tym trenowanie modeli wdrażanych w produkcie. Przed publikacją sprawdź wymogi atrybucji na karcie zbioru.
Ile danych zawiera Anthropic HH-RLHF i czy potrzebuję wszystkich?
Anthropic HH-RLHF zawiera 170k Pairs. Rzadko potrzebujesz całości: do fine-tuningu stylu i formatu wystarcza kilkaset–kilka tysięcy przykładów — załaduj wycinek (np. split="train[:1000]") i zwiększaj skalę tylko, gdy jakość przestaje rosnąć.
Do czego Anthropic HH-RLHF nadaje się najlepiej?
Safety-focused preference training (helpfulness and harmlessness). Należy do sekcji „Preferencje (RLHF / DPO)" naszego centrum zbiorów danych, gdzie znajdziesz alternatywy i zbiory komplementarne.

← Wszystkie zbiory danych | Fine-Tuning Guide