Text Classification
Transformers
PyTorch
English
deberta-v2
rlhf
Eval Results (legacy)
text-embeddings-inference
Instructions to use sileod/deberta-v3-large-tasksource-rlhf-reward-model with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use sileod/deberta-v3-large-tasksource-rlhf-reward-model with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="sileod/deberta-v3-large-tasksource-rlhf-reward-model")# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("sileod/deberta-v3-large-tasksource-rlhf-reward-model") model = AutoModelForSequenceClassification.from_pretrained("sileod/deberta-v3-large-tasksource-rlhf-reward-model", device_map="auto") - Notebooks
- Google Colab
- Kaggle
|
Download README.md from sileod/deberta-v3-large-tasksource-rlhf-reward-model: direct link, hf CLI and curl.
- Browser
- Download file 917 Bytes
-
https://huggingface.co/sileod/deberta-v3-large-tasksource-rlhf-reward-model/resolve/main/README.md
- Command line
-
hf download hf://sileod/deberta-v3-large-tasksource-rlhf-reward-model/README.md
-
curl -L -o README.md https://huggingface.co/sileod/deberta-v3-large-tasksource-rlhf-reward-model/resolve/main/README.md
917 Bytes
metadata
datasets:
- Anthropic/hh-rlhf
language:
- en
tags:
- rlhf
model-index:
- name: deberta-v3-large-tasksource-rlhf-reward-model
results:
- task:
type: text-classification
name: RLHF
dataset:
type: rlhf
name: Anthropic/hh-rlhf
split: validation
metrics:
- type: accuracy
value: 0,7516
verified: true
Reward model based deberta-v3-large-tasksource-nli fine-tuned on Anthropic/hh-rlhf
For 1 epoch with 1e-5 learning rate.
The data are described in the paper: Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.
Validation accuracy is currently the best publicly available reported: 75.16% (vs 69.25% for OpenAssistant/reward-model-deberta-v3-large-v2).