mBART-50 fine-tuned для межъязыковой суммаризации ru→kk

Описание

Модель mBART-50 дообученная на задачу межъязыковой суммаризации русский → казахский (ru→kk). Обучена на параллельном корпусе из 3 465 выровненных казахско-русских пар (LaBSE, θ=0.908). Превосходит специализированную систему kazRush по всем метрикам.

Результаты (ru→kk) — лучший результат для данной языковой пары

Метрика Значение
ROUGE-1 0.848
ROUGE-2 0.791
ROUGE-L 0.845
BLEU 62.4
chrF++ 77.1
BERTScore 0.957

Тест-сет: 347 параллельных пар

Сравнение с baseline системами (ru→kk)

Система ROUGE-1 BERTScore
mBART-50 ft (данная модель) 0.848 0.957
kazRush 0.806 0.827
NLLB-200 0.690 0.810
TF-IDF+kazRush 0.065 0.658

Использование

from transformers import MBartForConditionalGeneration, MBart50TokenizerFast

tokenizer = MBart50TokenizerFast.from_pretrained(
    "v-25/mbart-ru-kaz",
    src_lang="ru_RU",
    tgt_lang="kk_KZ"
)
model = MBartForConditionalGeneration.from_pretrained("v-25/mbart-ru-kaz")

text = "В Казахстане... (русская статья)"
inputs = tokenizer(
    text,
    return_tensors="pt",
    max_length=512,
    truncation=True
)
output = model.generate(
    **inputs,
    forced_bos_token_id=tokenizer.lang_code_to_id["kk_KZ"],
    max_new_tokens=128,
    num_beams=4
)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Параметры обучения

Параметр Значение
Базовая модель facebook/mbart-large-50
Параметры 610М
Learning rate 3e-5
Batch size 2
Epochs 5
Max input tokens 512
Max target tokens 128
num_beams 4
GPU NVIDIA RTX PRO 6000 Blackwell

Корпус

Параметр Значение
Всего пар 3 465
Train 2 772
Test 347
Метод выравнивания LaBSE (θ=0.908)
Источник Tengrinews.kz

Связанные модели

Live Demo

huggingface.co/spaces/v-25/kazakh-summarization-demo

GitHub

github.com/Akn-bb/kazakh-summarization

Цитирование

@mastersthesis{kazakh-summarization-2026,
  title={Исследование задачи суммаризации для казахского языка},
  year={2026}
}
Downloads last month
39
Safetensors
Model size
1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support