Краткое описание

Модель предназначена для классификации токсичности текста на русском языке. Обучена на основе архитектуры ai-forever/ru-en-RoSBERTa с использованием PyTorch Lightning.

Задача

Модель решает задачу бинарной классификации текста:

  • 0 – нейтральный, безопасный текст.
  • 1 – токсичный текст, содержащий грубость, мат, явные или скрытые оскорбления.

Метрики на тестовой выборке

  • Accuracy: 0.9967
  • F1 Score: 0.9967
  • ROC AUC: 0.9997
  • MCC: 0.9934

Пример использования (Inference)

from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch

tokenizer = AutoTokenizer.from_pretrained("Nelera/ru-en-toxicity-rosberta")
model = AutoModelForSequenceClassification.from_pretrained("Nelera/ru-en-toxicity-rosberta")

text = "Ваш текст для проверки"
inputs = tokenizer(text, return_tensors="pt", padding=True, truncation=True, max_length=128)

with torch.no_grad():
    logits = model(**inputs).logits
    prob = torch.softmax(logits, dim=-1)[0][1].item()
    pred = torch.argmax(logits, dim=1).item()

print(f"Класс: {pred} (Вероятность токсичности: {prob:.4f})")
Downloads last month
29
Safetensors
Model size
0.4B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support