You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.

Log in or Sign Up to review the conditions and access this model content.

Til-mini-1B

Көптілді base-модель · Многоязычная базовая модель · Multilingual base model

Қазақша · Русский · English


Қазақша

Til-mini-1B — қазақ тіліне басымдық беретін 956.3M параметрлі көптілді base-модель. Репозиторий көлемі — 3.84 ГБ. Модель Til-Corpus корпусындағы 47.0B токенге нөлден оқытылған.

Құрылымы мен бағалауы

Сипаттама Мәні
Архитектура DeepseekV3ForCausalLM, dense decoder және MLA
Жасырын қабат / қабат саны 1792 / 24
Attention heads 16
Контекст 2048 токен
Сөздік 131 072 токен

Корпуста ағылшын — 11.9B, код — 9.9B, қазақ — 9.7B, математика — 9.0B, орыс — 6.6B токен. Macro BPB — 0.6207, қазақ тіліндегі BPB — 0.4645. Модель мәтінді жалғастырады; чат нұсқаулары үшін бөлек fine-tune қажет.

Іске қосу

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "TilQazyna/Til-mini-1B"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(
    repo, dtype=torch.bfloat16, device_map="auto"
)
inputs = tokenizer("Абай Құнанбайұлы —", return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=80)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Қолжетімділік

Карточка мен файлдар тізімі ашық көрінеді. Файлдарды жүктеу үшін «Request access» өтінімін TilQazyna командасы мақұлдауы керек.

Байланысты репозиторийлер

Қазақ мәтініндегі қатені түзетуге арналған нұсқа — Til-mini-1B-GEC.


Русский

Til-mini-1B — многоязычная базовая модель на 956.3M параметров с приоритетом казахского языка. Объём репозитория — 3.84 ГБ. Модель обучена с нуля на 47.0B токенов из Til-Corpus.

Устройство и оценка

Характеристика Значение
Архитектура DeepseekV3ForCausalLM, dense decoder и MLA
Скрытый слой / слои 1792 / 24
Attention heads 16
Контекст 2048 токенов
Словарь 131 072 токена

В корпусе: английский — 11.9B, код — 9.9B, казахский — 9.7B, математика — 9.0B, русский — 6.6B токенов. Macro BPB — 0.6207, BPB для казахского — 0.4645. Модель продолжает текст; для диалога нужен отдельный fine-tune.

Как запустить

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "TilQazyna/Til-mini-1B"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(
    repo, dtype=torch.bfloat16, device_map="auto"
)
inputs = tokenizer("Абай Құнанбайұлы —", return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=80)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Доступ

Карточка и перечень файлов видны всем. Скачивание открывается после одобрения заявки, отправленной через «Request access», командой TilQazyna.

Связанные репозитории

Версия для исправления ошибок в казахском тексте — Til-mini-1B-GEC.


English

Til-mini-1B is a 956.3M-parameter multilingual base model with an emphasis on Kazakh. The repository occupies 3.84 GB. It was trained from scratch on 47.0B tokens from Til-Corpus.

Architecture and evaluation

Characteristic Value
Architecture DeepseekV3ForCausalLM, dense decoder with MLA
Hidden size / layers 1792 / 24
Attention heads 16
Context 2048 tokens
Vocabulary 131,072 tokens

The corpus contains 11.9B English, 9.9B code, 9.7B Kazakh, 9.0B mathematics, and 6.6B Russian tokens. Macro BPB is 0.6207, while Kazakh BPB is 0.4645. The checkpoint completes text; conversational use requires a separate fine-tune.

Usage

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "TilQazyna/Til-mini-1B"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(
    repo, dtype=torch.bfloat16, device_map="auto"
)
inputs = tokenizer("Абай Құнанбайұлы —", return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=80)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Access

The card and file listing are public. Downloads become available after the TilQazyna team approves a request submitted through “Request access.”

Related repositories

The Kazakh error-correction fine-tune is Til-mini-1B-GEC.


Лицензия · License: apache-2.0 · TilQazyna

Downloads last month
-
Safetensors
Model size
1.0B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for TilQazyna/Til-mini-1B

Finetunes
1 model

Dataset used to train TilQazyna/Til-mini-1B

Collection including TilQazyna/Til-mini-1B