Maximum Sequence Length: 512 tokens ?

#1
by ocg2347 - opened

Merhabalar,

Baz model olan Alibaba-NLP/gte-multilingual-base 8192 token ile calisabiliyorken, bu modelin model card'inda Maximum Sequence Length: 512 tokens diye deklare edilmis. Ayrica paper'da da [https://arxiv.org/pdf/2511.08376] 8192 diye raporlanmis.

Model card'da yazan 512 ifadesi bir typo mu yoksa pratikte bu degerin ustunde kararsiz sonuclar alinabilecegine dair bir ipucu mudur diye soracaktim.

Elinize saglik bu arada :)

NewMind AI org

Merhabalar, geri bildiriminiz için teşekkürler :)

Kart'taki 512 değeri bir typo değil; modelin eğitim (training setup) konfigürasyonundan geliyor. Eğitim sırasında kullandığımız veri setindeki örneklerin hiçbiri 512 token'ı aşmadığı için max_seq_length bu değere sabitlendi — elimizde daha uzun örnek yokken bu değeri yüksek tutmanın pratik bir faydası olmayacaktı. Model kartındaki değer de sentence-transformers konfigürasyonundan otomatik olarak alındığı için 512 olarak görünüyor.

Mimari tarafta ise bir kısıt yok: temel model 8192 token'ı destekliyor ve bu ayarı kendi tarafınızda yükseltip daha uzun girdilerle kullanabilirsiniz.

Tek dikkat edilmesi gereken nokta, modelin 512 token üzerindeki uzunluklarda fine-tune edilmemiş olması. Dolayısıyla metinler uzadıkça performansta bir miktar düşüş veya kararsızlık görmeniz mümkün. Uzun dokümanlarla çalışacaksanız kendi verinizde küçük bir değerlendirme yapmanızı ya da chunking stratejisiyle ilerlemenizi öneririm.

mebuldur changed discussion status to closed

Sign up or log in to comment