Instructions to use newmindai/TurkEmbed4STS with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use newmindai/TurkEmbed4STS with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("newmindai/TurkEmbed4STS", trust_remote_code=True) sentences = [ "Ya da dışarı çıkıp yürü ya da biraz koşun. Bunu düzenli olarak yapmıyorum ama Washington bunu yapmak için harika bir yer.", "“Washington's yürüyüş ya da koşu için harika bir yer.”", "H-2A uzaylılar Amerika Birleşik Devletleri'nde zaman kısa süreleri var.", "“Washington'da düzenli olarak yürüyüşe ya da koşuya çıkıyorum.”" ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [4, 4] - Notebooks
- Google Colab
- Kaggle
Maximum Sequence Length: 512 tokens ?
Merhabalar,
Baz model olan Alibaba-NLP/gte-multilingual-base 8192 token ile calisabiliyorken, bu modelin model card'inda Maximum Sequence Length: 512 tokens diye deklare edilmis. Ayrica paper'da da [https://arxiv.org/pdf/2511.08376] 8192 diye raporlanmis.
Model card'da yazan 512 ifadesi bir typo mu yoksa pratikte bu degerin ustunde kararsiz sonuclar alinabilecegine dair bir ipucu mudur diye soracaktim.
Elinize saglik bu arada :)
Merhabalar, geri bildiriminiz için teşekkürler :)
Kart'taki 512 değeri bir typo değil; modelin eğitim (training setup) konfigürasyonundan geliyor. Eğitim sırasında kullandığımız veri setindeki örneklerin hiçbiri 512 token'ı aşmadığı için max_seq_length bu değere sabitlendi — elimizde daha uzun örnek yokken bu değeri yüksek tutmanın pratik bir faydası olmayacaktı. Model kartındaki değer de sentence-transformers konfigürasyonundan otomatik olarak alındığı için 512 olarak görünüyor.
Mimari tarafta ise bir kısıt yok: temel model 8192 token'ı destekliyor ve bu ayarı kendi tarafınızda yükseltip daha uzun girdilerle kullanabilirsiniz.
Tek dikkat edilmesi gereken nokta, modelin 512 token üzerindeki uzunluklarda fine-tune edilmemiş olması. Dolayısıyla metinler uzadıkça performansta bir miktar düşüş veya kararsızlık görmeniz mümkün. Uzun dokümanlarla çalışacaksanız kendi verinizde küçük bir değerlendirme yapmanızı ya da chunking stratejisiyle ilerlemenizi öneririm.