-
LiquidAI/LFM2.5-ColBERT-350M
Sentence Similarity • 0.4B • Updated • 4.7k • 119 -
lightonai/GTE-ModernColBERT-v1
Sentence Similarity • 0.1B • Updated • 27k • • 177 -
lightonai/Reason-ModernColBERT
Sentence Similarity • 0.1B • Updated • 22k • • 250 -
lightonai/Agent-ModernColBERT
Sentence Similarity • 0.1B • Updated • 32.9k • • 35
AI & ML interests
In the following you find models tuned to be used for sentence / text embedding generation. They can be used with the sentence-transformers package.
Recent Activity
View all activity
A curated subset of the datasets that work out of the box with Sentence Transformers: https://huggingface.co/datasets?other=sentence-transformers
These datasets contain MS MARCO Triplets gathered by mining hard negatives using various models. Each dataset has various subsets.
-
sentence-transformers/msmarco-scores-ms-marco-MiniLM-L6-v2
Viewer • Updated • 241M • 111 • 3 -
sentence-transformers/msmarco-msmarco-distilbert-base-tas-b
Viewer • Updated • 86.3M • 1.69k • 5 -
sentence-transformers/msmarco-msmarco-distilbert-base-v3
Viewer • Updated • 88.9M • 2.49k • 5 -
sentence-transformers/msmarco-msmarco-MiniLM-L6-v3
Viewer • Updated • 80.6M • 812 • 3
NanoBEIR by Zeta Alpha, extended with BM25 scores. Used in the Sentence Transformers CrossEncoderNanoBEIREvaluator prior to ST version 5.2.
See https://huggingface.co/blog/multimodal-sentence-transformers
These datasets all have "english" and "non_english" columns for numerous datasets. They can be used to make embedding models multilingual.
-
sentence-transformers/parallel-sentences-wikititles
Viewer • Updated • 14.7M • 140 • 2 -
sentence-transformers/parallel-sentences-tatoeba
Viewer • Updated • 8.35M • 3.73k -
sentence-transformers/parallel-sentences-talks
Viewer • Updated • 19.6M • 5.86k • 12 -
sentence-transformers/parallel-sentences-europarl
Viewer • Updated • 49.7M • 1.69k • 1
These datasets are compatible with the (Sparse)NanoBEIREvaluator with Sentence Transformers v5.2+. Also CrossEncoderNanoBEIREvaluator if bm25 column
-
LiquidAI/LFM2.5-ColBERT-350M
Sentence Similarity • 0.4B • Updated • 4.7k • 119 -
lightonai/GTE-ModernColBERT-v1
Sentence Similarity • 0.1B • Updated • 27k • • 177 -
lightonai/Reason-ModernColBERT
Sentence Similarity • 0.1B • Updated • 22k • • 250 -
lightonai/Agent-ModernColBERT
Sentence Similarity • 0.1B • Updated • 32.9k • • 35
See https://huggingface.co/blog/multimodal-sentence-transformers
A curated subset of the datasets that work out of the box with Sentence Transformers: https://huggingface.co/datasets?other=sentence-transformers
These datasets all have "english" and "non_english" columns for numerous datasets. They can be used to make embedding models multilingual.
-
sentence-transformers/parallel-sentences-wikititles
Viewer • Updated • 14.7M • 140 • 2 -
sentence-transformers/parallel-sentences-tatoeba
Viewer • Updated • 8.35M • 3.73k -
sentence-transformers/parallel-sentences-talks
Viewer • Updated • 19.6M • 5.86k • 12 -
sentence-transformers/parallel-sentences-europarl
Viewer • Updated • 49.7M • 1.69k • 1
These datasets contain MS MARCO Triplets gathered by mining hard negatives using various models. Each dataset has various subsets.
-
sentence-transformers/msmarco-scores-ms-marco-MiniLM-L6-v2
Viewer • Updated • 241M • 111 • 3 -
sentence-transformers/msmarco-msmarco-distilbert-base-tas-b
Viewer • Updated • 86.3M • 1.69k • 5 -
sentence-transformers/msmarco-msmarco-distilbert-base-v3
Viewer • Updated • 88.9M • 2.49k • 5 -
sentence-transformers/msmarco-msmarco-MiniLM-L6-v3
Viewer • Updated • 80.6M • 812 • 3
These datasets are compatible with the (Sparse)NanoBEIREvaluator with Sentence Transformers v5.2+. Also CrossEncoderNanoBEIREvaluator if bm25 column
NanoBEIR by Zeta Alpha, extended with BM25 scores. Used in the Sentence Transformers CrossEncoderNanoBEIREvaluator prior to ST version 5.2.