Feature Extraction
Transformers
Safetensors
audio_embeddings
audio
custom_code
self-supervised-learning
audio-embeddings
best-rq-2
audioset
Instructions to use ltuncay/BEST-RQ-ViT with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use ltuncay/BEST-RQ-ViT with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("feature-extraction", model="ltuncay/BEST-RQ-ViT", trust_remote_code=True)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("ltuncay/BEST-RQ-ViT", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
Link pretrained baselines to their Hugging Face model pages
Browse files- README.md +3 -3
- export_manifest.json +1 -1
README.md
CHANGED
|
@@ -35,9 +35,9 @@ split for 200,000 steps**. The pretrained baselines are shown for comparison.
|
|
| 35 |
|
| 36 |
| Model | Speech | Music | Environment | Global Mean | Mean of Means | Hugging Face model |
|
| 37 |
| --- | ---: | ---: | ---: | ---: | ---: | --- |
|
| 38 |
-
| data2vec | 50.62 | 23.24 | 15.41 | 37.83 | 29.76 |
|
| 39 |
-
| wav2vec 2.0 | 41.79 | 34.94 | 29.52 | 37.84 | 35.42 |
|
| 40 |
-
| Whisper | 49.19 | 38.67 | 28.61 | 42.75 | 38.82 |
|
| 41 |
| BEST-RQ (Conformer) | 40.43 | 35.58 | 30.81 | 37.43 | 35.60 | Separate codebase |
|
| 42 |
| BEST-RQ (ViT) | 32.87 | 41.62 | 34.50 | 34.88 | 36.33 | [BEST-RQ-ViT](https://huggingface.co/ltuncay/BEST-RQ-ViT) |
|
| 43 |
| BEST-RQ-2 (Interspeech 2026) | 38.49 | 54.40 | 46.39 | 43.21 | 46.43 | [BEST-RQ-2](https://huggingface.co/ltuncay/BEST-RQ-2) |
|
|
|
|
| 35 |
|
| 36 |
| Model | Speech | Music | Environment | Global Mean | Mean of Means | Hugging Face model |
|
| 37 |
| --- | ---: | ---: | ---: | ---: | ---: | --- |
|
| 38 |
+
| data2vec | 50.62 | 23.24 | 15.41 | 37.83 | 29.76 | [facebook/data2vec-audio-base](https://huggingface.co/facebook/data2vec-audio-base) |
|
| 39 |
+
| wav2vec 2.0 | 41.79 | 34.94 | 29.52 | 37.84 | 35.42 | [facebook/wav2vec2-large-100k-voxpopuli](https://huggingface.co/facebook/wav2vec2-large-100k-voxpopuli) |
|
| 40 |
+
| Whisper | 49.19 | 38.67 | 28.61 | 42.75 | 38.82 | [openai/whisper-base](https://huggingface.co/openai/whisper-base) |
|
| 41 |
| BEST-RQ (Conformer) | 40.43 | 35.58 | 30.81 | 37.43 | 35.60 | Separate codebase |
|
| 42 |
| BEST-RQ (ViT) | 32.87 | 41.62 | 34.50 | 34.88 | 36.33 | [BEST-RQ-ViT](https://huggingface.co/ltuncay/BEST-RQ-ViT) |
|
| 43 |
| BEST-RQ-2 (Interspeech 2026) | 38.49 | 54.40 | 46.39 | 43.21 | 46.43 | [BEST-RQ-2](https://huggingface.co/ltuncay/BEST-RQ-2) |
|
export_manifest.json
CHANGED
|
@@ -29,7 +29,7 @@
|
|
| 29 |
},
|
| 30 |
"files": {
|
| 31 |
"CODE_LICENSE": "8fe9e8b749cd4abedabcb3100df445db899e72192394d14cc2dbf24a40811af6",
|
| 32 |
-
"README.md": "
|
| 33 |
"adapters.py": "ca0f26826763c0e48b7508da732242bb83adfeb4814e389ed3fde93ad648c728",
|
| 34 |
"config.json": "fe8227548617416bd879efe1be3e9e3fc04270709250f09f01806780fe548789",
|
| 35 |
"configuration_audio.py": "59f3a0b8db0df5af85e677ac33a4431595e9b2eff6d34c1e6a1778dd75a4568d",
|
|
|
|
| 29 |
},
|
| 30 |
"files": {
|
| 31 |
"CODE_LICENSE": "8fe9e8b749cd4abedabcb3100df445db899e72192394d14cc2dbf24a40811af6",
|
| 32 |
+
"README.md": "ceae661a267d9793f4ee445c7567525ada915ddb70292dd5236923fc24e7e6ee",
|
| 33 |
"adapters.py": "ca0f26826763c0e48b7508da732242bb83adfeb4814e389ed3fde93ad648c728",
|
| 34 |
"config.json": "fe8227548617416bd879efe1be3e9e3fc04270709250f09f01806780fe548789",
|
| 35 |
"configuration_audio.py": "59f3a0b8db0df5af85e677ac33a4431595e9b2eff6d34c1e6a1778dd75a4568d",
|