Instructions to use espnet/must_c_st_train_st_conformer with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- ESPnet
How to use espnet/must_c_st_train_st_conformer with ESPnet:
unknown model type (must be text-to-speech or automatic-speech-recognition)
- Notebooks
- Google Colab
- Kaggle
ESPnet3 st model
Packed model bundle generated from egs3/must_c/st.
Model
- Repository:
espnet/must_c_st_train_st_conformer - Recipe:
egs3/must_c/st - Corpus:
must_c - System:
st - Creator:
sjin2 - Created:
2026-09-19T23:26:37 - Branch:
espnet3/st-system - Git:
1339f4cf99(dirty) - Origin: git@github.com:chenehk/espnet.git
Model summary
- Class:
ESPnetSTModel - Total parameters:
57,592,032 - Learnable parameters:
57,592,032(100.0%) - Non-trainable parameters:
0 - Parameter size:
230.37 MB - Buffers:
22,396(90.27 KB) - Modules:
694total,567leaf - DType composition:
torch.float32(100.0%), torch.float64(0.0%), torch.int64(0.0%)
Usage
from espnet3.publication import InferenceModel
model = InferenceModel.from_pretrained("espnet/must_c_st_train_st_conformer", trust_user_code=True)
result = model(sample)
Packaging
- Bundle:
model_pack - Exp dir:
./exp/train_st_conformer - Strategy:
copy experiment outputs; include extra recipe assets; apply exclude filters
Results
| dataset | BLEU | BLEU_1gram_prec | BLEU_1gram_prec_lc | BLEU_2gram_prec | BLEU_2gram_prec_lc | BLEU_3gram_prec | BLEU_3gram_prec_lc | BLEU_4gram_prec | BLEU_4gram_prec_lc | BLEU_brevity_penalty | BLEU_brevity_penalty_lc | BLEU_lc | TER | TER_lc | chrF2 | chrF2_lc |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| tst-COMMON | 24.22 | 60.97 | 59.2 | 33.18 | 32.83 | 20.52 | 20.13 | 13.26 | 12.86 | 0.8894 | 0.8841 | 23.54 | 61.8 | 57.85 | 50.76 | 51.44 |
| tst-HE | 22.85 | 58.75 | 55.79 | 31.85 | 30.14 | 19.79 | 18.1 | 12.52 | 10.9 | 0.8758 | 0.878 | 21.07 | 66.16 | 62.76 | 49.35 | 49.8 |
Training config
expand
num_device: 1
num_nodes: 1
task: espnet2.tasks.st.STTask
recipe_dir: .
data_dir: ./data
exp_tag: train_st_conformer
exp_dir: ./exp/train_st_conformer
stats_dir: ./exp/stats
dataset_dir: ./data
create_dataset:
func: src.creating_dataset.create_dataset
dataset_dir: ./data
recipe_dir: .
cache:
enabled: true
backend: hf
cache_dir: ./data/hf/en_de
dataset:
_target_: espnet3.components.data.data_organizer.DataOrganizer
_recursive_: false
recipe_dir: .
train:
- data_src: must_c/st
data_src_args:
split: train
recipe_dir: .
source_dir: ./data
cache:
enabled: true
backend: hf
cache_dir: ./data/hf/en_de
task: st
tgt_lang: de
src_case: lc.rm
tgt_case: tc
valid:
- data_src: must_c/st
data_src_args:
split: dev
recipe_dir: .
source_dir: ./data
cache:
enabled: true
backend: hf
cache_dir: ./data/hf/en_de
task: st
tgt_lang: de
src_case: lc.rm
tgt_case: tc
test:
- name: tst-COMMON
data_src: must_c/st
data_src_args:
split: test
recipe_dir: .
source_dir: ./data
cache:
enabled: true
backend: hf
cache_dir: ./data/hf/en_de
task: st
tgt_lang: de
src_case: lc.rm
tgt_case: tc
- name: tst-HE
data_src: must_c/st
data_src_args:
split: tst-HE
recipe_dir: .
source_dir: ./data
cache:
enabled: true
backend: hf
cache_dir: ./data/hf/en_de
task: st
tgt_lang: de
src_case: lc.rm
tgt_case: tc
preprocessor:
_target_: espnet2.train.preprocessor.MutliTokenizerCommonPreprocessor
train: true
token_type:
- bpe
- bpe
bpemodel:
- ./data/bpe_tgt_4000/bpe.model
- ./data/bpe_src_4000/bpe.model
token_list:
- ./data/bpe_tgt_4000/tokens.txt
- ./data/bpe_src_4000/tokens.txt
text_name:
- text
- src_text
_convert_: all
_convert_: all
tokenizer:
tgt:
vocab_size: 4000
character_coverage: 1.0
model_type: bpe
save_path: ./data/bpe_tgt_4000
text_builder:
func: egs3.must_c.st.dataset.gather_training_text
recipe_dir: .
source_dir: ./data
cache:
enabled: true
backend: hf
cache_dir: ./data/hf/en_de
tgt_lang: de
side: tgt
case: tc
src:
vocab_size: 4000
character_coverage: 1.0
model_type: bpe
save_path: ./data/bpe_src_4000
text_builder:
func: egs3.must_c.st.dataset.gather_training_text
recipe_dir: .
source_dir: ./data
cache:
enabled: true
backend: hf
cache_dir: ./data/hf/en_de
tgt_lang: de
side: src
case: lc.rm
model:
token_list: ./data/bpe_tgt_4000/tokens.txt
src_token_list: ./data/bpe_src_4000/tokens.txt
token_type: bpe
src_token_type: bpe
bpemodel: ./data/bpe_tgt_4000/bpe.model
src_bpemodel: ./data/bpe_src_4000/bpe.model
input_size: null
frontend: default
frontend_conf:
n_fft: 400
hop_length: 160
specaug: specaug
specaug_conf:
apply_time_warp: true
time_warp_window: 5
time_warp_mode: bicubic
apply_freq_mask: true
freq_mask_width_range:
- 0
- 27
num_freq_mask: 2
apply_time_mask: true
time_mask_width_ratio_range:
- 0.0
- 0.05
num_time_mask: 5
normalize: global_mvn
normalize_conf:
stats_file: ./exp/stats/train/feats_stats.npz
encoder: conformer
encoder_conf:
output_size: 256
attention_heads: 4
linear_units: 2048
num_blocks: 12
dropout_rate: 0.1
positional_dropout_rate: 0.1
attention_dropout_rate: 0.1
input_layer: conv2d
normalize_before: true
macaron_style: true
rel_pos_type: latest
pos_enc_layer_type: rel_pos
selfattention_layer_type: rel_selfattn
activation_type: swish
use_cnn_module: true
cnn_module_kernel: 31
decoder: transformer
decoder_conf:
attention_heads: 4
linear_units: 2048
num_blocks: 6
dropout_rate: 0.1
positional_dropout_rate: 0.1
self_attention_dropout_rate: 0.1
src_attention_dropout_rate: 0.1
extra_asr_decoder: transformer
extra_asr_decoder_conf:
input_layer: embed
num_blocks: 6
linear_units: 2048
dropout_rate: 0.1
extra_mt_decoder: transformer
extra_mt_decoder_conf:
input_layer: embed
num_blocks: 2
linear_units: 2048
dropout_rate: 0.1
model_conf:
asr_weight: 0.3
mt_weight: 0.0
mtlalpha: 0.3
lsm_weight: 0.1
length_normalized_loss: false
sym_space: โ
tgt_sym_space: โ
optimizer:
_target_: torch.optim.Adam
lr: 0.002
weight_decay: 1.0e-06
_convert_: all
scheduler:
_target_: espnet2.schedulers.warmup_lr.WarmupLR
warmup_steps: 25000
_convert_: all
scheduler_interval: step
scheduler_monitor: null
best_model_criterion:
- - valid/acc
- 10
- max
seed: null
init: null
parallel:
env: local
n_workers: 16
options: {}
dataloader:
collate_fn:
_target_: espnet2.train.collate_fn.CommonCollateFn
int_pad_value: -1
_convert_: all
train:
iter_factory:
_target_: espnet2.iterators.sequence_iter_factory.SequenceIterFactory
shuffle: true
collate_fn:
_target_: espnet2.train.collate_fn.CommonCollateFn
int_pad_value: -1
_convert_: all
batches:
type: numel
shape_files:
- ./exp/stats/train/feats_shape
- ./exp/stats/train/text_shape
- ./exp/stats/train/src_text_shape
batch_size: 4
batch_bins: 26500000
num_workers: 4
_convert_: all
valid:
iter_factory:
_target_: espnet2.iterators.sequence_iter_factory.SequenceIterFactory
shuffle: false
collate_fn:
_target_: espnet2.train.collate_fn.CommonCollateFn
int_pad_value: -1
_convert_: all
batches:
type: numel
shape_files:
- ./exp/stats/valid/feats_shape
- ./exp/stats/valid/text_shape
- ./exp/stats/valid/src_text_shape
batch_size: 4
batch_bins: 26500000
num_workers: 4
_convert_: all
trainer:
accelerator: auto
devices: 1
num_nodes: 1
accumulate_grad_batches: 2
check_val_every_n_epoch: 1
gradient_clip_val: 5.0
log_every_n_steps: 100
max_epochs: 80
logger:
- _target_: lightning.pytorch.loggers.TensorBoardLogger
save_dir: ./exp/train_st_conformer/tensorboard
name: tb_logger
_convert_: all
- _target_: lightning.pytorch.loggers.WandbLogger
project: OWSM-Related Recipes
name: must_c_st
save_dir: ./exp/train_st_conformer
id: must_c_st_conformer_en_de
resume: allow
_convert_: all
strategy: auto
fit: {}
system: espnet3.systems.st.system.STSystem
cache:
enabled: true
backend: hf
cache_dir: ./data/hf/en_de
batch_bins: 26500000
Citing ESPnet
@inproceedings{watanabe2018espnet,
author={Shinji Watanabe and Takaaki Hori and Shigeki Karita and Tomoki Hayashi and
Jiro Nishitoba and Yuya Unno and Nelson Yalta and Jahn Heymann and Matthew Wiesner
and Nanxin Chen and Adithya Renduchintala and Tsubasa Ochiai},
title={{ESPnet}: End-to-End Speech Processing Toolkit},
year={2018},
booktitle={Proceedings of Interspeech},
pages={2207--2211},
doi={10.21437/Interspeech.2018-1456}
}
- Downloads last month
- -
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐ Ask for provider support