ESPnet3 st model

Packed model bundle generated from egs3/must_c/st.

Model

  • Repository: espnet/must_c_st_train_st_conformer
  • Recipe: egs3/must_c/st
  • Corpus: must_c
  • System: st
  • Creator: sjin2
  • Created: 2026-09-19T23:26:37
  • Branch: espnet3/st-system
  • Git: 1339f4cf99 (dirty)
  • Origin: git@github.com:chenehk/espnet.git

Model summary

  • Class: ESPnetSTModel
  • Total parameters: 57,592,032
  • Learnable parameters: 57,592,032 (100.0%)
  • Non-trainable parameters: 0
  • Parameter size: 230.37 MB
  • Buffers: 22,396 (90.27 KB)
  • Modules: 694 total, 567 leaf
  • DType composition: torch.float32(100.0%), torch.float64(0.0%), torch.int64(0.0%)

Usage

from espnet3.publication import InferenceModel

model = InferenceModel.from_pretrained("espnet/must_c_st_train_st_conformer", trust_user_code=True)
result = model(sample)

Packaging

  • Bundle: model_pack
  • Exp dir: ./exp/train_st_conformer
  • Strategy: copy experiment outputs; include extra recipe assets; apply exclude filters

Results

dataset BLEU BLEU_1gram_prec BLEU_1gram_prec_lc BLEU_2gram_prec BLEU_2gram_prec_lc BLEU_3gram_prec BLEU_3gram_prec_lc BLEU_4gram_prec BLEU_4gram_prec_lc BLEU_brevity_penalty BLEU_brevity_penalty_lc BLEU_lc TER TER_lc chrF2 chrF2_lc
tst-COMMON 24.22 60.97 59.2 33.18 32.83 20.52 20.13 13.26 12.86 0.8894 0.8841 23.54 61.8 57.85 50.76 51.44
tst-HE 22.85 58.75 55.79 31.85 30.14 19.79 18.1 12.52 10.9 0.8758 0.878 21.07 66.16 62.76 49.35 49.8

Training config

expand
num_device: 1
num_nodes: 1
task: espnet2.tasks.st.STTask
recipe_dir: .
data_dir: ./data
exp_tag: train_st_conformer
exp_dir: ./exp/train_st_conformer
stats_dir: ./exp/stats
dataset_dir: ./data
create_dataset:
  func: src.creating_dataset.create_dataset
  dataset_dir: ./data
  recipe_dir: .
  cache:
    enabled: true
    backend: hf
    cache_dir: ./data/hf/en_de
dataset:
  _target_: espnet3.components.data.data_organizer.DataOrganizer
  _recursive_: false
  recipe_dir: .
  train:
  - data_src: must_c/st
    data_src_args:
      split: train
      recipe_dir: .
      source_dir: ./data
      cache:
        enabled: true
        backend: hf
        cache_dir: ./data/hf/en_de
      task: st
      tgt_lang: de
      src_case: lc.rm
      tgt_case: tc
  valid:
  - data_src: must_c/st
    data_src_args:
      split: dev
      recipe_dir: .
      source_dir: ./data
      cache:
        enabled: true
        backend: hf
        cache_dir: ./data/hf/en_de
      task: st
      tgt_lang: de
      src_case: lc.rm
      tgt_case: tc
  test:
  - name: tst-COMMON
    data_src: must_c/st
    data_src_args:
      split: test
      recipe_dir: .
      source_dir: ./data
      cache:
        enabled: true
        backend: hf
        cache_dir: ./data/hf/en_de
      task: st
      tgt_lang: de
      src_case: lc.rm
      tgt_case: tc
  - name: tst-HE
    data_src: must_c/st
    data_src_args:
      split: tst-HE
      recipe_dir: .
      source_dir: ./data
      cache:
        enabled: true
        backend: hf
        cache_dir: ./data/hf/en_de
      task: st
      tgt_lang: de
      src_case: lc.rm
      tgt_case: tc
  preprocessor:
    _target_: espnet2.train.preprocessor.MutliTokenizerCommonPreprocessor
    train: true
    token_type:
    - bpe
    - bpe
    bpemodel:
    - ./data/bpe_tgt_4000/bpe.model
    - ./data/bpe_src_4000/bpe.model
    token_list:
    - ./data/bpe_tgt_4000/tokens.txt
    - ./data/bpe_src_4000/tokens.txt
    text_name:
    - text
    - src_text
    _convert_: all
  _convert_: all
tokenizer:
  tgt:
    vocab_size: 4000
    character_coverage: 1.0
    model_type: bpe
    save_path: ./data/bpe_tgt_4000
    text_builder:
      func: egs3.must_c.st.dataset.gather_training_text
      recipe_dir: .
      source_dir: ./data
      cache:
        enabled: true
        backend: hf
        cache_dir: ./data/hf/en_de
      tgt_lang: de
      side: tgt
      case: tc
  src:
    vocab_size: 4000
    character_coverage: 1.0
    model_type: bpe
    save_path: ./data/bpe_src_4000
    text_builder:
      func: egs3.must_c.st.dataset.gather_training_text
      recipe_dir: .
      source_dir: ./data
      cache:
        enabled: true
        backend: hf
        cache_dir: ./data/hf/en_de
      tgt_lang: de
      side: src
      case: lc.rm
model:
  token_list: ./data/bpe_tgt_4000/tokens.txt
  src_token_list: ./data/bpe_src_4000/tokens.txt
  token_type: bpe
  src_token_type: bpe
  bpemodel: ./data/bpe_tgt_4000/bpe.model
  src_bpemodel: ./data/bpe_src_4000/bpe.model
  input_size: null
  frontend: default
  frontend_conf:
    n_fft: 400
    hop_length: 160
  specaug: specaug
  specaug_conf:
    apply_time_warp: true
    time_warp_window: 5
    time_warp_mode: bicubic
    apply_freq_mask: true
    freq_mask_width_range:
    - 0
    - 27
    num_freq_mask: 2
    apply_time_mask: true
    time_mask_width_ratio_range:
    - 0.0
    - 0.05
    num_time_mask: 5
  normalize: global_mvn
  normalize_conf:
    stats_file: ./exp/stats/train/feats_stats.npz
  encoder: conformer
  encoder_conf:
    output_size: 256
    attention_heads: 4
    linear_units: 2048
    num_blocks: 12
    dropout_rate: 0.1
    positional_dropout_rate: 0.1
    attention_dropout_rate: 0.1
    input_layer: conv2d
    normalize_before: true
    macaron_style: true
    rel_pos_type: latest
    pos_enc_layer_type: rel_pos
    selfattention_layer_type: rel_selfattn
    activation_type: swish
    use_cnn_module: true
    cnn_module_kernel: 31
  decoder: transformer
  decoder_conf:
    attention_heads: 4
    linear_units: 2048
    num_blocks: 6
    dropout_rate: 0.1
    positional_dropout_rate: 0.1
    self_attention_dropout_rate: 0.1
    src_attention_dropout_rate: 0.1
  extra_asr_decoder: transformer
  extra_asr_decoder_conf:
    input_layer: embed
    num_blocks: 6
    linear_units: 2048
    dropout_rate: 0.1
  extra_mt_decoder: transformer
  extra_mt_decoder_conf:
    input_layer: embed
    num_blocks: 2
    linear_units: 2048
    dropout_rate: 0.1
  model_conf:
    asr_weight: 0.3
    mt_weight: 0.0
    mtlalpha: 0.3
    lsm_weight: 0.1
    length_normalized_loss: false
    sym_space: โ–
    tgt_sym_space: โ–
optimizer:
  _target_: torch.optim.Adam
  lr: 0.002
  weight_decay: 1.0e-06
  _convert_: all
scheduler:
  _target_: espnet2.schedulers.warmup_lr.WarmupLR
  warmup_steps: 25000
  _convert_: all
scheduler_interval: step
scheduler_monitor: null
best_model_criterion:
- - valid/acc
  - 10
  - max
seed: null
init: null
parallel:
  env: local
  n_workers: 16
  options: {}
dataloader:
  collate_fn:
    _target_: espnet2.train.collate_fn.CommonCollateFn
    int_pad_value: -1
    _convert_: all
  train:
    iter_factory:
      _target_: espnet2.iterators.sequence_iter_factory.SequenceIterFactory
      shuffle: true
      collate_fn:
        _target_: espnet2.train.collate_fn.CommonCollateFn
        int_pad_value: -1
        _convert_: all
      batches:
        type: numel
        shape_files:
        - ./exp/stats/train/feats_shape
        - ./exp/stats/train/text_shape
        - ./exp/stats/train/src_text_shape
        batch_size: 4
        batch_bins: 26500000
      num_workers: 4
      _convert_: all
  valid:
    iter_factory:
      _target_: espnet2.iterators.sequence_iter_factory.SequenceIterFactory
      shuffle: false
      collate_fn:
        _target_: espnet2.train.collate_fn.CommonCollateFn
        int_pad_value: -1
        _convert_: all
      batches:
        type: numel
        shape_files:
        - ./exp/stats/valid/feats_shape
        - ./exp/stats/valid/text_shape
        - ./exp/stats/valid/src_text_shape
        batch_size: 4
        batch_bins: 26500000
      num_workers: 4
      _convert_: all
trainer:
  accelerator: auto
  devices: 1
  num_nodes: 1
  accumulate_grad_batches: 2
  check_val_every_n_epoch: 1
  gradient_clip_val: 5.0
  log_every_n_steps: 100
  max_epochs: 80
  logger:
  - _target_: lightning.pytorch.loggers.TensorBoardLogger
    save_dir: ./exp/train_st_conformer/tensorboard
    name: tb_logger
    _convert_: all
  - _target_: lightning.pytorch.loggers.WandbLogger
    project: OWSM-Related Recipes
    name: must_c_st
    save_dir: ./exp/train_st_conformer
    id: must_c_st_conformer_en_de
    resume: allow
    _convert_: all
  strategy: auto
fit: {}
system: espnet3.systems.st.system.STSystem
cache:
  enabled: true
  backend: hf
  cache_dir: ./data/hf/en_de
batch_bins: 26500000

Citing ESPnet

@inproceedings{watanabe2018espnet,
  author={Shinji Watanabe and Takaaki Hori and Shigeki Karita and Tomoki Hayashi and
    Jiro Nishitoba and Yuya Unno and Nelson Yalta and Jahn Heymann and Matthew Wiesner
    and Nanxin Chen and Adithya Renduchintala and Tsubasa Ochiai},
  title={{ESPnet}: End-to-End Speech Processing Toolkit},
  year={2018},
  booktitle={Proceedings of Interspeech},
  pages={2207--2211},
  doi={10.21437/Interspeech.2018-1456}
}
Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support