{ "repo_id": "Aratako/MioCodec-25Hz-24kHz", "torch": "2.10.0+cu128", "sources": { "miocodec": { "file": "model.safetensors", "bytes": 523087956, "sha256": "60483759cde136451d53ff5a2f7e283c015758ab540de9037b5d4519366a7705" }, "wavlm": { "file": "wavlm_base_plus.pth", "bytes": 377604347, "sha256": "136a3e720c04f2c77bf7a4dc6a3868b14d5a2c145a988114b733cb1a8428be98" } }, "resample": { "orig": 3, "new": 2, "width": 10 }, "tensors": { "resample.kernel": [ 2, 1, 23 ], "wavlm.feature_extractor.conv_layers.0.conv.weight": [ 512, 1, 10 ], "wavlm.feature_extractor.conv_layers.0.layer_norm.weight": [ 512 ], "wavlm.feature_extractor.conv_layers.0.layer_norm.bias": [ 512 ], "wavlm.feature_extractor.conv_layers.1.conv.weight": [ 512, 512, 3 ], "wavlm.feature_extractor.conv_layers.2.conv.weight": [ 512, 512, 3 ], "wavlm.feature_extractor.conv_layers.3.conv.weight": [ 512, 512, 3 ], "wavlm.feature_extractor.conv_layers.4.conv.weight": [ 512, 512, 3 ], "wavlm.feature_extractor.conv_layers.5.conv.weight": [ 512, 512, 2 ], "wavlm.feature_extractor.conv_layers.6.conv.weight": [ 512, 512, 2 ], "wavlm.encoder.feature_projection.layer_norm.weight": [ 512 ], "wavlm.encoder.feature_projection.layer_norm.bias": [ 512 ], "wavlm.encoder.feature_projection.projection.weight": [ 768, 512 ], "wavlm.encoder.feature_projection.projection.bias": [ 768 ], "wavlm.encoder.transformer.pos_conv_embed.conv.weight": [ 768, 48, 128 ], "wavlm.encoder.transformer.pos_conv_embed.conv.bias": [ 768 ], "wavlm.encoder.transformer.layer_norm.weight": [ 768 ], "wavlm.encoder.transformer.layer_norm.bias": [ 768 ], "wavlm.encoder.transformer.layers.0.attention.attention.in_proj_weight": [ 2304, 768 ], "wavlm.encoder.transformer.layers.0.attention.attention.in_proj_bias": [ 2304 ], "wavlm.encoder.transformer.layers.0.attention.attention.out_proj.weight": [ 768, 768 ], "wavlm.encoder.transformer.layers.0.attention.attention.out_proj.bias": [ 768 ], "wavlm.encoder.transformer.layers.0.attention.gru_rel_pos_linear.weight": [ 8, 64 ], "wavlm.encoder.transformer.layers.0.attention.gru_rel_pos_linear.bias": [ 8 ], "wavlm.encoder.transformer.layers.0.attention.gru_rel_pos_const": [ 1, 12, 1, 1 ], "wavlm.encoder.transformer.layers.0.attention.rel_attn_embed.weight": [ 320, 12 ], "wavlm.encoder.transformer.layers.0.layer_norm.weight": [ 768 ], "wavlm.encoder.transformer.layers.0.layer_norm.bias": [ 768 ], "wavlm.encoder.transformer.layers.0.final_layer_norm.weight": [ 768 ], "wavlm.encoder.transformer.layers.0.final_layer_norm.bias": [ 768 ], "wavlm.encoder.transformer.layers.0.feed_forward.intermediate_dense.weight": [ 3072, 768 ], "wavlm.encoder.transformer.layers.0.feed_forward.intermediate_dense.bias": [ 3072 ], "wavlm.encoder.transformer.layers.0.feed_forward.output_dense.weight": [ 768, 3072 ], "wavlm.encoder.transformer.layers.0.feed_forward.output_dense.bias": [ 768 ], "wavlm.encoder.transformer.layers.1.attention.attention.in_proj_weight": [ 2304, 768 ], "wavlm.encoder.transformer.layers.1.attention.attention.in_proj_bias": [ 2304 ], "wavlm.encoder.transformer.layers.1.attention.attention.out_proj.weight": [ 768, 768 ], "wavlm.encoder.transformer.layers.1.attention.attention.out_proj.bias": [ 768 ], "wavlm.encoder.transformer.layers.1.attention.gru_rel_pos_linear.weight": [ 8, 64 ], "wavlm.encoder.transformer.layers.1.attention.gru_rel_pos_linear.bias": [ 8 ], "wavlm.encoder.transformer.layers.1.attention.gru_rel_pos_const": [ 1, 12, 1, 1 ], "wavlm.encoder.transformer.layers.1.layer_norm.weight": [ 768 ], "wavlm.encoder.transformer.layers.1.layer_norm.bias": [ 768 ], "wavlm.encoder.transformer.layers.1.final_layer_norm.weight": [ 768 ], "wavlm.encoder.transformer.layers.1.final_layer_norm.bias": [ 768 ], "wavlm.encoder.transformer.layers.1.feed_forward.intermediate_dense.weight": [ 3072, 768 ], "wavlm.encoder.transformer.layers.1.feed_forward.intermediate_dense.bias": [ 3072 ], "wavlm.encoder.transformer.layers.1.feed_forward.output_dense.weight": [ 768, 3072 ], "wavlm.encoder.transformer.layers.1.feed_forward.output_dense.bias": [ 768 ], "global_encoder.backbone.embed.weight": [ 384, 768, 7 ], "global_encoder.backbone.embed.bias": [ 384 ], "global_encoder.backbone.norm.weight": [ 384 ], "global_encoder.backbone.norm.bias": [ 384 ], "global_encoder.backbone.convnext.0.gamma": [ 384 ], "global_encoder.backbone.convnext.0.dwconv.weight": [ 384, 1, 7 ], "global_encoder.backbone.convnext.0.dwconv.bias": [ 384 ], "global_encoder.backbone.convnext.0.norm.weight": [ 384 ], "global_encoder.backbone.convnext.0.norm.bias": [ 384 ], "global_encoder.backbone.convnext.0.pwconv1.weight": [ 1152, 384 ], "global_encoder.backbone.convnext.0.pwconv1.bias": [ 1152 ], "global_encoder.backbone.convnext.0.pwconv2.weight": [ 384, 1152 ], "global_encoder.backbone.convnext.0.pwconv2.bias": [ 384 ], "global_encoder.backbone.convnext.1.gamma": [ 384 ], "global_encoder.backbone.convnext.1.dwconv.weight": [ 384, 1, 7 ], "global_encoder.backbone.convnext.1.dwconv.bias": [ 384 ], "global_encoder.backbone.convnext.1.norm.weight": [ 384 ], "global_encoder.backbone.convnext.1.norm.bias": [ 384 ], "global_encoder.backbone.convnext.1.pwconv1.weight": [ 1152, 384 ], "global_encoder.backbone.convnext.1.pwconv1.bias": [ 1152 ], "global_encoder.backbone.convnext.1.pwconv2.weight": [ 384, 1152 ], "global_encoder.backbone.convnext.1.pwconv2.bias": [ 384 ], "global_encoder.backbone.convnext.2.gamma": [ 384 ], "global_encoder.backbone.convnext.2.dwconv.weight": [ 384, 1, 7 ], "global_encoder.backbone.convnext.2.dwconv.bias": [ 384 ], "global_encoder.backbone.convnext.2.norm.weight": [ 384 ], "global_encoder.backbone.convnext.2.norm.bias": [ 384 ], "global_encoder.backbone.convnext.2.pwconv1.weight": [ 1152, 384 ], "global_encoder.backbone.convnext.2.pwconv1.bias": [ 1152 ], "global_encoder.backbone.convnext.2.pwconv2.weight": [ 384, 1152 ], "global_encoder.backbone.convnext.2.pwconv2.bias": [ 384 ], "global_encoder.backbone.convnext.3.gamma": [ 384 ], "global_encoder.backbone.convnext.3.dwconv.weight": [ 384, 1, 7 ], "global_encoder.backbone.convnext.3.dwconv.bias": [ 384 ], "global_encoder.backbone.convnext.3.norm.weight": [ 384 ], "global_encoder.backbone.convnext.3.norm.bias": [ 384 ], "global_encoder.backbone.convnext.3.pwconv1.weight": [ 1152, 384 ], "global_encoder.backbone.convnext.3.pwconv1.bias": [ 1152 ], "global_encoder.backbone.convnext.3.pwconv2.weight": [ 384, 1152 ], "global_encoder.backbone.convnext.3.pwconv2.bias": [ 384 ], "global_encoder.backbone.final_layer_norm.weight": [ 384 ], "global_encoder.backbone.final_layer_norm.bias": [ 384 ], "global_encoder.pooling.attn.0.weight": [ 128, 384, 1 ], "global_encoder.pooling.attn.0.bias": [ 128 ], "global_encoder.pooling.attn.2.weight": [ 384, 128, 1 ], "global_encoder.pooling.attn.2.bias": [ 384 ], "global_encoder.pooling.proj.weight": [ 128, 768 ], "global_encoder.pooling.proj.bias": [ 128 ], "global_encoder.pooling.norm.weight": [ 128 ], "global_encoder.pooling.norm.bias": [ 128 ] }, "bytes": 117303232, "sha256": "a35b4eaec345dde0e9abb2a7aa2c8c66e7a39d4ab53afce584568b5a616a0abd" }