MioCodec-encoder-webgpu / encoder-weights.json
m96-chan's picture
Publish weights repackaged for browser WebGPU inference
e15bee2 verified
Raw
History Blame Contribute Delete
8.91 kB
{
"repo_id": "Aratako/MioCodec-25Hz-24kHz",
"torch": "2.10.0+cu128",
"sources": {
"miocodec": {
"file": "model.safetensors",
"bytes": 523087956,
"sha256": "60483759cde136451d53ff5a2f7e283c015758ab540de9037b5d4519366a7705"
},
"wavlm": {
"file": "wavlm_base_plus.pth",
"bytes": 377604347,
"sha256": "136a3e720c04f2c77bf7a4dc6a3868b14d5a2c145a988114b733cb1a8428be98"
}
},
"resample": {
"orig": 3,
"new": 2,
"width": 10
},
"tensors": {
"resample.kernel": [
2,
1,
23
],
"wavlm.feature_extractor.conv_layers.0.conv.weight": [
512,
1,
10
],
"wavlm.feature_extractor.conv_layers.0.layer_norm.weight": [
512
],
"wavlm.feature_extractor.conv_layers.0.layer_norm.bias": [
512
],
"wavlm.feature_extractor.conv_layers.1.conv.weight": [
512,
512,
3
],
"wavlm.feature_extractor.conv_layers.2.conv.weight": [
512,
512,
3
],
"wavlm.feature_extractor.conv_layers.3.conv.weight": [
512,
512,
3
],
"wavlm.feature_extractor.conv_layers.4.conv.weight": [
512,
512,
3
],
"wavlm.feature_extractor.conv_layers.5.conv.weight": [
512,
512,
2
],
"wavlm.feature_extractor.conv_layers.6.conv.weight": [
512,
512,
2
],
"wavlm.encoder.feature_projection.layer_norm.weight": [
512
],
"wavlm.encoder.feature_projection.layer_norm.bias": [
512
],
"wavlm.encoder.feature_projection.projection.weight": [
768,
512
],
"wavlm.encoder.feature_projection.projection.bias": [
768
],
"wavlm.encoder.transformer.pos_conv_embed.conv.weight": [
768,
48,
128
],
"wavlm.encoder.transformer.pos_conv_embed.conv.bias": [
768
],
"wavlm.encoder.transformer.layer_norm.weight": [
768
],
"wavlm.encoder.transformer.layer_norm.bias": [
768
],
"wavlm.encoder.transformer.layers.0.attention.attention.in_proj_weight": [
2304,
768
],
"wavlm.encoder.transformer.layers.0.attention.attention.in_proj_bias": [
2304
],
"wavlm.encoder.transformer.layers.0.attention.attention.out_proj.weight": [
768,
768
],
"wavlm.encoder.transformer.layers.0.attention.attention.out_proj.bias": [
768
],
"wavlm.encoder.transformer.layers.0.attention.gru_rel_pos_linear.weight": [
8,
64
],
"wavlm.encoder.transformer.layers.0.attention.gru_rel_pos_linear.bias": [
8
],
"wavlm.encoder.transformer.layers.0.attention.gru_rel_pos_const": [
1,
12,
1,
1
],
"wavlm.encoder.transformer.layers.0.attention.rel_attn_embed.weight": [
320,
12
],
"wavlm.encoder.transformer.layers.0.layer_norm.weight": [
768
],
"wavlm.encoder.transformer.layers.0.layer_norm.bias": [
768
],
"wavlm.encoder.transformer.layers.0.final_layer_norm.weight": [
768
],
"wavlm.encoder.transformer.layers.0.final_layer_norm.bias": [
768
],
"wavlm.encoder.transformer.layers.0.feed_forward.intermediate_dense.weight": [
3072,
768
],
"wavlm.encoder.transformer.layers.0.feed_forward.intermediate_dense.bias": [
3072
],
"wavlm.encoder.transformer.layers.0.feed_forward.output_dense.weight": [
768,
3072
],
"wavlm.encoder.transformer.layers.0.feed_forward.output_dense.bias": [
768
],
"wavlm.encoder.transformer.layers.1.attention.attention.in_proj_weight": [
2304,
768
],
"wavlm.encoder.transformer.layers.1.attention.attention.in_proj_bias": [
2304
],
"wavlm.encoder.transformer.layers.1.attention.attention.out_proj.weight": [
768,
768
],
"wavlm.encoder.transformer.layers.1.attention.attention.out_proj.bias": [
768
],
"wavlm.encoder.transformer.layers.1.attention.gru_rel_pos_linear.weight": [
8,
64
],
"wavlm.encoder.transformer.layers.1.attention.gru_rel_pos_linear.bias": [
8
],
"wavlm.encoder.transformer.layers.1.attention.gru_rel_pos_const": [
1,
12,
1,
1
],
"wavlm.encoder.transformer.layers.1.layer_norm.weight": [
768
],
"wavlm.encoder.transformer.layers.1.layer_norm.bias": [
768
],
"wavlm.encoder.transformer.layers.1.final_layer_norm.weight": [
768
],
"wavlm.encoder.transformer.layers.1.final_layer_norm.bias": [
768
],
"wavlm.encoder.transformer.layers.1.feed_forward.intermediate_dense.weight": [
3072,
768
],
"wavlm.encoder.transformer.layers.1.feed_forward.intermediate_dense.bias": [
3072
],
"wavlm.encoder.transformer.layers.1.feed_forward.output_dense.weight": [
768,
3072
],
"wavlm.encoder.transformer.layers.1.feed_forward.output_dense.bias": [
768
],
"global_encoder.backbone.embed.weight": [
384,
768,
7
],
"global_encoder.backbone.embed.bias": [
384
],
"global_encoder.backbone.norm.weight": [
384
],
"global_encoder.backbone.norm.bias": [
384
],
"global_encoder.backbone.convnext.0.gamma": [
384
],
"global_encoder.backbone.convnext.0.dwconv.weight": [
384,
1,
7
],
"global_encoder.backbone.convnext.0.dwconv.bias": [
384
],
"global_encoder.backbone.convnext.0.norm.weight": [
384
],
"global_encoder.backbone.convnext.0.norm.bias": [
384
],
"global_encoder.backbone.convnext.0.pwconv1.weight": [
1152,
384
],
"global_encoder.backbone.convnext.0.pwconv1.bias": [
1152
],
"global_encoder.backbone.convnext.0.pwconv2.weight": [
384,
1152
],
"global_encoder.backbone.convnext.0.pwconv2.bias": [
384
],
"global_encoder.backbone.convnext.1.gamma": [
384
],
"global_encoder.backbone.convnext.1.dwconv.weight": [
384,
1,
7
],
"global_encoder.backbone.convnext.1.dwconv.bias": [
384
],
"global_encoder.backbone.convnext.1.norm.weight": [
384
],
"global_encoder.backbone.convnext.1.norm.bias": [
384
],
"global_encoder.backbone.convnext.1.pwconv1.weight": [
1152,
384
],
"global_encoder.backbone.convnext.1.pwconv1.bias": [
1152
],
"global_encoder.backbone.convnext.1.pwconv2.weight": [
384,
1152
],
"global_encoder.backbone.convnext.1.pwconv2.bias": [
384
],
"global_encoder.backbone.convnext.2.gamma": [
384
],
"global_encoder.backbone.convnext.2.dwconv.weight": [
384,
1,
7
],
"global_encoder.backbone.convnext.2.dwconv.bias": [
384
],
"global_encoder.backbone.convnext.2.norm.weight": [
384
],
"global_encoder.backbone.convnext.2.norm.bias": [
384
],
"global_encoder.backbone.convnext.2.pwconv1.weight": [
1152,
384
],
"global_encoder.backbone.convnext.2.pwconv1.bias": [
1152
],
"global_encoder.backbone.convnext.2.pwconv2.weight": [
384,
1152
],
"global_encoder.backbone.convnext.2.pwconv2.bias": [
384
],
"global_encoder.backbone.convnext.3.gamma": [
384
],
"global_encoder.backbone.convnext.3.dwconv.weight": [
384,
1,
7
],
"global_encoder.backbone.convnext.3.dwconv.bias": [
384
],
"global_encoder.backbone.convnext.3.norm.weight": [
384
],
"global_encoder.backbone.convnext.3.norm.bias": [
384
],
"global_encoder.backbone.convnext.3.pwconv1.weight": [
1152,
384
],
"global_encoder.backbone.convnext.3.pwconv1.bias": [
1152
],
"global_encoder.backbone.convnext.3.pwconv2.weight": [
384,
1152
],
"global_encoder.backbone.convnext.3.pwconv2.bias": [
384
],
"global_encoder.backbone.final_layer_norm.weight": [
384
],
"global_encoder.backbone.final_layer_norm.bias": [
384
],
"global_encoder.pooling.attn.0.weight": [
128,
384,
1
],
"global_encoder.pooling.attn.0.bias": [
128
],
"global_encoder.pooling.attn.2.weight": [
384,
128,
1
],
"global_encoder.pooling.attn.2.bias": [
384
],
"global_encoder.pooling.proj.weight": [
128,
768
],
"global_encoder.pooling.proj.bias": [
128
],
"global_encoder.pooling.norm.weight": [
128
],
"global_encoder.pooling.norm.bias": [
128
]
},
"bytes": 117303232,
"sha256": "a35b4eaec345dde0e9abb2a7aa2c8c66e7a39d4ab53afce584568b5a616a0abd"
}