hf-transformers-bot commited on
Commit
d6d185d
·
verified ·
1 Parent(s): 0147220

Update tiny models for VibeVoiceAsrForConditionalGeneration

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
chat_template.jinja ADDED
@@ -0,0 +1,26 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- set system_prompt = system_prompt | default("You are a helpful assistant that transcribes audio input into text output in JSON format.") -%}
2
+ <|im_start|>system
3
+ {{ system_prompt }}<|im_end|>
4
+ {%- set audio_token = audio_token | default("<|box_start|>") -%}
5
+ {%- set audio_start_token = "<|object_ref_start|>" -%}
6
+ {%- set audio_end_token = "<|object_ref_end|>" -%}
7
+ {%- for message in messages -%}
8
+ {%- if message['role'] == 'user' -%}
9
+ {{ '
10
+ ' }}<|im_start|>user{{ '
11
+ ' }}{%- set text_items = message['content'] | selectattr('type', 'equalto', 'text') | list -%}
12
+ {%- set context_text = text_items[0]['text'] if text_items else none -%}
13
+ {%- for item in message['content'] -%}
14
+ {%- if item['type'] == 'audio' -%}
15
+ {{ audio_start_token }}{{ audio_token }}{{ audio_end_token }}{{ "
16
+ " }}{%- if context_text -%}
17
+ This is a <|AUDIO_DURATION|> seconds audio, with extra info: {{ context_text }}
18
+
19
+ Please transcribe it with these keys: Start time, End time, Speaker ID, Content{%- else -%}
20
+ This is a <|AUDIO_DURATION|> seconds audio, please transcribe it with these keys: Start time, End time, Speaker ID, Content{%- endif -%}
21
+ {%- endif -%}
22
+ {%- endfor -%}
23
+ <|im_end|>{{ '
24
+ ' }}
25
+ {%- endif -%}
26
+ {%- endfor -%}
config.json ADDED
@@ -0,0 +1,84 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "acoustic_tokenizer_chunk_size": 400,
3
+ "acoustic_tokenizer_encoder_config": {
4
+ "channels": 1,
5
+ "depths": [
6
+ 1,
7
+ 1
8
+ ],
9
+ "downsampling_ratios": [
10
+ 2
11
+ ],
12
+ "ffn_expansion": 4,
13
+ "hidden_act": "gelu",
14
+ "hidden_size": 16,
15
+ "initializer_range": 0.01,
16
+ "kernel_size": 3,
17
+ "layer_scale_init_value": 1e-06,
18
+ "model_type": "vibevoice_acoustic_tokenizer_encoder",
19
+ "n_filters": 4,
20
+ "num_filters": 32,
21
+ "rms_norm_eps": 1e-05,
22
+ "vae_std": 0.625
23
+ },
24
+ "architectures": [
25
+ "VibeVoiceAsrForConditionalGeneration"
26
+ ],
27
+ "audio_bos_token_id": 151646,
28
+ "audio_eos_token_id": 151647,
29
+ "audio_token_id": 0,
30
+ "dtype": "float32",
31
+ "model_type": "vibevoice_asr",
32
+ "semantic_tokenizer_encoder_config": {
33
+ "channels": 1,
34
+ "depths": [
35
+ 1,
36
+ 1
37
+ ],
38
+ "downsampling_ratios": [
39
+ 2
40
+ ],
41
+ "ffn_expansion": 4,
42
+ "hidden_act": "gelu",
43
+ "hidden_size": 32,
44
+ "initializer_range": 0.01,
45
+ "kernel_size": 3,
46
+ "layer_scale_init_value": 1e-06,
47
+ "model_type": "vibevoice_acoustic_tokenizer_encoder",
48
+ "n_filters": 4,
49
+ "num_filters": 32,
50
+ "rms_norm_eps": 1e-05,
51
+ "vae_std": 0.625
52
+ },
53
+ "text_config": {
54
+ "attention_dropout": 0.0,
55
+ "bos_token_id": null,
56
+ "eos_token_id": null,
57
+ "hidden_act": "silu",
58
+ "hidden_size": 32,
59
+ "initializer_range": 0.02,
60
+ "intermediate_size": 36,
61
+ "layer_types": [
62
+ "full_attention",
63
+ "full_attention"
64
+ ],
65
+ "max_position_embeddings": 200,
66
+ "max_window_layers": 28,
67
+ "model_type": "qwen2",
68
+ "num_attention_heads": 4,
69
+ "num_hidden_layers": 2,
70
+ "num_key_value_heads": 4,
71
+ "pad_token_id": 151643,
72
+ "rms_norm_eps": 1e-06,
73
+ "rope_parameters": {
74
+ "rope_theta": 10000.0,
75
+ "rope_type": "default"
76
+ },
77
+ "sliding_window": null,
78
+ "tie_word_embeddings": false,
79
+ "use_cache": true,
80
+ "use_sliding_window": false,
81
+ "vocab_size": 151665
82
+ },
83
+ "transformers_version": "5.16.0.dev0"
84
+ }
generation_config.json ADDED
@@ -0,0 +1,8 @@
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "output_attentions": false,
4
+ "output_hidden_states": false,
5
+ "pad_token_id": 151643,
6
+ "transformers_version": "5.16.0.dev0",
7
+ "use_cache": true
8
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f867d8182da0f171d34f5d3eb2f2802f5557c3a587cb84309650c24cc64452d5
3
+ size 39355864
preprocessor_config.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "eps": 1e-06,
3
+ "feature_extractor_type": "VibeVoiceAcousticTokenizerFeatureExtractor",
4
+ "feature_size": 1,
5
+ "normalize_audio": true,
6
+ "padding_side": "right",
7
+ "padding_value": 0.0,
8
+ "return_attention_mask": true,
9
+ "sampling_rate": 24000,
10
+ "target_dB_FS": -25
11
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3fd169731d2cbde95e10bf356d66d5997fd885dd8dbb6fb4684da3f23b2585d8
3
+ size 11421892
tokenizer_config.json ADDED
@@ -0,0 +1,31 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": null,
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|endoftext|>",
7
+ "errors": "replace",
8
+ "extra_special_tokens": [
9
+ "<|im_start|>",
10
+ "<|im_end|>",
11
+ "<|object_ref_start|>",
12
+ "<|object_ref_end|>",
13
+ "<|box_start|>",
14
+ "<|box_end|>",
15
+ "<|quad_start|>",
16
+ "<|quad_end|>",
17
+ "<|vision_start|>",
18
+ "<|vision_end|>",
19
+ "<|vision_pad|>",
20
+ "<|image_pad|>",
21
+ "<|video_pad|>"
22
+ ],
23
+ "is_local": true,
24
+ "local_files_only": false,
25
+ "model_max_length": 200,
26
+ "pad_token": "<|endoftext|>",
27
+ "processor_class": "VibeVoiceAsrProcessor",
28
+ "split_special_tokens": false,
29
+ "tokenizer_class": "Qwen2Tokenizer",
30
+ "unk_token": null
31
+ }