hf-transformers-bot commited on
Commit
7047edc
·
verified ·
1 Parent(s): 57a1c4a

Update tiny models for MusicFlamingoModel

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
chat_template.jinja ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {% if messages[0]['role'] != 'system' %}<|im_start|>system
2
+ You are Music Flamingo, a multimodal assistant for language and music. On each turn you receive an audio clip which contains music and optional text, you will receive at least one or both; use your world knowledge and reasoning to help the user with any task. Interpret the entirety of the content any input music--regardlenss of whether the user calls it audio, music, or sound.<|im_end|>
3
+ {% endif %}{% for m in messages if m['content'] is not none %}<|im_start|>{{ m['role'] }}
4
+ {% if m['content'] is string %}{{ m['content'] }}{% else %}{% set audio = namespace(found=False) %}{% set text_buf = namespace(v='') %}{% for c in m['content'] %}{% if c.get('type') == 'audio' or 'audio' in c %}{% set audio.found = True %}{% elif c.get('type') == 'text' or 'text' in c %}{% set text_buf.v = text_buf.v + c['text'] %}{% endif %}{% endfor %}{% if audio.found %}{{ '<sound>' }}{% endif %}{{ text_buf.v }}{% endif %}<|im_end|>
5
+ {% endfor %}{% if add_generation_prompt %}<|im_start|>assistant
6
+ {% endif %}
config.json ADDED
@@ -0,0 +1,68 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "MusicFlamingoModel"
4
+ ],
5
+ "audio_bos_token_id": 151670,
6
+ "audio_config": {
7
+ "activation_dropout": 0.0,
8
+ "activation_function": "gelu",
9
+ "attention_dropout": 0.0,
10
+ "dropout": 0.0,
11
+ "hidden_size": 32,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 32,
14
+ "layerdrop": 0.0,
15
+ "max_source_positions": 30,
16
+ "model_type": "audioflamingo3_encoder",
17
+ "num_attention_heads": 2,
18
+ "num_hidden_layers": 2,
19
+ "num_mel_bins": 80,
20
+ "scale_embedding": false
21
+ },
22
+ "audio_eos_token_id": 151671,
23
+ "audio_frame_step": 0.01,
24
+ "audio_token_id": 0,
25
+ "dtype": "float32",
26
+ "head_dim": 32,
27
+ "max_position_embeddings": 512,
28
+ "model_type": "musicflamingo",
29
+ "pad_token_id": 151669,
30
+ "projector_bias": true,
31
+ "projector_hidden_act": "gelu",
32
+ "rope_parameters": {
33
+ "partial_rotary_factor": 0.5,
34
+ "rope_theta": 2048,
35
+ "rope_type": "default"
36
+ },
37
+ "text_config": {
38
+ "attention_dropout": 0.0,
39
+ "bos_token_id": 151668,
40
+ "eos_token_id": 151645,
41
+ "hidden_act": "gelu",
42
+ "hidden_size": 32,
43
+ "initializer_range": 0.02,
44
+ "intermediate_size": 32,
45
+ "layer_types": [
46
+ "full_attention",
47
+ "full_attention"
48
+ ],
49
+ "max_position_embeddings": 512,
50
+ "max_window_layers": 28,
51
+ "model_type": "qwen2",
52
+ "num_attention_heads": 2,
53
+ "num_hidden_layers": 2,
54
+ "num_key_value_heads": 2,
55
+ "pad_token_id": 151669,
56
+ "rms_norm_eps": 1e-06,
57
+ "rope_parameters": {
58
+ "rope_theta": 10000.0,
59
+ "rope_type": "default"
60
+ },
61
+ "sliding_window": null,
62
+ "tie_word_embeddings": false,
63
+ "use_cache": true,
64
+ "use_sliding_window": false,
65
+ "vocab_size": 151672
66
+ },
67
+ "transformers_version": "5.16.0.dev0"
68
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:46ab9ea4e28933a546b19f9de191abf2a4ce4fece57a6fbfa2fe1729294bf019
3
+ size 19587296
preprocessor_config.json ADDED
@@ -0,0 +1,14 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "chunk_length": 30,
3
+ "dither": 0.0,
4
+ "feature_extractor_type": "WhisperFeatureExtractor",
5
+ "feature_size": 128,
6
+ "hop_length": 160,
7
+ "n_fft": 400,
8
+ "n_samples": 480000,
9
+ "nb_max_frames": 3000,
10
+ "padding_side": "right",
11
+ "padding_value": 0.0,
12
+ "return_attention_mask": true,
13
+ "sampling_rate": 16000
14
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a64cc913679c6eaf01ba137504e15a55d174d590944fe06f7b3899b2ae82de31
3
+ size 11423197
tokenizer_config.json ADDED
@@ -0,0 +1,22 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "[BOS]",
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "errors": "replace",
8
+ "extra_special_tokens": [
9
+ "<|sound_bos|>",
10
+ "<|sound_eos|>"
11
+ ],
12
+ "is_local": true,
13
+ "legacy": false,
14
+ "local_files_only": false,
15
+ "model_max_length": 512,
16
+ "pad_token": "[PAD]",
17
+ "padding_side": "right",
18
+ "processor_class": "MusicFlamingoProcessor",
19
+ "split_special_tokens": false,
20
+ "tokenizer_class": "Qwen2Tokenizer",
21
+ "unk_token": null
22
+ }