hf-transformers-bot commited on
Commit
94dab1a
·
verified ·
1 Parent(s): b2bc7c3

Update tiny models for Sam3Model

Browse files
config.json ADDED
@@ -0,0 +1,141 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Sam3Model"
4
+ ],
5
+ "detr_decoder_config": {
6
+ "dropout": 0.1,
7
+ "hidden_act": "relu",
8
+ "hidden_dropout": 0.0,
9
+ "hidden_size": 32,
10
+ "initializer_range": 0.02,
11
+ "intermediate_size": 64,
12
+ "layer_norm_eps": 1e-06,
13
+ "model_type": "sam3_detr_decoder",
14
+ "num_attention_heads": 4,
15
+ "num_layers": 1,
16
+ "num_queries": 5
17
+ },
18
+ "detr_encoder_config": {
19
+ "dropout": 0.1,
20
+ "hidden_act": "relu",
21
+ "hidden_dropout": 0.0,
22
+ "hidden_size": 32,
23
+ "initializer_range": 0.02,
24
+ "intermediate_size": 64,
25
+ "layer_norm_eps": 1e-06,
26
+ "model_type": "sam3_detr_encoder",
27
+ "num_attention_heads": 4,
28
+ "num_layers": 1
29
+ },
30
+ "dtype": "float32",
31
+ "geometry_encoder_config": {
32
+ "dropout": 0.1,
33
+ "hidden_act": "relu",
34
+ "hidden_dropout": 0.0,
35
+ "hidden_size": 32,
36
+ "initializer_range": 0.02,
37
+ "intermediate_size": 64,
38
+ "layer_norm_eps": 1e-06,
39
+ "mask_fuser_hidden_size": 32,
40
+ "mask_fuser_num_layers": 1,
41
+ "model_type": "sam3_geometry_encoder",
42
+ "num_attention_heads": 4,
43
+ "num_layers": 1,
44
+ "roi_size": 7
45
+ },
46
+ "initializer_range": 0.02,
47
+ "mask_decoder_config": {
48
+ "dropout": 0.0,
49
+ "hidden_size": 32,
50
+ "initializer_range": 0.02,
51
+ "layer_norm_eps": 1e-06,
52
+ "model_type": "sam3_mask_decoder",
53
+ "num_attention_heads": 8,
54
+ "num_upsampling_stages": 2
55
+ },
56
+ "model_type": "sam3",
57
+ "text_config": {
58
+ "attention_dropout": 0.0,
59
+ "bos_token_id": 49406,
60
+ "eos_token_id": 49407,
61
+ "hidden_act": "gelu",
62
+ "hidden_size": 32,
63
+ "initializer_factor": 1.0,
64
+ "initializer_range": 0.02,
65
+ "intermediate_size": 64,
66
+ "layer_norm_eps": 1e-05,
67
+ "max_position_embeddings": 200,
68
+ "model_type": "clip_text_model",
69
+ "num_attention_heads": 4,
70
+ "num_hidden_layers": 2,
71
+ "pad_token_id": 49407,
72
+ "projection_dim": 32,
73
+ "vocab_size": 49408
74
+ },
75
+ "transformers_version": "5.16.0.dev0",
76
+ "vision_config": {
77
+ "backbone_config": {
78
+ "_name_or_path": "",
79
+ "architectures": null,
80
+ "attention_dropout": 0.0,
81
+ "chunk_size_feed_forward": 0,
82
+ "dtype": null,
83
+ "global_attn_indexes": [
84
+ 0,
85
+ 1
86
+ ],
87
+ "hidden_act": "gelu",
88
+ "hidden_dropout": 0.0,
89
+ "hidden_size": 32,
90
+ "id2label": {
91
+ "0": "LABEL_0",
92
+ "1": "LABEL_1"
93
+ },
94
+ "image_size": 224,
95
+ "initializer_range": 0.02,
96
+ "intermediate_size": 64,
97
+ "is_encoder_decoder": false,
98
+ "label2id": {
99
+ "LABEL_0": 0,
100
+ "LABEL_1": 1
101
+ },
102
+ "layer_norm_eps": 1e-06,
103
+ "layer_scale_init_value": null,
104
+ "model_type": "sam3_vit_model",
105
+ "num_attention_heads": 4,
106
+ "num_channels": 3,
107
+ "num_hidden_layers": 2,
108
+ "output_attentions": false,
109
+ "output_hidden_states": false,
110
+ "patch_size": 14,
111
+ "pretrain_image_size": 336,
112
+ "problem_type": null,
113
+ "return_dict": true,
114
+ "rope_theta": 10000.0,
115
+ "window_size": 8
116
+ },
117
+ "backbone_feature_sizes": [
118
+ [
119
+ 288,
120
+ 288
121
+ ],
122
+ [
123
+ 144,
124
+ 144
125
+ ],
126
+ [
127
+ 72,
128
+ 72
129
+ ]
130
+ ],
131
+ "fpn_hidden_size": 32,
132
+ "hidden_act": "gelu",
133
+ "initializer_range": 0.02,
134
+ "layer_norm_eps": 1e-06,
135
+ "model_type": "sam3_vision_model",
136
+ "scale_factors": [
137
+ 2.0,
138
+ 1.0
139
+ ]
140
+ }
141
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bf260be80d2ba90fc4a10962072e875326a867494569b5a8ec47a9ed7509341b
3
+ size 7311400
preprocessor_config.json ADDED
@@ -0,0 +1,31 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "crop_size": {
3
+ "height": 224,
4
+ "width": 224
5
+ },
6
+ "do_convert_rgb": true,
7
+ "do_normalize": true,
8
+ "do_rescale": true,
9
+ "do_resize": true,
10
+ "image_mean": [
11
+ 0.5,
12
+ 0.5,
13
+ 0.5
14
+ ],
15
+ "image_processor_type": "Sam3ImageProcessor",
16
+ "image_std": [
17
+ 0.5,
18
+ 0.5,
19
+ 0.5
20
+ ],
21
+ "mask_size": {
22
+ "height": 288,
23
+ "width": 288
24
+ },
25
+ "resample": 2,
26
+ "rescale_factor": 0.00392156862745098,
27
+ "size": {
28
+ "height": 224,
29
+ "width": 224
30
+ }
31
+ }
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|startoftext|>",
5
+ "clean_up_tokenization_spaces": false,
6
+ "do_lower_case": true,
7
+ "eos_token": "<|endoftext|>",
8
+ "errors": "replace",
9
+ "is_local": true,
10
+ "local_files_only": false,
11
+ "max_length": 32,
12
+ "model_max_length": 32,
13
+ "pad_token": "<|endoftext|>",
14
+ "processor_class": "Sam3VideoProcessor",
15
+ "tokenizer_class": "CLIPTokenizer",
16
+ "unk_token": "<|endoftext|>"
17
+ }
video_preprocessor_config.json ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "crop_size": {
3
+ "height": 224,
4
+ "width": 224
5
+ },
6
+ "do_convert_rgb": true,
7
+ "do_normalize": true,
8
+ "do_rescale": true,
9
+ "do_resize": true,
10
+ "image_mean": [
11
+ 0.485,
12
+ 0.456,
13
+ 0.406
14
+ ],
15
+ "image_std": [
16
+ 0.229,
17
+ 0.224,
18
+ 0.225
19
+ ],
20
+ "resample": 2,
21
+ "rescale_factor": 0.00392156862745098,
22
+ "return_metadata": false,
23
+ "size": {
24
+ "height": 224,
25
+ "width": 224
26
+ },
27
+ "video_processor_type": "Sam2VideoVideoProcessor"
28
+ }