arpitjadon commited on
Commit
fd1f898
·
verified ·
1 Parent(s): 44d8842

Upload 9B/nonzeroshot/checkpoint-avg75000-100000_drop77500_82500/transformer

Browse files
final_models/9B/nonzeroshot/checkpoint-avg75000-100000_drop77500_82500/transformer/config.json ADDED
@@ -0,0 +1,24 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_class_name": "Flux2Transformer2DModel",
3
+ "_diffusers_version": "0.39.0",
4
+ "_name_or_path": "black-forest-labs/FLUX.2-klein-base-9B",
5
+ "attention_head_dim": 128,
6
+ "axes_dims_rope": [
7
+ 32,
8
+ 32,
9
+ 32,
10
+ 32
11
+ ],
12
+ "eps": 1e-06,
13
+ "guidance_embeds": false,
14
+ "in_channels": 128,
15
+ "joint_attention_dim": 12288,
16
+ "mlp_ratio": 3.0,
17
+ "num_attention_heads": 32,
18
+ "num_layers": 8,
19
+ "num_single_layers": 24,
20
+ "out_channels": null,
21
+ "patch_size": 1,
22
+ "rope_theta": 2000,
23
+ "timestep_guidance_channels": 256
24
+ }
final_models/9B/nonzeroshot/checkpoint-avg75000-100000_drop77500_82500/transformer/diffusion_pytorch_model-00001-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d28b98c4a5fcf7ce1f53a438c604b8fcd21a831d2ac559c402436461fde3e289
3
+ size 9804206048
final_models/9B/nonzeroshot/checkpoint-avg75000-100000_drop77500_82500/transformer/diffusion_pytorch_model-00002-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a4bc112c3af7ed1ec2f03dc03610cdf708cd7d920cf69620f4dc0a001f729b96
3
+ size 9797913704
final_models/9B/nonzeroshot/checkpoint-avg75000-100000_drop77500_82500/transformer/diffusion_pytorch_model-00003-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7ec91abc8499de87d28edda44532089bf20a32b3458ccaf7aff900983185917e
3
+ size 9596584288
final_models/9B/nonzeroshot/checkpoint-avg75000-100000_drop77500_82500/transformer/diffusion_pytorch_model-00004-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ee511fc7285743d58f5fd64d5fc44c72111db4d2c976290ef6ba3e7ccf074e35
3
+ size 7115649136
final_models/9B/nonzeroshot/checkpoint-avg75000-100000_drop77500_82500/transformer/diffusion_pytorch_model.safetensors.index.json ADDED
@@ -0,0 +1,240 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "metadata": {
3
+ "total_size": 36314324992
4
+ },
5
+ "weight_map": {
6
+ "context_embedder.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
7
+ "double_stream_modulation_img.linear.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
8
+ "double_stream_modulation_txt.linear.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
9
+ "norm_out.linear.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
10
+ "proj_out.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
11
+ "single_stream_modulation.linear.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
12
+ "single_transformer_blocks.0.attn.norm_k.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
13
+ "single_transformer_blocks.0.attn.norm_q.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
14
+ "single_transformer_blocks.0.attn.to_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
15
+ "single_transformer_blocks.0.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
16
+ "single_transformer_blocks.1.attn.norm_k.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
17
+ "single_transformer_blocks.1.attn.norm_q.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
18
+ "single_transformer_blocks.1.attn.to_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
19
+ "single_transformer_blocks.1.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
20
+ "single_transformer_blocks.10.attn.norm_k.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
21
+ "single_transformer_blocks.10.attn.norm_q.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
22
+ "single_transformer_blocks.10.attn.to_out.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
23
+ "single_transformer_blocks.10.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
24
+ "single_transformer_blocks.11.attn.norm_k.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
25
+ "single_transformer_blocks.11.attn.norm_q.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
26
+ "single_transformer_blocks.11.attn.to_out.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
27
+ "single_transformer_blocks.11.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
28
+ "single_transformer_blocks.12.attn.norm_k.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
29
+ "single_transformer_blocks.12.attn.norm_q.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
30
+ "single_transformer_blocks.12.attn.to_out.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
31
+ "single_transformer_blocks.12.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
32
+ "single_transformer_blocks.13.attn.norm_k.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
33
+ "single_transformer_blocks.13.attn.norm_q.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
34
+ "single_transformer_blocks.13.attn.to_out.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
35
+ "single_transformer_blocks.13.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
36
+ "single_transformer_blocks.14.attn.norm_k.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
37
+ "single_transformer_blocks.14.attn.norm_q.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
38
+ "single_transformer_blocks.14.attn.to_out.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
39
+ "single_transformer_blocks.14.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
40
+ "single_transformer_blocks.15.attn.norm_k.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
41
+ "single_transformer_blocks.15.attn.norm_q.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
42
+ "single_transformer_blocks.15.attn.to_out.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
43
+ "single_transformer_blocks.15.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
44
+ "single_transformer_blocks.16.attn.norm_k.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
45
+ "single_transformer_blocks.16.attn.norm_q.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
46
+ "single_transformer_blocks.16.attn.to_out.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
47
+ "single_transformer_blocks.16.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
48
+ "single_transformer_blocks.17.attn.norm_k.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
49
+ "single_transformer_blocks.17.attn.norm_q.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
50
+ "single_transformer_blocks.17.attn.to_out.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
51
+ "single_transformer_blocks.17.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
52
+ "single_transformer_blocks.18.attn.norm_k.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
53
+ "single_transformer_blocks.18.attn.norm_q.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
54
+ "single_transformer_blocks.18.attn.to_out.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
55
+ "single_transformer_blocks.18.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
56
+ "single_transformer_blocks.19.attn.norm_k.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
57
+ "single_transformer_blocks.19.attn.norm_q.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
58
+ "single_transformer_blocks.19.attn.to_out.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
59
+ "single_transformer_blocks.19.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
60
+ "single_transformer_blocks.2.attn.norm_k.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
61
+ "single_transformer_blocks.2.attn.norm_q.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
62
+ "single_transformer_blocks.2.attn.to_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
63
+ "single_transformer_blocks.2.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
64
+ "single_transformer_blocks.20.attn.norm_k.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
65
+ "single_transformer_blocks.20.attn.norm_q.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
66
+ "single_transformer_blocks.20.attn.to_out.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
67
+ "single_transformer_blocks.20.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
68
+ "single_transformer_blocks.21.attn.norm_k.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
69
+ "single_transformer_blocks.21.attn.norm_q.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
70
+ "single_transformer_blocks.21.attn.to_out.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
71
+ "single_transformer_blocks.21.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
72
+ "single_transformer_blocks.22.attn.norm_k.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
73
+ "single_transformer_blocks.22.attn.norm_q.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
74
+ "single_transformer_blocks.22.attn.to_out.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
75
+ "single_transformer_blocks.22.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
76
+ "single_transformer_blocks.23.attn.norm_k.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
77
+ "single_transformer_blocks.23.attn.norm_q.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
78
+ "single_transformer_blocks.23.attn.to_out.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
79
+ "single_transformer_blocks.23.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00004-of-00004.safetensors",
80
+ "single_transformer_blocks.3.attn.norm_k.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
81
+ "single_transformer_blocks.3.attn.norm_q.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
82
+ "single_transformer_blocks.3.attn.to_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
83
+ "single_transformer_blocks.3.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
84
+ "single_transformer_blocks.4.attn.norm_k.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
85
+ "single_transformer_blocks.4.attn.norm_q.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
86
+ "single_transformer_blocks.4.attn.to_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
87
+ "single_transformer_blocks.4.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
88
+ "single_transformer_blocks.5.attn.norm_k.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
89
+ "single_transformer_blocks.5.attn.norm_q.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
90
+ "single_transformer_blocks.5.attn.to_out.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
91
+ "single_transformer_blocks.5.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
92
+ "single_transformer_blocks.6.attn.norm_k.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
93
+ "single_transformer_blocks.6.attn.norm_q.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
94
+ "single_transformer_blocks.6.attn.to_out.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
95
+ "single_transformer_blocks.6.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
96
+ "single_transformer_blocks.7.attn.norm_k.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
97
+ "single_transformer_blocks.7.attn.norm_q.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
98
+ "single_transformer_blocks.7.attn.to_out.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
99
+ "single_transformer_blocks.7.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
100
+ "single_transformer_blocks.8.attn.norm_k.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
101
+ "single_transformer_blocks.8.attn.norm_q.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
102
+ "single_transformer_blocks.8.attn.to_out.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
103
+ "single_transformer_blocks.8.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
104
+ "single_transformer_blocks.9.attn.norm_k.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
105
+ "single_transformer_blocks.9.attn.norm_q.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
106
+ "single_transformer_blocks.9.attn.to_out.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
107
+ "single_transformer_blocks.9.attn.to_qkv_mlp_proj.weight": "diffusion_pytorch_model-00003-of-00004.safetensors",
108
+ "time_guidance_embed.timestep_embedder.linear_1.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
109
+ "time_guidance_embed.timestep_embedder.linear_2.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
110
+ "transformer_blocks.0.attn.add_k_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
111
+ "transformer_blocks.0.attn.add_q_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
112
+ "transformer_blocks.0.attn.add_v_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
113
+ "transformer_blocks.0.attn.norm_added_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
114
+ "transformer_blocks.0.attn.norm_added_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
115
+ "transformer_blocks.0.attn.norm_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
116
+ "transformer_blocks.0.attn.norm_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
117
+ "transformer_blocks.0.attn.to_add_out.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
118
+ "transformer_blocks.0.attn.to_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
119
+ "transformer_blocks.0.attn.to_out.0.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
120
+ "transformer_blocks.0.attn.to_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
121
+ "transformer_blocks.0.attn.to_v.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
122
+ "transformer_blocks.0.ff.linear_in.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
123
+ "transformer_blocks.0.ff.linear_out.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
124
+ "transformer_blocks.0.ff_context.linear_in.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
125
+ "transformer_blocks.0.ff_context.linear_out.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
126
+ "transformer_blocks.1.attn.add_k_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
127
+ "transformer_blocks.1.attn.add_q_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
128
+ "transformer_blocks.1.attn.add_v_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
129
+ "transformer_blocks.1.attn.norm_added_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
130
+ "transformer_blocks.1.attn.norm_added_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
131
+ "transformer_blocks.1.attn.norm_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
132
+ "transformer_blocks.1.attn.norm_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
133
+ "transformer_blocks.1.attn.to_add_out.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
134
+ "transformer_blocks.1.attn.to_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
135
+ "transformer_blocks.1.attn.to_out.0.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
136
+ "transformer_blocks.1.attn.to_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
137
+ "transformer_blocks.1.attn.to_v.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
138
+ "transformer_blocks.1.ff.linear_in.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
139
+ "transformer_blocks.1.ff.linear_out.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
140
+ "transformer_blocks.1.ff_context.linear_in.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
141
+ "transformer_blocks.1.ff_context.linear_out.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
142
+ "transformer_blocks.2.attn.add_k_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
143
+ "transformer_blocks.2.attn.add_q_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
144
+ "transformer_blocks.2.attn.add_v_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
145
+ "transformer_blocks.2.attn.norm_added_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
146
+ "transformer_blocks.2.attn.norm_added_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
147
+ "transformer_blocks.2.attn.norm_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
148
+ "transformer_blocks.2.attn.norm_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
149
+ "transformer_blocks.2.attn.to_add_out.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
150
+ "transformer_blocks.2.attn.to_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
151
+ "transformer_blocks.2.attn.to_out.0.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
152
+ "transformer_blocks.2.attn.to_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
153
+ "transformer_blocks.2.attn.to_v.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
154
+ "transformer_blocks.2.ff.linear_in.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
155
+ "transformer_blocks.2.ff.linear_out.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
156
+ "transformer_blocks.2.ff_context.linear_in.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
157
+ "transformer_blocks.2.ff_context.linear_out.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
158
+ "transformer_blocks.3.attn.add_k_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
159
+ "transformer_blocks.3.attn.add_q_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
160
+ "transformer_blocks.3.attn.add_v_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
161
+ "transformer_blocks.3.attn.norm_added_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
162
+ "transformer_blocks.3.attn.norm_added_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
163
+ "transformer_blocks.3.attn.norm_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
164
+ "transformer_blocks.3.attn.norm_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
165
+ "transformer_blocks.3.attn.to_add_out.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
166
+ "transformer_blocks.3.attn.to_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
167
+ "transformer_blocks.3.attn.to_out.0.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
168
+ "transformer_blocks.3.attn.to_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
169
+ "transformer_blocks.3.attn.to_v.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
170
+ "transformer_blocks.3.ff.linear_in.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
171
+ "transformer_blocks.3.ff.linear_out.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
172
+ "transformer_blocks.3.ff_context.linear_in.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
173
+ "transformer_blocks.3.ff_context.linear_out.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
174
+ "transformer_blocks.4.attn.add_k_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
175
+ "transformer_blocks.4.attn.add_q_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
176
+ "transformer_blocks.4.attn.add_v_proj.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
177
+ "transformer_blocks.4.attn.norm_added_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
178
+ "transformer_blocks.4.attn.norm_added_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
179
+ "transformer_blocks.4.attn.norm_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
180
+ "transformer_blocks.4.attn.norm_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
181
+ "transformer_blocks.4.attn.to_add_out.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
182
+ "transformer_blocks.4.attn.to_k.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
183
+ "transformer_blocks.4.attn.to_out.0.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
184
+ "transformer_blocks.4.attn.to_q.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
185
+ "transformer_blocks.4.attn.to_v.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
186
+ "transformer_blocks.4.ff.linear_in.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
187
+ "transformer_blocks.4.ff.linear_out.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
188
+ "transformer_blocks.4.ff_context.linear_in.weight": "diffusion_pytorch_model-00001-of-00004.safetensors",
189
+ "transformer_blocks.4.ff_context.linear_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
190
+ "transformer_blocks.5.attn.add_k_proj.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
191
+ "transformer_blocks.5.attn.add_q_proj.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
192
+ "transformer_blocks.5.attn.add_v_proj.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
193
+ "transformer_blocks.5.attn.norm_added_k.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
194
+ "transformer_blocks.5.attn.norm_added_q.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
195
+ "transformer_blocks.5.attn.norm_k.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
196
+ "transformer_blocks.5.attn.norm_q.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
197
+ "transformer_blocks.5.attn.to_add_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
198
+ "transformer_blocks.5.attn.to_k.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
199
+ "transformer_blocks.5.attn.to_out.0.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
200
+ "transformer_blocks.5.attn.to_q.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
201
+ "transformer_blocks.5.attn.to_v.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
202
+ "transformer_blocks.5.ff.linear_in.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
203
+ "transformer_blocks.5.ff.linear_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
204
+ "transformer_blocks.5.ff_context.linear_in.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
205
+ "transformer_blocks.5.ff_context.linear_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
206
+ "transformer_blocks.6.attn.add_k_proj.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
207
+ "transformer_blocks.6.attn.add_q_proj.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
208
+ "transformer_blocks.6.attn.add_v_proj.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
209
+ "transformer_blocks.6.attn.norm_added_k.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
210
+ "transformer_blocks.6.attn.norm_added_q.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
211
+ "transformer_blocks.6.attn.norm_k.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
212
+ "transformer_blocks.6.attn.norm_q.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
213
+ "transformer_blocks.6.attn.to_add_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
214
+ "transformer_blocks.6.attn.to_k.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
215
+ "transformer_blocks.6.attn.to_out.0.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
216
+ "transformer_blocks.6.attn.to_q.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
217
+ "transformer_blocks.6.attn.to_v.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
218
+ "transformer_blocks.6.ff.linear_in.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
219
+ "transformer_blocks.6.ff.linear_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
220
+ "transformer_blocks.6.ff_context.linear_in.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
221
+ "transformer_blocks.6.ff_context.linear_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
222
+ "transformer_blocks.7.attn.add_k_proj.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
223
+ "transformer_blocks.7.attn.add_q_proj.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
224
+ "transformer_blocks.7.attn.add_v_proj.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
225
+ "transformer_blocks.7.attn.norm_added_k.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
226
+ "transformer_blocks.7.attn.norm_added_q.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
227
+ "transformer_blocks.7.attn.norm_k.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
228
+ "transformer_blocks.7.attn.norm_q.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
229
+ "transformer_blocks.7.attn.to_add_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
230
+ "transformer_blocks.7.attn.to_k.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
231
+ "transformer_blocks.7.attn.to_out.0.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
232
+ "transformer_blocks.7.attn.to_q.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
233
+ "transformer_blocks.7.attn.to_v.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
234
+ "transformer_blocks.7.ff.linear_in.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
235
+ "transformer_blocks.7.ff.linear_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
236
+ "transformer_blocks.7.ff_context.linear_in.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
237
+ "transformer_blocks.7.ff_context.linear_out.weight": "diffusion_pytorch_model-00002-of-00004.safetensors",
238
+ "x_embedder.weight": "diffusion_pytorch_model-00001-of-00004.safetensors"
239
+ }
240
+ }
final_models/9B/nonzeroshot/checkpoint-avg75000-100000_drop77500_82500/transformer/merge_manifest.json ADDED
@@ -0,0 +1,125 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "command": [
3
+ "scripts/models/merge_diffusers_transformers.py",
4
+ "--model",
5
+ "final_models/9B/nonzeroshot/checkpoint-75000",
6
+ "1",
7
+ "--model",
8
+ "final_models/9B/nonzeroshot/checkpoint-80000",
9
+ "1",
10
+ "--model",
11
+ "final_models/9B/nonzeroshot/checkpoint-85000",
12
+ "1",
13
+ "--model",
14
+ "final_models/9B/nonzeroshot/checkpoint-87500",
15
+ "1",
16
+ "--model",
17
+ "final_models/9B/nonzeroshot/checkpoint-90000",
18
+ "1",
19
+ "--model",
20
+ "final_models/9B/nonzeroshot/checkpoint-92500",
21
+ "1",
22
+ "--model",
23
+ "final_models/9B/nonzeroshot/checkpoint-95000",
24
+ "1",
25
+ "--model",
26
+ "final_models/9B/nonzeroshot/checkpoint-97500",
27
+ "1",
28
+ "--model",
29
+ "final_models/9B/nonzeroshot/checkpoint-100000",
30
+ "1",
31
+ "--output",
32
+ "final_models/9B/nonzeroshot/checkpoint-avg75000-100000_drop77500_82500/transformer"
33
+ ],
34
+ "created_at_utc": "2026-09-17T17:27:27.887473+00:00",
35
+ "format": "open_visionbanana.diffusers_transformer_merge.v1",
36
+ "ignored_config_fields": [
37
+ "_name_or_path"
38
+ ],
39
+ "inputs": [
40
+ {
41
+ "config_sha256": "34ec7b602e2372bf272fa7a07a85280bea6efcbda5f3253e1d6ef1a375b8eabb",
42
+ "index_sha256": "235a30e4d3ac93b6eaf483fe690af3d302d18b9e883878695fa60aff5ff0818b",
43
+ "normalized_weight": 0.1111111111111111,
44
+ "requested_weight": 1.0,
45
+ "transformer": "final_models/9B/nonzeroshot/checkpoint-75000/transformer"
46
+ },
47
+ {
48
+ "config_sha256": "34ec7b602e2372bf272fa7a07a85280bea6efcbda5f3253e1d6ef1a375b8eabb",
49
+ "index_sha256": "235a30e4d3ac93b6eaf483fe690af3d302d18b9e883878695fa60aff5ff0818b",
50
+ "normalized_weight": 0.1111111111111111,
51
+ "requested_weight": 1.0,
52
+ "transformer": "final_models/9B/nonzeroshot/checkpoint-80000/transformer"
53
+ },
54
+ {
55
+ "config_sha256": "34ec7b602e2372bf272fa7a07a85280bea6efcbda5f3253e1d6ef1a375b8eabb",
56
+ "index_sha256": "235a30e4d3ac93b6eaf483fe690af3d302d18b9e883878695fa60aff5ff0818b",
57
+ "normalized_weight": 0.1111111111111111,
58
+ "requested_weight": 1.0,
59
+ "transformer": "final_models/9B/nonzeroshot/checkpoint-85000/transformer"
60
+ },
61
+ {
62
+ "config_sha256": "34ec7b602e2372bf272fa7a07a85280bea6efcbda5f3253e1d6ef1a375b8eabb",
63
+ "index_sha256": "235a30e4d3ac93b6eaf483fe690af3d302d18b9e883878695fa60aff5ff0818b",
64
+ "normalized_weight": 0.1111111111111111,
65
+ "requested_weight": 1.0,
66
+ "transformer": "final_models/9B/nonzeroshot/checkpoint-87500/transformer"
67
+ },
68
+ {
69
+ "config_sha256": "34ec7b602e2372bf272fa7a07a85280bea6efcbda5f3253e1d6ef1a375b8eabb",
70
+ "index_sha256": "235a30e4d3ac93b6eaf483fe690af3d302d18b9e883878695fa60aff5ff0818b",
71
+ "normalized_weight": 0.1111111111111111,
72
+ "requested_weight": 1.0,
73
+ "transformer": "final_models/9B/nonzeroshot/checkpoint-90000/transformer"
74
+ },
75
+ {
76
+ "config_sha256": "34ec7b602e2372bf272fa7a07a85280bea6efcbda5f3253e1d6ef1a375b8eabb",
77
+ "index_sha256": "235a30e4d3ac93b6eaf483fe690af3d302d18b9e883878695fa60aff5ff0818b",
78
+ "normalized_weight": 0.1111111111111111,
79
+ "requested_weight": 1.0,
80
+ "transformer": "final_models/9B/nonzeroshot/checkpoint-92500/transformer"
81
+ },
82
+ {
83
+ "config_sha256": "34ec7b602e2372bf272fa7a07a85280bea6efcbda5f3253e1d6ef1a375b8eabb",
84
+ "index_sha256": "235a30e4d3ac93b6eaf483fe690af3d302d18b9e883878695fa60aff5ff0818b",
85
+ "normalized_weight": 0.1111111111111111,
86
+ "requested_weight": 1.0,
87
+ "transformer": "final_models/9B/nonzeroshot/checkpoint-95000/transformer"
88
+ },
89
+ {
90
+ "config_sha256": "34ec7b602e2372bf272fa7a07a85280bea6efcbda5f3253e1d6ef1a375b8eabb",
91
+ "index_sha256": "235a30e4d3ac93b6eaf483fe690af3d302d18b9e883878695fa60aff5ff0818b",
92
+ "normalized_weight": 0.1111111111111111,
93
+ "requested_weight": 1.0,
94
+ "transformer": "final_models/9B/nonzeroshot/checkpoint-97500/transformer"
95
+ },
96
+ {
97
+ "config_sha256": "34ec7b602e2372bf272fa7a07a85280bea6efcbda5f3253e1d6ef1a375b8eabb",
98
+ "index_sha256": "235a30e4d3ac93b6eaf483fe690af3d302d18b9e883878695fa60aff5ff0818b",
99
+ "normalized_weight": 0.1111111111111111,
100
+ "requested_weight": 1.0,
101
+ "transformer": "final_models/9B/nonzeroshot/checkpoint-100000/transformer"
102
+ }
103
+ ],
104
+ "method": "convex_weighted_average",
105
+ "output": "final_models/9B/nonzeroshot/checkpoint-avg75000-100000_drop77500_82500/transformer",
106
+ "shards": [
107
+ {
108
+ "name": "diffusion_pytorch_model-00001-of-00004.safetensors",
109
+ "size_bytes": 9804206048
110
+ },
111
+ {
112
+ "name": "diffusion_pytorch_model-00002-of-00004.safetensors",
113
+ "size_bytes": 9797913704
114
+ },
115
+ {
116
+ "name": "diffusion_pytorch_model-00003-of-00004.safetensors",
117
+ "size_bytes": 9596584288
118
+ },
119
+ {
120
+ "name": "diffusion_pytorch_model-00004-of-00004.safetensors",
121
+ "size_bytes": 7115649136
122
+ }
123
+ ],
124
+ "tensor_count": 233
125
+ }