LLaDA-Image-Turbo-FP8 / text_encoder /quantization_manifest.json
OsGo's picture
Duplicate from inclusionAI/LLaDA-Image-Turbo-FP8
9609cbb
Raw
History Blame Contribute Delete
4.05 kB
{
"source": "/home/admin/LLaDA-Image-few-step/text_encoder",
"output": "/home/admin/LLaDA-Image-few-step-text-encoder-fp8-block128-dynamic",
"format": "float8_e4m3fn",
"weight_quantization": "symmetric absmax RTN per expert 2-D block",
"weight_block_size": [
128,
128
],
"weight_scale_shape": "[experts, ceil(N/block_n), ceil(K/block_k)]",
"activation_quantization": "dynamic symmetric absmax RTN per token",
"quantized_tensors": [
"model.language_model.layers.1.mlp.experts.down_proj",
"model.language_model.layers.1.mlp.experts.gate_proj",
"model.language_model.layers.1.mlp.experts.up_proj",
"model.language_model.layers.2.mlp.experts.down_proj",
"model.language_model.layers.2.mlp.experts.gate_proj",
"model.language_model.layers.2.mlp.experts.up_proj",
"model.language_model.layers.3.mlp.experts.down_proj",
"model.language_model.layers.3.mlp.experts.gate_proj",
"model.language_model.layers.3.mlp.experts.up_proj",
"model.language_model.layers.4.mlp.experts.down_proj",
"model.language_model.layers.4.mlp.experts.gate_proj",
"model.language_model.layers.4.mlp.experts.up_proj",
"model.language_model.layers.5.mlp.experts.gate_proj",
"model.language_model.layers.5.mlp.experts.up_proj",
"model.language_model.layers.10.mlp.experts.down_proj",
"model.language_model.layers.10.mlp.experts.gate_proj",
"model.language_model.layers.10.mlp.experts.up_proj",
"model.language_model.layers.11.mlp.experts.gate_proj",
"model.language_model.layers.11.mlp.experts.up_proj",
"model.language_model.layers.5.mlp.experts.down_proj",
"model.language_model.layers.6.mlp.experts.down_proj",
"model.language_model.layers.6.mlp.experts.gate_proj",
"model.language_model.layers.6.mlp.experts.up_proj",
"model.language_model.layers.7.mlp.experts.down_proj",
"model.language_model.layers.7.mlp.experts.gate_proj",
"model.language_model.layers.7.mlp.experts.up_proj",
"model.language_model.layers.8.mlp.experts.down_proj",
"model.language_model.layers.11.mlp.experts.down_proj",
"model.language_model.layers.12.mlp.experts.down_proj",
"model.language_model.layers.8.mlp.experts.gate_proj",
"model.language_model.layers.8.mlp.experts.up_proj",
"model.language_model.layers.9.mlp.experts.down_proj",
"model.language_model.layers.9.mlp.experts.gate_proj",
"model.language_model.layers.9.mlp.experts.up_proj",
"model.language_model.layers.12.mlp.experts.gate_proj",
"model.language_model.layers.12.mlp.experts.up_proj",
"model.language_model.layers.13.mlp.experts.down_proj",
"model.language_model.layers.13.mlp.experts.gate_proj",
"model.language_model.layers.13.mlp.experts.up_proj",
"model.language_model.layers.14.mlp.experts.down_proj",
"model.language_model.layers.14.mlp.experts.gate_proj",
"model.language_model.layers.14.mlp.experts.up_proj",
"model.language_model.layers.15.mlp.experts.down_proj",
"model.language_model.layers.15.mlp.experts.gate_proj",
"model.language_model.layers.15.mlp.experts.up_proj",
"model.language_model.layers.16.mlp.experts.down_proj",
"model.language_model.layers.16.mlp.experts.gate_proj",
"model.language_model.layers.16.mlp.experts.up_proj",
"model.language_model.layers.17.mlp.experts.down_proj",
"model.language_model.layers.17.mlp.experts.gate_proj",
"model.language_model.layers.17.mlp.experts.up_proj",
"model.language_model.layers.18.mlp.experts.down_proj",
"model.language_model.layers.18.mlp.experts.gate_proj",
"model.language_model.layers.18.mlp.experts.up_proj",
"model.language_model.layers.19.mlp.experts.down_proj",
"model.language_model.layers.19.mlp.experts.gate_proj",
"model.language_model.layers.19.mlp.experts.up_proj"
],
"quantized_tensor_count": 57,
"tensor_bytes": 17348419072,
"elapsed_seconds": 43.784,
"runtime_note": "Real FP8 torch._scaled_mm reference path on CUDA; custom grouped FP8 MoE kernel needed for production throughput."
}