{ "source": "/home/admin/LLaDA-Image-Multi-step/text_encoder", "output": "/home/admin/LLaDA-Image-Multi-step-text-encoder-fp8-block128-dynamic", "format": "float8_e4m3fn", "weight_quantization": "symmetric absmax RTN per expert 2-D block", "weight_block_size": [ 128, 128 ], "weight_scale_shape": "[experts, ceil(N/block_n), ceil(K/block_k)]", "activation_quantization": "dynamic symmetric absmax RTN per token", "quantized_tensors": [ "model.language_model.layers.1.mlp.experts.down_proj", "model.language_model.layers.1.mlp.experts.gate_proj", "model.language_model.layers.1.mlp.experts.up_proj", "model.language_model.layers.2.mlp.experts.down_proj", "model.language_model.layers.2.mlp.experts.gate_proj", "model.language_model.layers.2.mlp.experts.up_proj", "model.language_model.layers.3.mlp.experts.down_proj", "model.language_model.layers.3.mlp.experts.gate_proj", "model.language_model.layers.3.mlp.experts.up_proj", "model.language_model.layers.4.mlp.experts.down_proj", "model.language_model.layers.4.mlp.experts.gate_proj", "model.language_model.layers.4.mlp.experts.up_proj", "model.language_model.layers.5.mlp.experts.gate_proj", "model.language_model.layers.5.mlp.experts.up_proj", "model.language_model.layers.10.mlp.experts.down_proj", "model.language_model.layers.10.mlp.experts.gate_proj", "model.language_model.layers.10.mlp.experts.up_proj", "model.language_model.layers.11.mlp.experts.gate_proj", "model.language_model.layers.11.mlp.experts.up_proj", "model.language_model.layers.5.mlp.experts.down_proj", "model.language_model.layers.6.mlp.experts.down_proj", "model.language_model.layers.6.mlp.experts.gate_proj", "model.language_model.layers.6.mlp.experts.up_proj", "model.language_model.layers.7.mlp.experts.down_proj", "model.language_model.layers.7.mlp.experts.gate_proj", "model.language_model.layers.7.mlp.experts.up_proj", "model.language_model.layers.8.mlp.experts.down_proj", "model.language_model.layers.8.mlp.experts.gate_proj", "model.language_model.layers.8.mlp.experts.up_proj", "model.language_model.layers.9.mlp.experts.down_proj", "model.language_model.layers.9.mlp.experts.gate_proj", "model.language_model.layers.9.mlp.experts.up_proj", "model.language_model.layers.11.mlp.experts.down_proj", "model.language_model.layers.12.mlp.experts.down_proj", "model.language_model.layers.12.mlp.experts.gate_proj", "model.language_model.layers.12.mlp.experts.up_proj", "model.language_model.layers.13.mlp.experts.down_proj", "model.language_model.layers.13.mlp.experts.gate_proj", "model.language_model.layers.13.mlp.experts.up_proj", "model.language_model.layers.14.mlp.experts.down_proj", "model.language_model.layers.14.mlp.experts.gate_proj", "model.language_model.layers.14.mlp.experts.up_proj", "model.language_model.layers.15.mlp.experts.down_proj", "model.language_model.layers.15.mlp.experts.gate_proj", "model.language_model.layers.15.mlp.experts.up_proj", "model.language_model.layers.16.mlp.experts.down_proj", "model.language_model.layers.16.mlp.experts.gate_proj", "model.language_model.layers.16.mlp.experts.up_proj", "model.language_model.layers.17.mlp.experts.down_proj", "model.language_model.layers.17.mlp.experts.gate_proj", "model.language_model.layers.17.mlp.experts.up_proj", "model.language_model.layers.18.mlp.experts.down_proj", "model.language_model.layers.18.mlp.experts.gate_proj", "model.language_model.layers.18.mlp.experts.up_proj", "model.language_model.layers.19.mlp.experts.down_proj", "model.language_model.layers.19.mlp.experts.gate_proj", "model.language_model.layers.19.mlp.experts.up_proj" ], "quantized_tensor_count": 57, "tensor_bytes": 17348419072, "elapsed_seconds": 43.155, "runtime_note": "Real FP8 torch._scaled_mm reference path on CUDA; custom grouped FP8 MoE kernel needed for production throughput." }