three commited on
Commit
e195fb3
Β·
verified Β·
1 Parent(s): 0e8e1cf

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +28 -21
README.md CHANGED
@@ -5,16 +5,20 @@ tags:
5
  - gpt2
6
  - indonesian
7
  - causal-lm
8
- - 0.3B
9
  - from-scratch
10
  - tanyaAi
11
  ---
12
 
13
  # TanyaAI-0.3B-2837
14
 
 
 
 
 
15
  ## πŸ“Œ Tentang Model Ini
16
 
17
- **TanyaAI-0.3B-2837** adalah model bahasa Indonesia berukuran 0.3 miliar parameter (300 juta) yang dikembangkan dari awal (from scratch) menggunakan arsitektur GPT-2. Model ini dirancang khusus untuk memahami dan merespons pertanyaan dalam bahasa Indonesia dengan gaya percakapan yang alami.
18
 
19
  Model ini merupakan hasil dari proses pelatihan intensif menggunakan ribuan sampel percakapan dan instruksi berbahasa Indonesia. Meskipun ukurannya tergolong kecil dibandingkan model AI modern lainnya, TanyaAI-0.3B-2837 menawarkan keseimbangan antara performa dan efisiensi, sehingga cocok untuk dijalankan di perangkat dengan sumber daya terbatas.
20
 
@@ -50,14 +54,27 @@ Model ini cocok digunakan untuk berbagai keperluan, antara lain:
50
 
51
  ---
52
 
 
 
 
 
 
 
 
 
 
 
 
 
53
  ## πŸ“Š Spesifikasi Teknis
54
 
55
- ### Tabel 1: Arsitektur & Parameter
56
 
57
  | Komponen | Spesifikasi | Keterangan |
58
  |----------|-------------|------------|
59
  | **Arsitektur** | GPT-2 (Decoder-only Transformer) | Berbasis arsitektur OpenAI GPT-2 |
60
- | **Total Parameter** | 0.3B (300.000.000) | 300 juta parameter |
 
61
  | **Lapisan (Layers)** | 16 | Jumlah hidden layers |
62
  | **Attention Heads** | 12 | Multi-head attention heads |
63
  | **Hidden Size** | 768 | Dimensi hidden state |
@@ -67,7 +84,7 @@ Model ini cocok digunakan untuk berbagai keperluan, antara lain:
67
  | **Positional Encoding** | Learned | Dipelajari selama training |
68
  | **Activation Function** | GELU | Gaussian Error Linear Unit |
69
 
70
- ### Tabel 2: Training Configuration
71
 
72
  | Parameter | Nilai | Keterangan |
73
  |-----------|-------|------------|
@@ -81,17 +98,17 @@ Model ini cocok digunakan untuk berbagai keperluan, antara lain:
81
  | **Mixed Precision** | FP16 | Hemat VRAM |
82
  | **Max Gradient Norm** | 1.0 | Clipping untuk stabilitas |
83
 
84
- ### Tabel 3: Dataset & Training Statistics
85
 
86
  | Metrik | Nilai | Keterangan |
87
  |--------|-------|------------|
88
- | **Total Sample** | 49.969 | Jumlah sampel pelatihan |
89
  | **Epochs** | 3 | 3 kali putaran data |
90
  | **Total Steps** | ~8.007 | Jumlah langkah training |
91
- | **Final Loss** | 1.62 | Nilai loss akhir |
92
  | **Training Duration** | ~6 jam | Waktu pelatihan (T4 GPU) |
93
 
94
- ### Tabel 4: Performance & Requirements
95
 
96
  | Aspek | Spesifikasi | Keterangan |
97
  |-------|-------------|------------|
@@ -101,7 +118,7 @@ Model ini cocok digunakan untuk berbagai keperluan, antara lain:
101
  | **RAM (Inference)** | ~2-4 GB | Untuk inferensi |
102
  | **Storage** | ~1.2 GB | Ukuran model terkompresi |
103
 
104
- ### Tabel 5: Support & Integration
105
 
106
  | Platform | Status | Keterangan |
107
  |----------|--------|------------|
@@ -109,17 +126,7 @@ Model ini cocok digunakan untuk berbagai keperluan, antara lain:
109
  | **PyTorch** | βœ… Support | Load model |
110
  | **CPU** | βœ… Support | Bisa jalan di CPU |
111
  | **GPU** | βœ… Support | CUDA compatible |
112
-
113
- ---
114
-
115
- ## 🧠 Keunggulan Model
116
-
117
- | Keunggulan | Keterangan |
118
- |------------|------------|
119
- | **Ringan** | Ukuran 0.3B memungkinkan model berjalan di perangkat dengan spesifikasi terbatas |
120
- | **Bahasa Indonesia** | Dikembangkan khusus untuk bahasa Indonesia, bukan terjemahan dari bahasa lain |
121
- | **Respons Cepat** | Proses inferensi yang efisien untuk interaksi real-time |
122
- | **Dari Awal** | Dibangun dari nol, bukan fine-tune dari model asing |
123
 
124
  ---
125
 
 
5
  - gpt2
6
  - indonesian
7
  - causal-lm
8
+ - 0.2B
9
  - from-scratch
10
  - tanyaAi
11
  ---
12
 
13
  # TanyaAI-0.3B-2837
14
 
15
+ > **Catatan:** Berdasarkan deteksi otomatis dari Hugging Face, model ini memiliki **0.2B (200M) parameter**. Nama "0.3B" digunakan untuk konsistensi proyek awal. Jangan khawatir, model ini tetap berfungsi dengan baik untuk berbagai tugas berbahasa Indonesia.
16
+
17
+ ---
18
+
19
  ## πŸ“Œ Tentang Model Ini
20
 
21
+ **TanyaAI-0.3B-2837** adalah model bahasa Indonesia berukuran **200 juta parameter (0.2B)** yang dikembangkan dari awal (*from scratch*) menggunakan arsitektur GPT-2. Model ini dirancang khusus untuk memahami dan merespons pertanyaan dalam bahasa Indonesia dengan gaya percakapan yang alami.
22
 
23
  Model ini merupakan hasil dari proses pelatihan intensif menggunakan ribuan sampel percakapan dan instruksi berbahasa Indonesia. Meskipun ukurannya tergolong kecil dibandingkan model AI modern lainnya, TanyaAI-0.3B-2837 menawarkan keseimbangan antara performa dan efisiensi, sehingga cocok untuk dijalankan di perangkat dengan sumber daya terbatas.
24
 
 
54
 
55
  ---
56
 
57
+ ## 🧠 Keunggulan Model
58
+
59
+ | Keunggulan | Keterangan |
60
+ |------------|------------|
61
+ | **Ringan** | Ukuran 200M memungkinkan model berjalan di perangkat dengan spesifikasi terbatas |
62
+ | **Bahasa Indonesia** | Dikembangkan khusus untuk bahasa Indonesia, bukan terjemahan dari bahasa lain |
63
+ | **Respons Cepat** | Proses inferensi yang efisien untuk interaksi real-time |
64
+ | **Dari Awal** | Dibangun dari nol, bukan fine-tune dari model asing |
65
+ | **Open Source** | Lisensi MIT, bebas digunakan dan dimodifikasi |
66
+
67
+ ---
68
+
69
  ## πŸ“Š Spesifikasi Teknis
70
 
71
+ ### Arsitektur & Parameter
72
 
73
  | Komponen | Spesifikasi | Keterangan |
74
  |----------|-------------|------------|
75
  | **Arsitektur** | GPT-2 (Decoder-only Transformer) | Berbasis arsitektur OpenAI GPT-2 |
76
+ | **Total Parameter** | **0.2B (200M)** | Terdeteksi otomatis oleh Hugging Face |
77
+ | **Tensor Type** | F32 (float32) | Presisi floating point 32-bit |
78
  | **Lapisan (Layers)** | 16 | Jumlah hidden layers |
79
  | **Attention Heads** | 12 | Multi-head attention heads |
80
  | **Hidden Size** | 768 | Dimensi hidden state |
 
84
  | **Positional Encoding** | Learned | Dipelajari selama training |
85
  | **Activation Function** | GELU | Gaussian Error Linear Unit |
86
 
87
+ ### Training Configuration
88
 
89
  | Parameter | Nilai | Keterangan |
90
  |-----------|-------|------------|
 
98
  | **Mixed Precision** | FP16 | Hemat VRAM |
99
  | **Max Gradient Norm** | 1.0 | Clipping untuk stabilitas |
100
 
101
+ ### Dataset & Training Statistics
102
 
103
  | Metrik | Nilai | Keterangan |
104
  |--------|-------|------------|
105
+ | **Total Sample** | 42.711 | Jumlah sampel pelatihan (setelah filter) |
106
  | **Epochs** | 3 | 3 kali putaran data |
107
  | **Total Steps** | ~8.007 | Jumlah langkah training |
108
+ | **Final Loss** | 1.62 | Nilai loss akhir (semakin kecil semakin bagus) |
109
  | **Training Duration** | ~6 jam | Waktu pelatihan (T4 GPU) |
110
 
111
+ ### Performance & Requirements
112
 
113
  | Aspek | Spesifikasi | Keterangan |
114
  |-------|-------------|------------|
 
118
  | **RAM (Inference)** | ~2-4 GB | Untuk inferensi |
119
  | **Storage** | ~1.2 GB | Ukuran model terkompresi |
120
 
121
+ ### Support & Integration
122
 
123
  | Platform | Status | Keterangan |
124
  |----------|--------|------------|
 
126
  | **PyTorch** | βœ… Support | Load model |
127
  | **CPU** | βœ… Support | Bisa jalan di CPU |
128
  | **GPU** | βœ… Support | CUDA compatible |
129
+ | **ONNX** | ⚠️ Belum di-test | Belum dicoba |
 
 
 
 
 
 
 
 
 
 
130
 
131
  ---
132