three commited on
Commit
42811eb
Β·
verified Β·
1 Parent(s): 92c2e33

Update README.md

Browse files

---
language: id
license: mit
tags:
- gpt2
- indonesian
- causal-lm
- 0.3B
- from-scratch
- tanyaAi
---

# TanyaAI-0.3B-2837

## πŸ“Œ Tentang Model Ini

**TanyaAI-0.3B-2837** adalah model bahasa Indonesia berukuran 0.3 miliar parameter (300 juta) yang dikembangkan dari awal (from scratch) menggunakan arsitektur GPT-2. Model ini dirancang khusus untuk memahami dan merespons pertanyaan dalam bahasa Indonesia dengan gaya percakapan yang alami.

Model ini merupakan hasil dari proses pelatihan intensif menggunakan ribuan sampel percakapan dan instruksi berbahasa Indonesia. Meskipun ukurannya tergolong kecil dibandingkan model AI modern lainnya, TanyaAI-0.3B-2837 menawarkan keseimbangan antara performa dan efisiensi, sehingga cocok untuk dijalankan di perangkat dengan sumber daya terbatas.

---

## 🎯 Untuk Apa Model Ini?

Model ini cocok digunakan untuk berbagai keperluan, antara lain:

### 1. Asisten Virtual Berbahasa Indonesia
- Menjawab pertanyaan umum sehari-hari
- Membantu pencarian informasi sederhana
- Bertindak sebagai asisten pribadi untuk tugas-tugas ringan

### 2. Chatbot dan Customer Service
- Dapat diintegrasikan ke dalam sistem layanan pelanggan
- Memberikan respons otomatis untuk pertanyaan yang sering diajukan
- Mendukung interaksi dalam bahasa Indonesia yang alami

### 3. Edukasi dan Pembelajaran
- Media pembelajaran interaktif untuk siswa
- Latihan tanya-jawab dalam berbagai topik
- Pendamping belajar untuk mata pelajaran umum

### 4. Kreativitas dan Hiburan
- Menghasilkan ide atau saran kreatif
- Membantu menulis cerita pendek atau puisi
- Menjawab pertanyaan ringan untuk hiburan

### 5. Prototipe Aplikasi AI
- Cocok untuk pengembang yang ingin menguji aplikasi AI berbasis teks
- Ringan dan mudah di-deploy di berbagai platform

---

## πŸ“Š Spesifikasi Teknis

### Tabel 1: Arsitektur & Parameter

| Komponen | Spesifikasi | Keterangan |
|----------|-------------|------------|
| **Arsitektur** | GPT-2 (Decoder-only Transformer) | Berbasis arsitektur OpenAI GPT-2 |
| **Total Parameter** | 0.3B (300.000.000) | 300 juta parameter |
| **Lapisan (Layers)** | 16 | Jumlah hidden layers |
| **Attention Heads** | 12 | Multi-head attention heads |
| **Hidden Size** | 768 | Dimensi hidden state |
| **Context Length** | 512 token | Maksimal input per sesi |
| **Vocab Size** | 50.257 | Jumlah kosakata tokenizer |
| **Embedding Size** | 768 | Sama dengan hidden size |
| **Positional Encoding** | Learned | Dipelajari selama training |
| **Activation Function** | GELU | Gaussian Error Linear Unit |

### Tabel 2: Training Configuration

| Parameter | Nilai | Keterangan |
|-----------|-------|------------|
| **Batch Size (per device)** | 4 | Ukuran batch per GPU |
| **Gradient Accumulation** | 4 | Efektif batch = 16 |
| **Learning Rate** | 2e-4 | Learning rate awal |
| **Warmup Steps** | 10% dari total step | Agar training stabil |
| **Weight Decay** | 0.01 | Regularisasi untuk menghindari overfit |
| **Epochs** | 3 | Jumlah putaran training |
| **Optimizer** | AdamW | Optimizer standar |
| **Mixed Precision** | FP16 | Hemat VRAM |
| **Max Gradient Norm** | 1.0 | Clipping untuk stabilitas |

### Tabel 3: Dataset & Training Statistics

| Metrik | Nilai | Keterangan |
|--------|-------|------------|
| **Total Sample** | 49.969 | Jumlah sampel pelatihan |
| **Epochs** | 3 | 3 kali putaran data |
| **Total Steps** | ~8.007 | Jumlah langkah training |
| **Final Loss** | 1.62 | Nilai loss akhir |
| **Training Duration** | ~6 jam | Waktu pelatihan (T4 GPU) |

### Tabel 4: Performance & Requirements

| Aspek | Spesifikasi | Keterangan |
|-------|-------------|------------|
| **Inference (CPU)** | ~2-3 detik/respon | VPS 2 CPU |
| **Inference (GPU T4)** | ~0.5 detik/respon | Respons cepat |
| **VRAM (Training)** | ~10-12 GB | Saat training |
| **RAM (Inference)** | ~2-4 GB | Untuk inferensi |
| **Storage** | ~1.2 GB | Ukuran model terkompresi |

### Tabel 5: Support & Integration

| Platform | Status | Keterangan |
|----------|--------|------------|
| **Hugging Face Transformers** | βœ… Full Support | Format standar |
| **PyTorch** | βœ… Support | Load model |
| **CPU** | βœ… Support | Bisa jalan di CPU |
| **GPU** | βœ… Support | CUDA compatible |

---

## 🧠 Keunggulan Model

| Keunggulan | Keterangan |
|------------|------------|
| **Ringan** | Ukuran 0.3B memungkinkan model berjalan di perangkat dengan spesifikasi terbatas |
| **Bahasa Indonesia** | Dikembangkan khusus untuk bahasa Indonesia, bukan terjemahan dari bahasa lain |
| **Respons Cepat** | Proses inferensi yang efisien untuk interaksi real-time |
| **Dari Awal** | Dibangun dari nol, bukan fine-tune dari model asing |

---

## πŸš€ Cara Menggunakan

### Instalasi Library

```bash
pip install transformers torch

Files changed (1) hide show
  1. README.md +3 -0
README.md CHANGED
@@ -4,4 +4,7 @@ language:
4
  - id
5
  pipeline_tag: text-generation
6
  library_name: transformers
 
 
 
7
  ---
 
4
  - id
5
  pipeline_tag: text-generation
6
  library_name: transformers
7
+ tags:
8
+ - gpt2
9
+ - indonesian
10
  ---