ANALISIS KOMPARATIF MBERT DAN INDOBERT UNTUK KLASIFIKASI SENTIMEN TWEET BERBAHASA INDONESIA INFORMAL DAN CODE-MIXING

Adyanata, I Komang (2026) ANALISIS KOMPARATIF MBERT DAN INDOBERT UNTUK KLASIFIKASI SENTIMEN TWEET BERBAHASA INDONESIA INFORMAL DAN CODE-MIXING. Masters thesis, Universitas Pendidikan Ganesha.

[img] Text (COVER)
2229101018-COVER .pdf

Download (1MB)
[img] Text (ABSTRAK)
2229101018-ABSTRAK.pdf

Download (323kB)
[img] Text (BAB 1 PENDAHULUAN)
2229101018-BAB 1 PENDAHULUAN.pdf

Download (496kB)
[img] Text (BAB 2 KAJIAN TEORI)
2229101018-BAB 2 KAJIAN TEORI.pdf
Restricted to Repository staff only

Download (901kB) | Request a copy
[img] Text (BAB 3 METODELOGI PENELITIAN)
2229101018-BAB 3 METODELOGI PENELITIAN.pdf
Restricted to Repository staff only

Download (676kB) | Request a copy
[img] Text (BAB 4 HASIL DAN PEMBAHASAN)
2229101018-BAB 4 HASIL DAN PEMBAHASAN.pdf
Restricted to Repository staff only

Download (1MB) | Request a copy
[img] Text (BAB 5 PENUTUP)
2229101018-BAB 5 PENUTUP.pdf
Restricted to Repository staff only

Download (475kB) | Request a copy
[img] Text (DAFTAR PUSTAKA)
2229101018-DAFTAR PUSTAKA.pdf

Download (489kB)
[img] Text (LAMPIRAN)
2229101018-LAMPIRAN.pdf

Download (1MB)

Abstract

Pertumbuhan pesat penggunaan media sosial Twitter di Indonesia memunculkan kebutuhan akan analisis sentimen yang mampu menangani karakteristik bahasa informal, slang, singkatan, serta pencampuran bahasa Indonesia dengan bahasa lainnya (code-mixing). Penelitian ini membandingkan dua model berbasis transformer, yakni Multilingual BERT (mBERT) base-uncased yang dilatih pada 104 bahasa dan IndoBERT base-p1 yang khusus bahasa Indonesia, pada klasifikasi sentimen tiga kelas (negatif, netral, positif). Dataset yang digunakan adalah Indonesian General Sentiment Analysis Dataset sebanyak 10.806 tweet dengan distribusi label tidak seimbang (netral 49,3%, negatif 26,7%, positif 24,0%) dan terdapat pencampuran bahasa dalam dataset. Pra-pemrosesan dilakukan secara terbatas, mencakup case folding dan pembersihan URL, mention, hashtag, serta karakter spesial, dengan mempertahankan slang, singkatan, dan karakter berulang sebagai ciri khas data. Ketidakseimbangan kelas ditangani dengan balanced class weighting pada fungsi loss CrossEntropy, dan hyperparameter tuning dilakukan dalam dua tahap. Eksplorasi data menunjukkan tingginya bahasa nonbaku: 37,8% tweet memuat slang dan 31,7% memuat singkatan. Analisis tokenisasi memperlihatkan mBERT memecah kata secara berlebihan (1,529 subword per kata), sedangkan IndoBERT lebih hemat (1,192 subword per kata, sekitar 22%). Pada test set 2.162 tweet, IndoBERT mencatat accuracy 69,84%, F1-macro 69,07%, dan F1-weighted 69,93%, sementara mBERT mencapai accuracy 63,00%, F1-macro 61,43%, dan F1-weighted 63,00%, sehingga IndoBERT unggul +6,85 poin accuracy dan +7,64 poin F1-macro. Dibandingkan baseline KNN dan SVM (62,9%), IndoBERT meningkat +6,94 poin. Keunggulan IndoBERT terbukti signifikan secara statistik melalui uji McNemar (p<0,0001) dengan selang kepercayaan bootstrap 95% yang tidak tumpang-tindih, sementara mBERT tidak berbeda signifikan dari baseline klasik TF-IDF + SVM (p=1,000). Analisis bertingkat menunjukkan selisih performa terbesar pada tweet berkarakter berulang (F1-macro 12,51 poin) dan tweet pendek di bawah 10 kata (10,32 poin), mengindikasikan ketepatan tokenisasi sebagai penentu utama keberhasilan klasifikasi pada konteks bahasa nonbaku.

Item Type: Thesis (Masters)
Uncontrolled Keywords: analisis sentimen, IndoBERT, mBERT, hyperparameter tuning, class weighting
Subjects: Q Science > QA Mathematics > QA75 Electronic computers. Computer science
Divisions: Pascasarjana > Program Studi Ilmu Komputer (S2)
Depositing User: I Komang Adyanata
Date Deposited: 10 Aug 2026 01:43
Last Modified: 10 Aug 2026 01:43
URI: http://repo.undiksha.ac.id/id/eprint/32207

Actions (login required)

View Item View Item