EVALUASI MULTI-DIMENSI MODEL TRANSFORMER UNTUK ANALISIS SENTIMEN BAHASA BALI: PERFORMA, TOKENISASI, DAN INTERPRETABILITAS

Supanji, I Komang Deny (2026) EVALUASI MULTI-DIMENSI MODEL TRANSFORMER UNTUK ANALISIS SENTIMEN BAHASA BALI: PERFORMA, TOKENISASI, DAN INTERPRETABILITAS. Masters thesis, Universitas Pendidikan Ganesha.

[img] Text (2229101026_COVER)
2229101026_Cover.pdf

Download (17MB)
[img] Text (2229101026_ABSTRAK)
2229101026_Abstrak.pdf

Download (16MB)
[img] Text (2229101026_BAB 1 PENDAHULUAN)
2229101026_Bab 1 Pendahuluan.pdf

Download (16MB)
[img] Text (2229101026_BAB 2 KAJIAN TEORI)
2229101026_Bab 2 Kajian Teori.pdf
Restricted to Repository staff only

Download (16MB) | Request a copy
[img] Text (2229101026_BAB 3 METODELOGI PENELITIAN)
2229101026_Bab 3 Metodelogi Penelitian.pdf
Restricted to Repository staff only

Download (16MB) | Request a copy
[img] Text (2229101026_BAB 4 HASIL DAN PEMBAHASAN)
2229101026_Bab 4 Hasil dan Pembahasan.pdf
Restricted to Repository staff only

Download (16MB) | Request a copy
[img] Text (2229101026_BAB 5 PENUTUP)
2229101026_Bab 5 Penutup.pdf
Restricted to Repository staff only

Download (16MB) | Request a copy
[img] Text (2229101026_DAFTAR PUSTAKA)
2229101026_Daftar Pustaka.pdf

Download (16MB)
[img] Text (2229101026_LAMPIRAN)
2229101026_Lampiran.pdf

Download (16MB)

Abstract

Bahasa Bali tergolong sebagai low-resource language yang menghadapi keterbatasan sumber daya pemrosesan bahasa alami. Penelitian ini mengevaluasi tiga model pre-trained berbasis Transformer, yaitu IndoBERT, mBERT, dan XLM-RoBERTa, untuk analisis sentimen teks berbahasa Bali pada dataset NusaX melalui kerangka evaluasi multi-dimensi yang mengintegrasikan performa klasifikasi, audit kualitas tokenisasi, dan interpretabilitas SHAP. Audit tokenisasi dilakukan terhadap leksikon bahasa Bali yang telah melalui proses pembersihan dari 1.063 entri mentah menjadi 830 kata unik. Hasil menunjukkan IndoBERT mencapai performa terbaik dengan akurasi 78,00% dan F1-Macro 77,23%, mengungguli XLM-RoBERTa (65,25%, 64,39%) dan mBERT (64,75%, 63,59%) secara signifikan berdasarkan uji McNemar. Audit tokenizer menunjukkan IndoBERT memiliki fertility rate terendah (1,9373) dan perfect match rate tertinggi (30,36%) yang berkorelasi dengan performa terbaik. Analisis OOV rate dihitung melalui pendekatan vocabulary lookup yang konsisten untuk WordPiece dan SentencePiece. Analisis SHAP menunjukkan IndoBERT menghasilkan atribusi token yang lebih terfokus secara semantik, sementara model multilingual cenderung mengandalkan tanda baca dan fragmen subword tidak bermakna akibat fragmentasi tokenisasi. Penelitian ini menyimpulkan bahwa kesamaan kosakata antara data pelatihan dan dataset tampak lebih berpengaruh terhadap performa dibandingkan ukuran model, dan menghasilkan kerangka evaluasi multi-dimensi yang dapat direplikasi sebagai prosedur evaluasi pada penelitian sejenis, dengan penyesuaian terhadap karakteristik kosakata masing-masing dataset. Perlu ditekankan bahwa keunggulan IndoBERT bersumber dari tumpang tindih leksikal dengan bahasa Indonesia, mengingat dataset NusaX bahasa Bali merupakan hasil terjemahan yang memuat kata serapan dan potensi code-mixing, sehingga sebagian besar kosakata Bali murni tetap terfragmentasi pada seluruh model. Keberlakuan temuan pada bahasa daerah lain karenanya masih memerlukan pengujian lebih lanjut.

Item Type: Thesis (Masters)
Uncontrolled Keywords: Analisis Sentimen, Bahasa Bali, Model Pre-Trained Transformer, Audit Tokenizer, SHAP
Subjects: T Technology > T Technology (General)
Divisions: Pascasarjana > Program Studi Ilmu Komputer (S2)
Depositing User: I Komang Deny Supanji
Date Deposited: 10 Aug 2026 04:01
Last Modified: 10 Aug 2026 04:01
URI: http://repo.undiksha.ac.id/id/eprint/32245

Actions (login required)

View Item View Item