Rizki Al Feqih, Ahmad, 52204110034 and Zahara, Soffa, 0704079101 and Yanuarini, N.S., 0714018304 (2026) KLASIFIKASI TINGKAT KETERBACAAN ABSTRAK ILMIAH BERBAHASA INDONESIA MENGGUNAKAN PENDEKATAN K-MEANS DAN MULTINOMIAL NAIVE BAYES. Bachelor thesis, Universitas Islam Majapahit.
|
Text
ABSTRAK.pdf Restricted to Registered users only Download (1MB) | Request a copy |
||
|
Text
BAB I.pdf Download (221kB) | Preview |
|
|
Text
BAB II.pdf Restricted to Registered users only Download (379kB) | Request a copy |
||
|
Text
BAB III.pdf Restricted to Registered users only Download (470kB) | Request a copy |
||
|
Text
BAB IV.pdf Restricted to Registered users only Download (735kB) | Request a copy |
||
|
Text
BAB V.pdf Download (200kB) | Preview |
|
|
Text
DAFTAR PUSTAKA.pdf Download (179kB) | Preview |
|
|
Text
LAMPIRAN.pdf Restricted to Registered users only Download (693kB) | Request a copy |
Abstract
Pesatnya publikasi ilmiah di bidang Informatika menyebabkan peningkatan beban pemahaman bacaan pada saat penyaringan literatur, sehingga dibutuhkan sistem otomatis untuk memetakan tingkat kesulitan teks. Penelitian ini bertujuan membangun model klasifikasi otomatis tingkat keterbacaan abstrak jurnal Informatika berbahasa Indonesia ke dalam kategori Mudah, Sedang, dan Sulit menggunakan pendekatan Machine Learning. Sebanyak 3.000 dokumen abstrak diekstraksi dari portal Garba Rujukan Digital (GARUDA) melalui teknik web scraping berbasis Selenium. Data teks melalui tahap pra-pemrosesan berupa case folding, cleansing, dan filtering tanpa stemming guna mempertahankan bentuk asli istilah teknis. Fitur leksikal kemudian diekstraksi menggunakan pembobotan Term Frequency-Inverse Document Frequency (TF-IDF) unigram-bigram yang dibatasi pada 3.000 fitur teratas. Mengingat tidak tersedianya label acuan, reduksi dimensi TruncatedSVD dan algoritma K-Means Clustering diterapkan untuk membentuk tiga klaster secara objektif berdasarkan pola kemiripan kosakata, dengan pelabelan yang dipetakan melalui rata-rata jumlah kata per kalimat (Average Words per Sentence). Untuk mengatasi ketidakseimbangan proporsi kelas hasil klasterisasi, teknik Synthetic Minority Over-sampling Technique (SMOTE) diterapkan pada data latih hingga mencapai distribusi seimbang sebanyak 1.844 dokumen per kelas. Model Multinomial Naive Bayes (MNB) yang dilatih pada matriks tersebut menghasilkan performa klasifikasi yang tinggi dengan akurasi keseluruhan mencapai 94,83%, serta F1-score sebesar 0,97 untuk kelas Mudah, 0,92 untuk Sedang, dan 0,88 untuk Sulit. Validasi komparatif eksternal terhadap standar Automated Readability Index (ARI) menunjukkan tingkat kesesuaian sebesar 63,83%. Perbedaan hasil ini memperlihatkan bahwa pendekatan berbasis data mampu mempertimbangkan variasi istilah teknis dalam dokumen, sedangkan formula konvensional umumnya hanya berfokus pada statistik panjang struktur pembentuk teks.
| Item Type: | Skripsi/Thesis (Bachelor) |
|---|---|
| Uncontrolled Keywords: | Keterbacaan Teks, Automated Readability Index, K-Means Clustering, Multinomial Naive Bayes, Machine Learning. |
| Subjects: | 0 Majapahit Islamic University Subject Areas > Fakultas Teknik > Teknik Informatika |
| Divisions: | Faculty of Engineering > Computer and Information Technology |
| Depositing User: | Feqih Ahmad Rizki Al |
| Date Deposited: | 19 Aug 2026 05:45 |
| Last Modified: | 19 Aug 2026 05:45 |
| URI: | http://repository.unim.ac.id/id/eprint/6411 |
Actions (login required)
![]() |
View Item |
