Principal Component Analysis untuk Reduksi Dimensi pada Clustering Ulasan Buku di Goodreads
DOI:
https://doi.org/10.33795/jip.v12i4.10127Keywords:
PCA, K-Means, data mining, NLPAbstract
Penelitian ini bertujuan menganalisis dan memetakan pola tanggapan pembaca Indonesia terhadap buku The Da Vinci Code melalui pengelompokan (clustering) ulasan berbahasa Indonesia di Goodreads. Dataset dikumpulkan menggunakan alat bantu Instant Data Scraper. Data teks yang diperoleh kemudian diproses melewati beberapa tahapan preprocessing meliputi case folding, penghapusan stopword, penghapusan karakter khusus, serta stemming dengan pustaka Sastrawi untuk mengurangi noise dan menyatukan variasi kata. Selanjutnya, representasi numerik dibentuk melalui word embedding FastText model skip-gram dengan dimensi vektor 100, yang dinilai efektif untuk bahasa Indonesia karena mampu menangkap informasi sub-kata dan menangani variasi imbuhan. Eksperimen dilakukan dengan dua skema. Pada skema pertama clustering langsung menggunakan algoritma K-Means pada vektor FastText. Sedangkan pada skema kedua, terlebih dahulu dilakukan reduksi dimensi menggunakan Principal Component Analysis (PCA) sebelum K-Means, dengan penurunan dimensi dari 100 menjadi 50 fitur. Penentuan jumlah cluster optimal dilakukan melalui evaluasi silhouette score pada nilai k sama dengan 2, 3, 4, dan 5. Hasil menunjukkan nilai terbaik pada k = 2 untuk kedua skema, dengan peningkatan kualitas yang tipis setelah penerapan PCA (silhouette 0,5899 tanpa PCA dan 0,5901 dengan PCA). Temuan ini mengindikasikan bahwa PCA dapat memperbaiki struktur cluster, namun diperlukan pengujian lanjutan untuk memastikan signifikansi perbedaannya
Downloads
References
Minutes Australia (2019). The Da Vinci Code phenomenon | 60 Minutes Australia. Youtube. https://www.youtube.com/watch?v=qJY1ak5VQcs
Afuan, L., & Hidayat, N. (2024). Sentiment Analysis of the Kampus Merdeka Program on Twitter Using Support Vector Machine and a Feature Extraction Comparison: TF-IDF vs. FastText. Journal of Applied Data Sciences, 5(4), 1738–1753. https://doi.org/10.47738/jads.v5i4.436
Amalia, A., Sitompul, O. S., Mantoro, T., & Nababan, E. B. (2021). Morpheme Embedding for Bahasa Indonesia Using Modified Byte Pair Encoding. IEEE Access, 9, 155699–155710. https://doi.org/10.1109/ACCESS.2021.3128439
Fazri, M., & Voutama, A. (2025). ANALISIS SENTIMEN PUBLIK TERHADAP DANANTARA DI MEDIA SOSIAL X MENGGUNAKAN NLP DAN PEMBELAJARAN MESIN. JOISIE (Journal Of Information Systems And Informatics Engineering), 9(1), 197. https://doi.org/10.35145/joisie.v9i1.4924
Gramedia. (2026). The Da Vinci Code (Edisi Ke-3, Republish 2025). Gramedia.com. https://www.gramedia.com/products/the-da-vinci-code-edisi-ke3-republish-2025
Harris, A., Nugroho, A., Novianto, Y., Jasmir, J., Fatma, D., (2026). Sistemasi: Jurnal Sistem Informasi Fitur Word Embedding untuk meningkatkan Kinerja Machine Learning pada Analisis Sentimen Game Honor of Kings Word Embedding Features to Improve Machine Learning Performance in Sentiment Analysis of the Honor of Kings Game. Retrieved http://sistemasi.ftik.unisi.ac.id
Hasan, Y. (2024). Pengukuran Silhouette Score dan Davies-Bouldin Index pada Hasil Cluster K-Means dan Dbscan (Vol. 06, Issue 01).
Hediyati, D., & Suartana, I. M. (2021). Penerapan Principal Component Analysis (PCA) Untuk Reduksi Dimensi Pada Proses Clustering Data Produksi Pertanian Di Kabupaten Bojonegoro.
Khairuna, R., Nurdin, & Ar Razi. (2025). ANALISIS PERBANDINGAN ALGORITMA K-MEANS DAN K-MEDOIDS UNTUK KLUSTERISASI TEKS ULASAN PADA APLIKASI COOKPAD. Rabit : Jurnal Teknologi Dan Sistem Informasi Univrab, 10(2), 445–458. https://doi.org/10.36341/rabit.v10i2.6131
Nurdin, A., Anggo, B., Aji, S., Bustamin, A., & Abidin, Z. (2020). PERBANDINGAN KINERJA WORD EMBEDDING WORD2VEC, GLOVE, DAN FASTTEXT PADA KLASIFIKASI TEKS. Jurnal TEKNOKOMPAK, 14(2), 74
Nurjanah, M., & Arifin, T. (2021). PENERAPAN ALGORITMA K-MEANS UNTUK ANALISIS DATA ULASAN DI SITUS TRIPADVISOR. JURNAL RESPONSIF, 3(1), 75–82. http://ejurnal.ars.ac.id/index.php/jti
Pamungkas, M. D., & Februariyanti, H. (2022). PENERAPAN ALGORITMA K-MEANS CLUSTERING UNTUK MENGELOMPOKAN DATA REVIEW BARANG PADA E-COMMERCE LAZADA. semanTIK, 8(2), 99. https://doi.org/10.55679/semantik.v8i2.29058
Putra, B. A., Mukhtar, H., Titasari Br Bangun, E., Gusnanda, A., Maisyarah, A., Kurniawan, M. I., Pradipa, R., & Ali, Z. M. (2025). OPTIMISASI ALGORITMA K-MEANS DENGAN METODE REDUKSI DIMENSI UNTUK PENGELOMPOKAN BIG DATA DALAM ARSITEKTUR CLOUD COMPUTING. 5(1), 1–8.
Ramang, E., Haryono, K., Lailiyah, S., & Sa’ad, M. I. (2025). Implementation of Data Clustering for Informatics Engineering Study Program Students at STMIK Widya Cipta Dharma Using the K-Means Method Implementasi Clustering Data Mahasiswa Program Studi Teknik Informatika STMIK Widya Cipta Dharma Menggunakan Metode K-Means. https://doi.org/10.46984/sebatik.v29i1.0000
Rianti, R., Andarsyah, R., & Awangga, R. M. (2024). Penerapan PCA dan Algoritma Clustering untuk Analisis Mutu Perguruan Tinggi di LLDIKTI Wilayah IV (Vol. 18). Retrieved https://journal.fkom.uniku.ac.id/ilkom
Ritonga, A. S., & Muhandhis, I. (2021). TEKNIK DATA MINING UNTUK MENGKLASIFIKASIKAN DATA ULASAN DESTINASI WISATA MENGGUNAKAN REDUKSI DATA PRINCIPAL COMPONENT ANALYSIS (PCA). In Jurnal Ilmiah Edutic (Vol. 7, Issue 2).
Rosyada, I. A., & Utari, D. T. (2024). Penerapan Principal Component Analysis untuk Reduksi Variabel pada Algoritma K-Means Clustering. Jambura J. Probab. Stat, 5(1), 6–13. https://doi.org/10.34312/jjps.v5i1.18733
Saputra, R., & Purnama, I. (2024). OPTIMIZING K-MEANS ALGORITHM WITH ELBOW AND SILHOUETTE METHODS FOR NATIONAL EXAM SCORE DATA CLUSTERING. In Jurnal Ilmu Komputer Ruru e-ISSN : XXXX-XXX (Vol. 1).
Saputro, S. W., Abadi, F., & Nugroho, R. A. (2025). JIP (Jurnal Informatika Polinema) ANALISIS SENTIMEN ULASAN MEDIA SOSIAL UMKM KULINER DENGAN PENDEKATAN LEXICON-BASED DAN KOSAKATA KHUSUS.
Sari, P., & Syahri, R. (n.d.). (2023). ALGORITMA K-MEANS CLUSTERING: SEBUAH STUDI LITERATUR. Jurnal Informatika (JURI). https://doi.org/10.12345/juri
Sepriadi, N., Budianita’, E., Fikry, M., Fakultas, P., Sains, ", Teknologi, D., Negeri, I., & Riau, K. (2023). INFORMASI (Jurnal Informatika dan Sistem Informasi) Analisis Sentimen Review Aplikasi MyPertamina menggunakan Word Embedding Fasttext dan Algoritma K-Nearest Neighbor
Sinaga, A., & Nainggolan, S. P. (2023). ANALISIS PERBANDINGAN AKURASI DAN WAKTU PROSES ALGORITMA STEMMING ARIFIN-SETIONO DAN NAZIEF-ADRIANI PADA DOKUMEN TEKS BAHASA INDONESIA. Sebatik, 27(1), 63–69. https://doi.org/10.46984/sebatik.v27i1.2072
Sudrajat, R., Hadiana, A. I., & Melina, M. (2025). Evaluasi Kualitas Klaster Wilayah Rawan Bencana Menggunakan K-Means dengan Silhouette dan Elbow Method. Jurnal Algoritma, 22(2), 127–139. https://doi.org/10.33364/algoritma/v.22-2.2379
Syahril Dwi Prasetyo, Shofa Shofiah Hilabi, & Fitri Nurapriani. (2023). Analisis Sentimen Relokasi Ibukota Nusantara Menggunakan Algoritma Naïve Bayes dan KNN. Jurnal KomtekInfo, 1–7. https://doi.org/10.35134/komtekinfo.v10i1.330
Wicaksono, S. A., Wijoyo, S. H., & Aryadita, H. (2025). PENENTUAN STRATEGI PROMOSI PROGRAM STUDI PENDIDIKAN TEKNOLOGI INFORMASI MENGGUNAKAN ALGORITMA K-MEANS CLUSTERING. JIPI (Jurnal Ilmiah Penelitian Dan Pembelajaran Informatika), 10(4), 4153–4162. https://doi.org/10.29100/jipi.v10i4.9576
Yolandari, N.A., Butarbutar, L.E., Rajagukguk, G.C.H., Zulfi, M.F., Arnita, Ramadhani, F., (2025). ANALISIS PERBANDINGAN K-MEANS DAN DBSCAN DALAM PENGELOMPOKAN DATA TRAVEL REVIEW RATINGS MENGGUNAKAN EVALUASI SILHOUETTE INDEX DAN DAVIES-BOULDIN INDEX. Jurnal Informatika Dan Teknik Elektro Terapan, 13(3). https://doi.org/10.23960/jitet.v13i3.6884







