Responsive Banner

Evaluasi kesesuaian text pada website budaya-indonesia.org menggunakan metode TF-IDF dengan variasi rule-based validation

Rosyad, Nazla Sabila (2026) Evaluasi kesesuaian text pada website budaya-indonesia.org menggunakan metode TF-IDF dengan variasi rule-based validation. Undergraduate thesis, Universitas Islam Negeri Maulana Malik Ibrahim.

[img] Text (Fulltext)
220605110145.pdf - Accepted Version
Available under License Creative Commons Attribution Non-commercial No Derivatives.

(4MB)

Abstract

INDONESIA:

Pelestarian budaya digital melalui platform crowdsourcing seperti budaya-indonesia.org menimbulkan tantangan pada kualitas data, khususnya ketidaksesuaian semantik antara judul dan deskripsi entri budaya. Penelitian ini mengevaluasi tingkat kesesuaian teks menggunakan metode TF-IDF (Term Frequency–Inverse Document Frequency) yang dikombinasikan dengan rule-based validation pada 58.604 entri data dari situs budaya-indonesia.org. Tahapan penelitian mengikuti kerangka CRISP-DM yang meliputi data preparation dengan proses case folding, tokenizing, stopword removal, dan stemming, dilanjutkan dengan perhitungan cosine similarity berbasis bobot TF-IDF untuk mengklasifikasikan kesesuaian ke dalam tiga kategori: Sangat Sesuai, Cukup Sesuai, dan Tidak Sesuai. Hasil implementasi menunjukkan bahwa pendekatan hybrid TF-IDF dan rule-based mampu meningkatkan sensitivitas sistem dalam mendeteksi keterkaitan kontekstual yang tidak tertangkap oleh TF-IDF saja, ditandai dengan peningkatan kategori Sangat Sesuai dari 6% menjadi 13,9% dan peningkatan kategori Cukup Sesuai dari 53,3% menjadi 79,7%, sehingga secara keseluruhan sistem mampu meningkatkan proporsi data yang terklasifikasi sesuai secara signifikan. Evaluasi kualitatif pada 15 skenario percobaan yang dirancang dalam tiga level data uji dan lima tema budaya menunjukkan seluruh skenario berhasil mengalami peningkatan kategori dengan tingkat keberhasilan 100%.

ENGLISH:

The preservation of digital culture through crowdsourcing platforms such as budaya-indonesia.org poses challenges regarding data quality, particularly semantic mismatches between the titles and descriptions of cultural entries. This study evaluates the level of text alignment using the TF-IDF (Term Frequency–Inverse Document Frequency) method combined with rule-based validation on 58,604 data entries from the budaya-indonesia.org website. The research phases followed the CRISP-DM framework, which included data preparation through case folding, tokenization, stopword removal, and stemming, followed by the calculation of TF-IDF-weighted cosine similarity to classify alignment into three categories: Highly Aligned, Moderately Aligned, and Not Aligned. The implementation results show that the hybrid TF-IDF and rule-based approach was able to improve the system’s sensitivity in detecting contextual relationships not captured by TF-IDF alone, as indicated by an increase in the “Highly Relevant” category from 6% to 13.9% and an increase in the “Moderately Relevant” category from 53.3% to 79.7%, thereby enabling the system to significantly increase the proportion of correctly classified data overall. A qualitative evaluation of 15 experimental scenarios designed across three levels of test data and five cultural themes showed that all scenarios successfully improved their classification categories with a 100% success rate.

ARABIC:

يُشكل الحفاظ على الثقافة الرقمية من خلال منصات التعهيد الجماعي مثل budaya-indonesia.org تحديات تتعلق بجودة البيانات، ولا سيما عدم التوافق الدلالي بين عناوين ووصف المدخلات الثقافية. تقيّم هذه الدراسة مستوى توافق النصوص باستخدام طريقة TF-IDF (تكرار المصطلح – تكرار الوثيقة العكسي) مقترنةً بالتحقق القائم على القواعد على 58,604 مدخلاً من موقع budaya-indonesia.org. تتبع مراحل البحث إطار عمل CRISP-DM الذي يشمل إعداد البيانات من خلال عمليات «توحيد الحالات» (case folding)، و«التقطيع إلى رموز» (tokenizing)، و«إزالة الكلمات الممنوعة» (stopword removal)، و«الاستخلاص» (stemming)، تليها حساب «تشابه جيب التمام» (cosine similarity) استنادًا إلى أوزان TF-IDF لتصنيف التوافق إلى ثلاث فئات: «متوافق جدًا»، و«متوافق إلى حد ما»، و«غير متوافق». أظهرت نتائج التنفيذ أن النهج الهجين بين TF-IDF والقواعد القاعدية قادر على تحسين حساسية النظام في الكشف عن الارتباطات السياقية التي لا يلتقطها TF-IDF وحده، وهو ما يتجلى في ارتفاع نسبة فئة «مطابقة جدًا» من 6% إلى 13,9% وارتفاع نسبة فئة «مطابقة إلى حد ما» من 53,3% إلى 79,7%، وبالتالي، تمكن النظام بشكل عام من زيادة نسبة البيانات المصنفة بشكل صحيح بشكل ملحوظ. أظهر التقييم النوعي لـ 15 سيناريو تجريبي تم تصميمها على ثلاثة مستويات من بيانات الاختبار وخمسة مواضيع ثقافية أن جميع السيناريوهات نجحت في تحسين التصنيف بنسبة نجاح بلغت 100%.

Item Type: Thesis (Undergraduate)
Supervisor: Melani, Roro Inda and Karami, Ahmad Fahmi
Keywords: tf-idf; rule-based validation; cosine similarity; kesesuaian teks; text mining; budaya digital; text relevance; digital culture; التحقق القائم على القواعد; تشابه جيب التمام ملاءمة النصوص; استخراج النصوص; الثقافة الرقمية.
Subjects: 08 INFORMATION AND COMPUTING SCIENCES > 0801 Artificial Intelligence and Image Processing > 080107 Natural Language Processing
08 INFORMATION AND COMPUTING SCIENCES > 0801 Artificial Intelligence and Image Processing > 080109 Pattern Recognition and Data Mining
Departement: Fakultas Sains dan Teknologi > Jurusan Teknik Informatika
Depositing User: Nazla Sabila Rosyad
Date Deposited: 23 Jul 2026 14:04
Last Modified: 23 Jul 2026 14:04
URI: http://etheses.uin-malang.ac.id/id/eprint/87073

Downloads

Downloads per month over past year

Actions (login required)

View Item View Item