Alfatih, Syafri Maulana (2026) Pencocokan judul dan transkrip video menggunakan metode Cosine Similarity. Undergraduate thesis, Universitas Islam Negeri Maulana Malik Ibrahim.
|
Text (Fulltext)
220605110139.pdf - Accepted Version Available under License Creative Commons Attribution Non-commercial No Derivatives. (3MB) | Preview |
Abstract
INDONESIA:
Perkembangan platform berbagi video menyebabkan meningkatnya jumlah konten digital yang dapat diakses oleh masyarakat, namun tidak semua judul video mampu merepresentasikan isi video secara akurat sehingga berpotensi menimbulkan kesalahpahaman informasi. Penelitian ini bertujuan untuk mengukur tingkat kecocokan antara judul dan transkrip video menggunakan metode Cosine Similarity dengan representasi semantik berbasis Sentence BERT. Dataset yang digunakan adalah Indonesian Stand-Up Comedy Transcription Dataset dari Mendeley Data dengan jumlah 2.774 data setelah melalui proses pembersihan data. Tahapan penelitian meliputi text cleaning, case folding, pembentukan embedding menggunakan model Sentence BERT all-MiniLM-L6-v2, serta perhitungan tingkat kemiripan menggunakan Cosine Similarity. Hasil perhitungan kemudian diklasifikasikan ke dalam kategori relevan dan tidak relevan menggunakan beberapa skenario threshold, yaitu 0,10; 0,15; 0,20; 0,25; dan nilai rata-rata (mean similarity) sebesar 0,34. Evaluasi dilakukan menggunakan Confusion Matrix dengan metrik Accuracy, Precision, Recall, dan F1-Score. Hasil penelitian menunjukkan bahwa kombinasi Sentence BERT dan Cosine Similarity mampu mengukur tingkat kecocokan antara judul dan transkrip video secara efektif. Berdasarkan hasil pengujian, threshold 0,34 menghasilkan performa terbaik dengan nilai Accuracy 79,82%, Precision 78,12%, Recall 82,12%, dan F1-Score 80,07%. Hasil tersebut menunjukkan bahwa representasi semantik yang dihasilkan Sentence BERT mampu memahami kesamaan makna antara judul dan transkrip video dengan baik sehingga dapat digunakan untuk mengevaluasi relevansi konten digital secara lebih objektif.
ENGLISH:
The rapid growth of video sharing platforms has increased the amount of digital content accessible to the public. However, not all video titles accurately represent the content of the videos, potentially leading to misinformation and misunderstanding. This study aims to measure the level of similarity between video titles and transcripts using the Cosine Similarity method with semantic representations generated by Sentence BERT. The dataset used in this study is the Indonesian Stand-Up Comedy Transcription Dataset obtained from Mendeley Data, consisting of 2,774 records after the data cleaning process. The research stages include text cleaning, case folding, embedding generation using the Sentence BERT all-MiniLM-L6-v2 model, and similarity calculation using Cosine Similarity. The resulting similarity scores were then classified into relevant and irrelevant categories using several threshold scenarios, namely 0.10, 0.15, 0.20, 0.25, and the mean similarity value of 0.34. System evaluation was conducted using a Confusion Matrix with Accuracy, Precision, Recall, and F1-Score metrics. The results show that the combination of Sentence BERT and Cosine Similarity is effective in measuring the similarity between video titles and transcripts. Based on the experimental results, the threshold value of 0.34 achieved the best performance with an Accuracy of 79.82%, Precision of 78.12%, Recall of 82.12%, and F1-Score of 80.07%. These findings indicate that the semantic representations generated by Sentence BERT are capable of capturing the semantic similarity between video titles and transcripts, making them suitable for evaluating the relevance of digital content in a more objective manner.
ARABIC:
أدى النمو السريع لمنصات مشاركة مقاطع الفيديو إلى زيادة كمية المحتوى الرقمي المتاح للجمهور. ومع ذلك، لا تعبر جميع عناوين مقاطع الفيديو بدقة عن محتوى هذه المقاطع، مما قد يؤدي إلى انتشار المعلومات الخاطئة وسوء الفهم. تهدف هذه الدراسة إلى قياس مستوى التشابه بين عناوين مقاطع الفيديو ونصوصها باستخدام طريقة تشابه جيب التمام مع التمثيلات الدلالية التي تم إنشاؤها بواسطة Sentence BERT. مجموعة البيانات المستخدمة في هذه الدراسة هي «مجموعة بيانات نصوص الكوميديا الارتجالية الإندونيسية» (Indonesian Stand-Up Comedy Transcription Dataset) التي تم الحصول عليها من Mendeley Data، وتتألف من 2,774 سجلًا بعد عملية تنقية البيانات. وتشمل مراحل البحث تنقية النص، وتحويل الأحرف الكبيرة والصغيرة، وإنشاء التضمين باستخدام نموذج Sentence BERT all-MiniLM-L6-v2، وحساب التشابه باستخدام طريقة تشابه الجيب. ثم تم تصنيف درجات التشابه الناتجة إلى فئتين: ذات صلة وغير ذات صلة، باستخدام عدة سيناريوهات للعتبة، وهي 0.10 و0.15 و0.20 و0.25، وقيمة التشابه المتوسطة البالغة 0.34. وأُجري تقييم النظام باستخدام مصفوفة الارتباك (Confusion Matrix) مع مقاييس الدقة (Accuracy) والدقة النوعية (Precision) والاسترجاع (Recall) ودرجة F1. تُظهر النتائج أن الجمع بين نموذج Sentence BERT ومقياس التشابه الجيبي (Cosine Similarity) فعال في قياس التشابه بين عناوين مقاطع الفيديو ونصوصها. استنادًا إلى نتائج التجربة، حققت قيمة العتبة البالغة 0.34 أفضل أداء بدقة بلغت 79.82٪، ودقة تحديد بلغت 78.12٪، ومعدل استرجاع بلغ 82.12٪، ودرجة F1 بلغت 80.07٪. تشير هذه النتائج إلى أن التمثيلات الدلالية التي يولدها نموذج Sentence BERT قادرة على التقاط التشابه الدلالي بين عناوين مقاطع الفيديو ونصوصها، مما يجعلها مناسبة لتقييم مدى صلة المحتوى الرقمي بطريقة أكثر موضوعية
| Item Type: | Thesis (Undergraduate) |
|---|---|
| Supervisor: | Kurniawan, Fachrul and Fatchurrochman, Fatchurrochman |
| Keywords: | sentence bert; cosine similarity; judul video; transkrip video; kemiripan semantik; video title; video transcript; semantic similarity; تشابه جيب التمام، عنوان الفيديو ;نص الفيديو ;التشابه الدلالي |
| Subjects: | 08 INFORMATION AND COMPUTING SCIENCES > 0801 Artificial Intelligence and Image Processing > 080107 Natural Language Processing |
| Departement: | Fakultas Sains dan Teknologi > Jurusan Teknik Informatika |
| Depositing User: | Syafri Maulana Alfatih |
| Date Deposited: | 22 Jul 2026 10:30 |
| Last Modified: | 22 Jul 2026 10:30 |
| URI: | http://etheses.uin-malang.ac.id/id/eprint/87609 |
Downloads
Downloads per month over past year
Actions (login required)
![]() |
View Item |
