Muchtar, Anzila Rahmania (2026) Evaluasi performa LPC dan random forest dalam menganalisis emosi sinyal suara. Undergraduate thesis, Universitas Islam Negeri Maulana Malik Ibrahim.
|
Text (Fulltext)
200605110054.pdf - Accepted Version Available under License Creative Commons Attribution Non-commercial No Derivatives. (3MB) |
Abstract
ABSTRAK:
Dalam bidang Human-Computer Interaction (HCI), kemampuan sistem untuk mengenali emosi pengguna merupakan faktor penting dalam menciptakan interaksi yang lebih natural dan adaptif. Salah satu pendekatan yang digunakan adalah Speech Emotion Recognition (SER), yaitu pengenalan emosi berdasarkan karakteristik suara. Meskipun penelitian SER berkembang pesat, ketersediaan dataset berbahasa Indonesia masih terbatas dan evaluasi pada skenario speaker-independent masih jarang dilakukan. Penelitian ini bertujuan untuk mengevaluasi kemampuan Linear Predictive Coding (LPC) sebagai metode ekstraksi fitur dan Random Forest sebagai algoritma klasifikasi dalam mengklasifikasikan enam emosi suara berbahasa Indonesia, yaitu bahagia, jijik, kaget, marah, sedih, dan takut. Dataset yang digunakan terdiri dari 240 sampel suara dari 20 partisipan, yang dibagi menjadi 192 data latih dan 48 data uji. Evaluasi pada data latih dilakukan menggunakan StratifiedGroupKFold 5-fold Cross Validation untuk memastikan tidak terjadi kebocoran speaker antar fold. Hasil pengujian menunjukkan akurasi rata-rata validasi silang sebesar 23% dan akurasi data uji sebesar 18,75%. Hasil tersebut menunjukkan bahwa fitur LPC belum mampu merepresentasikan karakteristik emosi secara optimal pada skenario speaker-independent. Temuan ini memberikan gambaran mengenai keterbatasan LPC pada tugas SER berbahasa Indonesia serta dapat menjadi baseline evaluation bagi penelitian selanjutnya.
ABSTRACT:
In the field of Human-Computer Interaction (HCI), a system’s ability to recognize user emotions is a key factor in creating more natural and adaptive interactions. One approach used is Speech Emotion Recognition (SER), which involves recognizing emotions based on voice characteristics. Although SER research is advancing rapidly, the availability of Indonesian-language datasets remains limited. This study aims to evaluate the capability of Linear Predictive Coding (LPC) as a feature extraction method and Random Forest as a classification algorithm in classifying six Indonesian-language voice emotions, namely happy, disgust, surprise, anger, sadness, and fear. The dataset consists of 240 voice samples from 20 participants, divided into 192 training data and 48 test data. Evaluation on the training data was performed using StratifiedGroupKFold 5-fold cross-validation to ensure no speaker leakage occurred between folds. Test results showed an average cross-validation accuracy of 23% and a test set accuracy of 18.75%. These results indicate that LPC features are not yet capable of optimally representing emotional characteristics in a speaker-independent scenario. This finding highlights the limitations of LPC in Indonesian SER tasks and can serve as a baseline evaluation for future research.
الملخص:
في مجال التفاعل بين الإنسان والحاسوب (HCI)، تُعد قدرة النظام على التعرف على عواطف المستخدم عاملاً مهمًا في خلق تفاعل أكثر طبيعية وتكيفًا. ومن بين الأساليب المستخدمة في هذا المجال «التعرف على العواطف من خلال الكلام» (SER)، وهو التعرف على العواطف بناءً على خصائص الصوت. وعلى الرغم من التطور السريع في أبحاث التعرف على العواطف من خلال الكلام، إلا أن توفر قواعد البيانات باللغة الإندونيسية لا يزال محدودًا. تهدف هذه الدراسة إلى تقييم قدرة الترميز التنبئي الخطي (LPC) كطريقة لاستخراج الميزات، وقدرة الغابة العشوائية (Random Forest) كخوارزمية تصنيف، في تصنيف ستة مشاعر صوتية باللغة الإندونيسية، وهي السعادة، والاشمئزاز، والدهشة، والغضب، والحزن، والخوف. تتكون مجموعة البيانات المستخدمة من 240 عينة صوتية من 20 مشاركًا، تم تقسيمها إلى 192 عينة تدريب و48 عينة اختبار. تم إجراء التقييم على بيانات التدريب باستخدام التحقق المتقاطع StratifiedGroupKFold 5-fold للتأكد من عدم حدوث تسرب للمتحدثين بين الطيات. أظهرت نتائج الاختبار دقة متوسطة للتحقق المتقاطع بنسبة 23٪ ودقة لبيانات الاختبار بنسبة 18.75٪. تشير هذه النتائج إلى أن ميزات LPC لم تتمكن بعد من تمثيل خصائص العواطف بشكل مثالي في سيناريو مستقل عن المتحدث. توفر هذه النتائج نظرة عامة حول محدودية LPC في مهام التعرف على العواطف الصوتية باللغة الإندونيسية ويمكن أن تشكل تقييمًا أساسيًا للبحوث اللاحقة.
| Item Type: | Thesis (Undergraduate) |
|---|---|
| Supervisor: | Yaqin, M. Ainul and Imamudin, Mochamad |
| Keywords: | Pengenalan Emosi Ucapan; Emosi; Speech Emotion Recognition; Linear Predictive Coding; Random Forest; Speaker-Independent; Emotion; التعرف على المشاعر في الكلام; الترميز التنبئي الخطي; غابة عشوائية; مستقل عن المتحدث; المشاعر |
| Subjects: | 08 INFORMATION AND COMPUTING SCIENCES > 0801 Artificial Intelligence and Image Processing > 080109 Pattern Recognition and Data Mining |
| Departement: | Fakultas Sains dan Teknologi > Jurusan Teknik Informatika |
| Depositing User: | Anzila Rahmania Muchtar |
| Date Deposited: | 24 Jul 2026 09:54 |
| Last Modified: | 24 Jul 2026 09:54 |
| URI: | http://etheses.uin-malang.ac.id/id/eprint/87643 |
Downloads
Downloads per month over past year
Actions (login required)
![]() |
View Item |
