Responsive Banner

Implementasi model LONG SHORT TERM MEMORY untuk klasifikasi kategori berita berbahasa Indonesia

Najiburrohman, Nur Muhammad (2026) Implementasi model LONG SHORT TERM MEMORY untuk klasifikasi kategori berita berbahasa Indonesia. Undergraduate thesis, Universitas Islam Negeri Maulana Malik Ibrahim.

[img]
Preview
Text (Fulltext)
220605110165.pdf - Accepted Version
Available under License Creative Commons Attribution Non-commercial No Derivatives.

(2MB) | Preview

Abstract

INDONESIA
Klasifikasi berita merupakan salah satu tugas dalam Natural Language Processing (NLP) yang bertujuan untuk mengelompokkan dokumen berita ke dalam kategori tertentu secara otomatis. Penelitian ini bertujuan untuk menganalisis performa metode Long Short-Term Memory (LSTM) dengan representasi Word2Vec dalam klasifikasi berita multi-kelas berbahasa Indonesia. Dataset yang digunakan adalah Indonesian News Corpus yang terdiri atas delapan kategori berita, yaitu Bisnis, Bola, Lifestyle, Nasional, Olahraga, Otomotif, Teknologi, dan Travel. Tahapan penelitian meliputi preprocessing data berupa cleaning, case folding, tokenisasi, stopword removal, padding, dan label encoding, kemudian dilanjutkan dengan pembentukan representasi kata menggunakan Word2Vec, pelatihan model LSTM, serta evaluasi menggunakan K-Fold Cross Validation dengan variasi batch size 32 dan 64 pada skenario 5-fold dan 10-fold. Kinerja model dievaluasi menggunakan metrik accuracy, precision, recall, dan F1-score. Hasil pengujian menunjukkan bahwa seluruh skenario menghasilkan nilai accuracy di atas 88%. Performa terbaik diperoleh pada penggunaan batch size 32 dengan 10-fold cross validation, yang menghasilkan accuracy sebesar 0,9203, precision sebesar 0,9207, recall sebesar 0,9203, dan F1-score sebesar 0,9203. Hasil tersebut menunjukkan bahwa kombinasi Word2Vec dan LSTM mampu memberikan performa klasifikasi yang baik serta memiliki kemampuan generalisasi yang stabil terhadap data berita berbahasa Indonesia.

ENGLISH
News classification is one of the fundamental tasks in Natural Language Processing (NLP), aiming to automatically assign news articles to predefined categories based on their content. This study investigates the performance of the Long Short-Term Memory (LSTM) model combined with Word2Vec word embeddings for multi-class classification of Indonesian news articles. The dataset used in this research is the Indonesian News Corpus, which consists of eight categories: Business, Sports (Football), Lifestyle, National, Sports, Automotive, Technology, and Travel. The research process includes data preprocessing, consisting of cleaning, case folding, tokenization, stopword removal, padding, and label encoding, followed by word representation using Word2Vec, model training with LSTM, and performance evaluation using K-Fold Cross Validation. Two batch size values (32 and 64) and two validation scenarios (5-fold and 10-fold) were evaluated. The model performance was assessed using accuracy, precision, recall, and F1-score. Experimental results indicate that all evaluation scenarios achieved an accuracy above 88%. The best performance was obtained using a batch size of 32 with 10-fold cross-validation, achieving an accuracy of 0.9203, a precision of 0.9207, a recall of 0.9203, and an F1-score of 0.9203. These findings demonstrate that the combination of Word2Vec and LSTM provides effective and stable performance for multi-class classification of Indonesian news articles.

ARABIC
يُعدُّ تصنيف الأخبار إحدى مهام معالجة اللغات الطبيعية (Natural Language Processing - NLP)، ويهدف إلى تصنيف الوثائق الإخبارية تلقائيًا ضمن فئات محددة. تهدف هذه الدراسة إلى تحليل أداء نموذج الذاكرة طويلة وقصيرة المدى LSTM باستخدام تمثيل الكلمات Word2Vecفي تصنيف الأخبار متعددة الفئات باللغة الإندونيسية. واعتمدت الدراسة على مجموعة بيانات Indonesian News Corpus التي تضم ثماني فئات إخبارية، وهي: الأعمال، وكرة القدم، ونمط الحياة، والأخبار الوطنية، والرياضة، والسيارات، والتكنولوجيا، والسفر. وشملت مراحل البحث المعالجة المسبقة للبيانات، والتي تضمنت تنظيف البيانات، وتحويل الأحرف إلى أحرف صغيرة Case Folding، وتقسيم النص إلى كلمات Tokenization، وإزالة الكلمات الشائعة Stopword Removal، وإضافة الحشو Padding، وترميز الفئات Label Encoding، ثم إنشاء تمثيل الكلمات باستخدام Word2Vec، وتدريب نموذج LSTM، وتقييمه باستخدام أسلوب K-Fold Cross Validation مع استخدام حجمَي دفعة Batch Size مقدارهما 32 و64 ضمن سيناريوهين هما 5-Fold و10-Fold. وتم تقييم أداء النموذج باستخدام مقاييس الدقة Accuracy، والدقة الإيجابية Precision، والاسترجاع Recall، ومقياس F1-Score. وأظهرت النتائج أن جميع السيناريوهات حققت قيمة Accuracy تجاوزت 88%، في حين تحقق أفضل أداء عند استخدام Batch Size يساوي 32 مع 10-Fold Cross Validation، حيث بلغت قيمة Accuracy ‏0.9203، وPrecision ‏0.9207، وRecall ‏0.9203، وF1-Score ‏0.9203، مما يدل على أن الجمع بين Word2Vec وLSTM يحقق أداءً جيدًا في تصنيف الأخبار، ويتمتع بقدرة مستقرة على التعميم عند التعامل مع بيانات الأخبار باللغة الإندونيسية.

Item Type: Thesis (Undergraduate)
Supervisor: Abidin, Zainal and Utama, Shoffin Nahwa
Keywords: Klasifikasi Berita; Text Classification; Long Short-Term Memory; Natural Languange Processing; Deep Learning; News Classification; Text Classification; Long Short-Term Memory; Natural Language Processing; Deep Learning; تصنيف الأخبار; تصنيف النصوص; الذاكرة طويلة وقصيرة المدى; معالجة اللغة الطبيعية; التعلم العميق
Subjects: 08 INFORMATION AND COMPUTING SCIENCES > 0801 Artificial Intelligence and Image Processing > 080107 Natural Language Processing
Departement: Fakultas Sains dan Teknologi > Jurusan Teknik Informatika
Depositing User: Nur Muhammad Najiburrohman
Date Deposited: 28 Jul 2026 10:49
Last Modified: 28 Jul 2026 10:49
URI: http://etheses.uin-malang.ac.id/id/eprint/87996

Downloads

Downloads per month over past year

Actions (login required)

View Item View Item