Prayoga, Ega Okta Syafan (2026) Analisis sentimen berita online menggunakan model BERT untuk teks berita berbahasa Inggris. Undergraduate thesis, Universitas Islam Negeri Maulana Malik Ibrahim.
This is the latest version of this item.
|
Text (Fulltext)
220605110163.pdf - Accepted Version Available under License Creative Commons Attribution Non-commercial No Derivatives. (2MB) |
Abstract
INDONESIA:
Perkembangan media online menyebabkan jumlah berita yang dipublikasikan semakin meningkat sehingga diperlukan metode yang mampu menganalisis sentimen yang terkandung dalam teks berita secara otomatis. Penelitian ini bertujuan untuk menerapkan model BERT dalam analisis sentimen berita online berbahasa Inggris serta mengevaluasi kinerjanya menggunakan metrik accuracy, precision, recall, dan F1-score. Dataset yang digunakan merupakan dataset sekunder yang diperoleh dari Kaggle dengan total 3.500 data berita yang terdiri dari tiga kelas sentimen, yaitu positif, negatif, dan netral. Tahapan penelitian meliputi preprocessing data, tokenisasi dan encoding menggunakan BERT tokenizer, pembagian data menggunakan Stratified 5-Fold Cross Validation, proses fine-tuning model BERT, serta evaluasi kinerja model. Pengujian dilakukan pada tiga skenario objek teks, yaitu judul berita (title), isi berita (description), dan kombinasi judul serta isi berita (combination). Hasil penelitian menunjukkan bahwa model BERT mampu melakukan klasifikasi sentimen dengan baik pada seluruh skenario pengujian. Skenario terbaik diperoleh pada penggunaan isi berita (description) dengan nilai accuracy sebesar 86,26%, precision sebesar 0,8641, recall sebesar 0,8626, dan F1-score sebesar 0,8618. Hasil tersebut menunjukkan bahwa teks yang lebih panjang dan kaya konteks memberikan informasi semantik yang lebih baik bagi model BERT dalam memahami sentimen berita online berbahasa Inggris.
ENGLISH:
The rapid growth of online media has increased the volume of published news, creating a need for methods capable of automatically analyzing sentiment contained in news articles. This study aims to implement the Bidirectional Encoder Representations from Transformers (BERT) model for sentiment analysis of English online news and evaluate its performance using accuracy, precision, recall, and F1-score metrics. The dataset used was a secondary dataset obtained from Kaggle consisting of 3,500 news articles categorized into three sentiment classes: positive, negative, and neutral. The research stages included data preprocessing, tokenization and encoding using the BERT tokenizer, data splitting using Stratified 5-Fold Cross Validation, BERT fine-tuning, and model performance evaluation. Experiments were conducted on three text scenarios: news titles, news descriptions, and a combination of titles and descriptions. The results indicate that the BERT model achieved satisfactory performance across all testing scenarios. The best performance was obtained using news descriptions, achieving an accuracy of 86.26%, precision of 0.8641, recall of 0.8626, and F1-score of 0.8618. These findings demonstrate that longer and more context-rich texts provide better semantic information for BERT in understanding sentiment within English online news articles.
ARABIC:
أدى النمو السريع لوسائل الإعلام الإلكترونية إلى زيادة حجم الأخبار المنشورة، مما استدعى الحاجة إلى أساليب قادرة على تحليل المشاعر الواردة في المقالات الإخبارية تلقائيًا. تهدف هذه الدراسة إلى تطبيق نموذج BERT (تمثيلات المشفر ثنائي الاتجاه من المحولات) لتحليل المشاعر في الأخبار الإنجليزية المنشورة على الإنترنت، وتقييم أدائه باستخدام مقاييس الدقة، والضبط، والاستدعاء، ومقياس F1. استُخدمت مجموعة بيانات ثانوية من موقع Kaggle، تضم 3500 مقالة إخبارية مصنفة إلى ثلاث فئات من المشاعر: إيجابية، وسلبية، ومحايدة. شملت مراحل البحث معالجة البيانات الأولية، وتقسيمها إلى رموز وتشفيرها باستخدام مُجزئ BERT، وتقسيم البيانات باستخدام التحقق المتقاطع الطبقي ذي الخمس طيات، وضبط BERT، وتقييم أداء النموذج. أُجريت التجارب على ثلاثة سيناريوهات نصية: عناوين الأخبار، ووصف الأخبار، ومزيج من العناوين والأوصاف. تشير النتائج إلى أن نموذج BERT حقق أداءً مُرضيًا في جميع سيناريوهات الاختبار. تم تحقيق أفضل أداء باستخدام أوصاف الأخبار، حيث بلغت الدقة 86.26%، والدقة 0.8641، والاستدعاء 0.8626، ودرجة F1 0.8618. تُظهر هذه النتائج أن النصوص الأطول والأكثر ثراءً بالسياق توفر معلومات دلالية أفضل لنموذج BERT في فهم المشاعر ضمن مقالات الأخبار الإنجليزية المنشورة على الإنترنت.
| Item Type: | Thesis (Undergraduate) |
|---|---|
| Supervisor: | Abidin, Zainal and Imamudin, Mochamad |
| Keywords: | Analisis Sentimen; Berita Daring; Pemrosesan Bahasa Alami; Sentiment Analysis; BERT; Online News; Natural Language Processing; Text Classification; تحليل المشاعر; الأخبار عبر الإنترنت; معالجة اللغة الطبيعية; تصنيف النصوص. |
| Subjects: | 08 INFORMATION AND COMPUTING SCIENCES > 0801 Artificial Intelligence and Image Processing > 080107 Natural Language Processing 08 INFORMATION AND COMPUTING SCIENCES > 0806 Information Systems > 080608 Information Systems Development Methodologies |
| Departement: | Fakultas Sains dan Teknologi > Jurusan Teknik Informatika |
| Depositing User: | Ega Okta Syafan Prayoga |
| Date Deposited: | 23 Jul 2026 10:57 |
| Last Modified: | 23 Jul 2026 10:57 |
| URI: | http://etheses.uin-malang.ac.id/id/eprint/87982 |
Downloads
Downloads per month over past year
Available Versions of this Item
-
Analisis sentimen berita online menggunakan model BERT untuk teks berita berbahasa Inggris. (deposited UNSPECIFIED)
- Analisis sentimen berita online menggunakan model BERT untuk teks berita berbahasa Inggris. (deposited 23 Jul 2026 10:57) [Currently Displayed]
Actions (login required)
![]() |
View Item |
