Responsive Banner

Pengembangan sistem ringkasan teks otomatis cerita Jawa dengan metode Abstraktif Menggunakan Model Transformer

Cahyadi, Ahmad Syafrian (2026) Pengembangan sistem ringkasan teks otomatis cerita Jawa dengan metode Abstraktif Menggunakan Model Transformer. Undergraduate thesis, Universitas Islam Negeri Maulana Malik ibrahim.

[img]
Preview
Text (Fulltext)
19650154.pdf - Accepted Version
Available under License Creative Commons Attribution Non-commercial No Derivatives.

(2MB) | Preview

Abstract

INDONESIA:

Pertumbuhan teks digital menuntut teknologi peringkasan otomatis, namun penelitian peringkasan abstraktif masih didominasi bahasa Indonesia dan Inggris, sedangkan bahasa Jawa yang tergolong low-resource belum banyak dikaji. Penelitian ini bertujuan mengembangkan dan mengevaluasi sistem ringkasan teks abstraktif cerita berbahasa Jawa berbasis Transformer. Model yang digunakan adalah mT5 (Multilingual Text-to-Text Transfer Transformer) yang di fine tune pada dataset cerita Jawa dari Kaggle, dengan tokenisasi subword SentencePiece Unigram dan decoding beam search. Sistem dibangun sebagai pipeline utuh yang meliputi praproses, tokenisasi, pemodelan, decoding, dan postprocessing. Untuk menguji pengaruh strategi pemanfaatan data, dirancang tiga skenario, yaitu data murni (S1), data terjemahan otomatis/G-Translate (S2), dan data gabungan/hybrid (S3). Evaluasi dilakukan menggunakan metrik ROUGE pada data uji serta analisis kuantitative. Hasil pengujian menunjukkan skenario hybrid (S3) memperoleh performa terbaik dengan ROUGE-1 sebesar 0,8029, ROUGE-2 sebesar 0,7745, dan ROUGE-L sebesar 0,7976; mengungguli skenario G-Translate (ROUGE-1 0,6457) dan murni (ROUGE-1 0,4035). Temuan ini menunjukkan bahwa penggabungan data murni dan terjemahan otomatis memadukan keunggulan kualitas linguistik dan volume data, sehingga menjadi strategi paling efektif untuk pengembangan NLP bahasa Jawa sebagai bahasa low-resource sekaligus mendukung pelestarian bahasa daerah melalui teknologi digital.

ENGLISH:

The rapid growth of digital text increases the need for automatic summarization, yet research on abstractive summarization remains dominated by Indonesian and English, while Javanese, a low-resource language, has received little attention. This study aims to develop and evaluate a Transformer-based abstractive summarization system for Javanese stories. The model used is mT5 (Multilingual Text-to-Text Transfer Transformer), fine-tuned on a Javanese story dataset obtained from Kaggle, using SentencePiece Unigram subword tokenization and beam-search decoding. The system was built as a complete pipeline comprising preprocessing, tokenization, modeling, decoding, and postprocessing. To examine the effect of the data utilization strategy, three scenarios were designed: pure data (S1), automatically translated/G-Translate data (S2), and combined/hybrid data (S3). Evaluation was conducted using ROUGE metrics on the test set together with qualitative analysis. The results show that the hybrid scenario (S3) achieved the best performance, with ROUGE-1 of 0.8029, ROUGE-2 of 0.7745, and ROUGE-L of 0.7976, outperforming the G-Translate scenario (ROUGE-1 0.6457) and the pure scenario (ROUGE-1 0.4035). These findings indicate that combining pure and automatically translated data merges the advantages of linguistic quality and data volume, making it the most effective strategy for developing Javanese NLP as a low-resource language while supporting the preservation of regional languages through digital technology.

ARAB:

نمو النصوص الرقمية يتطلب تقنية التلخيص التلقائي، ومع ذلك، ما زالت الأبحاث حول التلخيص التلقائي تهيمن عليها اللغتان الإندونيسية والإنجليزية، في حين أن اللغة الجاوية التي تعتبر قليلة الموارد لم تُدرس بشكل واسع. هدف هذا البحث إلى تطوير وتقييم نظام تلخيص نصي تلقائي للقصص المكتوبة باللغة الجاوية قائم على تقنية المحولات (Transformer). النموذج المستخدم هو mT5 (Multilingual Text-to-Text Transfer Transformer) الذي تم ضبطه بدقة على مجموعة بيانات القصص الجاوية من Kaggle، باستخدام تقسيم الرموز الفرعية SentencePiece Unigram وتقنية فك الترميز beam search. تم بناء النظام كسلسلة متكاملة تشمل المعالجة المسبقة، وتقسيم الرموز، والنمذجة، وفك الترميز، وما بعد المعالجة. لاختبار تأثير استراتيجيات استخدام البيانات، تم تصميم ثلاثة سيناريوهات، وهي البيانات الأصيلة (S1)، البيانات المترجمة آليًا/جوجل ترجمة (S2)، والبيانات المدمجة (S3). تم إجراء التقييم باستخدام مقاييس ROUGE على بيانات الاختبار بالإضافة إلى التحليل الكمي. أظهرت نتائج الاختبار أن سيناريو مدمجة (S3) حقق أفضل أداء حيث بلغت قيم ROUGE-1 0.8029، ROUGE-2 0.7745، وROUGE-L 0.7976؛ متفوقاً على سيناريو جوجل ترجمة (ROUGE-1 0.6457) والصافي (ROUGE-1 0.4035). أشارت هذه النتائج إلى أن دمج البيانات الأصيلة مع البيانات المترجمة تلقائيا يجمع بين مزايا الجودة اللغوية وحجم البيانات، مما يجعله استراتيجية فعّالة للغاية لتطوير معالجة اللغة الطبيعية للغة الجاوية كلغة ذات موارد منخفضة، مع دعم الحفاظ على اللغات المحلية من خلال التكنولوجيا الرقمية.

Item Type: Thesis (Undergraduate)
Supervisor: Supriyono, Supriyono and Utama, Soffin Nahwa
Keywords: Peringkasan Teks Abstraktif; Bahasa Jawa; mT5; Transformer; ROUGE; Low Resource; Abstractive Text Summarization; Javanese language; mT5; Transformer; Low Resource; الكلمات الرئيسي;: تلخيص نصي تلقائ ; لغة جاوية; mT5; نماذج محولات ; الموارد المحدودة
Subjects: 08 INFORMATION AND COMPUTING SCIENCES > 0801 Artificial Intelligence and Image Processing > 080107 Natural Language Processing
Departement: Fakultas Sains dan Teknologi > Jurusan Teknik Informatika
Depositing User: Ahmad Syafrian Cahyadi
Date Deposited: 23 Jul 2026 14:13
Last Modified: 23 Jul 2026 14:13
URI: http://etheses.uin-malang.ac.id/id/eprint/87843

Downloads

Downloads per month over past year

Actions (login required)

View Item View Item