Search for collections on Undip Repository

Peringkasan Multi-Dokumen Ekstraktif Menggunakan Metode Sentence-BERT dan Maximal Marginal Relevance (MMR) pada Berita Online Bahasa Indonesia

YUSANDA, Al Ferro Putra (2026) Peringkasan Multi-Dokumen Ekstraktif Menggunakan Metode Sentence-BERT dan Maximal Marginal Relevance (MMR) pada Berita Online Bahasa Indonesia. Undergraduate thesis, UNDIP: Fakultas Sains dan Matematika.

[thumbnail of FULL TEXT] Archive (FULL TEXT)
Softfile-Skripsi-Al Ferro Putra Yusanda-24060122140164.zip
Restricted to Repository staff only

Download (7MB) | Request a copy
[thumbnail of 1. COVER.pdf] Text
1. COVER.pdf

Download (3MB)
[thumbnail of 3. HALAMAN PENGESAHAN.pdf] Text
3. HALAMAN PENGESAHAN.pdf

Download (378kB)
[thumbnail of 4. KATA PENGANTAR.pdf] Text
4. KATA PENGANTAR.pdf

Download (191kB)
[thumbnail of 6. ABSTRAK.pdf] Text
6. ABSTRAK.pdf

Download (168kB)
[thumbnail of 7. ABSTRACT.pdf] Text
7. ABSTRACT.pdf

Download (168kB)
[thumbnail of 8. DAFTAR ISI.pdf] Text
8. DAFTAR ISI.pdf

Download (206kB)
[thumbnail of 11. BAB I PENDAHULUAN.pdf] Text
11. BAB I PENDAHULUAN.pdf

Download (325kB)
[thumbnail of 16. DAFTAR PUSTAKA.pdf] Text
16. DAFTAR PUSTAKA.pdf

Download (199kB)

Abstract

Fenomena information overload pada portal berita daring berbahasa Indonesia sering kali
memicu tingginya tingkat redundansi informasi lintas artikel, sehingga menyulitkan pembaca
dalam memperoleh intisari peristiwa secara efisien. Penelitian ini mengusulkan metode
peringkasan multi-dokumen ekstraktif yang mengintegrasikan Agglomerative Clustering
sebagai algoritma pemilah topik, representasi semantik Sentence-BERT (SBERT)
menggunakan varian paraphrase-multilingual-MiniLM-L12-v2, serta algoritma Maximal
Marginal Relevance (MMR) sebagai mekanisme penyeleksi kalimat anti-redundan.
Pendekatan komputasi berbasis dense embedding ini diimplementasikan guna mengatasi
keterbatasan representasi statistik konvensional dalam mendeteksi makna parafrasa.
Pengujian arsitektur dilakukan terhadap benchmark dataset dari portal berita Liputan6 yang
terdistribusi ke dalam enam kategori topik utama. Kualitas ringkasan dievaluasi menggunakan
metrik ROUGE terhadap human ground truth yang telah tervalidasi reliabilitasnya dengan
nilai kesepakatan aktual (Percentage Agreement) sebesar 63,21%. Hasil eksperimen
komputasional pada skenario tingkat kompresi 20%, 30%, 40%, dan 50% memvalidasi bahwa
tingkat kompresi 30% merupakan titik keseimbangan (sweet spot) paling optimal antara
kepadatan informasi utama dan keberagaman frasa. Pada ambang batas kompresi tersebut,
metode usulan secara keseluruhan meraih nilai rata-rata performa kompetitif dengan F1-Score
ROUGE-1 sebesar 0,4750, ROUGE-2 sebesar 0,3034, dan ROUGE-L sebesar 0,3391.
Penelitian ini membuktikan secara empiris bahwa integrasi pemahaman semantik mendalam
dan metrik diversitas komputasional efektif untuk mereduksi redundansi leksikal sekaligus
mempertahankan akurasi faktual teks berita bagi pembaca digital.
Kata Kunci
:
Peringkasan Multi-Dokumen Ekstraktif, Sentence-BERT, Maximal
Marginal Relevance, ROUGE.

(NO. KETERSEDIAAN : 1701/F/2025)

Item Type: Thesis (Undergraduate)
Subjects: Sciences and Mathemathic
Divisions: Faculty of Science and Mathematics > Department of Informatics
Depositing User: Yemima Laras Sekarsari
Date Deposited: 28 Jul 2026 10:44
Last Modified: 28 Jul 2026 10:44
URI: https://eprints2.undip.ac.id/id/eprint/57979

Actions (login required)

View Item View Item