Search for collections on Undip Repository

Optimasi Hyperparameter Arsitektur Retrieval -Augmented Generation (RAG) Pada Chatbot Ekstraksi Informasi Jurnal Ilmiah

BAHTIAR, Ahlis Dinal (2026) Optimasi Hyperparameter Arsitektur Retrieval -Augmented Generation (RAG) Pada Chatbot Ekstraksi Informasi Jurnal Ilmiah. Undergraduate thesis, UNDIP: Fakultas Sains dan Matematika.

[thumbnail of FULL TEXT] Archive (FULL TEXT)
Softfile (Split) Skripsi Ahlis Dinal Bahtiar.zip
Restricted to Repository staff only

Download (9MB) | Request a copy
[thumbnail of 1. COVER.pdf] Text
1. COVER.pdf

Download (131kB)
[thumbnail of 3. HALAMAN PENGESAHAN I.pdf] Text
3. HALAMAN PENGESAHAN I.pdf

Download (391kB)
[thumbnail of 4. HALAMAN PENGESAHAN II.pdf] Text
4. HALAMAN PENGESAHAN II.pdf

Download (391kB)
[thumbnail of 5. KATA PENGANTAR.pdf] Text
5. KATA PENGANTAR.pdf

Download (756kB)
[thumbnail of 6. ABSTRAK.pdf] Text
6. ABSTRAK.pdf

Download (283kB)
[thumbnail of 7. ABSTRACT.pdf] Text
7. ABSTRACT.pdf

Download (194kB)
[thumbnail of 8. DAFTAR ISI.pdf] Text
8. DAFTAR ISI.pdf

Download (288kB)
[thumbnail of 12. BAB I PENDAHULUAN.pdf] Text
12. BAB I PENDAHULUAN.pdf

Download (385kB)
[thumbnail of 17. DAFTAR PUSTAKA.pdf] Text
17. DAFTAR PUSTAKA.pdf

Download (314kB)

Abstract

Pertumbuhan literatur ilmiah di bidang Teknologi Informasi menghadirkan tantangan
kelebihan informasi (information overload) yang membuat pencarian informasi teknis
secara manual menjadi tidak efisien. Sistem pencarian konvensional berbasis kata kunci
memiliki keterbatasan dalam memahami konteks pertanyaan, sementara penggunaan Large
Language Model (LLM) secara langsung rentan terhadap halusinasi fakta. Arsitektur
Retrieval-Augmented Generation (RAG) hadir sebagai solusi untuk meminimalisir
halusinasi dengan mengunci (grounding) jawaban pada dokumen referensi. Namun,
performa sistem RAG sangat bergantung pada strategi pemotongan teks dokumen akademik
yang panjang. Oleh karena itu, penelitian ini bertujuan untuk mengimplementasikan chatbot
LLM dan mencari konfigurasi optimal pada parameter Chunk Size, Chunk Overlap, Top-K,
serta metode penarikan data (Similarity Search dan Maximal Marginal Relevance) guna
mencegah hilangnya konteks informasi (Lost in the Middle). Sistem dibangun menggunakan
basis pengetahuan berupa 100 dokumen artikel ilmiah guna menguji ketahanan sistem
terhadap dokumen pengecoh (noise), dengan evaluasi terkontrol menggunakan 10 dokumen
sampel uji sebagai acuan kunci jawaban (ground truth). Evaluasi kinerja model diukur secara
kuantitatif menggunakan metrik Response Time, Coverage, ROUGE-1, ROUGE-L, dan
BERTScore. Hasil evaluasi dari 72 skenario eksperimen menunjukkan bahwa konfigurasi
RAG paling optimal dicapai pada penggunaan metode Similarity Search, Chunk Size 512
karakter, Chunk Overlap 20%, dan batasan Top-K 8. Konfigurasi ini menghasilkan tingkat
keberhasilan penarikan dokumen (Coverage) sebesar 100%, skor ROUGE-1 0,611,
ROUGE-L 0,567, serta akurasi semantik (BERTScore) yang sangat tinggi sebesar 0,842,
dengan rata-rata waktu komputasi yang efisien dan responsif yaitu 2,06 detik.
Kata kunci : Chatbot, Large Language Model, Retrieval-Augmented Generation, Chunk
Size, Top-K, Similarity Search, Evaluasi.

(NO. KETERSEDIAAN : 1730/F/2026)

Item Type: Thesis (Undergraduate)
Subjects: Sciences and Mathemathic
Divisions: Faculty of Science and Mathematics > Department of Informatics
Depositing User: Yemima Laras Sekarsari
Date Deposited: 07 Aug 2026 03:10
Last Modified: 07 Aug 2026 03:10
URI: https://eprints2.undip.ac.id/id/eprint/58712

Actions (login required)

View Item View Item