IMPLEMENTASI SISTEM PENCARIAN SEMANTIK MENGGUNAKAN MINILM-RAG PADA ARSIP DOKUMEN DIGITAL PERGURUAN TINGGI
Author
Abstract
Institusi perguruan tinggi sangat bergantung pada arsip digital untuk mengelola dokumen administratif dan akademik. Sistem temu kembali informasi berbasis kata kunci konvensional kerap gagal menangkap relasi semantik antara kueri pengguna dan dokumen arsip, sehingga menghasilkan relevansi pencarian yang kurang optimal. Penelitian ini mengusulkan sistem pencarian semantik dan Retrieval-Augmented Generation (RAG) untuk pengelolaan arsip akademik di Universitas Darussalam Gontor. Sistem ini memanfaatkan model sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 yang telah diadaptasi ke dalam domain spesifik, dilatih menggunakan augmentasi data sintetis threefold serta fungsi Multiple Negatives Ranking Loss. Representasi vektor dokumen (embeddings) diindeks pada ChromaDB menggunakan metrik cosine similarity, sementara Cross-Encoder multibahasa melakukan pengurutan ulang hibrida (hybrid reranking) sebelum konteks yang relevan diteruskan ke Large Language Model lokal. Hasil eksperimen terhadap 784 dokumen arsip menunjukkan bahwa model SBERT MiniLM hasil fine-tuning dengan augmentasi data sintetis mampu mencapai nilai Accuracy@1 sebesar 0,923, Precision@1 sebesar 0,923, Recall@5 sebesar 0,9936, NDCG@10 sebesar 0,9632, dan MRR@10 sebesar 0,9511, yang mengungguli kualitas pemeringkatan model pre-trained MiniLM, model MiniLM fine-tuned tanpa augmentasi data sintetis, maupun MPNet multibahasa. Alur kerja (pipeline) RAG kemudian dievaluasi menggunakan Llama 3.2, Gemma 2, dan Qwen 2.5. Model Gemma 2 mencatatkan performa keseluruhan terbaik, dengan skor faithfulness sebesar 0,97, answer relevancy sebesar 0,89, context precision sebesar 0,91, serta rata-rata waktu komputasi end-to-end (latency) sebesar 6,07 detik. Temuan ini menunjukkan bahwa penggunaan model MiniLM berparameter ringan yang diadaptasi secara domain, dikombinasikan dengan pengurutan ulang hibrida dan pipeline RAG lokal, mampu menyediakan akses informasi arsip akademik yang akurat dan efisien secara komputasi.