IMPLEMENTASI RETRIEVAL-AUGMENTED GENERATION (RAG) UNTUK FACT-CHECKING OTOMATIS PADA KLAIM KESEHATAN
Penyebaran misinformasi kesehatan melalui media digital menjadi tantangan yang semakin serius, terutama sejak peningkatan penggunaan internet pasca-pandemi COVID-19. Penelitian ini mengimplementasikan pendekatan Retrieval-Augmented Generation (RAG) untuk melakukan verifikasi klaim kesehatan secara otomatis dan membandingkannya dengan model generatif murni (Non-RAG). Dataset yang digunakan adalah PubHealth, dengan cakupan tiga topik kesehatan (Biomedis/Medis, Kebijakan & Layanan Kesehatan Pemerintah, dan Cerita/Narasi Kesehatan Masyarakat) sebanyak 6.704 data. Sistem dibangun menggunakan model generator FLAN-T5-base, embedding Sentence-Transformer, indeks vektor FAISS, dan re-ranking berbasis CrossEncoder. Evaluasi dilakukan melalui dua skema untuk menghindari kebocoran data: Train (In-Corpus, 6.204 data) dan Test (Held-Out, 500 data) guna mengukur kemampuan generalisasi sistem. Hasil evaluasi menunjukkan model RAG secara konsisten unggul dibandingkan Non-RAG, dengan akurasi terbaik pada skema Train mencapai 0,5652 (F1-Score 0,5701; Cohen's Kappa 0,1307), sedangkan model Non-RAG mengalami bias ekstrem terhadap label Mitos (70–79% klaim dari seluruh kelas). Namun, pada skema Test, performa RAG menurun signifikan (akurasi 0,4880–0,4976; Kappa 0,0146–0,0315), mengindikasikan keterbatasan generalisasi terhadap klaim baru di luar korpus. Analisis per label juga menunjukkan kerangka klasifikasi biner efektif untuk klaim True dan False, namun tidak memadai untuk klaim Mixture dan Unproven yang secara definisi tidak memiliki nilai kebenaran tunggal. Sistem yang dikembangkan diimplementasikan dalam bentuk prototipe berbasis antarmuka Gradio, sehingga dapat digunakan sebagai alat bantu verifikasi klaim kesehatan yang transparan dan berbasis bukti.
The spread of health misinformation through digital media has become an increasingly serious challenge, particularly following the surge in internet usage after the COVID-19 pandemic. This research implements a Retrieval-Augmented Generation (RAG) approach for automatic health claim verification and compares it with a purely generative model (Non-RAG). The dataset used is PubHealth, covering three health-related topics (Biomedical/Medical, Government Health Policy and Services, and Public Health Narratives) with a total of 6,704 data entries. The system was built using FLAN-T5-base as the generator, Sentence-Transformer embeddings, a FAISS vector index, and CrossEncoder-based re-ranking. Evaluation was conducted using two schemes to prevent data leakage: Train (In-Corpus, 6,204 data) and Test (Held-Out, 500 data) to measure the system's generalization capability. The results show that the RAG model consistently outperformed the Non-RAG model, achieving its best Train-scheme accuracy of 0.5652 (F1-Score 0.5701; Cohen's Kappa 0.1307), while the Non-RAG model exhibited extreme bias toward the "Myth" label (70–79% of claims across all classes). However, under the Test scheme, RAG performance dropped significantly (accuracy 0.4880–0.4976; Kappa 0.0146–0.0315), indicating limited generalization to unseen claims outside the corpus. Per-label analysis further revealed that the binary classification framework was effective for True and False claims but inadequate for Mixture and Unproven claims, which by definition lack a single truth value. The developed system was implemented as a prototype with a Gradio-based interface, making it usable as a transparent, evidence-based health claim verification tool.