Automasi Pemeriksaan Fakta (Fact-Checking) Berbasis n8n + AI: Pipeline Crawl → Claim Detection → Source Verification → Report
· 4 menit baca
Automasi Pemeriksaan Fakta (Fact-Checking) Berbasis n8n + AI: Pipeline Crawl → Claim Detection → Source Verification → Report
Ringkasan: Panduan langkah-demi-langkah untuk membangun workflow otomatis pemeriksaan fakta (fact-checking) menggunakan n8n dan model AI. Artikel ini membahas arsitektur, komponen utama (crawler, ekstraksi klaim, verifikasi sumber, scoring, dan reporting), contoh prompt, template node n8n, serta praktik terbaik agar hasil akurat, transparan, dan auditable.
Mengapa otomatisasi fact-checking penting?
Di era informasi cepat, misinformasi dan disinformasi menyebar dengan cepat. Tim fact-checking manual tidak selalu bisa skala secepat informasi beredar. Dengan menggabungkan n8n (automation) dan AI (NLP, retrieval, scoring), organisasi dapat:
- Memproses klaim dalam volume lebih besar
- Menemukan sumber primer dan bukti pendukung lebih cepat
- Membangun audit trail yang dapat direview
- Mengotomasi pembuatan laporan dan notifikasi
Arsitektur tingkat tinggi
Arsitektur rekomendasi terdiri dari beberapa komponen:
- Crawler / Ingest: Mengambil konten dari RSS, Twitter/X, Telegram, web scraping, atau feed internal.
- Klaim Detection: Model NLP mengekstrak kalimat potensial berisi klaim faktual.
- Entity & Claim Normalization: Normalisasi nama entitas, angka, tanggal, lokasi untuk memudahkan pencarian bukti.
- Retrieval & Source Verification: Mencari sumber primer (news, publikasi resmi, data pemerintah, fact-check databases) dan menilai kredibilitas sumber.
- Evidence Scoring: Membuat skor kebenaran berbasis bukti dan confidence model.
- Human-in-the-loop: Editor memverifikasi hasil, memodifikasi verdict, dan menambahkan catatan.
- Reporting & Distribution: Menghasilkan artikel ringkasan, visual badges (True/False/Misleading), dan notifikasi ke tim atau publik.
Desain workflow n8n — node utama
Berikut contoh node workflow yang bisa dibuat di n8n:
- Trigger: Cron / Webhook / RSS Trigger
- Fetcher: HTTP Request node / Scraper untuk mengambil konten
- Preprocessing: Function node — bersihkan HTML, remove boilerplate
- Claim Detection: OpenAI / Hugging Face / model lokal — ekstrak kalimat klaim
- Normalization: Named Entity Recognition (NER) + Date/Number parsing
- Search & Retrieval: Multiple HTTP requests ke search engines, fact-check databases (Snopes, Google Fact Check Tools), government APIs, publikasi jurnal
- Source Credibility Check: Rule-based + AI scoring (domain age, HTTPS, known publishers list)
- Evidence Aggregation: Mengumpulkan bukti teratas dan snippets
- Classifier / Scoring: Model yang menggabungkan bukti untuk hasil akhir (True/False/Unverified/Misleading)
- Human Review: Kirim ke Slack/Email/Spreadsheet untuk review dan approval
- Publish: Auto-generate laporan (HTML/Markdown/PDF) dan post ke CMS atau media sosial
- Audit Log: Simpan semua input/output ke database (Postgres/Elastic/Vector DB) untuk retraining dan compliance
Contoh prompt untuk Claim Detection
Gunakan prompt terstruktur agar model konsisten. Contoh:
"Ekstrak semua pernyataan faktual dari teks ini. Untuk setiap pernyataan, kembalikan: 1) teks klaim, 2) entitas utama, 3) tipe klaim (angka, kejadian, opini), 4) confidence estimate (0-1)."
Prompt ini dijalankan di node LLM, hasilnya di-parse menjadi array klaim.
Strategi retrieval & source prioritization
- Gunakan federated search: Google Custom Search, Bing, arXiv, PubMed, data.gov, situs resmi kementerian.
- Prioritaskan sumber primer (statements resmi, dataset, publikasi) > jurnalisme > blog pribadi.
- Gunakan Vector DB (Milvus/Weaviate/Pinecone) untuk menyimpan embeddings klaim & bukti sehingga pencarian semantik cepat.
- Tambahkan heuristik trust score: domain age, SSL, WHOIS, fact-check database hits, known bias lists.
Evidence Scoring: contoh metrik
Gabungkan metrik kuantitatif dan kualitatif:
- Semantic similarity (embedding cosine)
- Jumlah sumber independen yang mendukung
- Sumber primer vs sekunder
- Bias / reputasi sumber
- Recency (apakah bukti relevan dengan waktu klaim)
Normalisasi tiap metrik dan hitung skor akhir dengan bobot yang bisa disesuaikan.
Human-in-the-loop & governance
Automasi harus melibatkan pengawasan manusia untuk kasus ambiguitas:
- Thresholding: Jika score di antara 0.3–0.7, kirim ke reviewer
- Audit trail: simpan semua prompt, sources, dan model outputs
- Explainability: sertakan snippets bukti dan alasan mengapa model memberikan verdict tertentu
- Versioning: simpan versi prompt dan model agar pemeriksaan masa depan mudah
Contoh implementasi n8n — snippet pseudo-setup
<Webhook Trigger> --> <HTTP Request (fetch page)> --> <Function (clean html)> --> <LLM: Claim Detection> --> <For Each Claim>
--> <NER + Normalizer> --> <Search APIs / Vector DB Query> --> <Evidence Aggregator> --> <Scoring Node> --> <If low-confidence then Human Review else Auto-Publish>
Tips praktis & best practices
- Throttle & rate-limit pada search APIs untuk menghindari pemblokiran.
- Cache hasil pencarian—banyak klaim berbeda berbagi sumber yang sama.
- Sanitize input untuk mencegah prompt injection ketika memproses konten pengguna.
- Monitor false positives dengan metrics: precision, recall, reviewer override rate.
- Privacy: jangan kirim data sensitif ke model publik tanpa anonymization.
Contoh template output laporan
Laporan otomatis harus ringkas namun transparan. Contoh struktur:
- Judul klaim
- Teks sumber asli (snippet + link)
- Kesimpulan (True / False / Misleading / Unverified)
- Confidence score
- Bukti pendukung (daftar link dan snippet)
- Catatan reviewer (jika ada)
- Audit trail (timestamp, model version, prompt hash)
Monitoring dan continuous improvement
Gunakan metrik untuk mengukur sistem:
- Throughput klaim per jam
- Time-to-first-evidence
- Agreement rate antara model & human reviewer
- Precision & recall terhadap dataset fact-checked
Pakai feedback reviewer untuk retrain model atau memperbaiki prompt chaining. Simpan data labeled ke vector DB untuk fine-tuning masa depan.
Kesimpulan
Membangun sistem fact-checking otomatis dengan n8n + AI memungkinkan organisasi memproses klaim lebih cepat dengan jejak audit yang jelas. Kunci keberhasilan adalah desain pipeline yang modular, keterlibatan manusia untuk kasus ambiguitas, dan monitoring yang ketat. Dengan arsitektur dan praktik terbaik di atas, Anda bisa memulai proof-of-concept dalam beberapa hari dan skala sesuai kebutuhan.
Butuh template workflow n8n atau contoh JSON node? Kontak tim JIPRAKS Classroom — kami dapat menyediakan template siap-pakai dan checklist implementasi.