Otomatisasi Pembuatan Runbook & SOP dari Insiden dengan n8n + AI
· 5 menit baca
Otomatisasi Pembuatan Runbook & SOP dari Insiden dengan n8n + AI
Pada era DevOps dan SRE, waktu tanggap terhadap insiden adalah kunci. Namun membuat runbook atau SOP yang terstruktur untuk setiap insiden memakan waktu dan sering terlambat di-update. Dalam artikel ini kita akan membahas cara membangun workflow otomatis menggunakan n8n dan model AI (LLM) untuk menghasilkan runbook/SOP dari insiden secara cepat, konsisten, dan dapat direview oleh tim.
Kenapa Otomatisasi Runbook Penting?
Runbook yang baik mempercepat resolusi insiden, memastikan tindakan yang konsisten, dan membantu knowledge transfer. Tantangannya: dokumentasi sering tidak up-to-date, bergantung pada memori individu, dan memerlukan waktu untuk ditulis setelah insiden. Dengan menggabungkan n8n dan AI, kita bisa mengotomasi pembuatan versi awal runbook dari data insiden (alerts, logs, chat ops) dan menyertakan proses review manusia.
Gambaran Arsitektur Workflow
Workflow dasar yang akan kita bangun:
- Trigger: Alert dari monitoring (Prometheus, Datadog, PagerDuty) via webhook
- Enrichment: Ambil logs terkait, trace, dan metadata insiden
- Processing: Ringkasan & klasifikasi menggunakan LLM
- Generation: Buat draft runbook/SOP (langkah-langkah, checklist, rollback)
- Store: Simpan ke knowledge base (Confluence/Notion/Git)
- Notify: Kirim draft ke Slack/Email dan buat tiket review di Jira
- Feedback loop: Simpan review & perbaikan untuk fine-tuning atau prompt refinement
Contoh Flow n8n (High-level)
Di n8n, flow kita bisa terlihat seperti:
- Webhook node (Trigger)
- HTTP Request node (Ambil logs dari ELK / Loki)
- Function node (Preprocess: anonymize / extract fields)
- OpenAI / LLM node (Ringkasan & klasifikasi)
- OpenAI / LLM node (Generate Runbook Draft dengan prompt template)
- HTTP Request node (Create page di Confluence / Notion)
- Jira node (Buat tiket review)
- Slack node (Notify channel dengan tombol review)
Prompt Template untuk Generate Runbook
Prompt yang baik menentukan kualitas output. Berikut contoh template prompt yang bisa dipakai:
System: You are an expert SRE writing clear, concise runbooks.
User: Given the incident summary and logs, generate a runbook with sections: Title, Summary, Severity, Impact, Preconditions, Steps to Reproduce, Immediate Mitigation Steps, Root Cause Hypothesis, Full Remediation Steps, Rollback Plan, Postmortem Checklist, and References. Keep each step actionable and include command-line examples if applicable. Output in Markdown.
Incident Summary:
{{incident_summary}}
Relevant Logs:
{{logs_excerpt}}
Additional Metadata:
{{metadata}}
Tambahkan instruksi untuk model menandai bagian yang perlu verifikasi manusia (mis. [VERIFY]) untuk bagian hipotesis akar masalah atau perintah berisiko tinggi.
Tips Prompt Engineering & Safety
- Batasi konteks: Hanya kirim potongan log yang relevan untuk mengurangi biaya dan kebocoran informasi sensitif.
- Anonymize: Hapus IP, token, atau PII sebelum mengirim ke LLM.
- Instruksi verifikasi: Minta model menilai kepercayaan untuk setiap langkah (high/medium/low) sehingga reviewer tahu bagian mana harus diuji.
- Use system messages (jika provider mendukung) untuk men-set persona seperti "SRE runbook author" dan batas gaya.
Contoh Output Draft (Markdown)
Contoh hasil yang diharapkan dari LLM:
# Title: API Gateway Latency Spike
## Summary
API Gateway mengalami peningkatan latency ~500ms sejak 2025-08-20 08:15 UTC. Affected endpoints: /v1/payments.
## Severity: P2
## Impact
Pengguna mengalami timeout pada pembayaran (~10% requests error rate).
## Preconditions
- Deployment version: api-gateway:v2.3.1
- Recent config change at 2025-08-20 07:50 UTC
## Immediate Mitigation Steps
1. Scale up gateway replicas to 6 (kubectl scale deployment api-gateway --replicas=6) [VERIFY]
2. Temporarily enable circuit breaker for /v1/payments
## Root Cause Hypothesis
Konfigurasi timeouts di upstream service terlalu rendah setelah deploy. [LOW CONFIDENCE]
## Full Remediation Steps
1. Roll back to previous config commit: git revert
2. Increase upstream timeout to 30s, redeploy
## Rollback Plan
Revert to api-gateway:v2.3.0
## Postmortem Checklist
- Run load test
- Update runbook
- Schedule postmortem meeting
## References
- Link to logs
- PR#123
Integrasi dengan Sistem Lain
Pastikan runbook yang dihasilkan langsung tersimpan di tempat yang mudah diakses tim operasi:
- Confluence / Notion: Buat page draft dan tag tim terkait
- Git: Simpan markdown di repo internal untuk versioning dan code review
- Jira: Buat tiket review & assign reviewer
- Slack / MS Teams: Kirim notifikasi dengan link dan tombol untuk approve
Feedback Loop & Continuous Improvement
Sertakan mekanisme feedback supaya kualitas runbook meningkat seiring waktu:
- Simpan edit history dan diff dari review manusia
- Gunakan data review untuk refine prompt atau fine-tune model (jika memungkinkan)
- Tambahkan metrik: waktu pembuatan draft, waktu persetujuan, dan akurasi langkah (berdasarkan postmortem)
Keamanan, Kepatuhan & Privasi
Saat mengirim data ke LLM eksternal, perhatikan:
- Jangan kirim kredensial atau token. Gunakan token-masking.
- Patuh terhadap kebijakan perusahaan tentang data sensitif.
- Jika mungkin, jalankan LLM di lingkungan on-prem atau private cloud untuk insiden sensitif.
Optimasi Biaya & Latency
- Gunakan summarization step—kirim ringkasan bukan seluruh log ke model.
- Cache hasil yang sering muncul (template runbook untuk insiden umum).
- Batching: kelompokkan insiden kecil untuk generasi periodik jika tidak kritis.
Testing & Validasi Workflow
Uji otomatisasi dengan skenario simulasi:
- Synthetic alert yang memicu seluruh flow
- Verifikasi bahwa sensitive data dimask
- Pastikan reviewer dapat menolak/memperbaiki draft dan perubahan tersimpan
Best Practices
- Mulai dari template: Buat template runbook untuk tipe insiden umum (latency, errors, resource exhaustion).
- Human-in-the-loop: Selalu review manusia sebelum tindakan berisiko dieksekusi.
- Versioning: Simpan runbook sebagai markdown di git untuk audit trail.
- Monitoring meta: Tambahkan metric untuk kualitas runbook dan response time.
Kesimpulan
Menggabungkan n8n dan AI untuk otomatisasi pembuatan runbook & SOP dapat memangkas waktu dokumentasi, meningkatkan konsistensi, dan membantu tim merespons insiden lebih cepat. Kuncinya adalah desain workflow yang aman (anonymize), dapat direview (human-in-the-loop), dan terus diperbaiki melalui feedback. Implementasi yang baik memadukan integrasi monitoring, penyimpanan knowledge base, dan proses review terotomasi untuk hasil yang bisa diandalkan.
Ingin contoh workflow n8n yang bisa langsung di-import atau template prompt lebih lanjut? Tinggalkan komentar atau kunjungi JIPRAKS Classroom untuk tutorial langkah demi langkah.