Tuesday, June 30, 2026

Membangun Model Prediksi Pelanggan Berisiko Churn Menggunakan Random Forest

 1. Pendahuluan

Dalam bisnis yang menggunakan sistem berlangganan, menjaga pelanggan agar tetap bertahan menjadi hal yang sangat penting. Ketika seorang pelanggan memutuskan untuk berhenti menggunakan layanan atau churn, perusahaan tidak hanya kehilangan pendapatan dari pelanggan tersebut, tetapi juga harus mengeluarkan biaya baru untuk menarik pelanggan pengganti.

Churn pelanggan biasanya dapat dipengaruhi oleh beberapa hal, seperti durasi pelanggan menggunakan layanan, jenis kontrak, layanan tambahan yang dipilih, metode pembayaran, biaya bulanan, dan total pembayaran selama berlangganan. Informasi tersebut dapat dimanfaatkan untuk melihat pola pelanggan yang memiliki kemungkinan lebih besar untuk berhenti berlangganan.

Pada proyek ini, saya menggunakan Telco Customer Churn Dataset dari Kaggle. Dataset ini terdiri dari 7.043 data pelanggan dengan 21 kolom yang mencakup informasi profil pelanggan, jenis layanan yang digunakan, biaya layanan, serta status apakah pelanggan tersebut churn atau tidak.

Tujuan dari proyek ini adalah membangun model Machine Learning menggunakan algoritma Random Forest untuk membantu memprediksi pelanggan yang berisiko churn. Dengan prediksi tersebut, perusahaan dapat melakukan langkah pencegahan lebih awal, misalnya melalui penawaran khusus, peningkatan kualitas layanan, atau pendekatan yang lebih personal kepada pelanggan yang memiliki risiko tinggi untuk berhenti berlangganan.

2. Mengapa Random Forest?

Algoritma Random Forest digunakan dalam proyek ini karena cocok untuk masalah klasifikasi, termasuk prediksi customer churn. Secara sederhana, Random Forest bekerja dengan membentuk banyak decision tree, kemudian menggabungkan hasil dari setiap tree untuk menghasilkan prediksi akhir yang lebih stabil.

Pada kasus churn pelanggan, data yang digunakan memiliki banyak jenis fitur, mulai dari data numerik hingga data kategorikal. Beberapa fitur yang dianalisis antara lain tenure, contract, payment method, internet service, monthly charges, total charges, dan layanan tambahan yang digunakan pelanggan. Setelah data kategorikal diubah ke bentuk numerik melalui proses encoding, fitur-fitur tersebut dapat digunakan oleh model untuk mengenali pola pelanggan yang berpotensi churn.

Salah satu keunggulan Random Forest adalah kemampuannya menampilkan feature importance. Dengan feature importance, kita dapat melihat variabel mana saja yang paling berpengaruh terhadap prediksi churn. Hal ini membuat model tidak hanya berguna untuk menghasilkan prediksi, tetapi juga membantu memberikan insight bisnis yang lebih mudah dipahami.

Selain itu, jumlah pelanggan yang churn lebih sedikit dibandingkan pelanggan yang tidak churn. Untuk mengatasi kondisi tersebut, model dibuat dengan pendekatan class_weight="balanced". Pendekatan ini membantu model agar tidak hanya fokus pada kelas mayoritas, tetapi juga lebih memperhatikan pelanggan yang benar-benar berisiko churn.

3. Metodologi

Proyek ini dimulai dari tahap memahami data, melakukan preprocessing, membangun model, hingga mengevaluasi hasil prediksi. Dataset yang digunakan adalah Telco Customer Churn Dataset dari Kaggle, dengan kolom Churn sebagai target prediksi. Target ini memiliki dua kategori, yaitu Yes untuk pelanggan yang churn dan No untuk pelanggan yang tidak churn.

Pada tahap awal, dilakukan data understanding untuk melihat struktur dataset, jumlah data, jumlah kolom, tipe data, missing value, serta distribusi target churn. Dari hasil pengecekan, dataset terdiri dari 7.043 data pelanggan dan 21 kolom. Distribusi target menunjukkan bahwa pelanggan yang tidak churn jumlahnya lebih banyak dibandingkan pelanggan yang churn, sehingga model perlu memperhatikan adanya ketidakseimbangan kelas.

Tahap berikutnya adalah preprocessing. Kolom customerID dihapus karena hanya berfungsi sebagai identitas pelanggan dan tidak memberikan pola yang relevan untuk proses prediksi. Kolom TotalCharges disesuaikan menjadi format numerik agar dapat diproses oleh model. Sementara itu, kolom kategorikal seperti gender, Contract, PaymentMethod, InternetService, dan layanan tambahan lainnya diubah menjadi bentuk numerik menggunakan encoding.

Setelah data siap, dataset dibagi menjadi data training dan data testing dengan rasio 80:20. Data training digunakan untuk melatih model, sedangkan data testing digunakan untuk menguji performa model pada data yang belum pernah dilihat sebelumnya. Model yang digunakan adalah Random Forest Classifier dengan class_weight="balanced" agar model lebih sensitif terhadap pelanggan yang berisiko churn.

Evaluasi model dilakukan menggunakan accuracy, precision, recall, F1-score, dan confusion matrix. Selain itu, feature importance digunakan untuk mengetahui faktor-faktor yang paling berpengaruh terhadap prediksi churn. Hasil dari evaluasi ini kemudian digunakan untuk menyusun insight dan rekomendasi bisnis terkait strategi retensi pelanggan.

4. Hasil & Pembahasan

Setelah data melalui tahap preprocessing, model Random Forest Classifier dilatih menggunakan data training dan diuji menggunakan data testing. Pada proyek ini, model dibuat dengan pendekatan class_weight="balanced" agar lebih memperhatikan pelanggan yang berisiko churn, karena jumlah pelanggan churn lebih sedikit dibandingkan pelanggan yang tidak churn.

Berdasarkan hasil pengujian, model memperoleh akurasi sebesar 76,86%. Dari total 1.409 data testing, model berhasil memprediksi 804 pelanggan tidak churn dengan benar dan 279 pelanggan churn dengan benar. Sementara itu, terdapat 231 pelanggan tidak churn yang diprediksi sebagai churn, serta 95 pelanggan churn yang belum berhasil terdeteksi oleh model.



Gambar 1. Confusion Matrix Model Random Forest

Dalam konteks customer churn, angka yang perlu diperhatikan bukan hanya akurasi, tetapi juga kemampuan model dalam mengenali pelanggan yang benar-benar berisiko churn. Berdasarkan hasil evaluasi, model mampu mendeteksi sekitar 74,60% pelanggan churn. Artinya, sebagian besar pelanggan yang berpotensi berhenti berlangganan sudah dapat dikenali oleh model, meskipun masih ada sebagian pelanggan churn yang belum terdeteksi.

Selain confusion matrix, analisis feature importance juga digunakan untuk melihat faktor-faktor yang paling berpengaruh terhadap prediksi churn.

Gambar 2. Top 10 Feature Importance Model Random Forest

Berdasarkan hasil feature importance, fitur yang paling berpengaruh terhadap prediksi churn adalah tenure, TotalCharges, Contract_Two year, MonthlyCharges, InternetService_Fiber optic, PaymentMethod_Electronic check, Contract_One year, OnlineSecurity_Yes, TechSupport_Yes, dan PaperlessBilling_Yes.

Hasil ini menunjukkan bahwa churn pelanggan banyak dipengaruhi oleh lama berlangganan, total biaya yang telah dibayarkan, jenis kontrak, biaya bulanan, layanan internet, metode pembayaran, serta layanan tambahan seperti online security dan tech support. Pelanggan dengan pola tertentu, misalnya masa berlangganan yang lebih pendek, kontrak yang kurang mengikat, atau biaya bulanan yang tinggi, dapat memiliki risiko churn yang lebih besar.

Insight ini dapat digunakan perusahaan untuk menyusun strategi retensi yang lebih terarah. Pelanggan yang terdeteksi memiliki risiko churn tinggi dapat diprioritaskan untuk mendapatkan pendekatan khusus, seperti penawaran paket yang lebih sesuai, peningkatan kualitas layanan, atau komunikasi personal dari tim customer service. Dengan begitu, model Machine Learning tidak hanya berfungsi sebagai alat prediksi, tetapi juga dapat menjadi dasar pengambilan keputusan bisnis yang lebih proaktif.

5. Rekomendasi Bisnis

Berdasarkan hasil model Random Forest, perusahaan dapat menggunakan prediksi churn sebagai dasar untuk menentukan prioritas pelanggan yang perlu mendapatkan perhatian lebih. Pelanggan yang terdeteksi memiliki risiko churn tinggi sebaiknya tidak diperlakukan sama dengan pelanggan lain, karena mereka membutuhkan pendekatan yang lebih cepat dan lebih personal.

Salah satu rekomendasi utama adalah membuat segmentasi pelanggan berdasarkan tingkat risiko churn. Pelanggan dengan risiko tinggi dapat dimasukkan ke dalam daftar prioritas retensi, kemudian diberikan penawaran khusus seperti diskon paket, bonus layanan, upgrade fitur, atau rekomendasi paket yang lebih sesuai dengan kebutuhan mereka.

Hasil feature importance menunjukkan bahwa tenure, TotalCharges, jenis kontrak, MonthlyCharges, InternetService, dan metode pembayaran menjadi faktor yang cukup berpengaruh terhadap prediksi churn. Berdasarkan hal tersebut, perusahaan dapat lebih memperhatikan pelanggan dengan masa berlangganan yang masih pendek, pelanggan dengan biaya bulanan tinggi, serta pelanggan yang menggunakan kontrak jangka pendek atau metode pembayaran tertentu.

Perusahaan juga dapat meningkatkan strategi retensi melalui pendekatan layanan pelanggan. Misalnya, pelanggan yang mulai menunjukkan risiko churn dapat dihubungi lebih awal oleh tim customer service untuk mengetahui kendala yang mereka alami. Pendekatan ini dapat membantu perusahaan memahami penyebab churn secara lebih spesifik, baik karena harga, kualitas layanan, kontrak, maupun pengalaman pelanggan.

Selain itu, model ini dapat dikembangkan menjadi dashboard Customer Intelligence. Dashboard tersebut dapat membantu tim bisnis memantau pelanggan berisiko churn secara berkala, melihat faktor penyebab utama, dan menentukan tindakan yang paling sesuai. Dengan begitu, keputusan retensi tidak hanya berdasarkan asumsi, tetapi didukung oleh hasil analisis data.

6. Kesimpulan & Saran

Berdasarkan hasil pengujian, model Random Forest mampu digunakan untuk memprediksi pelanggan yang berisiko berhenti berlangganan. Model memperoleh akurasi sebesar 76,86% dan berhasil mengenali sebagian besar pelanggan churn pada data testing. Hasil ini menunjukkan bahwa pendekatan Machine Learning dapat membantu perusahaan melihat potensi churn lebih awal, sebelum pelanggan benar-benar berhenti menggunakan layanan.

Namun, hasil model juga menunjukkan bahwa masih terdapat pelanggan churn yang belum berhasil terdeteksi. Dalam konteks bisnis, hal ini penting untuk diperhatikan karena pelanggan yang tidak terdeteksi berisiko lepas dari strategi retensi perusahaan. Oleh karena itu, performa model tidak hanya perlu dilihat dari akurasi, tetapi juga dari kemampuan model dalam mengenali pelanggan yang benar-benar berisiko churn.

Model ini dapat dikembangkan lebih lanjut menjadi bagian dari Dashboard Customer Intelligence. Dengan dashboard tersebut, perusahaan dapat memantau pelanggan berisiko churn secara berkala, melihat faktor-faktor yang memengaruhi churn, dan menentukan langkah retensi yang lebih tepat berdasarkan data.

Untuk pengembangan selanjutnya, model dapat ditingkatkan dengan teknik cross-validation dan hyperparameter optimization seperti GridSearchCV agar pemilihan parameter menjadi lebih optimal. Selain itu, algoritma lain seperti XGBoost atau LightGBM juga dapat digunakan sebagai pembanding untuk melihat apakah performa prediksi dapat ditingkatkan. Pendekatan explainable AI seperti SHAP atau LIME juga dapat diterapkan agar hasil prediksi lebih mudah dipahami oleh tim bisnis dan tidak hanya menjadi output teknis dari model.

7. Opini Pribadi: Prediksi Churn sebagai Langkah Awal Retensi Pelanggan

Melalui proyek ini, saya melihat bahwa Machine Learning dapat membantu perusahaan memahami pelanggan dengan cara yang lebih terukur. Prediksi churn bukan hanya soal mengetahui siapa yang kemungkinan akan berhenti berlangganan, tetapi juga tentang memahami alasan di balik risiko tersebut.

Menurut saya, nilai utama dari model seperti Random Forest adalah kemampuannya memberikan gambaran awal kepada perusahaan mengenai pelanggan yang perlu diperhatikan lebih cepat. Dengan informasi tersebut, perusahaan dapat mengambil tindakan sebelum pelanggan benar-benar berhenti menggunakan layanan.

Namun, model prediksi tetap perlu digunakan sebagai alat bantu, bukan sebagai satu-satunya dasar pengambilan keputusan. Hasil model sebaiknya dikombinasikan dengan analisis bisnis, feedback pelanggan, dan kebijakan perusahaan agar strategi retensi yang dibuat menjadi lebih tepat.

Dari proyek ini, saya belajar bahwa data dapat menjadi dasar yang kuat untuk mengambil keputusan. Ketika data diolah dengan baik, perusahaan tidak hanya bisa melihat masalah setelah terjadi, tetapi juga dapat mengantisipasi risiko lebih awal dan menyusun tindakan yang lebih proaktif.

Referensi

Kaggle. Telco Customer Churn Dataset.

Breiman, L. (2001). Random Forests. Machine Learning, 45, 5–32.

Ahmad, A. K., Jafar, A., & Aljoumaa, K. (2019). Customer churn prediction in telecom using machine learning and social network analysis in big data platform.

Phua, C., Cao, H., Gomes, J. B., & Nguyen, M. N. (2012). Predicting Near-Future Churners and Win-Backs in the Telecommunications Industry.

Raden Sultan Shoma - 231011701353 - 06SIFP002 - UAS Keamanan Sistem Informasi

 Nama: Raden Sultan Shoma NIM: 231011701353 Kelas: 06SIFP002 Mata Kuliah: Keamanan Sistem Informasi jawaban no 1 Sebelum mengakses website J...