K-means clustering termasuk analisis kluster yang bermanfaat untuk melakukan pengelompokkan berdasarkan jarak terdekat. Tutorial K-Means Clustering Analisis berisi tentang pembahasan detil bagaimana menghitung dan menggunakannya.
Pengertian clustering dalam bahasa formalnya adalah sebagai berikut: Proses pengelompokkan sejumlah obyek berdasarkan informasi yang diperoleh dari data yang menjelaskan hubungan antar obyek dengan prinsip untuk memaksimalkan kesamaan antar anggota satu cluster dan meminimumkan kesamaan antar cluster.
Sebelum membahas detil tentang k-means clustering, kita perlu memahami bahwa clustering analisis terbagi menjadi dua dari sudut pandang metode statistik; yakni metode hierarki dan metode non hierarki.
KLustering dalam metode hierarki memiliki syarat bertingkat sehingga terdapat bobot pada tingkat pertama dan tingkat berikutnya. Ketentuannya tentu pengelompokkan akan sangat dipengaruhi oleh struktur atau hierarki itu sendiri.
sedangkan kluster non hierarki berarti meniadakan struktural, semua data dianggap bebas dan dapat langsung dilakukan pengelompokkan. K-means clustering ini termasuk dalam metode klustering non hierarki.
Manfaat K-Means Clustering Analysis
Sesuai dengan fungsinya, clustering ini pastinya akan memberikan output akhir berupa kelompok data. Jika pada awalnya kita memiliki 100 data, kemudian kita akan membagi data tersebut menjadi dua kelompok, kelompok A dan B. Akan terasa sangat mudah jika parameter yang diamati hanya satu. Kita tinggal membagi data tersebut sesuai nilai tengahnya. Namun, akan sedikit rumit jika parameternya lebih dari 1, bahkan mungkin 10. tentu kita tidak bisa mengandalkan rata-rata disemua parameter tersebut. Sebenarnya bisa saja kita melakukan analisis multidimensional scaling terlebih dahulu untuk menggabungkan parameter-parameter tersebut. Tapi tetap saja, kita sedang membahas k-means clustering, bukan multidimensional scaling.
Secara spesifik, saya amati clustering ini digunakan untuk menganalisis kelompok yang berbeda, namun peneliti tidak membedakan kedua kelompok ini di awal penelitian atau saat pengambilan data. bingung?
Begini, biasanya dalam metode kuantitaif jika membahas perbedaan 2 kelompok maka kriterianya ditetapkan diawal penelitian. sehingga pengambilan data menyesuaikan kriteria tersebut. misalnya, kriteria satu kelompok mendapatkan bansos, satunya lagi tidak mendapat bansos. atau kriteria satu kelompok memiliki penghasilan dibawah 10 juta, satu kelompok lagi diatas 10 juta.
Nah, tidak demikian dengan K-means clustering ini. Pada analisis k-means clustering data diambil sesuai yang ada. misalnya melakukan observasi pada sebuah kecamatan. Maka tidak ada kriteria, semua data sesuai sampling diambil. pada proses analisisnya, peneliti baru akan membagi kelompok berdasarkan beberapa parameter yang ditentukan kemudian menganalisis perbedaan kedua kelompok tersebut.
Tutorial K-Means Clustering Analisis
Peneliti boleh melakukan standarisasi data terlebih dahulu, atau menjadikan data tersebar normal dengan mengkonversi ke nilai z score, t statistik, dan lain-lain. anda bisa mempelajari cara menormalisasi ke z score dalam artikel ini: Z score: Mengurutkan nilai secara signifikan.
Agar lebih paham, kita akan langsung praktek saja. langkah pertama adalah mempersiapkan data. saya memiliki 50 data dengan 5 parameter saya akan membuat 2 kelompok. karena masing masing parameter ini saya random nilainya dari 1-10, maka saya tidak perlu melakukan standar baku nilainya. asumsi sudah tersebar normal.

Ada 5 parameter yang akan digunakan untuk menentukan apakah data ke -n atau siswa ini masuk kelompok ke 1 atau 2. langkah pertama adalah menentukan berapa kelompok yang akan dibuat. saya sudah jelaskan saya akan membuat dua kelompok.
Menentukan nilai pusat kelompok data
langkah kedua: menentukan nilai pusat masing-masing kelompok. istilah nilai pusat ini bisa diartikan nilai median jika data sudah standar baku. sebenarnya nilai ini bersifat random, anda bisa menetapkan berapapun asal masih dalam range kelompok. hal ini karena nanti ada tahap penyesuaian. apa yang dimaksud dengan range kelompok?
karna data saya berkisar antara 1 – 10, maka dalam benak saya kelompok pertama klira-kira siswa yang memiliki nilai 1 sampai 5 sebagai kelompok 1. sedangkan siswa yang memiliki nilai 6 hingga 10 akan berada di kelompok 2. median dari kelompok 1 adalah 3, sedangkan median dari kelompok 2 adalah 8. nilai 1 sampai 5 dan 6 sampai 10 inilah yang saya sebut range kelompok. anada bisa saja menetapkan 2 atau angka bebas sebagai pusat kelompok 1 asal nilainya masih dalam range 1 hingga 5. paham sampai disini?
Menentukan jarak dari pusat kelompok
Setelah kita menentukan pusat dalam kelompok tersebut, kita sekarang hitung setiap data dalam kedua pusat tersebut. rumus untuk menghitung jarak tersebut adalah:

Kelima parameter diatas dihitung jarak ke kelompok pusat 1 dan pusat kelompok kedua. agar lebih teknis, ini rumus diexcelnya:

Nilai $M$2, $N$2, $O$2, $P$2, $Q$2 adalah tempat nilai pusat setiap parameternya. maka keluarlah nilai jarak Kelompok 1 di kolom G. Jarak K1 itu artinya, data ke-n memiliki jarak x untuk kelompok 1. Nah selanjutnya di kolom J adalah penentuan apakah data ke-n itu masuk dalam kelompok 1 atau kelompok 2. Cara menentukannya adalah mana nilai yang rendah atau jarak terdekat. Jika data tersebut lebih dekat /nilai jaraknya lebih pendek ke Kelompok 1 atau K1 maka kita putuskan bahwa data tersebut masuk dalam kelompok 1. dalam gambar diatas tercantum dalam kolom J. Maka setengah perjalanan untuk analisis ini sudah selesai.
Evaluasi nilai titik pusat kelompok
Langkah selanjutnya adalah melakukan evaluasi nilai titik pusat kelompok. sebelumnya kita tadi menentukan nilai titik pusat adalah dengan asumsi kita sendiri, bahkan saya bilang boleh dengan nilai yang random. agar nilai titik pusat itu sudah sesuai dengan nilai sebenarnya. tahapannya adalah:
pertama, kita hitung rata-rata parameter di kelompok 1 dan kelompok 2 berdasarkan pembagian kelompok dilangkah sebelumnya. kemudian nilai rata-rata setiap parameter menggantikan nilai pusat kelompok. Jadi, nilai pusat kelompoknya setiap parameter bisa saja berbeda tergantung rata-rata yang ditemukan skr. Berikut contoh yang sedang saya kerjakan dalam artikel ini:

Terlihat bahwa pusat kelompok after perhitungan pertama sudah terlihat bervariasi tergantung rata-rata parameter di kelompoknya.
kedua, menghitung ulang jarak seperti langkah sebelumnya dengan nilai pusat yang baru. ketiga, ulangi terus hingga rata-rata di kelompok parameter ini tidak terlalu berbeda dengan nilai pusatnya, artinya nilai pusat sudah sama dengan nilai meannya. berikut adalah hasil akhir beserta evaluasi atau rata-rata di setiap parameternya. Tidak sama persis tapi sudah menyerupai nilai pusat kelompok disetiap parameter.

Tahap akhir adalah menentukan kelompok disetiap data yang ada. Cara menentukan data ke-n itu masuk kelompok 1 atau 2 adalah dengan cara melihat jarak pusat yang sudah kita hitung. Jika nilai jarak pusat K1 < jarak pusat K2, maka data/responden itu tergolong kelompok 1. Bahasa yang mudah dimengerti “lebih dekat kemana, ke K1 atau ke K2?”.
Dan hasilnya dari data yang saya miliki kelompok 1 memiliki 22 data dan kelompok 2 memiliki 28 data. dengan gambar clusternya sebagai berikut:

berikut tutorial secara visualnya:
