Kümeleme Analizi: Paket Program Uygulamaları ve Makale Örnekleri

Yazarlar

Özet

Kümeleme analizi, önceden grup yapıları veya sınıflandırmaları bilinmeyen veri setlerindeki gözlemleri ya da değişkenleri, kendi aralarındaki benzerlik veya uzaklık ölçütlerini temel alarak homojen alt gruplara (kümelere) ayıran çok değişkenli keşifsel bir istatistiksel yöntemdir. Temel olarak hiyerarşik (aşamalı) ve hiyerarşik olmayan (K-Ortalamalar/K-Means) olmak üzere iki grupta uygulanan bu yöntemde amaç, küme içi benzerliği maksimum, kümeler arası farkı ise en yüksek (maksimum) düzeye ulaştırmaktır. Analiz sürecinin ve elde edilen küme yapılarının anlamlılığını doğrulamak, değişkenlerin kümeler itibariyle farklılık gösterip göstermediğini denetlemek amacıyla varyans analizi (ANOVA) tablolarına ve küme merkezleri arası uzaklık matrislerine başvurulur.

Cluster analysis is a multivariate exploratory statistical method used to partition observations or variables with unknown predefined group structures into distinct subgroups (clusters) that are homogeneous within themselves and heterogeneous between each other based on their similarity or distance levels. Executed through three main algorithms in advanced statistical software—namely Two-Step, Hierarchical, and K-Means clustering—this analysis utilizes various distance metrics such as Euclidean, Minkowski, or correlation distances. In designs where no prior knowledge regarding the number of clusters exists, the optimum number of groups is automatically determined via the Two-Step clustering method based on Bayesian Information Criterion (BIC) or Akaike Information Criterion (AIC), while Dendrogram plots are standardly used for visual tracking of hierarchical structures, and ANOVA statistics are employed to systematically evaluate significant differences across the generated clusters.

Yayınlanan

19 Kasım 2022

Lisans

Lisans