全站数据
8 4 2 0 5 8 1

聚类分析和因子分析的区别

学历提升自考大百科 | 简单学习,快乐成才!         
问题更新日期:2024-10-26 17:32:42

问题描述

聚类分析和因子分析的区别急求答案,帮忙回答下
精选答案
最佳答案

我先抛砖引玉。聚类分析的方法经常被用来进行市场细分或用户分群。在聚类分析中,聚类变量的增加意味着需要更大的样本量才能识别出一定的模式。

许多变量(多维度空间)和很少的样本(这个空间只有很少的数据点)(密度不够)通常难以识别出一定的结构。

因此,当聚类变量很多时,很多研究者先进行因子分析萃取出少量因子,然后再利用这些因子进行聚类分析。

直到现在,你都能找到很多使用这种方法的研究文献。

但是,这种方法开始引起一些研究者的质疑。在2011年一篇名为《Three good reasons NOT to use factor-cluster segmentation》的文章中,研究者提出了三条理由说明先因子分析后聚类分析不如直接聚类:

1. 这些萃取出的公因子只能解释部分变异(这个做过因子分析的人都知道),这会丢失一些重要信息;

2.因子是对原始题项的抽象,没有直接的实践意义,甚至会出现一个因子下的题目逻辑上没有关联的情况;

3. 研究者做了一些数据研究发现,对原始题目进行聚类分析比先因子分析再聚类分析更能识别出正确的数据结构。总之,直接聚类分析的方法实际上是更可靠的。

另外还有一个值得提醒的问题就是,正如一开始提到的,参与聚类的变量数越多,所需样本量就越大。

如果直接拿变量进行聚类,常常要考虑自己的样本量是否足够的问题。

很少有研究者提到变量数和样本量之间的数量关系。

不过,Anton Formann在他1984年的一本书中指出最少样本量应该是2^k,其中k代表作为分群基础的变量数。

这意味着,10个变量至少需要1024个样本(2^10=1024)。

20个变量算出来的最少样本量那就是天文数字了。如果直接聚类,建议先删去冗余变量再进行。

其他回答

聚类分析是依据实验数据本身所具有的定性或定量的特征来对大量的数据进行分组归类以了解数据集的内在结构,并且对每一个数据集进行描述的过程。其主要依据是聚到同一个数据集中的样本应该彼此相似,而属于不同组的样本应该足够不相似。

因子分析就是设法将原来众多具有一定相关性(比如P个指标),重新组合成一组新的互相无关的综合指标来代替原来的指标。

综合指标即为主成分。所得出的少数几个主成分,要尽可能多地保留原始变量的信息,且彼此不相关。

其他回答

聚类分析是无监督分类,就是只有自变量(指标)数据,没有(表示类别的)因变量数据,就可以根据指标数据的距离或相似性进行归类,而且归为多少类也是不确定的,取决于数据本身和分类效果的度量指标。常见的聚类分析算法有层次聚类,K均值聚类,高斯混合聚类,还有基于密度的DBSCAN聚类。

判别分析是有监督分类,就是既有自变量(指标)数据,又有(表示类别的)因变量数据,根据已知类别的样本所提供的信息,总结出分类的规律性,并建立好判别公式和判别准则,这样有了新样本,就能据此判断其所属类别。除了通常的距离判别(相当于KNN),贝叶斯判别(朴素贝叶斯),Fisher判别,其它机器学习中的分类算法,比如决策树,支持向量机,神经网络等也都是判别分析算法。