如何进行类别比较?
类别区分或比较挖掘特征,将目标类别与其对比类别进行分类。目标类别和对比类别应该具有可比性,前提是它们具有相同的维度和属性。例如,人员、地址和元素这三个类别是不可比的。但过去三年的销售额是可比的类别,计算机科学类候选对象与物理类候选对象也是如此。
可以继续使用已开发的技术来管理多个可比类别之间的类别比较。例如,可以更改为类别表征定义的属性泛化过程,以便在所有比较的类别之间同步实现泛化。这使得某些类中的属性可以泛化到相似的抽象级别。
例如,假设给定 AllElectronics 公司 2003 年和 2004 年的销售额数据,并且可以比较这两个类别。考虑在城市、省/州和国家/地区级别进行抽象的维度区域。每类数据都必须推广到类似的位置级别。
也就是说,它们必须同步推广到城市级别、职责级别、州级别或国家级别。这比比较温哥华 2003 年的销售额与美国 2004 年的销售额(即每组销售数据都要推广到多个级别)更有帮助。
用户必须能够选择覆盖,包括自动同步比较(当选择时)。有几个程序如下 −
数据收集 − 通过查询处理收集数据库中的相关记录集,并相应地将其分为目标类和一个或一组对比类。
维度相关性分析 −如果有多个维度,则必须对这些类别进行维度相关性分析,以便仅选择高度相关的维度进行进一步分析。
同步泛化 − 泛化是在目标类别上实现的,泛化达到用户或专业人员指定的维度阈值所控制的水平,从而产生主要的目标类别关系。
派生比较结果的呈现 − 生成的类别比较描述可以以表格、图形和规则的形式进行预测。这种呈现通常涉及一个"对比"度量,包括 count%(百分比计数),以反映目标类别和对比类别之间的比较。
用户可以通过对获取的目标类别和对比类别进行下钻、上卷和其他 OLAP 操作来调整比较描述。

