数据挖掘多维关联规则

dbmsdata miningdatabase更新于 2026/1/22 10:37:17

关联规则挖掘帮助我们发现大型数据集之间的关系。

在多维关联中,

  • 多维关联规则包含多个方面

  • 数值属性应该离散化。

  • 属性可以是非量化的,也可以是量化的。

  • 量化特征是数值型的,并巩固了优先顺序。

挖掘多维关联规则的三种方法是:

对量化属性进行静态离散化

离散化在挖掘之前发生,并且是静态的。离散化的属性被视为绝对属性,并使用一种称为先验算法的算法来搜索所有k次频繁谓词集(需要k次或k+1次表扫描)。频繁谓词集的每个子集都应该是连续的。数据立方体最适合挖掘,因为它们有助于加速挖掘。谓词单元与 n 维数据长方体的单元相关。

示例 - 在数据立方体中,三维长方体 (id, name, class) 是频繁出现的,则表明 (id, name),(name, class),(id, class) 也是频繁出现的。

使用定量属性的动态离散化

这也称为挖掘定量关联规则,数值属性会被动态离散化。

示例

age(A,"12..25")Λrank(A,"1..4")Λgets(A,"laptop computer")

输出

rank1

rank2

rank3

rank4

age,22-25

age,18-21

age,12-17

这里,属性被分类到箱子中,并基于数据的分布。这些容器可以进一步组合进行分析,从而实现动态离散化。

元组网格

基于距离的聚类离散化

这是一个动态离散化过程,考虑了感兴趣数据之间的距离。

挖掘过程包含两个步骤。

  • 通过执行聚类找到所涉及的属性区间。

  • 关联规则是通过搜索同时出现的聚类组来获取的。

注意 − 规则前提和结果中的聚类是强关联的,并且同时出现。

结论

本文涉及使用多维关联规则进行数据挖掘,这有助于发现数据集之间的关系,然后使用不同的方法(离散化)进行挖掘。第一种方法是使用静态离散化,即使用先验算法来定位谓词集。第二种方法是动态离散化,即对数值属性进行动态离散化。第三种方法是基于距离的离散化,即测量数据点之间的距离。