如何找到原始属性的良好子集?

data miningdatabasedata structure更新于 2026/2/3 22:07:17

属性子集选择通过删除不相关或冗余的属性(或维度)来缩减数据集的大小。属性子集选择的目标是发现一个最小属性集,使得后续数据类的概率分布尽可能接近使用所有属性获得的原始分布。

对于 n 个属性,有 2n 个可能的子集。穷举搜索最佳属性子集的成本可能非常高,尤其是在 n 和数据类数量增加的情况下。因此,通常使用探索缩小搜索空间的启发式方法来选择属性子集。

这些方法通常是贪婪的,因为它们在搜索属性空间时会不断做出当时最佳选择的观点。它们的方法是开发局部最优选择,希望这能够带来全局最优解。这种贪婪技术在实践中非常有效,并且可以接近计算出最优解。

"最佳"和"最差"属性通常使用统计显著性检验来确定,这些检验认为属性彼此独立。可以使用一些不同的属性评估指标,包括用于构建分类决策树的信息增益指标。

属性子集选择的基本启发式方法包括以下技术:−

逐步向前选择 − 该过程从空属性集作为减少集开始。确定最佳初始属性并将其插入到减少集中。在后续的每个迭代或步骤中,将剩余的初始属性插入到集合中。

逐步向后消除 − 该过程从完整的属性集开始。在每个阶段,它会消除集合中剩余的最差属性。

向前选择和向后消除的组合 −可以混合使用逐步向前选择和向后消除技术,以便在每个阶段,该过程都会选择最佳属性,并从剩余属性中消除最差属性。

决策树归纳 − 决策树算法,包括 ID3、C4.5 和 CART,最初是为分类而设计的。决策树归纳构建了一个类似流程图的结构,其中每个内部(非叶)节点表示对某个属性的测试,每个分支对应测试的一个结果,每个外部(叶)节点表示一个类别预测。在每个节点上,算法都会选择"最佳"属性,将信息划分为单个类别。

当决策树归纳用于属性子集选择时,会根据给定的信息构建一棵树。所有未在树中出现的属性都被视为不相关。在树中出现的属性组构成属性的缩减子集。


相关文章