衍生模型在数据挖掘中是如何呈现的?

data miningdatabasedata structure

分类是发现一个模型的过程,该模型用于定义和分类数据类别或概念。该模型基于对一组训练数据(即,类标签已知的数据对象)的搜索。该模型可以预测类标签未知的对象的类标签。

衍生模型可以以多种形式表示,包括分类规则(即 IF-THEN 规则)、决策树、数值公式或神经网络。决策树是一种类似流程图的树形结构,其中每个节点表示对属性值的测试,每个分支定义测试的结果,树叶描述类别或类别分布。

决策树可以转换为分类规则。神经网络用于分类时,通常是一组类似神经元的处理单元,单元之间具有加权连接。构建分类模型的方法有很多,包括朴素贝叶斯分类、支持向量机和k近邻分类。

分类预测分类(离散、无序)标签,回归模型预测连续值函数。回归可以预测缺失或不可用的统计数据值,而不是(离散)类标签。

预测既包括数值预测,也包括类标签预测。回归分析是一种用于数值预测的统计方法,尽管也存在其他多种技术。回归也围绕着根据可用数据识别分布趋势。

分类和回归可能需要先进行相关性分析,相关性分析试图识别与分类和回归过程密切相关的属性。这些属性将被选择用于分类和回归过程。有多个属性与实际无关,无需考虑。

假设作为 AllElectronics 的销售经理,需要根据促销活动的三种反应类型(例如,反应良好、反应一般和无反应)来定义商店中的大量商品。

它可以基于商品的描述性特征(包括价格、品牌、产地、类型和类别)为这三个类别分别构建一个模型。最终的分类结果应该最大限度地分析每个类别与其他类别的区别,从而呈现数据集的有序图像。

决策树可以将价格识别为最能区分这三个类别的独立因素。决策树还可以揭示,除了价格之外,其他有助于进一步区分每个类别的特征还包括品牌和产地。这样的决策树可以帮助我们了解特定促销活动的影响,并在未来设计更有效的促销活动。


相关文章