数据挖掘:数据属性和质量
数据挖掘
从海量数据集中提取数据,用于分析并为组织带来益处的过程。此过程有助于识别模式并管理数据之间的关系,从而预测业务问题。
数据属性
属性可以定义为对象的特征或属性。对象由属性集描述,并被称为实体的记录。实体由数据的一部分(即属性)描述。
例如:在学生数据库中。(姓名、ID、学号、分数)是给定数据库中的属性。
属性类型
名义属性
它仅提供足以区分对象的属性。例如姓名、学号、地址都是数据集中使用的不同对象。
序数属性
该属性的可能值提供了足够的信息,使对象具有有意义的顺序。例如薪资范围、教育程度、排名等。
二元属性
二元属性为 0 和 1。0 表示缺少任何特征,1 表示添加特定特征。
数值属性
它本质上是定量的,即数量可以用整数或实数形式测量和表示。
它有两种类型 −
区间缩放属性 −
此属性用于测量等大小单位的缩放比例。它让我们比较诸如摄氏度或华氏度之类的温度。
比例缩放属性 −
差异和比例对于比例都很重要。例如年龄、体重、工资等。
数据质量
数据质量是指实施技术,使数据能够提供组织所需的特定信息。符合需求的数据被视为高质量数据,并且准确无误,有助于组织做出决策。确保数据质量以获得更好护理的六个主要因素 −
准确性
数据必须反映真实情况。由于人为或计算机错误等多种原因,数据可能不准确。
完整性
完整性意味着可用数据能够有效地交付。根据感兴趣的属性,数据可能会不完整。
一致性
它指的是跨网络使用的数据的规律性。存储在不同位置的相似数据不应存在任何冲突。不正确的数据也会导致不一致。
时效性
数据在需要时可用。数据实时更新,以方便访问。有时,如果数据未及时更新或用户自行更正和调整,则会影响数据质量。
可信度
它指的是用户对数据的信任程度。现有数据被认为准确无误,可用于未来的分析。
可解释性
它指的是用户理解数据的流畅程度。数据用于执行分析等任务,但要成功执行这些任务,数据必须是可解释的,以便用户能够基于所提供的数据顺利执行任务。
结论
本文涵盖了数据挖掘中的属性和数据质量。
数据属性是指对象的属性及其类型,即名义属性、序数属性、二进制属性和数值属性。名义属性区分对象,序数属性为对象提供有意义的顺序,二进制属性表示 0 和 1,分别表示特征的缺失和特定字符的添加,数值属性本质上是定量的。数据质量是指组织用于决策的数据的质量。需要考虑的因素包括准确性、完整性和一致性。
时效性、可信度和可解释性。

