如何计算异常值?

data miningdatabasedata structure更新于 2026/2/3 20:52:17

有三种度量用作异常指标,用于支持识别数据异常。这些度量表示单元格中的数量对其预期值的影响程度。

这些度量会针对所有聚合级别计算并与每个单元格关联。它们如下:SelfExp、InExp 和 PathExp 度量基于用于表分析的数值方法。

单元格值被视为异常取决于其与预期值的差异程度,其中预期值由统计模型确定。给定单元格值与其预期值之间的差异称为残差。

直观地说,残差越高,提供的单元格值越是异常。残差值的比较需要我们根据与残差相关的预期标准差来缩放值。因此,如果单元格值的缩放残差值超过预设阈值,则该单元格值被视为异常。

SelfExp、InExp 和 PathExp 度量均基于此缩放残差。给定单元格的预期值是所提供单元格的更高级别分组的服务。例如,给定一个包含三个维度 A、B 和 C 的立方体,A 中第 i 个位置、B 中第 j 个位置和 C 中第 k 个位置的单元格的预期值是 γ、γAi、γBj、γCk、γ ABij、γ ACik 和 γ BCjk 的函数,这些是所用数值模型的系数。

这些系数遵循更高级别的值如何差异,取决于通过查看更高级别的聚合所形成的广义印象。在这种方法中,单元格值的异常质量取决于其后值的异常。因此,在查看异常时,用户必须通过向下钻取来分析异常。

此计算包含三个阶段,如下所示 −

  • 第一步包含计算定义立方体的聚合值(包括求和或计数),将在其中发现异常。

  • 第二阶段包括模型拟合,在此过程中确定系数并用于计算标准化残差。由于计算相同,此阶段可以与第一阶段重叠。

  • 第三阶段根据标准化残差计算 SelfExp、InExp 和 PathExp 值。此阶段在计算上与第一阶段等效。因此,可以有效地完成用于发现驱动型探索的数据立方体计算。


相关文章