这些统计信息如何用于查询应答?
统计参数可以按如下方式自上而下地用于基于网格的方法。首先,确定分层架构中的某一层,查询应答过程从该层开始。
该层通常包含少量单元格。对于当前层中的每个单元格,它可以计算反映该单元格与给定查询的相关性的置信区间(或估计的概率范围)。
高层单元格的统计参数可以简单地根据低层单元格的参数计算得出。这些参数包含以下内容:与属性无关的参数计数,以及与属性相关的参数平均值、stdev(标准差)、min(最小值)、max(最大值);以及单元格中属性值遵循的分布类型,包括正态分布、均匀分布、指数分布或无分布(如果分布是匿名的)。
不相关的单元格将被移除,不再考虑。后续较低层的处理仅测试剩余的相关单元格。此阶段重复进行,直到获取底层。如果满足查询描述,则恢复使用该查询的相关单元格区域。
STING 具有以下几个优点:−
基于网格的计算与查询无关,因为每个单元格中保存的统计数据定义了网格单元格中数据的摘要记录,与查询无关。
网格架构支持并行处理和增量刷新。
该技术的效率是其主要优势。 STING 会遍历数据库,因为它可以计算单元的数值参数,因此生成聚类的时间复杂度为 O(n),其中 n 是对象总数。
在构建层次化架构后,查询处理时间为 O(g),其中 g 是最低层网格单元的总数,通常小于 n。
由于 STING 需要采用多分辨率方法进行聚类分析,因此 STING 聚类的质量取决于网格架构最低层的粒度。如果粒度非常细,处理效果会显著提升;但是,如果网格架构最低层过于粗糙,则会降低聚类分析的质量。
STING 在生成父级单元时,没有考虑子级单元与其相邻单元之间的空间关系。因此,生成的聚类形状是等边的;例如,一些聚类边界是水平或垂直的,并且没有发现对角线边界。尽管该技术处理时间很快,但这会降低聚类的质量和确定性。

