rt ,现在在做一个高频相关的违规模型,背景有点类似与营业厅人员的操作,这种非规律性的数据,我需要怎么去定义一个高频的阈值呢🤔
目前计划以“人员在某个时间窗口内的操作次数”作为统计指标,但数据分布较不均匀,可能还会受到岗位、网点、业务类型和时段等因素的影响,因此不确定应该如何定义“异常高频”。
目前的思路是结合分位数和箱线图规则:先将 P90 以上的数据作为重点观察范围,再使用 Q3 + 1.5 × IQR 作为异常高频阈值。但实际结合数据分析后,发现识别效果并不理想,存在一定的误报或漏报。
想请教以下问题:
P90 和 Q3 + 1.5 × IQR 是否适合用于这类偏态或长尾的计数数据?
阈值应该全局统一设置,还是按人员、岗位、网点、业务类型或时段分别计算?
除分位数和 IQR 外,是否有更合适的统计方法或异常检测方法?
如果需要,我也可以补充数据分布、时间窗口以及当前误报和漏报情况。
内容用 AI 修饰了一下 ,大伙将就着看哈
目前计划以“人员在某个时间窗口内的操作次数”作为统计指标,但数据分布较不均匀,可能还会受到岗位、网点、业务类型和时段等因素的影响,因此不确定应该如何定义“异常高频”。
目前的思路是结合分位数和箱线图规则:先将 P90 以上的数据作为重点观察范围,再使用 Q3 + 1.5 × IQR 作为异常高频阈值。但实际结合数据分析后,发现识别效果并不理想,存在一定的误报或漏报。
想请教以下问题:
P90 和 Q3 + 1.5 × IQR 是否适合用于这类偏态或长尾的计数数据?
阈值应该全局统一设置,还是按人员、岗位、网点、业务类型或时段分别计算?
除分位数和 IQR 外,是否有更合适的统计方法或异常检测方法?
如果需要,我也可以补充数据分布、时间窗口以及当前误报和漏报情况。
内容用 AI 修饰了一下 ,大伙将就着看哈