Mayerchan
V2EX  ›  问与答

请教一个统计相关的问题

  •  
  •   Mayerchan · 6h 11m ago · 246 views
    rt ,现在在做一个高频相关的违规模型,背景有点类似与营业厅人员的操作,这种非规律性的数据,我需要怎么去定义一个高频的阈值呢🤔


    目前计划以“人员在某个时间窗口内的操作次数”作为统计指标,但数据分布较不均匀,可能还会受到岗位、网点、业务类型和时段等因素的影响,因此不确定应该如何定义“异常高频”。

    目前的思路是结合分位数和箱线图规则:先将 P90 以上的数据作为重点观察范围,再使用 Q3 + 1.5 × IQR 作为异常高频阈值。但实际结合数据分析后,发现识别效果并不理想,存在一定的误报或漏报。

    想请教以下问题:

    P90 和 Q3 + 1.5 × IQR 是否适合用于这类偏态或长尾的计数数据?
    阈值应该全局统一设置,还是按人员、岗位、网点、业务类型或时段分别计算?
    除分位数和 IQR 外,是否有更合适的统计方法或异常检测方法?
    如果需要,我也可以补充数据分布、时间窗口以及当前误报和漏报情况。



    内容用 AI 修饰了一下 ,大伙将就着看哈
    2 replies    2026-08-07 17:11:07 +08:00
    Sawyerhou
        1
    Sawyerhou  
       47 mins ago
    既然“操作次数”“会受到岗位、网点、业务类型和时段等因素的影响”,那阈值理论上也应该随着不同的“岗位、网点、业务类型和时段等因素”而变化。

    阈值紧,误报多,漏报少;阈值松,误报少,漏报多。没有免费的午餐,总要有取舍。具体怎么取舍,还是取决于业务场景的需求。

    我觉得用分位数就行,不过 90%分位数似乎有点低,98%、99%差不多,不过不清楚业务具体情况,也不敢确定。
    Mayerchan
        2
    Mayerchan  
    OP
       17 mins ago
    @Sawyerhou 就是这个取舍 还有误报这个问题,有点头疼
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   4965 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 23ms · UTC 09:28 · PVG 17:28 · LAX 02:28 · JFK 05:28
    ♥ Do have faith in what you're doing.