
运维监控中心
设备与链路指标秒级刷新,异常 15 s 内触发告警。
- 指标刷新 3 s
- 告警误报率 < 5%
- MTTR 缩短 38%
按顺序执行,每一步都给到可直接落库的参数阈值。任何一步不达标,先修链再扩量,避免把性能债带进生产。
所有埋点强制携带 event_id / ts_ms / tenant 三字段,落库前做 Schema 校验;字段漂移率需 < 0.5%,否则先修上游 SDK 再放开流量。
Kafka 单分区写入 ≤ 8 MB/s,批大小 256 KB、linger 20 ms;消费端并行度 = 分区数 × 0.8,避免 rebalance 抖动导致重复消费。
近 7 天明细存热层(SSD),历史转冷层;对高频维度做 1 min / 1 h 两级预聚合,可将即席查询耗时降低 60%~75%。
事实表按 dt + tenant 双分区,单分区 ≤ 200 GB;开启列存压缩(ZSTD-3),存储成本下降约 4 成且扫描量可控。
看板首屏只渲染 6~8 个核心卡,其余懒加载;图表数据点上限 2000,超量走采样,保证交互帧率稳定在 50 FPS 以上。
为每个指标登记名称、公式、口径、负责人四项元数据;同名不同义指标每月巡检一次,口径冲突需在 3 个工作日内收敛。
避坑点:不要用「加机器」替代分区裁剪与预聚合;在 10 亿级明细表上直接跑全表聚合,CPU 打满且延迟不可控,优先把计算前移到预聚合层。
按「接入→采集→计算→存储→渲染」倒序排查:先看前端首屏渲染是否超 1.5 s,再看存储分区是否命中裁剪,最后看计算层是否有全表扫。多数延迟来自未预聚合,而非采集慢。
按指标漂移度决定:当特征分布偏移(PSI)> 0.2 或核心指标周环比波动 > 15% 时触发重训;稳定场景按月重训即可,避免无意义算力消耗。
每个看板只保留 1 个主指标 + 3 个辅助指标,统一单位与颜色语义;数值旁给出同比/环比标签,并把「异常阈值」直接画成参考线,减少解释成本。
控制单图数据点 ≤ 2000,交互节流 60 ms,联动筛选走服务端预聚合结果;避免在客户端做万级点重绘,可把首屏交互稳定在 50 FPS 以上。
按租户划分查询队列并设置并发上限(单租户 ≤ 8 并发),大租户单独资源组;配合查询超时 30 s 熔断,防止单一租户拖垮整体链路。
关注曝光→互动→转化的三段漏斗:曝光到互动转化率、互动到线索转化率、单渠道获客成本。三段数据同源同口径,才能支撑渠道预算的快速调整。

设备与链路指标秒级刷新,异常 15 s 内触发告警。

拖拉维度即出图,多维下钻无需写 SQL。

渠道漏斗同源统计,预算按效果实时再分配。
流批一体计算引擎,支持实时特征与离线模型共用同一份口径。
拖拉即出图、联动下钻,图表与明细双向穿透,支撑快速判断。
指标口径统一登记,看板与报表同源,避免同名不同义。
★★★★★
把 12 个渠道的埋点统一后,品牌传播看板首屏从 6 秒降到 1.2 秒,周会讨论从「数据对不对」变成「下一步投哪里」。
★★★★★
预聚合改造后,分析师即席查询平均耗时下降 71%,不再排队等数仓同学出数,自助探索真正跑起来了。
★★★★☆
互动可视化让业务同学愿意自己下钻,需求工单减少约四成;唯一门槛是前期指标口径要对齐,这一步省不得。