Skip to content

13 监控、运行与报表

13.1 运行可观测性目标

运行团队应能够识别请求来自何处、经过哪些组件、处于何种业务状态、是否已最终确认、是否存在资金/账本/审计差异以及如何恢复。日志、指标、追踪和审计须形成互补而非重复的证据链。

13.2 日志、指标与追踪

类型最低内容控制要求
结构化日志时间、级别、服务、版本、环境、关联 ID、错误码、结果脱敏;不得记录私钥、PIN、长期 Token 或完整敏感报文
指标请求量、成功率、延迟、在途量、资源、依赖和健康状态控制标签基数;不得把钱包/交易 ID 作为无界标签
分布式追踪入口到下游和后台任务的关联上下文记录阶段与结果;敏感字段最小化
审计事件身份、动作、对象、原因、审批、前后值摘要、结果防篡改、受控访问和按政策保留

当前项目代码可见 OpenTelemetry 初始化和遥测接入点;实际监控、日志、告警和 SIEM 平台的部署、保留期和访问控制由甲方环境确认。

13.3 健康检查与告警

服务须区分 liveness、readiness 和启动检查。readiness 应验证实例能否安全承接业务流量,避免在证书、数据库、关键配置或必要依赖未就绪时接收请求。健康接口不得泄露架构细节或凭据。

告警应以可行动的业务或服务风险为中心,至少覆盖:服务不可用、错误率/延迟异常、账本最终性积压、数据库/缓存/存储饱和、证书即将到期、KMS/HSM 异常、备份失败、对账差异、安全事件和审计中断。

13.4 仪表盘、报表与监管查询

运营仪表盘应区分业务、账本、集成、安全和基础设施视图。报表与导出至少应说明数据来源、更新时间、过滤范围、权限、格式、签名/完整性、保留和审计。监管或管理报表的字段、频率、审批与最终格式由甲方确认。

13.5 Runbook 与事件管理

每个高优先级告警应有 Runbook:识别与确认、影响评估、隔离、恢复、对账、升级、沟通和证据保存步骤。事件分级、响应时间、甲乙双方通知、第三方协调和复盘要求应与服务等级和甲方事件流程对齐。

13.6 运行操作控制

系统启动/停止、配置变更、证书轮换、备份恢复、扩缩容、升级回滚、机构接入和紧急操作均须使用受控权限、变更记录和审计。关键生产操作应具备复核或审批,且不依赖个人本地脚本或未受控凭据。

13.7 运维接管

交付前,甲方运维团队应在服务商指导下独立完成至少一次部署、健康检查、告警定位、日志/追踪查询、证书轮换、备份恢复、升级回滚和典型故障处置。演练记录、发现问题和整改结果应进入验收证据包。