主题
13 监控、运行与报表
13.1 运行可观测性目标
运行团队应能够识别请求来自何处、经过哪些组件、处于何种业务状态、是否已最终确认、是否存在资金/账本/审计差异以及如何恢复。日志、指标、追踪和审计须形成互补而非重复的证据链。
13.2 日志、指标与追踪
| 类型 | 最低内容 | 控制要求 |
|---|---|---|
| 结构化日志 | 时间、级别、服务、版本、环境、关联 ID、错误码、结果 | 脱敏;不得记录私钥、PIN、长期 Token 或完整敏感报文 |
| 指标 | 请求量、成功率、延迟、在途量、资源、依赖和健康状态 | 控制标签基数;不得把钱包/交易 ID 作为无界标签 |
| 分布式追踪 | 入口到下游和后台任务的关联上下文 | 记录阶段与结果;敏感字段最小化 |
| 审计事件 | 身份、动作、对象、原因、审批、前后值摘要、结果 | 防篡改、受控访问和按政策保留 |
当前项目代码可见 OpenTelemetry 初始化和遥测接入点;实际监控、日志、告警和 SIEM 平台的部署、保留期和访问控制由甲方环境确认。
13.3 健康检查与告警
服务须区分 liveness、readiness 和启动检查。readiness 应验证实例能否安全承接业务流量,避免在证书、数据库、关键配置或必要依赖未就绪时接收请求。健康接口不得泄露架构细节或凭据。
告警应以可行动的业务或服务风险为中心,至少覆盖:服务不可用、错误率/延迟异常、账本最终性积压、数据库/缓存/存储饱和、证书即将到期、KMS/HSM 异常、备份失败、对账差异、安全事件和审计中断。
13.4 仪表盘、报表与监管查询
运营仪表盘应区分业务、账本、集成、安全和基础设施视图。报表与导出至少应说明数据来源、更新时间、过滤范围、权限、格式、签名/完整性、保留和审计。监管或管理报表的字段、频率、审批与最终格式由甲方确认。
13.5 Runbook 与事件管理
每个高优先级告警应有 Runbook:识别与确认、影响评估、隔离、恢复、对账、升级、沟通和证据保存步骤。事件分级、响应时间、甲乙双方通知、第三方协调和复盘要求应与服务等级和甲方事件流程对齐。
13.6 运行操作控制
系统启动/停止、配置变更、证书轮换、备份恢复、扩缩容、升级回滚、机构接入和紧急操作均须使用受控权限、变更记录和审计。关键生产操作应具备复核或审批,且不依赖个人本地脚本或未受控凭据。
13.7 运维接管
交付前,甲方运维团队应在服务商指导下独立完成至少一次部署、健康检查、告警定位、日志/追踪查询、证书轮换、备份恢复、升级回滚和典型故障处置。演练记录、发现问题和整改结果应进入验收证据包。