NSIO Docs
NSIO Docs
首页

NSIO Next · 当前开发基线

统一 L3 + L4 架构
产品能力目录与实现闭环
功能闭环总账
产品闭环与功能实现
实施蓝图与交付契约
发行、升级与卸载
跨组件共享契约
控制资源生命周期
控制投影与 Runtime Protocol
数据面协议
Grant 与策略编译

组件实现规格

ns · 统一节点运行时
Client · App、CLI 与门户
NSD · 身份与控制面
NSGW · 增值数据面
身份、登录与会话
注册、准入与配额协议
商业模型与 Entitlement
采购、计费与发票
服务运营与 SLA
备份与灾难恢复
信任、合规与数据权利

Last Updated: 2026/8/8 22:11:23

Previous Page采购、计费与发票
Next Page备份与灾难恢复

#NSIO Next · 服务运营、SLA 与状态通报

状态:托管服务运营与客户支持实现依据。本文把工程 SLO、合同 SLA、状态页、事故响应、支持响应和隐私遥测分开。具体价格与 entitlement 仍以商业模型和采购计费为权威。

#1. 服务边界

不能用一个“NSIO 可用率”覆盖不同失败影响。运营对象至少分为:

服务类成功定义失败影响
Identity/Login可以完成登录、refresh 和 MFA新控制会话受阻;现有数据面默认不断
Hosted Control读写租户资源、编译并分发有效 projection新变更/新连接受阻;未过期配置继续
Coordinationendpoint discovery、path/Relay 候选协调新路径建立或漫游受阻
Community Relay至少一个基础 Relay 可承载密文困难 NAT 节点可能不可达
Managed Relay region所购区域 Relay 可用且在容量内该区域的托管中继降级
Managed EdgeIngress/Egress/Exit 对已授权目标工作对应增值流量不可用或 fail-closed
Billing/Entitlement购买与 entitlement 激活新增商业能力延迟;不得切断有效数据面
Status/Support状态页、通知和工单入口可用客户无法判断责任与获得帮助

自建 NSD、客户 IdP、客户网络、客户自建 Relay/NSGW 和目标应用不计入 NSIO 托管服务可用率,但诊断必须明确归因,不能笼统标成客户问题。

#2. SLI 与测量

#2.1 请求型服务

一分钟 bucket 中,符合生产协议的合成请求在截止时间内得到成功或明确幂等结果,记为成功。鉴权错误、无授权和合法限速不是服务错误;5xx、超时、无有效签名配置和错误空投影是服务错误。

全局服务至少由三个独立故障域探测;同一分钟至少两处成功才记为 available。区域服务由至少两个区域外探针进入所购区域,并结合区域内 dataplane canary;任一侧证明平台不能完成真实事务即记 unavailable。单个探针自身网络故障只有在独立证据确认且其他探针成功时才从该分钟剔除,不能人工挑掉平台故障样本。

月可用率:

successful eligible minutes / total eligible minutes

探针使用最小测试租户完成真实 DNS、TLS、认证和签名验证。只 ping 端口不算控制面可用。bucket 原始结果、剔除原因和批准规则版本必须可重算。

#2.2 Relay 与 Edge

Relay SLI 使用真实端到端加密 session:两个探针节点获得 route token、经目标 region 交换带 nonce 的 frame 并校验返回。Edge 使用每种 capability 的实际流:Ingress 请求、Egress origin 连接、Exit canary 流量。容量拒绝若由客户购买上限触发不计服务故障;平台容量不足导致的拒绝计故障。

#2.3 客户可验证性

管理端展示 Organization 维度的服务类、区域、受影响窗口、request/incident ID 和 SLA 计算结果。客户不能看到其他租户容量或流量。原始测量和排除决定至少保存到争议窗口结束。

#3. 工程 SLO 与合同 SLA

SLO 是内部可靠性目标;SLA 是合同承诺。内部 SLO 必须比 SLA 更严格并留 error budget。首发默认合同基线:

商品Hosted Control所购 Managed Relay region所购 Managed Edge
Personal/Team无合同 SLA,发布实时状态无合同 SLA按具体附加包
Business99.90% 月可用率99.90% 月可用率99.90% 月可用率
Enterprise99.95% 月可用率99.95% 月可用率99.95% 月可用率

不出售的服务不进入 SLA。Community Relay 是基础兜底,不以单一区域承诺;状态页仍公开其健康。高于上述目标的专属架构必须由容量、故障域和演练证据支撑,销售不能在报价单中自由填写更高数字。

默认服务抵扣按受影响服务当月费用计算:

实际月可用率抵扣
低于承诺但 ≥99.0%10%
<99.0% 且 ≥95.0%25%
<95.0%50%

抵扣总额不超过该受影响服务当月费用,不自动折算为现金赔偿。客户在账期结束后 30 天内提交或由平台自动生成 claim;合同可提供更优条款但不能低于已签承诺。

#4. 排除项与维护

可排除:提前至少 72 小时通知且在公布窗口内的计划维护、客户明确配置错误、客户/第三方 IdP 或目标系统故障、互联网级不可控事件、客户违反容量/滥用规则、不可抗力和客户选择的 preview 功能。排除必须有时间、证据和影响服务类,不能事后把平台容量不足改写成计划维护。

安全紧急维护可少于 72 小时通知,但仍计入内部 SLO;是否从合同 SLA 排除依合同执行并在事后报告。维护不能靠状态页一句“性能下降”无限延长。

#5. Error Budget 与变更门

每个服务类/区域单独计算 28 天滚动 error budget。消耗达到 50% 时停止非必要高风险变更;达到 100% 时只允许修复、容量和安全变更。恢复新功能发布需要 owner 记录原因和保护措施。

发行灰度、NSD schema、NSGW config 和路由策略变更都关联 deployment ID;异常可以按 revision/region/cohort 回滚或停止,不靠全局停机排查。

#6. 状态页

公开状态页使用独立域名和故障域,不依赖主要 NSD 登录。无需登录即可查看:

  • Identity、Control、Coordination、Community Relay、各托管区域、Ingress/Egress/Exit、Billing/API;
  • operational / degraded / partial outage / major outage / maintenance;
  • 开始时间、受影响区域/能力、当前缓解、下一次更新时间;
  • 近 90 天历史、订阅邮件/RSS/webhook 和 incident API。

客户端在控制面不可达且本地网络基本诊断正常时可以展示状态页链接,但不能据状态页绿色就判定本地无问题。状态页内容来自事故系统,不允许值班人员只改前端颜色而没有事件记录。

#7. 事故响应

等级示例首次公开更新后续节奏
SEV-0安全边界失效、密钥泄漏、广泛错误授权确认后尽快,安全细节按响应计划至少每 30 分钟
SEV-1多区域控制/Relay/Edge 大面积不可用30 分钟内每 30 分钟
SEV-2单区域或单能力显著降级60 分钟内每 60 分钟
SEV-3小范围、已有绕行工作日内状态变化时

内部流程:自动告警/报告 → incident commander → 分级和受影响面 → 状态页/客户通知 → 缓解 → 验证 → 关闭 → 复盘。SEV-0/1 在恢复后 5 个工作日内提供客户可读复盘,包含时间线、影响、根因类别、检测缺口和有 owner/日期 的行动项;不泄露其他租户数据或可利用细节。

安全事故另走 security incident 流程,并按适用合同和法律时限通知。产品事故和安全事故可以关联,但不能用普通 outage 关闭数据事件义务。

#8. 支持

严重级别定义Business 首次响应Enterprise 首次响应
P1生产完全不可用或安全事件,无可接受绕行1 小时,7×2430 分钟,7×24
P2关键能力显著受损,有有限绕行4 小时,工作时段2 小时,7×24
P3非关键缺陷或配置协助1 工作日4 工作小时
P4咨询、功能建议2 工作日1 工作日

首次响应不是解决时限。工单必须包含 Organization、deployment、component versions、request/operation ID 和脱敏诊断包;支持人员不能要求客户发送私钥、完整策略或业务流量。

#9. 可观测性与隐私遥测

#9.1 运行遥测

默认允许的字段采用 allowlist:组件/版本、平台/OS major、operation stage、typed error code、duration bucket、path kind、Relay region、crash signature、更新通道和随机安装级诊断 ID。默认禁止:业务域名、完整 Node/Service 名、IP/endpoint、用户邮箱、Group 成员、ACL 内容、应用 payload、密钥和 token。

云托管的服务端安全/计费日志按必要性收集;Client 产品分析和 crash 上传提供清晰设置与区域适用的同意。自建默认本地保存,向厂商上传必须 opt-in 或由管理员策略明确开启。

#9.2 激活漏斗

为了验证“三分钟首次成功”,只收以下状态转移及耗时,不收用户访问目标:

install_completed
login_started / login_completed
enrollment_started / committed
tunnel_permission_requested / granted / denied
first_connection_ready
second_device_visible
first_peer_connect_success
first_service_published / opened

每个事件带 schema version、occurred_at、installation analytics ID、deployment class、platform、app/runtime version、result/error code 和 duration bucket。账号、Organization、Device 业务 ID 在分析系统中使用不可逆且按部署轮换的伪名,不允许与广告标识关联。

漏斗 dashboard 必须区分未知/漏报与零,展示每阶段样本量、版本和平台;不得依据未同意遥测推断个人行为。删除账号时按信任与数据权利处理可关联分析数据。

#10. 容量与区域运营

每个 NSGW region 有 admission、CPU/memory、bandwidth、session、queue、packet loss 和 drain 指标。达到软阈值停止向该实例分配新 session;达到硬阈值由控制面移除候选并告警。扩容失败不得返回 unauthorized 或 offline。

区域上下线经过 canary、容量验证、drain 和 DNS/config revision。Data residency 商品只在数据和运营链路均满足时展示可购买;region label 不是合规证明。

#11. 完成门

  • 每个 SLA 服务类有真实合成事务和独立 dashboard;
  • 故障注入能让客户端、状态页、告警和 SLA 计量得到一致但不过度推断的结果;
  • 状态页在主 NSD 登录故障时仍可访问;
  • SEV-1 tabletop 和 region outage 演练完成;
  • 服务抵扣可从原始 bucket 重算并生成客户证据;
  • telemetry schema 经隐私审查,新增字段默认拒绝而不是自动上传;
  • 漏斗可以回答每个平台从安装到首个 peer 成功的转化和耗时;
  • 销售报价中的 SLA 只能从受控产品目录选择。