Files
pikasTech-unidesk/docs/MDTODO/platform-resource-governance.md
2026-07-18 10:30:46 +02:00

2.8 KiB
Raw Permalink Blame History

平台资源治理

  • 范围:主机与 Kubernetes 的 CPU、物理内存、swap、进程生命周期、控制面对象、存储、缓存和资源压力治理。
  • 配置真相:资源预算、留存窗口、自动回收 cadence 与安全边界统一由 owning YAML 表达,CLI 只负责校验、预览、执行和实证。
  • 运行原则:先用全局 overview 完成业务归因,再执行受控回收;物理内存资格只认 /proc/meminfoMemAvailableswap 不计入。
  • 历史入口:WebProbe/Chrome 专属生命周期仍归属 Web Observe 运行时可靠性;其中 R1.2.1-R1.2.8 保留为 #1710 的历史实施记录,后续平台级资源治理统一在本文件登记。

R1 [completed]

完成 UniDesk #1710 的 NC01 平台资源治理首阶段:修复 Decision Center 子进程泄露,提供一次调用可见物理内存、PSS、swap、僵尸进程归属与 Kubernetes 对象压力的 overviewYAML-first 调优 Kafka 资源预算、扩容 64 GiB swap 安全垫,并把五个 CI namespace 的 Tekton 历史对象纳入自动留存,最终以真实 MemAvailable 超过 4 GiB、自动定时回收成功且不触碰 Webterm/PK01 为验收,历史实施明细引用 Web Observe R1.2.1-R1.2.8,完成任务后将详细报告写入任务报告

R1.1 [completed]

执行 UniDesk #2458:修复 NC01 上 HWLAB PaC/Tekton 大型内联 PipelineRun spec 被复制到 status.pipelineSpec、持续以约 1 MB 对象写入 Kine/SQLite并在 compaction 窗口阻塞 node lease,最终导致 k3s NodeNotReady 和 UniDesk backend-core endpoint 中断;将大段脚本拆入原生文件或复用 Task,补齐对象体积、Kine/WAL、API 延迟和 retention 的受控可见性,经正常 PR 自动交付并用 NC01 原入口验收,不以人工重启 k3s 或强删 Pod 作为最终修复,完成任务后将详细报告写入任务报告

R1.2 [in_progress]

继续执行 UniDesk #1710 的 NC01 内存恢复:先用一次全局 memory-distribution 从业务、进程、cgroup、swap、僵尸进程和 Kubernetes 对象分布归因,目标是让 /proc/meminfo 的真实 MemAvailable 稳定超过 4 GiB;只执行 YAML 明确允许且 plan 判定可运行的受控 GC,禁止把 swap 计入目标、禁止触碰 Webterm/PK01、禁止重启 k3s或裸删 workload,若低风险候选不足则报告业务优化或废弃建议并收敛长期策略,完成任务后将详细报告写入任务报告