From 82e7b4c9e36e5b96398033a14e0a17a69bdfe776 Mon Sep 17 00:00:00 2001 From: ATM Platform Date: Wed, 23 Sep 2026 13:48:25 +0000 Subject: [PATCH] fix(plataforma): cota com folga para rolling update - 10 para 12 CPU --- .../plataforma/00-namespace-quota-netpol.yaml | 28 +++++++++++++++++-- 1 file changed, 25 insertions(+), 3 deletions(-) diff --git a/tenants/plataforma/00-namespace-quota-netpol.yaml b/tenants/plataforma/00-namespace-quota-netpol.yaml index 4d562ad..ef34b97 100644 --- a/tenants/plataforma/00-namespace-quota-netpol.yaml +++ b/tenants/plataforma/00-namespace-quota-netpol.yaml @@ -26,8 +26,30 @@ spec: # contando o default do LimitRange no postgres. # # O numero do piloto no cluster e outro — limits.cpu 20, memory 16Gi, - # pods 30 — porque aquele tenant roda 18 deployments. Aqui sao 8, entao - # copiar 20 seria pedir folga que este tenant nao usa. + # pods 30 — porque aquele tenant roda 18 deployments. Aqui eram 8 quando + # esta cota foi escrita; hoje sao 10. + # + # 2026-09-23: de 10 para 12, e o motivo e ROLLING UPDATE, nao consumo. + # + # Durante o corte de dominio (P0.9) todos os deployments trocaram ao mesmo + # tempo, e a cota bateu no teto: "exceeded quota: tenant-quota, requested: + # limits.cpu=500m, used: 9700m, limited: 10". O `servico-bff`, o + # `servico-configuracao` e o `servico-captacao` nao conseguiram CRIAR pod. + # Dois entraram aos poucos, conforme outros liberavam vaga; o terceiro + # ficou para tras e precisou de `kubectl rollout restart` — porque o + # ReplicaSet tinha acumulado falhas e o backoff dele ficou longo demais. + # + # Em repouso o uso e 8700m. Com o teto em 10 sobram 1300m, que dao para + # DOIS pods extras — e uma atualizacao que mexe em varios servicos precisa + # de mais. Com 12 sobram 3300m, ou seis pods de 500m (o default do + # LimitRange logo abaixo). + # + # **Isto alivia; nao resolve.** A causa e o `plataforma` ser o unico tenant + # que nao foi consolidado em runtimes: sao 10 deployments contra 3 nos + # outros quatro. Consolidar faz a cota sobrar em vez de faltar. + # + # Nao mexemos em `limits.memory`: em repouso sao 8Gi de 11Gi, e 3Gi dao + # para seis pods extras de 512Mi — a mesma folga que a CPU passa a ter. # # `limits` e teto, nao reserva: o no ja opera com 836% de limits.cpu # comprometidos, o que e pratica normal. O que reserva de verdade e @@ -35,7 +57,7 @@ spec: # e 72% da memoria ja reservados. Os 8 pods pedem ~2,1Gi. requests.cpu: "3" requests.memory: 4Gi - limits.cpu: "10" + limits.cpu: "12" limits.memory: 11Gi pods: "20" persistentvolumeclaims: "6"