About this [Job-32080] Senior SRE / Cloud Engineer (Pessoa Engenheira de Plataforma), Brazil role at Ciandt
Na CI&T , ajudamos grandes empresas a transformar o potencial da AI em impacto real nos negócios com AI Deployment, execução AI-native e tech-integrated business solutions.
Com 30 anos de experiência em transformação tecnológica, aceleramos inovação com expertise em agentic SDLC, application modernization, Data & AI, martech e business strategy.
Somos 8.000 CI&Ters em mais de 25 países, colaborando para construir soluções com impacto real. AI já faz parte da forma como trabalhamos, evoluímos e inovamos todos os dias.
A CI&T busca uma pessoa Engenheira de Plataforma Sênior para projetar e manter a infraestrutura crítica que suporta a operação de agentes de IA em Oracle Cloud Infrastructure (OCI), garantindo disponibilidade de 99,95% e latências de resposta rigorosas.
Responsabilidades:
- Provisionar recursos OCI via Terraform, garantindo infraestrutura como código robusta e auditável.
- Gerenciar clusters OKE com node pools de GPU para inferência, assegurando performance e disponibilidade.
- Configurar autoscaling (HPA) baseado em latência e carga dos agentes de IA.
- Garantir segurança de rede em VCNs privadas, incluindo configuração de NSGs e Service Gateways.
- Gerenciar segredos no OCI Vault, mantendo conformidade e proteção de credenciais.
- Monitorar proativamente a plataforma através do OCI Observability (Monitoring, Logging, APM).
- Atuar em FinOps para controle e otimização de custos de GPU e tokens de IA generativa.
Requisitos para este desafio:
- Experiência com Oracle Cloud Infrastructure (OCI).
- Conhecimento em Kubernetes (OKE) e GPU Node Pools.
- Proficiência em Terraform para infraestrutura como código.
- Conhecimento em redes: VCN, NSG e Service Gateway.
- Experiência com ferramentas de observabilidade (OCI Monitoring/APM).
[Opcional] Diferenciais:
- Experiência com FinOps para IA Generativa.
- Conhecimento em Service Mesh (mTLS interno).
- Familiaridade com OCI Streaming (Kafka API).
- Experiência com gestão de GPU Runtimes (vLLM/Triton).
- Conhecimento em práticas de SRE e definição de SLOs.
#LI-midsenior