[CLOUD] ESPECIALISTA I SRE

TOTVS | São Paulo - SP | Híbrido

Estamos em busca de um(a) SRE para integrar o time responsável pela nova plataforma de IaaS daTOTVS. É um time em formação, com a oportunidade de participar desde o início da definição de arquitetura, padrões de operação e cultura de confiabilidade da plataforma.
Mais do que operar infraestrutura, buscamos alguém que trate confiabilidade como produto:automação e IA em primeiro lugar, decisões guiadas por dados e melhoria contínua dos serviços que sustentam a plataforma. Queremos quem use IA não como enfeite, mas como alavanca real para diagnosticar mais rápido, encontrar causa-raiz e reduzir o esforço operacional.

Faixa salarial

A combinar

Regime de contratação

CLT

Benefícios

  • Universidade em Rede TOTVS, uma universidade Corporativa com conteúdos e certificações gratuitos para cada pessoa colaboradora;
  • Programa +Saudáveis, que cuida de cada TOTVER com assessoria e ações voltadas para o bem estar em corpo, mente e finanças pessoais;
  • Programa +Vantagens, a maior rede de descontos da América Latina, exclusivos para nossas pessoas colaboradoras;
  • Programa + Cuidado, programa de apoio pessoal para pessoas colaboradoras e familiares, com orientações em diversas especialidades como: psicologia, serviço social, pet consultoria...
  • Einstein Conecta, benefício de orientação médica online pelos médicos do Hospital Israelita Albert Einstein, totalmente gratuito;
  • Plano de saúde e odontológico;
  • Vale refeição e / ou alimentação;
  • Vale transporte e fretados em algumas estações do metrô;
  • Licença maternidade e paternidade estendida;
  • Espaço de lactário;
  • Bicicletário;
  • Vestiário;
  • Seguro de vida;
  • Auxílio creche;
  • Previdência privada;
  • Escritório que estimula a criatividade e produtividade com ambientes para lanches, salas de jogos, mesas de bilhar e poltronas para relaxar;
  • Gympass.
  • Definir, implementar e acompanhar SLIs, SLOs e error budgets para os serviços da plataforma
  • de IaaS.
  • Construir e evoluir a stack de observabilidade (métricas, logs, traces e alertas), garantindo
  • visibilidade fim a fim dos serviços.
  • Automatizar provisionamento, configuração e operação da infraestrutura com práticas de
  • Infrastructure as Code.
  • Atuar na resposta a incidentes, conduzindo diagnósticos, mitigações e post-mortems sem
  • culpabilização (blameless).
  • Projetar e operar pipelines de CI/CD e estratégias de deploy seguras (rollbacks, canary, feature
  • flags).
  • Realizar planejamento de capacidade, análise de performance e otimização de custos na OCI.
  • Reduzir toil por meio de automação, runbooks e ferramentas internas.
  • Colaborar com os times de desenvolvimento na construção de serviços confiáveis por design
  • (resiliência, escalabilidade, segurança).
  •  Contribuir para a cultura de confiabilidade do time, disseminando boas práticas e apoiando
  • tecnicamente colegas menos experientes.
  • Incorporar práticas de AIOps na operação: detecção de anomalias, correlação de eventos e
  • redução de ruído de alertas para que o time foque no que importa.
  • Acelerar troubleshooting e análise de causa-raiz com apoio de IA (análise de logs/traces,
  • sumarização de incidentes, assistentes de diagnóstico), sempre com validação criteriosa antes
  • de agir.
  • Experiência comprovada como SRE, DevOps Engineer, Platform Engineer ou em operação de
  • infraestrutura cloud em produção.
  • Sólidos conhecimentos de Linux e fundamentos de redes (TCP/IP, DNS, load balancing,
  • firewalls).
  • Experiência com pelo menos um provedor de nuvem pública (OCI, AWS, Azure ou GCP).
  • Experiência com Infrastructure as Code (Terraform, Pulumi ou similares).
  • Experiência com containers e orquestração (Docker e Kubernetes).
  • Vivência com ferramentas de observabilidade (Prometheus, Grafana, OpenTelemetry ou
  • equivalentes).
  • Programação e automação em pelo menos uma linguagem (Go, Python ou similar).
  • Experiência com pipelines de CI/CD (GitHub Actions, Jenkins ou similares).
  • Vivência com práticas de resposta a incidentes e post-mortems.
  • Experiência prática com Oracle Cloud Infrastructure (OCI) e suas certificações.
  • Experiência com Pulumi.
  • Vivência na construção de plataformas internas, ofertas de IaaS/PaaS ou produtos de infraestrutura.
  • Conhecimento de bancos de dados relacionais em produção (PostgreSQL).
  • Experiência com práticas de segurança em cloud (IAM, segregação de redes, gestão de
  • segredos).Certificações em cloud, Kubernetes (CKA/CKS) ou Linux.
  • Familiaridade com conceitos de Platform Engineering e Team Topologies.Experiência prática com AIOps ou ferramentas de observabilidade com IA (detecção de
  • anomalias, correlação de eventos, RCA assistido), e/ou uso de LLMs/assistentes no fluxo de operação e troubleshooting.
Como empresa líder em tecnologia somos um universo de pessoas inconformadas, movidas por inovação, autonomia, aprendizado e performance. 
Juntos e juntas, criamos oportunidades, transformamos futuros e compartilhamos conhecimento. Aqui o seu desenvolvimento profissional acontece em um ambiente inclusivo, respeitoso e energizante. De gente pra gente!
Buscamos o crescimento sustentável. E usamos dados e IA para impulsionar resultados mais inteligentes e eficientes para os nossos clientes. 
Vem com a gente inovar e construir o futuro da tecnologia.
#VemPraTOTVS #SomosTOTVS
Ver página da empresa

[CLOUD] ESPECIALISTA I SRE

TOTVS | São Paulo - SP | Híbrido

Descrição da vaga

Estamos em busca de um(a) SRE para integrar o time responsável pela nova plataforma de IaaS daTOTVS. É um time em formação, com a oportunidade de participar desde o início da definição de arquitetura, padrões de operação e cultura de confiabilidade da plataforma.
Mais do que operar infraestrutura, buscamos alguém que trate confiabilidade como produto:automação e IA em primeiro lugar, decisões guiadas por dados e melhoria contínua dos serviços que sustentam a plataforma. Queremos quem use IA não como enfeite, mas como alavanca real para diagnosticar mais rápido, encontrar causa-raiz e reduzir o esforço operacional.

Responsabilidades e atribuições

  • Definir, implementar e acompanhar SLIs, SLOs e error budgets para os serviços da plataforma
  • de IaaS.
  • Construir e evoluir a stack de observabilidade (métricas, logs, traces e alertas), garantindo
  • visibilidade fim a fim dos serviços.
  • Automatizar provisionamento, configuração e operação da infraestrutura com práticas de
  • Infrastructure as Code.
  • Atuar na resposta a incidentes, conduzindo diagnósticos, mitigações e post-mortems sem
  • culpabilização (blameless).
  • Projetar e operar pipelines de CI/CD e estratégias de deploy seguras (rollbacks, canary, feature
  • flags).
  • Realizar planejamento de capacidade, análise de performance e otimização de custos na OCI.
  • Reduzir toil por meio de automação, runbooks e ferramentas internas.
  • Colaborar com os times de desenvolvimento na construção de serviços confiáveis por design
  • (resiliência, escalabilidade, segurança).
  •  Contribuir para a cultura de confiabilidade do time, disseminando boas práticas e apoiando
  • tecnicamente colegas menos experientes.
  • Incorporar práticas de AIOps na operação: detecção de anomalias, correlação de eventos e
  • redução de ruído de alertas para que o time foque no que importa.
  • Acelerar troubleshooting e análise de causa-raiz com apoio de IA (análise de logs/traces,
  • sumarização de incidentes, assistentes de diagnóstico), sempre com validação criteriosa antes
  • de agir.

Requisitos e qualificações

  • Experiência comprovada como SRE, DevOps Engineer, Platform Engineer ou em operação de
  • infraestrutura cloud em produção.
  • Sólidos conhecimentos de Linux e fundamentos de redes (TCP/IP, DNS, load balancing,
  • firewalls).
  • Experiência com pelo menos um provedor de nuvem pública (OCI, AWS, Azure ou GCP).
  • Experiência com Infrastructure as Code (Terraform, Pulumi ou similares).
  • Experiência com containers e orquestração (Docker e Kubernetes).
  • Vivência com ferramentas de observabilidade (Prometheus, Grafana, OpenTelemetry ou
  • equivalentes).
  • Programação e automação em pelo menos uma linguagem (Go, Python ou similar).
  • Experiência com pipelines de CI/CD (GitHub Actions, Jenkins ou similares).
  • Vivência com práticas de resposta a incidentes e post-mortems.

Requisitos desejáveis

  • Experiência prática com Oracle Cloud Infrastructure (OCI) e suas certificações.
  • Experiência com Pulumi.
  • Vivência na construção de plataformas internas, ofertas de IaaS/PaaS ou produtos de infraestrutura.
  • Conhecimento de bancos de dados relacionais em produção (PostgreSQL).
  • Experiência com práticas de segurança em cloud (IAM, segregação de redes, gestão de
  • segredos).Certificações em cloud, Kubernetes (CKA/CKS) ou Linux.
  • Familiaridade com conceitos de Platform Engineering e Team Topologies.Experiência prática com AIOps ou ferramentas de observabilidade com IA (detecção de
  • anomalias, correlação de eventos, RCA assistido), e/ou uso de LLMs/assistentes no fluxo de operação e troubleshooting.
Enviar candidatura
Enviar candidatura

Faixa salarial

A combinar

Regime de contratação

CLT

Benefícios

  • Universidade em Rede TOTVS, uma universidade Corporativa com conteúdos e certificações gratuitos para cada pessoa colaboradora;
  • Programa +Saudáveis, que cuida de cada TOTVER com assessoria e ações voltadas para o bem estar em corpo, mente e finanças pessoais;
  • Programa +Vantagens, a maior rede de descontos da América Latina, exclusivos para nossas pessoas colaboradoras;
  • Programa + Cuidado, programa de apoio pessoal para pessoas colaboradoras e familiares, com orientações em diversas especialidades como: psicologia, serviço social, pet consultoria...
  • Einstein Conecta, benefício de orientação médica online pelos médicos do Hospital Israelita Albert Einstein, totalmente gratuito;
  • Plano de saúde e odontológico;
  • Vale refeição e / ou alimentação;
  • Vale transporte e fretados em algumas estações do metrô;
  • Licença maternidade e paternidade estendida;
  • Espaço de lactário;
  • Bicicletário;
  • Vestiário;
  • Seguro de vida;
  • Auxílio creche;
  • Previdência privada;
  • Escritório que estimula a criatividade e produtividade com ambientes para lanches, salas de jogos, mesas de bilhar e poltronas para relaxar;
  • Gympass.

Sobre a empresa

Como empresa líder em tecnologia somos um universo de pessoas inconformadas, movidas por inovação, autonomia, aprendizado e performance. 
Juntos e juntas, criamos oportunidades, transformamos futuros e compartilhamos conhecimento. Aqui o seu desenvolvimento profissional acontece em um ambiente inclusivo, respeitoso e energizante. De gente pra gente!
Buscamos o crescimento sustentável. E usamos dados e IA para impulsionar resultados mais inteligentes e eficientes para os nossos clientes. 
Vem com a gente inovar e construir o futuro da tecnologia.
#VemPraTOTVS #SomosTOTVS
Ver página da empresa