[CLOUD] ESPECIALISTA I SRE
TOTVS | São Paulo - SP | Híbrido
Estamos em busca de um(a) SRE para integrar o time responsável pela nova plataforma de IaaS daTOTVS. É um time em formação, com a oportunidade de participar desde o início da definição de arquitetura, padrões de operação e cultura de confiabilidade da plataforma.
Mais do que operar infraestrutura, buscamos alguém que trate confiabilidade como produto:automação e IA em primeiro lugar, decisões guiadas por dados e melhoria contínua dos serviços que sustentam a plataforma. Queremos quem use IA não como enfeite, mas como alavanca real para diagnosticar mais rápido, encontrar causa-raiz e reduzir o esforço operacional.
Faixa salarial
A combinar
Regime de contratação
CLT
Benefícios
- Universidade em Rede TOTVS, uma universidade Corporativa com conteúdos e certificações gratuitos para cada pessoa colaboradora;
- Programa +Saudáveis, que cuida de cada TOTVER com assessoria e ações voltadas para o bem estar em corpo, mente e finanças pessoais;
- Programa +Vantagens, a maior rede de descontos da América Latina, exclusivos para nossas pessoas colaboradoras;
- Programa + Cuidado, programa de apoio pessoal para pessoas colaboradoras e familiares, com orientações em diversas especialidades como: psicologia, serviço social, pet consultoria...
- Einstein Conecta, benefício de orientação médica online pelos médicos do Hospital Israelita Albert Einstein, totalmente gratuito;
- Plano de saúde e odontológico;
- Vale refeição e / ou alimentação;
- Vale transporte e fretados em algumas estações do metrô;
- Licença maternidade e paternidade estendida;
- Espaço de lactário;
- Bicicletário;
- Vestiário;
- Seguro de vida;
- Auxílio creche;
- Previdência privada;
- Escritório que estimula a criatividade e produtividade com ambientes para lanches, salas de jogos, mesas de bilhar e poltronas para relaxar;
- Gympass.
- Definir, implementar e acompanhar SLIs, SLOs e error budgets para os serviços da plataforma
- de IaaS.
- Construir e evoluir a stack de observabilidade (métricas, logs, traces e alertas), garantindo
- visibilidade fim a fim dos serviços.
- Automatizar provisionamento, configuração e operação da infraestrutura com práticas de
- Infrastructure as Code.
- Atuar na resposta a incidentes, conduzindo diagnósticos, mitigações e post-mortems sem
- culpabilização (blameless).
- Projetar e operar pipelines de CI/CD e estratégias de deploy seguras (rollbacks, canary, feature
- flags).
- Realizar planejamento de capacidade, análise de performance e otimização de custos na OCI.
- Reduzir toil por meio de automação, runbooks e ferramentas internas.
- Colaborar com os times de desenvolvimento na construção de serviços confiáveis por design
- (resiliência, escalabilidade, segurança).
- Contribuir para a cultura de confiabilidade do time, disseminando boas práticas e apoiando
- tecnicamente colegas menos experientes.
- Incorporar práticas de AIOps na operação: detecção de anomalias, correlação de eventos e
- redução de ruído de alertas para que o time foque no que importa.
- Acelerar troubleshooting e análise de causa-raiz com apoio de IA (análise de logs/traces,
- sumarização de incidentes, assistentes de diagnóstico), sempre com validação criteriosa antes
- de agir.
- Experiência comprovada como SRE, DevOps Engineer, Platform Engineer ou em operação de
- infraestrutura cloud em produção.
- Sólidos conhecimentos de Linux e fundamentos de redes (TCP/IP, DNS, load balancing,
- firewalls).
- Experiência com pelo menos um provedor de nuvem pública (OCI, AWS, Azure ou GCP).
- Experiência com Infrastructure as Code (Terraform, Pulumi ou similares).
- Experiência com containers e orquestração (Docker e Kubernetes).
- Vivência com ferramentas de observabilidade (Prometheus, Grafana, OpenTelemetry ou
- equivalentes).
- Programação e automação em pelo menos uma linguagem (Go, Python ou similar).
- Experiência com pipelines de CI/CD (GitHub Actions, Jenkins ou similares).
- Vivência com práticas de resposta a incidentes e post-mortems.
- Experiência prática com Oracle Cloud Infrastructure (OCI) e suas certificações.
- Experiência com Pulumi.
- Vivência na construção de plataformas internas, ofertas de IaaS/PaaS ou produtos de infraestrutura.
- Conhecimento de bancos de dados relacionais em produção (PostgreSQL).
- Experiência com práticas de segurança em cloud (IAM, segregação de redes, gestão de
- segredos).Certificações em cloud, Kubernetes (CKA/CKS) ou Linux.
- Familiaridade com conceitos de Platform Engineering e Team Topologies.Experiência prática com AIOps ou ferramentas de observabilidade com IA (detecção de
- anomalias, correlação de eventos, RCA assistido), e/ou uso de LLMs/assistentes no fluxo de operação e troubleshooting.
Como empresa líder em tecnologia somos um universo de pessoas inconformadas, movidas por inovação, autonomia, aprendizado e performance.
Juntos e juntas, criamos oportunidades, transformamos futuros e compartilhamos conhecimento. Aqui o seu desenvolvimento profissional acontece em um ambiente inclusivo, respeitoso e energizante. De gente pra gente!
Buscamos o crescimento sustentável. E usamos dados e IA para impulsionar resultados mais inteligentes e eficientes para os nossos clientes.
Vem com a gente inovar e construir o futuro da tecnologia.
#VemPraTOTVS #SomosTOTVS
[CLOUD] ESPECIALISTA I SRE
TOTVS | São Paulo - SP | Híbrido
Descrição da vaga
Estamos em busca de um(a) SRE para integrar o time responsável pela nova plataforma de IaaS daTOTVS. É um time em formação, com a oportunidade de participar desde o início da definição de arquitetura, padrões de operação e cultura de confiabilidade da plataforma.
Mais do que operar infraestrutura, buscamos alguém que trate confiabilidade como produto:automação e IA em primeiro lugar, decisões guiadas por dados e melhoria contínua dos serviços que sustentam a plataforma. Queremos quem use IA não como enfeite, mas como alavanca real para diagnosticar mais rápido, encontrar causa-raiz e reduzir o esforço operacional.
Responsabilidades e atribuições
- Definir, implementar e acompanhar SLIs, SLOs e error budgets para os serviços da plataforma
- de IaaS.
- Construir e evoluir a stack de observabilidade (métricas, logs, traces e alertas), garantindo
- visibilidade fim a fim dos serviços.
- Automatizar provisionamento, configuração e operação da infraestrutura com práticas de
- Infrastructure as Code.
- Atuar na resposta a incidentes, conduzindo diagnósticos, mitigações e post-mortems sem
- culpabilização (blameless).
- Projetar e operar pipelines de CI/CD e estratégias de deploy seguras (rollbacks, canary, feature
- flags).
- Realizar planejamento de capacidade, análise de performance e otimização de custos na OCI.
- Reduzir toil por meio de automação, runbooks e ferramentas internas.
- Colaborar com os times de desenvolvimento na construção de serviços confiáveis por design
- (resiliência, escalabilidade, segurança).
- Contribuir para a cultura de confiabilidade do time, disseminando boas práticas e apoiando
- tecnicamente colegas menos experientes.
- Incorporar práticas de AIOps na operação: detecção de anomalias, correlação de eventos e
- redução de ruído de alertas para que o time foque no que importa.
- Acelerar troubleshooting e análise de causa-raiz com apoio de IA (análise de logs/traces,
- sumarização de incidentes, assistentes de diagnóstico), sempre com validação criteriosa antes
- de agir.
Requisitos e qualificações
- Experiência comprovada como SRE, DevOps Engineer, Platform Engineer ou em operação de
- infraestrutura cloud em produção.
- Sólidos conhecimentos de Linux e fundamentos de redes (TCP/IP, DNS, load balancing,
- firewalls).
- Experiência com pelo menos um provedor de nuvem pública (OCI, AWS, Azure ou GCP).
- Experiência com Infrastructure as Code (Terraform, Pulumi ou similares).
- Experiência com containers e orquestração (Docker e Kubernetes).
- Vivência com ferramentas de observabilidade (Prometheus, Grafana, OpenTelemetry ou
- equivalentes).
- Programação e automação em pelo menos uma linguagem (Go, Python ou similar).
- Experiência com pipelines de CI/CD (GitHub Actions, Jenkins ou similares).
- Vivência com práticas de resposta a incidentes e post-mortems.
Requisitos desejáveis
- Experiência prática com Oracle Cloud Infrastructure (OCI) e suas certificações.
- Experiência com Pulumi.
- Vivência na construção de plataformas internas, ofertas de IaaS/PaaS ou produtos de infraestrutura.
- Conhecimento de bancos de dados relacionais em produção (PostgreSQL).
- Experiência com práticas de segurança em cloud (IAM, segregação de redes, gestão de
- segredos).Certificações em cloud, Kubernetes (CKA/CKS) ou Linux.
- Familiaridade com conceitos de Platform Engineering e Team Topologies.Experiência prática com AIOps ou ferramentas de observabilidade com IA (detecção de
- anomalias, correlação de eventos, RCA assistido), e/ou uso de LLMs/assistentes no fluxo de operação e troubleshooting.
Faixa salarial
A combinar
Regime de contratação
CLT
Benefícios
- Universidade em Rede TOTVS, uma universidade Corporativa com conteúdos e certificações gratuitos para cada pessoa colaboradora;
- Programa +Saudáveis, que cuida de cada TOTVER com assessoria e ações voltadas para o bem estar em corpo, mente e finanças pessoais;
- Programa +Vantagens, a maior rede de descontos da América Latina, exclusivos para nossas pessoas colaboradoras;
- Programa + Cuidado, programa de apoio pessoal para pessoas colaboradoras e familiares, com orientações em diversas especialidades como: psicologia, serviço social, pet consultoria...
- Einstein Conecta, benefício de orientação médica online pelos médicos do Hospital Israelita Albert Einstein, totalmente gratuito;
- Plano de saúde e odontológico;
- Vale refeição e / ou alimentação;
- Vale transporte e fretados em algumas estações do metrô;
- Licença maternidade e paternidade estendida;
- Espaço de lactário;
- Bicicletário;
- Vestiário;
- Seguro de vida;
- Auxílio creche;
- Previdência privada;
- Escritório que estimula a criatividade e produtividade com ambientes para lanches, salas de jogos, mesas de bilhar e poltronas para relaxar;
- Gympass.
Sobre a empresa
Como empresa líder em tecnologia somos um universo de pessoas inconformadas, movidas por inovação, autonomia, aprendizado e performance.
Juntos e juntas, criamos oportunidades, transformamos futuros e compartilhamos conhecimento. Aqui o seu desenvolvimento profissional acontece em um ambiente inclusivo, respeitoso e energizante. De gente pra gente!
Buscamos o crescimento sustentável. E usamos dados e IA para impulsionar resultados mais inteligentes e eficientes para os nossos clientes.
Vem com a gente inovar e construir o futuro da tecnologia.
#VemPraTOTVS #SomosTOTVS