Sensedia
Sensedia

Analista Operações Cloud (SRE) | Pleno (13535)

TLDR

Garanta disponibilidade e previsibilidade da plataforma API Management, antecipando falhas com observabilidade, automações e resposta a incidentes em produção.

Vaga 100% remota

Aqui a gente conecta o mundo

Sensedia é uma multinacional brasileira provedora de plataforma de gerenciamento de APIs, governança de agentes e soluções de integração, além de serviços profissionais. A companhia impulsiona a transformação digital de grandes empresas habilitando arquiteturas mais ágeis, modernas e escaláveis, possibilitando assim que seus clientes ofereçam produtos e experiências digitais a todo o seu ecossistema.

Trabalhar aqui é pertencer a uma cultura plural, descontraída e inovadora. É para quem tem coragem de ir além, pensar e agir fora da caixa. Preferimos pedir desculpas ao invés de pedir permissão e estamos sempre dispostos a nos transformar, nos reinventar.
Nossas pessoas são incríveis e você pode fazer parte disso tudo. Nos comprometemos em garantir um ambiente de trabalho acolhedor e respeitoso.

Conheça + em nosso site: https://br.sensedia.com/sensedia-careers


Qual a missão do Cargo?

Garantir a disponibilidade, a observabilidade e a previsibilidade da plataforma API Management que sustenta, em produção, as APIs de nossos clientes. É um ambiente heterogêneo, em cloud (AWS, Kubernetes, Terraform), em que o API Gateway está no caminho crítico do negócio dos nossos clientes. Indisponibilidade ou degradação não é apenas inconveniência operacional: ela se propaga para todas as aplicações, canais e parceiros que consomem essas APIs, gerando impactos severos em fluxos produtivos. O desafio central é evoluir a operação de reativa para preventiva. Isso significa construir observabilidade que antecipe problemas, como saturação de capacidade, degradação de latência e erros por tenant. Significa também eliminar, por meio de automações, o trabalho manual repetitivo. A pessoa nesta posição será referência na operação da plataforma APIM, atuando junto de arquitetos cloud e de software, além de desenvolvedores, com responsabilidade compartilhada pelos ambientes em produção.

Quais serão suas atividades do dia-a-dia?

  • Observabilidade e Monitoração Evoluir o monitoramento: Construir e aprimorar a monitoração de produção com o foco central em antecipar falhas antes que elas ocorram. Métricas de experiência: Definir e instrumentar indicadores que reflitam a experiência real do usuário (SLIs/SLOs), e não apenas a saúde do recurso (como uso de CPU ou disco). Limpeza de alertas: Reduzir ativamente o ruído e os alertas falsos positivos, garantindo que o time só seja acionado por problemas reais. Dashboards estratégicos: Manter painéis visuais que realmente sustentem decisões técnicas. 
  •  Automação e Redução de Toil (Trabalho Braçal) Fim do trabalho manual: Identificar e eliminar tarefas repetitivas ligadas a provisionamento, configuração e rotinas diárias. Infraestrutura como Código (IaC): Evoluir e manter a infraestrutura baseada em Terraform e Helm como a fonte única e absoluta de verdade. Desenvolvimento de scripts: Criar automações e ferramentas em Python e Shell para agilizar as operações recorrentes do time. Padronização: Converter procedimentos empíricos e não documentados em runbooks claros e executáveis.
  • Sustentação e Resposta a Incidentes Linha de frente de produção: Atuar diretamente na triagem, mitigação e resolução de incidentes quando a plataforma apresentar problemas. Cultura Blameless: Documentar e conduzir os post-mortems dos incidentes focando em descobrir a causa raiz e definir ações preventivas (investigar o sistema, não as pessoas). Atuação conjunta: Sustentar os ambientes em parceria diária com o time de engenharia de software. Controle de custos (FinOps): Acompanhar o consumo e os custos da infraestrutura

Quais são os requisitos obrigatórios para esse cargo?

Experiência demonstrável, não familiaridade conceitual:

  • Kubernetes em Produção: Ter operado a ferramenta de fato, incluindo debug de pods, análise de consumo de recursos e entendimento dos modos de falha.
  • Cloud de Missão Crítica: Experiência em nuvem rodando ambientes críticos (a preferência da vaga é por AWS). 
  • Infraestrutura como Código (IaC): Capacidade de escrever e manter códigos usando Terraform e Helm, o que inclui realizar revisões (Code Review) das mudanças feitas por outras pessoas.
  • Monitoração (Prometheus e Grafana): Ter construído monitoração do zero (criação de métricas e regras de alerta), não apenas consumindo dashboards que já estavam prontos.
  • Troubleshooting Avançado em Linux: Autonomia para investigar e resolver problemas envolvendo serviços, processos, disco, rede e análise de logs.
  • Desenvolvimento de Automações: Ter criado automações em Python ou Shell que foram adotadas e usadas por outras pessoas do time.
  • Gestão de Incidentes: Experiência real participando de respostas a incidentes em produção, tendo clareza e bom julgamento sobre quando tentar resolver sozinho e quando escalar o problema.
  • Conhecimentos de Rede: Base sólida para investigação técnica, englobando segmentação de redes, DNS, TLS, VPN e uso de ferramentas de debug.

Quais serão os requisitos diferencias para este cargo?

  • APIs: Vivência prática com APIs, padrão REST e ferramentas de API Gateway.
  • Gestão de Logs em Larga Escala: Experiência com ferramentas de centralização e análise de logs, como Elasticsearch, OpenSearch, Loki ou equivalentes.
  • CI/CD: Conhecimento na construção e manutenção de esteiras de integração e entrega contínuas (pipelines).
  • SLIs, SLOs e Error Budgets: Prática na definição de Service Level Indicators e Service Level Objectives, além do uso de "orçamento de erro" para guiar decisões técnicas.
  • Configuração como Código: Experiência com ferramentas de gerência de configuração, como Ansible ou similares.
  • Idioma: Inglês intermediário/técnico com capacidade para leitura de documentação técnica.

Aqui você vai encontrar:

  • Vale Refeição/Vale Alimentação (Cartão Flash benefícios), Plano de Saúde, Plano Odontológico, Seguro de Vida, PPR, TotalPass, Auxílio Creche, Programa Well-Being (destinado para saúde física e mental), Universidade Corporativa (nossa #SensediaAcademy), com diversas trilhas de desenvolvimento; Parceiros culturais e educacionais, com descontos especiais; Somos uma empresa cidadã,  proporcionando licença maternidade e licença paternidade estendida.

  • Temos #WorkWhereYouBelong como proposta de valor, que é um modelo flexível de trabalho que nos ajuda a aumentar o senso de pertencimento dos Sensediers.
    Trabalhe onde você pertence, porque as barreiras físicas estão menores, e o sentimento é de que exista apenas uma Sensedia em qualquer lugar que você esteja trabalhando.

Esta oportunidade também é para PCD! ;)


Suas experiências são compatíveis? Se candidate e venha conhecer a maior referência de APIs no Brasil! Queremos você em nossa equipe!!

  • Pensando em promover times cada vez mais diversos e ambientes de trabalho plurais, nossa missão é  mapear os diferentes públicos que alcançamos com ele! Por isso, faremos algumas perguntinhas relacionadas à diversidade*, tudo bem? =)

 *Os dados pessoais e dados pessoais sensíveis coletados serão tratados de acordo com a Lei Geral de Proteção de Dados - Lei n° 13.709/2018

Benefits

Flexible Work Hours

Temos #WorkWhereYouBelong como proposta de valor, que é um modelo flexível de trabalho

Free Meals & Snacks

Vale Refeição/Vale Alimentação (Cartão Flash benefícios)

Health Insurance

Seguro de Vida

PPR (profit sharing or performance bonus)

PPR

Paid Parental Leave

licença paternidade estendida

Remote-Friendly

Vaga 100% remota

Wellness Stipend

TotalPass

Sensedia builds powerful API integration solutions and provides expert consulting for large companies across various sectors in Brazil and globally. We cater to organizations looking to enhance their connectivity and streamline operations, positioning ourselves as a leader in the Latin American API market.

Founded
Founded 2007
Employees
500+ employees
Industry
information technology and services
Total raised
$21M raised
View company profile