openqareer

Staff Platform Engineer

Cobli · São Paulo, SP

# Staff Platform Engineer **Cobli** · São Paulo, SP · `On-site` 🕒 **Статус:** *Опубликовано: вчера* · *Источник: Indeed* --- ### About the Role Sobre a vaga Se você curte construir a plataforma sobre a qual dezenas de engenheiros entregam produto, e quer ver o efeito disso em milhões de km rodados e na segurança de motoristas reais, esse desafio é pra você. Como Staff Engineer de Infra & DevTools, você vai liderar a execução técnica dos projetos mais importantes da Cobli. Você propõe e implementa soluções de infraestrutura em nuvem e de ferramentas internas que tornam o desenvolvimento fácil, rápido, eficiente e escalável para as squads de Produto, Hardware e Dados. No dia a dia, o foco do time está nos aspectos comuns a toda a plataforma: custo, segurança e observabilidade. Na prática, isso significa cuidar de clusters Kubernetes na AWS que processam telemetria e vídeo de frotas em tempo real, dos caminhos padronizados (Golden Paths) da nossa Internal Developer Platform, da observabilidade e do custo da nuvem. Responsabilidades e atribuições - Propor e evoluir a arquitetura da plataforma (Kubernetes/EKS, rede, IaC, CI/CD, IDP), usando dados para priorizar melhorias alinhadas às metas da área. - Liderar a execução técnica de projetos importantes da plataforma, coordenando com as squads impactadas, como upgrades de EKS, migrações de Karpenter e de ingress e mudanças no modelo de gestão de cargas. - Escrever e revisar design docs e ADRs, explicitando trade-offs entre confiabilidade, custo, segurança e velocidade de entrega. - Identificar gaps nos fluxos de desenvolvimento e propor padrões de plataforma (Golden Paths, templates, políticas), apoiando (e liderando) a adoção pelas squads. - Evoluir a Internal Developer Platform com base nas dores dos times, propondo o que construir, adotar ou descontinuar (build vs. buy) - Evoluir a observabilidade (Datadog) e as práticas de FinOps: ownership de alertas e de custo por squad, cobertura de tags e redução de custo AWS. - Implementar e evoluir práticas de segurança na infraestrutura e do ciclo de desenvolvimento junto a SecOps (IAM, segredos, Cognito, desenvolvimento seguro). - Ser a referência de escalação técnica em problemas complexos de infraestrutura e performance - Elevar o nível técnico do time por meio de revisão de código e de design, pareamento e mentoria técnica. - Ser agente ativo na adoção de IA na operação da plataforma: automação operacional, investigação de incidentes e ferramentas que aumentem a produtividade das squads. - Seguir hands-on, implementando as partes mais críticas das iniciativas que lidera. Requisitos obrigatórios - Experiência sólida em infraestrutura, SRE, DevOps ou Platform Engineering, com parte relevante em produção de alto volume. - Histórico de liderar a execução técnica de projetos de plataforma complexos, coordenando com outras equipes do design à adoção. - Experiência propondo soluções de arquitetura com trade-offs documentados (design docs, ADRs). - Domínio profundo de AWS (EKS, EC2, VPC, IAM, S3, RDS ou equivalentes), incluindo desenho de rede, multi-conta e modelo de permissões. - Domínio de Kubernetes em produção: operação multi-cluster, upgrades sem downtime, autoscaling, networking e troubleshooting avançado. - Infraestrutura como código com Terraform e empacotamento de aplicações com Helm, incluindo módulos e padrões reutilizáveis por outros times. - CI/CD (CircleCI ou similar), com experiência evoluindo fluxos de deploy usados por vários times, e noções de GitOps. - Experiência construindo ou evoluindo uma plataforma interna de desenvolvimento (self-service, templates, catálogo), tratando outros engenheiros como clientes. - Confiabilidade e observabilidade: SLIs/SLOs, error budgets, estratégia de alertas e análise de logs, métricas e traces (Datadog ou equivalente), usando esses dados para priorizar melhorias. - Programação para automação e ferramentas internas (Python, Go ou similar) com qualidade de código de produção. - Liderança de incidentes de alta severidade e de post-mortems. - Fundamentos sólidos de Linux, redes (DNS, TLS, load balancing) e segurança em nuvem. - Experiência prática usando IA para acelerar a engenharia, elevando a produtividade do time e não apenas a própria. - Inglês avançado para leitura técnica. Diferenciais - Experiência com Karpenter, Emissary-ingress/Envoy ou service mesh. - Experiência prática com Flux ou outra ferramenta de GitOps (ex.: ArgoCD). - Operação de bancos distribuídos (ScyllaDB, Cassandra) ou sistemas de streaming (Kafka, Kinesis). - Prática de FinOps em AWS: alocação de custo por time, tagging, Savings Plans e rightsizing. - Conhecimento de DevSecOps: scanning de imagens e dependências, políticas de admissão, gestão de segredos. - Vivência com o ecossistema JVM em produção (tuning de memória, heap dumps, profiling). - Contato com plataformas de dados (Snowflake, data warehouses) do ponto de vista de infraestrutura. - Gestão de infraestrutura para IA: controle de consumo e custo de tokens de LLMs (gateways, quotas e observabilidade de uso por squad) e MLOps (pipelines de treino e deploy de modelos, serving com GPU no Kubernetes, versionamento e monitoramento de modelos em produção).

Наблюдалась 2026-10-07, впервые 2026-10-05, источник — Indeed.

Открыть у работодателя