Engenheiro de llmops e otimização de inferência
Remoto LATAM
Esta vaga é 100% remota e está aberta a candidatos de qualquer país da LATAM (Argentina, Bolívia, Brasil, Chile, Colômbia, México, Paraguai, Uruguai). Mesmo que a ficha mencione uma cidade, não é necessário morar lá: a empresa contrata em toda a região.
VariaCodeAmérica Latina (Remoto)
47 pessoas interessadas nesta vaga
Seja um dos primeiros a se candidatar
SalárioSalário não especificado
Jornadafull-time
Modalidaderemote
Publicado28 ago
Verificada atualmente: 28 ago
Estamos contratando um Engenheiro de LLMOps e Otimização de Inferência para atuação em regime remoto na América Latina. A posição é para contrato em tempo integral. Buscamos um profissional especializado para integrar nossa equipe técnica e focar no desempenho de modelos de linguagem de grande escala.
8+ anos de experiênciaHigh-level systems architecture designstrategic technical leadershipadvanced mathematicalGPU resource optimization+1 mais
Sobre a vaga
A VariaCode busca um Engenheiro de LLMOps & Otimização de Inferência para liderar a estratégia de nossa infraestrutura de IA. O profissional atuará de forma remota em toda a América Latina, estabelecendo as bases técnicas para modelos de larga escala. O foco principal é o desenho e a implementação de sistemas robustos que sustentem operações de IA de alto desempenho.
Responsabilidades principais
Projetar estratégias de implantação e escalonamento para modelos proprietários e de código aberto em ambientes distribuídos. Definir padrões de otimização de velocidade de inferência e uso de GPU através de quantização e gestão de memória. Desenvolver arquiteturas de alto rendimento com vLLM e Triton, além de estruturar pipelines de RAG com busca híbrida e bancos de dados vetoriais. Gerenciar a orquestração de GPU em nuvem e colaborar com lideranças e equipes de Produto para alinhar o roadmap de engenharia de IA.
Requisitos indispensáveis
Mais de 8 anos de experiência em engenharia de software, dados ou machine learning, com histórico comprovado na arquitetura de modelos de IA auto-hospedados em produção. Domínio técnico de ferramentas como vLLM, TensorRT-LLM, Triton Inference Server, Ollama, PyTorch, técnicas de quantização (AWQ/GPTQ), FlashAttention e sistemas distribuídos via Ray. É necessário ter fluência em inglês para comunicação técnica e consultiva de alto nível.
Condicoes de trabalho
• Trabalho com tecnologias de ponta e clientes de grande porte (Fortune 500). Cultura global focada em inovação e colaboração, operando em modelo totalmente remoto. Oportunidades de crescimento profissional contínuo. Remuneração competitiva em USD, estruturada para talentos de nível principal em IA.

Perguntas frequentes
- A vaga é totalmente remota?
- Sim, a posição é 100% remota e aberta para candidatos em toda a América Latina. A VariaCode opera com modelo distribuído, focando na entrega técnica sem necessidade de deslocamento físico. Você terá liberdade geográfica para trabalhar de onde preferir, desde que consiga manter a conexão necessária com a equipe global e os clientes Fortune 500.
- Posso me candidatar com menos experiência?
- Esta função exige mais de oito anos de atuação sólida em engenharia de software ou machine learning, com histórico comprovado em modelos de IA em produção. O papel envolve liderar estratégias de infraestrutura e otimização de inferência em escala. Se você tem menos tempo de mercado, recomendo buscar posições de nível sênior antes de tentar esta oportunidade de liderança técnica.
- Que perguntas fazer sobre salário antes da entrevista?
- Como o valor não foi divulgado, pergunte diretamente sobre a faixa salarial em dólares americanos e como ela se compara ao padrão de mercado para especialistas seniores em LLMOps. Questione também sobre bônus por desempenho, revisão anual de remuneração e se há benefícios adicionais vinculados à performance do projeto ou aos resultados de otimização de custos de GPU.
- Por qual meio devo enviar a candidatura?
- A candidatura deve ser enviada através do link externo fornecido no anúncio original no LinkedIn. Não há opção de envio por e-mail direto ou WhatsApp para esta vaga específica. Clique no botão de aplicação no perfil da empresa para acessar o formulário oficial e garantir que seu currículo chegue corretamente à triagem inicial.