Revisor de qualidade de benchmark de ia
Remoto LATAM
Esta vaga é 100% remota e está aberta a candidatos de qualquer país da LATAM (Argentina, Bolívia, Brasil, Chile, Colômbia, México, Paraguai, Uruguai). Mesmo que a ficha mencione uma cidade, não é necessário morar lá: a empresa contrata em toda a região.
PGC Digital (America) IncAmérica Latina (Remoto)
85 pessoas interessadas nesta vaga
Seja um dos primeiros a se candidatar
SalárioSalário não especificado
Modalidaderemote
Publicado22 sept
Estou procurando um *AI Benchmark Quality Reviewer* remoto para avaliar modelos de IA em qualidade e precisão, com foco em testes e feedback técnico. A vaga é para profissional com expertise em análise de sistemas automatizados, idealmente com experiência em benchmarking ou avaliação de algoritmos.
Sobre a vaga
Você vai atuar como revisor de qualidade em benchmarks de IA, garantindo que os testes sejam precisos e justos. O trabalho envolve avaliar desde o design das tarefas até o desempenho dos modelos, identificando problemas e sugerindo melhorias com base em evidências sólidas. É uma oportunidade para quem gosta de detalhes técnicos e quer contribuir para que os sistemas de IA sejam avaliados de forma rigorosa e transparente.
Responsabilidades principais
Você vai verificar se as instruções, materiais de referência e critérios de avaliação estão alinhados e sem informações ocultas ou faltantes. Analisará o desempenho dos agentes — como eles executam tarefas, chamam ferramentas e entregam resultados — para confirmar se os sucessos e fracassos estão realmente justificados. Também vai checar a lógica de pontuação, identificando erros como respostas esperadas incorretas ou critérios de rubrica que não têm embasamento. Outra parte importante é investigar discrepâncias: separar os limites reais dos modelos dos problemas no design das tarefas ou nos erros de avaliação automática. Por fim, você vai documentar suas conclusões com base em provas, dar feedback útil e garantir que as revisões corrijam os pontos levantados.
Requisitos indispensáveis
É preciso ter familiaridade prática com Python, SQL, scripts em shell e dados estruturados para entender como as tarefas e avaliações são configuradas. Você deve saber analisar logs de execução e identificar inconsistências ou falhas em cálculos ou critérios de pontuação. Além disso, é fundamental ter habilidade para escrever feedback claro e detalhado, com exemplos concretos, e experiência em áreas como avaliação de IA, QA técnico ou análise de dados. Conhecimento prévio com o sistema Harbor é um diferencial, mas não obrigatório.
Condicoes de trabalho
Commitment: 40 hours a week 8 hrs PST overlap mandatoryDuration: 10 weeks, starting immediately
Vagas similares sugeridas
Ver todas as ofertas de Suporte Técnico / TI
Perguntas frequentes
- Que perguntas fazer sobre salário antes da entrevista?
- Como o valor não foi divulgado, pergunte diretamente se a remuneração é fixa ou variável por hora. Questione como o pagamento é processado para contratados internacionais e se há bônus por desempenho ou conclusão do projeto de 10 semanas. É essencial confirmar se o valor cobre custos locais no Brasil ou se segue uma tabela global.
- A vaga é totalmente remota?
- Sim, a posição é remota com sede na América Latina. No entanto, exige disponibilidade total de 40 horas semanais e sobreposição obrigatória de 8 horas com o horário PST (Califórnia). Isso significa que você precisará ajustar sua rotina para trabalhar em horários noturnos ou muito cedo pela manhã no Brasil.
- Por qual meio devo enviar a candidatura?
- O processo ocorre exclusivamente através do link externo fornecido no anúncio original do LinkedIn. Não há opção de envio por e-mail direto ou WhatsApp para esta oportunidade específica. Acesse a página da vaga na plataforma de recrutamento para iniciar seu cadastro e subir seu currículo imediatamente.