Pessoa Cientista de Dados
MJV INNOVATION
Sobre a vaga
Cientista de Dados Sênior
Objetivo da posição
Buscamos um(a) Cientista de Dados Sênior para atuar no desenvolvimento de um projeto estratégico de modelagem preditiva, desde a exploração e preparação dos dados até o desenvolvimento, validação e implantação do modelo em ambiente produtivo.
Principais responsabilidades
- Compreender o problema de negócio e traduzi-lo em uma solução de Ciência de Dados;
- Realizar exploração, tratamento e preparação de grandes volumes de dados;
- Desenvolver modelos estatísticos e de Machine Learning para previsão e classificação;
- Definir variáveis, realizar feature engineering e seleção de atributos;
- Avaliar, comparar e otimizar diferentes algoritmos e abordagens;
- Definir métricas de avaliação e conduzir a validação dos modelos;
- Identificar riscos de overfitting, data leakage e outros problemas de modelagem;
- Documentar premissas, metodologia, resultados e limitações do modelo;
- Trabalhar em parceria com áreas de negócio, Engenharia de Dados e Engenharia de Machine Learning;
- Apoiar a implementação e disponibilização do modelo em produção;
- Monitorar performance, estabilidade e evolução do modelo após sua implantação;
- Apresentar resultados e recomendações de forma clara para públicos técnicos e não técnicos.
Requisitos
- Experiência sólida em Ciência de Dados e Machine Learning;
- Experiência comprovada no desenvolvimento de modelos preditivos end-to-end;
- Domínio de Python, especialmente bibliotecas como Pandas, NumPy e Scikit-learn;
- Conhecimento de técnicas de regressão, classificação, árvores de decisão, ensemble methods e/ou outros algoritmos de Machine Learning;
- Conhecimento de estatística, probabilidade e avaliação de modelos;
- Experiência com SQL e manipulação de dados;
- Conhecimento de técnicas de feature engineering e tratamento de dados;
- Experiência com validação cruzada, tuning de hiperparâmetros e definição de métricas;
- Capacidade de transformar problemas de negócio em problemas analíticos;
- Boa comunicação e capacidade de trabalhar de forma autônoma.
Diferenciais
- Experiência com XGBoost, LightGBM, CatBoost ou modelos de séries temporais;
- Experiência com cloud (AWS, Azure ou GCP);
- Conhecimento de MLOps e ferramentas de deploy/monitoramento de modelos;
- Experiência com Databricks, Spark ou ambientes de processamento distribuído;
- Conhecimento de técnicas de explicabilidade de modelos, como SHAP;
- Experiência em projetos de previsão em produção;
- Conhecimento de LLMs/GenAI, caso aplicável ao projeto.
Perfil esperado
Procuramos uma pessoa sênior, analítica e orientada a resultados, capaz de conduzir o projeto com autonomia, questionar premissas, propor soluções e fazer a ponte entre necessidades de negócio e soluções técnicas.
É importante ter capacidade para atuar em um cenário de problema aberto, no qual será necessário explorar os dados, definir a abordagem de modelagem, estabelecer critérios de sucesso e recomendar a melhor solução para o negócio.