Bolsa para Engenheiro(a) de Dados Pleno
Cidacs
Sobre a vaga
- Página da Vaga | Bolsa para Engenheiro(a) de Dados Pleno - Curadoria de Dados - - - - - - - Pular para o conteúdo principalCandidaturas encerradas
Bolsa para Engenheiro(a) de Dados Pleno - Curadoria de Dados
Copiar link
Erro ao copiar link
Compartilhar vagaLink copiado
Ir para candidatura
Descrição da vaga
Estamos selecionando um(a) bolsista para a área de Engenharia de Dados, nível Pleno, que integrará a equipe do Núcleo de Curadoria de
Dados do Centro de Integração de Dados e Conhecimentos para Saúde
(CIDACS/IGM/Fiocruz Bahia), localizado no Parque Tecnológico da Bahia. Esta bolsa tem como objetivo contribuir para o desenvolvimento de pesquisas em saúde.
O(a) bolsista atuará na
estruturação, no desenvolvimento e na automatização de fluxos e pipelines de
dados, bem como em atividades de inspeção, validação, padronização,
harmonização, documentação e avaliação da qualidade de grandes bases de dados
utilizadas em pesquisas.
Também contribuirá para a evolução
e a sustentação da arquitetura do Data Lake, com foco em governança,
versionamento, linhagem, qualidade, segurança e rastreabilidade dos dados, além
da produção de metadados, dicionários e relatórios técnicos e da disponibilização
segura de datasets.
Responsabilidades e atribuições
- Desenvolver,
automatizar, manter e aprimorar pipelines de dados em ambiente on-premises
para o processamento de grandes volumes de dados;
- Projetar
e implementar soluções de ETL/ELT para ingestão, transformação,
integração, validação e disponibilização de dados;
- Desenvolver
pipelines utilizando linguagens, ferramentas e padrões compatíveis com a
arquitetura institucional e com os requisitos de cada projeto;
- Implementar
testes, registros de execução, monitoramento e mecanismos de tratamento de
falhas, assegurando a qualidade, a rastreabilidade e a reprodutibilidade
dos processos;
- Produzir
metadados técnicos estruturados, padronizados e processáveis por máquina,
favorecendo a catalogação, a interoperabilidade e a automação;
- Participar
das atividades de inspeção, perfilamento, validação, descrição,
padronização, harmonização, mapeamento e avaliação da qualidade de bases
de dados e datasets utilizados em pesquisas;
- Elaborar
e atualizar dicionários de dados, registros de versionamento, linhagem,
proveniência e histórico das bases;
- Contribuir
para a evolução e a sustentação da arquitetura do Data Lake e dos
ambientes de produção de dados;
- Automatizar
atividades e controles relacionados aos processos de curadoria de dados;
- Avaliar,
propor e implementar tecnologias que contribuam para a eficiência, a
segurança e a melhoria contínua dos processos de curadoria;
- Atuar
de forma integrada com as equipes de Curadoria, Produção de Dados,
Segurança da Informação, Tecnologia da Informação e Pesquisa;
- Elaborar
documentação e relatórios técnicos periódicos sobre as atividades,
soluções e resultados produzidos;
- Participar
de reuniões, apresentações e sessões técnico-científicas relacionadas aos
projetos e às atividades institucionais.
Requisitos e qualificações
- Ensino superior completo, em nível de bacharelado ou curso superior de tecnologia, em Ciência da Computação, Engenharia da Computação, Sistemas de Informação, Ciência de Dados, Informática ou áreas correlatas;
- Experiência em Engenharia de Dados e no desenvolvimento, automação e sustentação de pipelines de dados;
- Experiência com processos de ETL/ELT, contemplando ingestão, transformação, validação, integração e disponibilização de dados;
- Conhecimento avançado de SQL;
- Experiência com Python e Shell Script/Bash;
- Experiência no desenvolvimento, execução e otimização de jobs utilizando Apache Spark;
- Experiência com ferramentas de orquestração de pipelines e fluxos de dados;
- Conhecimento de arquiteturas de Data Lake e de tecnologias de armazenamento distribuído e de objetos, especialmente MinIO e HDFS;
- Conhecimento de formatos de dados estruturados e semiestruturados, como CSV, JSON e Parquet;
- Experiência com sistemas operacionais Linux;
- Experiência com práticas de versionamento de código utilizando Git;
- Conhecimento de testes, monitoramento, qualidade, versionamento, linhagem e rastreabilidade de dados;
- Conhecimento de produção e gestão de metadados e dicionários de dados;
- Inglês intermediário para leitura e interpretação de documentação técnica.
Diferenciais
- Experiência com Elasticsearch;
- Experiência em ambientes on-premises de processamento de grandes volumes de dados;
- Conhecimento de segurança da informação, governança de dados e proteção de dados pessoais;
- Experiência com dados administrativos governamentais ou dados de saúde;
- Conhecimento de padrões de interoperabilidade em saúde, como OMOP e FHIR;
- Experiência com ferramentas de catalogação de dados e metadados.
- A ausência dos requisitos diferenciais não impede a candidatura à vaga; contudo, esses requisitos serão considerados como critérios de avaliação.
Informações adicionais
O Centro de Integ