Swip

Bolsa para Engenheiro(a) de Dados Pleno

Cidacs

PresencialCLTSalvador, Bahia

Sobre a vaga

  • Página da Vaga | Bolsa para Engenheiro(a) de Dados Pleno - Curadoria de Dados - - - - - - - Pular para o conteúdo principalCandidaturas encerradas

Bolsa para Engenheiro(a) de Dados Pleno - Curadoria de Dados

Copiar link
Erro ao copiar link

Compartilhar vagaLink copiado

Ir para candidatura
Descrição da vaga

Estamos selecionando um(a) bolsista para a área de Engenharia de Dados, nível Pleno, que integrará a equipe do Núcleo de Curadoria de
Dados do Centro de Integração de Dados e Conhecimentos para Saúde
(CIDACS/IGM/Fiocruz Bahia), localizado no Parque Tecnológico da Bahia. Esta bolsa tem como objetivo contribuir para o desenvolvimento de pesquisas em saúde.

O(a) bolsista atuará na
estruturação, no desenvolvimento e na automatização de fluxos e pipelines de
dados, bem como em atividades de inspeção, validação, padronização,
harmonização, documentação e avaliação da qualidade de grandes bases de dados
utilizadas em pesquisas.

Também contribuirá para a evolução
e a sustentação da arquitetura do Data Lake, com foco em governança,
versionamento, linhagem, qualidade, segurança e rastreabilidade dos dados, além
da produção de metadados, dicionários e relatórios técnicos e da disponibilização
segura de datasets.

Responsabilidades e atribuições

  • Desenvolver,

automatizar, manter e aprimorar pipelines de dados em ambiente on-premises
para o processamento de grandes volumes de dados;

  • Projetar

e implementar soluções de ETL/ELT para ingestão, transformação,
integração, validação e disponibilização de dados;

  • Desenvolver

pipelines utilizando linguagens, ferramentas e padrões compatíveis com a
arquitetura institucional e com os requisitos de cada projeto;

  • Implementar

testes, registros de execução, monitoramento e mecanismos de tratamento de
falhas, assegurando a qualidade, a rastreabilidade e a reprodutibilidade
dos processos;

  • Produzir

metadados técnicos estruturados, padronizados e processáveis por máquina,
favorecendo a catalogação, a interoperabilidade e a automação;

  • Participar

das atividades de inspeção, perfilamento, validação, descrição,
padronização, harmonização, mapeamento e avaliação da qualidade de bases
de dados e datasets utilizados em pesquisas;

  • Elaborar

e atualizar dicionários de dados, registros de versionamento, linhagem,
proveniência e histórico das bases;

  • Contribuir

para a evolução e a sustentação da arquitetura do Data Lake e dos
ambientes de produção de dados;

  • Automatizar

atividades e controles relacionados aos processos de curadoria de dados;

  • Avaliar,

propor e implementar tecnologias que contribuam para a eficiência, a
segurança e a melhoria contínua dos processos de curadoria;

  • Atuar

de forma integrada com as equipes de Curadoria, Produção de Dados,
Segurança da Informação, Tecnologia da Informação e Pesquisa;

  • Elaborar

documentação e relatórios técnicos periódicos sobre as atividades,
soluções e resultados produzidos;

  • Participar

de reuniões, apresentações e sessões técnico-científicas relacionadas aos
projetos e às atividades institucionais.

Requisitos e qualificações

  • Ensino superior completo, em nível de bacharelado ou curso superior de tecnologia, em Ciência da Computação, Engenharia da Computação, Sistemas de Informação, Ciência de Dados, Informática ou áreas correlatas;
  • Experiência em Engenharia de Dados e no desenvolvimento, automação e sustentação de pipelines de dados;
  • Experiência com processos de ETL/ELT, contemplando ingestão, transformação, validação, integração e disponibilização de dados;
  • Conhecimento avançado de SQL;
  • Experiência com Python e Shell Script/Bash;
  • Experiência no desenvolvimento, execução e otimização de jobs utilizando Apache Spark;
  • Experiência com ferramentas de orquestração de pipelines e fluxos de dados;
  • Conhecimento de arquiteturas de Data Lake e de tecnologias de armazenamento distribuído e de objetos, especialmente MinIO e HDFS;
  • Conhecimento de formatos de dados estruturados e semiestruturados, como CSV, JSON e Parquet;
  • Experiência com sistemas operacionais Linux;
  • Experiência com práticas de versionamento de código utilizando Git;
  • Conhecimento de testes, monitoramento, qualidade, versionamento, linhagem e rastreabilidade de dados;
  • Conhecimento de produção e gestão de metadados e dicionários de dados;
  • Inglês intermediário para leitura e interpretação de documentação técnica.

Diferenciais

  • Experiência com Elasticsearch;
  • Experiência em ambientes on-premises de processamento de grandes volumes de dados;
  • Conhecimento de segurança da informação, governança de dados e proteção de dados pessoais;
  • Experiência com dados administrativos governamentais ou dados de saúde;
  • Conhecimento de padrões de interoperabilidade em saúde, como OMOP e FHIR;
  • Experiência com ferramentas de catalogação de dados e metadados.
  • A ausência dos requisitos diferenciais não impede a candidatura à vaga; contudo, esses requisitos serão considerados como critérios de avaliação.

Informações adicionais

O Centro de Integ