Quem contrata um engenheiro de dados quer pipelines que entreguem dados corretos, no horário, com custo previsível, para que analistas e cientistas trabalhem sem esperar. O currículo precisa descrever a plataforma construída (fontes, volume, ferramentas, destino) e o que mudou: atraso dos dados, falhas de pipeline, custo de processamento, tempo para disponibilizar uma nova fonte.
O currículo comum do cargo lista Spark, Airflow, Kafka e três provedores de nuvem sem dizer quantos dados passavam por ali nem com que confiabilidade. Este guia mostra o que pesa na leitura, quais termos as vagas filtram, como escrever tópicos com volume, custo e qualidade, e como fica um exemplo completo dentro da área de tecnologia.
Neste guia
O que pesa no currículo de engenheiro de dados
A experiência precisa nomear a arquitetura (data lake, lakehouse, warehouse), a stack (Spark, Airflow, dbt, Kafka, provedor de nuvem), o volume (gigabytes ou terabytes por dia, número de tabelas e de pipelines) e as métricas de operação: pipelines com falha, atraso na entrega dos dados, custo mensal, tempo de onboarding de uma nova fonte. Sem volume e sem confiabilidade, o currículo descreve um curso.
SQL avançado e modelagem de dados (dimensional, Data Vault, tabelas particionadas) continuam sendo filtro central, junto com Python. Certificações de nuvem específicas de dados (AWS Data Engineer, Google Professional Data Engineer, Databricks Data Engineer) aparecem como diferencial forte, e convém informá-las com o ano. Governança e LGPD entram cada vez mais nas vagas de bancos, saúde e varejo.
A seção de habilidades se organiza por camadas: processamento, orquestração, armazenamento, streaming, infraestrutura como código, qualidade de dados. Formação em Ciência da Computação, Engenharia, Sistemas de Informação ou tecnólogo em Banco de Dados é comum; muitos perfis vêm de administração de banco de dados ou de desenvolvimento backend, e essa origem vale ser mostrada.
Palavras-chave que as vagas buscam
Os termos mais frequentes nas vagas de engenheiro de dados no Brasil:
- Python e SQL avançado
- Apache Spark (PySpark)
- Apache Airflow
- dbt
- Apache Kafka e streaming
- Databricks e Delta Lake
- Snowflake, BigQuery ou Redshift
- AWS (S3, Glue, Athena, EMR), Azure Data Factory ou GCP Dataflow
- Data lake e lakehouse
- Modelagem dimensional (Kimball) e Data Vault
- ETL e ELT
- Qualidade de dados (Great Expectations, testes no dbt)
- Terraform e Docker
- CI/CD para pipelines
- Governança de dados e LGPD
Esses termos rendem mais nos tópicos de experiência, ligados a volume e confiabilidade, e repetidos na seção de habilidades com a grafia da vaga. A ferramenta para adaptar o currículo à vaga aponta as ferramentas que o anúncio pede e o documento ainda não menciona.
Descrições de experiência que funcionam
Volume, confiabilidade e custo são o vocabulário do cargo. Os pares abaixo mostram a diferença:
| Assim não | Assim sim |
|---|---|
| Desenvolvimento de pipelines de dados | Construí o lakehouse em Databricks (Delta Lake, S3) que ingere 2 TB por dia de 35 fontes, com 98% dos pipelines entregando antes das 6h |
| Manutenção de processos ETL | Migrei 120 jobs de ETL legados para Airflow e dbt, reduzindo as falhas mensais de 40 para 5 e o tempo de correção de um dia para uma hora |
| Otimização de custos | Reparticionei as tabelas mais consultadas e ajustei os clusters do Spark, cortando 35% do custo mensal de processamento |
| Implementação de streaming | Implementei ingestão em streaming com Kafka e Spark Structured Streaming, levando a atualização do painel de pedidos de D+1 para 15 minutos |
| Garantia da qualidade dos dados | Criei 400 testes de qualidade no dbt e no Great Expectations que barraram 27 cargas com dados inconsistentes antes de chegarem aos relatórios |
| Suporte aos times de dados | Padronizei a modelagem dimensional de 60 tabelas e reduzi de 3 semanas para 4 dias o tempo para disponibilizar uma nova fonte aos analistas |
Júnior vs. sênior
Um engenheiro de dados júnior costuma vir de backend, administração de banco de dados ou análise de dados, e o currículo aproveita essa base: SQL sólido, Python, um projeto público com pipeline em Airflow ou dbt sobre dados abertos, rodando em nuvem gratuita ou em Docker. Certificações de nível associate em nuvem ajudam no filtro. O título pode ser "Engenheiro de dados júnior", e a formação sobe.
O sênior mostra plataforma e decisão: arquitetura escolhida e por quê, custo sob controle em escala, padrões de qualidade e governança adotados pela empresa, mentoria, suporte a dezenas de consumidores dos dados. As métricas ganham escala (terabytes por dia, centenas de pipelines) e prazo (confiabilidade mantida por anos). Muitos sêniores migram para arquitetura de dados ou plataforma, e o currículo já deve mostrar esse alcance nos dois últimos cargos, como descreve o guia de currículo sênior.
Volume por dia, percentual de pipelines no prazo e custo mensal são os três números que um gestor de dados procura. Ao menos um deve aparecer em cada cargo.
Erros frequentes neste cargo
Os currículos de engenheiro de dados falham quando a ferramenta aparece sem a operação:
- Ferramentas sem volume. "Spark, Airflow, Kafka" sem terabytes, tabelas ou pipelines não diz se a pessoa operou algo além de um tutorial.
- Nenhuma métrica de confiabilidade. Pipelines falham; o currículo que não fala em taxa de falha, atraso ou correção parece não ter operado em produção.
- Omitir modelagem de dados. Muitas vagas filtram por modelagem dimensional; deixá-la de fora sugere um perfil só de movimentação de arquivos.
- Confundir com analista ou cientista. Dashboards e modelos preditivos como foco do currículo deslocam o perfil para outro cargo.
- Ignorar custo. Em nuvem, engenheiro de dados que não fala em custo de processamento preocupa quem paga a conta.
- Currículo com diagramas de arquitetura. Imagens não são lidas pelo ATS; a arquitetura se descreve em texto, e um modelo de currículo de uma coluna comporta isso com clareza.
Exemplo de currículo de engenheiro de dados
O exemplo abaixo mostra um perfil pleno com origem em backend, em uma página. Nome e empresas são fictícios.
Engenheira de dados pleno ou sênior em plataforma de dados, com foco em lakehouse, orquestração e qualidade de dados em escala.
Engenheira de dados com 6 anos de experiência, dos quais 2 em desenvolvimento backend. Especializada em Spark, Airflow, dbt e Databricks na AWS, com histórico de plataformas ingerindo terabytes por dia, redução de custo de processamento e pipelines confiáveis para dezenas de consumidores.
Engenheira de dados pleno, Farmácias Vitalle (rede varejista), Salvador. 2022 - atual
- Construí o lakehouse em Databricks (Delta Lake, S3) que ingere 2 TB por dia de 35 fontes, com 98% dos pipelines entregando antes das 6h.
- Implementei ingestão em streaming com Kafka e Spark Structured Streaming, levando a atualização do painel de vendas de D+1 para 15 minutos.
- Reparticionei as tabelas mais consultadas e ajustei os clusters do Spark, cortando 35% do custo mensal de processamento.
Engenheira de dados, Trilha Log (logística), Salvador. 2020 - 2022
- Migrei 120 jobs de ETL legados para Airflow e dbt, reduzindo as falhas mensais de 40 para 5 e o tempo de correção de um dia para uma hora.
- Criei 400 testes de qualidade no dbt e no Great Expectations que barraram 27 cargas inconsistentes antes de chegarem aos relatórios.
- Padronizei a modelagem dimensional de 60 tabelas e reduzi de 3 semanas para 4 dias o tempo para disponibilizar uma nova fonte aos analistas.
Bacharelado em Ciência da Computação, UFBA, 2019. AWS Certified Data Engineer Associate, 2024.
Python, SQL, PySpark, Airflow, dbt, Kafka, Databricks, Delta Lake, AWS (S3, Glue, Athena, EMR), Redshift, Terraform, Docker, Great Expectations, modelagem dimensional, Git. Inglês avançado.
Perguntas frequentes
Quais números colocar no currículo de engenheiro de dados?
Volume processado por dia, número de fontes e de pipelines, percentual de pipelines no prazo, falhas por mês, atraso dos dados (de D+1 para minutos), custo mensal de processamento e tempo para disponibilizar uma nova fonte. Um por tópico já basta.
Certificações de nuvem pesam no currículo de engenheiro de dados?
Pesam, especialmente as específicas de dados: AWS Data Engineer, Google Professional Data Engineer e Databricks Data Engineer. Convém informar o ano, porque expiram, e colocá-las junto da formação.
Desenvolvedor backend pode migrar para engenharia de dados pelo currículo?
Pode, e a base em Python, SQL e sistemas distribuídos é valorizada. O currículo deve acrescentar um projeto público com Airflow ou dbt, mostrar modelagem de dados e reescrever os tópicos de backend destacando o que envolveu dados em volume.
O currículo de engenheiro de dados deve mencionar LGPD?
Sim, quando houve trabalho real: anonimização, controle de acesso, catálogo de dados, políticas de retenção. Bancos, saúde e varejo pedem isso com frequência, e uma linha concreta vale mais do que a sigla na lista de habilidades.