Engenheiro de Machine LearningAberto a vagas efetivas, contratos e freelance

Engenheiro de Machine Learning focado em colocar modelos em produção e mantê-los confiáveis nesse processo.

Download CV
3+
Anos de Experiência
4
Estudos de Caso
C1
Inglês (IELTS 7.5)

Sobre Mim

Sou Engenheiro de Machine Learning, formado em Engenharia de Computação, focado em construir e implantar sistemas de machine learning. Minha experiência abrange ML clássico, deep learning e NLP, com ênfase em levar modelos da experimentação à produção.

Já trabalhei em saúde pública, pesquisa no setor automotivo e desenvolvimento internacional, construindo pipelines de dados, APIs e monitoramento para sistemas de ML do mundo real. Tenho interesse particular em MLOps e machine learning em produção. Fora do trabalho, jogo xadrez, contribuo com projetos open-source e gosto de longas caminhadas com meu cachorro.

Experiência Profissional

Trabalho de ML em produção em saúde, automotivo e desenvolvimento internacional

Engenheiro de Machine Learning

Out 2024 – Jan 2026
Secretaria Estadual de Saúde de Pernambuco
  • Automatizei o workflow de OCR (OpenCV, Tesseract, PaddleOCR), reduzindo o tempo de processamento de 20 dias para 7 horas.
  • Construí pipelines de NLP (Kedro, DVC, MLflow) para classificação automática de laudos médicos, garantindo rastreabilidade total para auditoria.
  • Entreguei serviços FastAPI em Docker com MinIO como data lake/artifact store, e padronizei o ciclo de vida dos modelos com tracking e registry remoto no MLflow.
PythonPyTorchTensorFlowNLPKedroDVCMLflowFastAPIDocker

Cientista de Dados

Mai 2023 – Set 2024
Fácil Espaider
  • Desenvolvi modelos de ML (Scikit-learn, Pandas, NumPy) que contribuíram para um aumento de 18% na satisfação dos clientes.
  • Implementei pipelines de NLP (NLTK, spaCy, fastText, Word2Vec) para automatizar a extração de insights de texto.
  • Integrei modelos de ML em sistemas legados em C# e conduzi testes A/B para validar novas soluções contra o modelo vigente.
PythonScikit-learnPandasNumPyNLPC#

Pesquisador & Cientista de Dados

Mai 2023 – Abr 2024
Ford Motor Company
Contrato de pesquisa paralelo, concomitante com a Fácil Espaider
  • Analisei dados de performance de veículos elétricos (EV) com PySpark e MLlib, aplicando testes de hipótese e análise multivariada.
  • Desenvolvi modelos de regressão, classificação e clusterização sobre dados de telemetria em ambiente GCP (BigQuery, Vertex AI).
  • Apresentei resultados para lideranças internacionais, colaborando com times de engenharia e negócios na modelagem de features.
PySparkMLlibGCPBigQueryVertex AI

Estagiário de Analytics

Mai 2022 – Nov 2022
IOM – UN Migration
  • Apoiei projetos internacionais de análise de dados com equipes multiculturais em uma agência de migração da ONU.
  • Construí pipelines de ETL (Pentaho, SQL, SQLAlchemy) e protótipos de API/dashboard (FastAPI, Streamlit) para relatórios a stakeholders.
  • Gerenciei dados em Azure e S3, e contribuí com dashboards em Power BI para apoio à decisão.
SQLSQLAlchemyFastAPIStreamlitPower BIAzure

Skills e Tecnologias

Ferramentas que uso de verdade, agrupadas por onde aparecem no trabalho acima

Linguagens & Frameworks

Python, SQL, C#, Pandas, NumPy, Scikit-learn, TensorFlow, PyTorch, FastAPI

MLOps & Cloud

Docker, MLflow, DVC, Kedro, Airflow, Spark, AWS, GCP, Azure

Bancos de Dados & Visualização

PostgreSQL, MongoDB, Matplotlib, Seaborn, Plotly, Power BI

Projetos em Destaque

Alguns dos projetos que desenvolvi

AI Hiring Matcher

Matcher de currículos para vagas que audita o próprio rótulo de treinamento em busca de viés antes de confiar nele. Encontrou viés de gênero de até 89 pontos percentuais dependendo do cargo, e é projetado para não reproduzi-lo. Avaliado como recuperação em conjunto fechado de 51 cargos conhecidos (88,2% de Recall@5), sem pretensão de generalizar para vagas novas. Stack de MLOps totalmente local (DVC, MLflow, Evidently), sem precisar de conta em nuvem.

89pp
Viés Encontrado
88,2%
Recall@5
Pythonsentence-transformersMLflowDVCFastAPIDocker

CiteRAG

Sistema de RAG self-hosted para documentação técnica. Se o modelo não conseguir embasar uma resposta com uma citação, ele se recusa a responder em vez de arriscar. Um design fail-closed que a maioria dos demos de RAG ignora. Busca híbrida, reranking por cross-encoder, inferência 100% local.

100%
Inferência Local
Ativa
Checagem de Citação
PythonQdrantFastAPIOllamaLangChain

Pipeline de Benchmark de OCR

Pipeline containerizado para comparar engines de OCR (Tesseract, EasyOCR, PaddleOCR) em documentos escaneados, medindo precisão real (CER/WER, extração de campos, localização por IoU) contra um gabarito, não só tempo. Novos engines se plugam por uma única interface; vem com dados de exemplo e modo offline completo, rodando do zero sem configuração externa.

3
Engines de OCR
6
Serviços Docker
DockerFastAPIStreamlitPostgreSQLMongoDB

Previsão de Demanda de Corridas

Previsão de demanda de corridas reconstruída de forma honesta com dados públicos, em vez de reutilizar o dataset de uma entrevista de emprego. Encontrou uma divisão treino/teste ingênua inflando o erro de avaliação em 4x, e corrigiu mais dois bugs de vazamento de dados ao transformar o notebook em um serviço FastAPI real.

4x
Bug de Avaliação
2,10
MAE Prod (Corridas/Dia)
PythonXGBoostscikit-learnFastAPIDocker

Entre em Contato

Aberto a vagas efetivas, freelance e colaborações

Email

joaopedrocdias@hotmail.com

LinkedIn

linkedin.com/in/jpcunhadias

Localização

Brasília, Brasil