Importante

Você está vendo a versão anterior da nova experiência da Alura que estamos preparando para você. Em breve, ela ganha uma identidade visual novinha totalmente pensada em potencializar seus estudos!

1
resposta

[Sugestão] Por favor verifique se a minha solução está correta

Priscila verifique no meu GitHub https://github.com/Antonino-Marques-Jares/Qualidade-de-Dados-com-Biblioteca-Pydeequ/tree/main
Pelo que entendi o conflito é com a versão python , pyspark e pydeequ e tem que ter arquivo winutils.exe compativel e configuração de variavel de ambiente.
No meu projeto local apontamos a variável 'HANDOOP_HOME' para a pasta 'handoop\bin' que se encontra no projeto desta forma não tem que configurar no windows.

Apenas siga os passos:

1 - Instale em seu computador python 3.11.6
2 - Crie maquina virtual - "py -3.11 -m venv .venv"
3 - Atualizando pip - "python -m pip install --upgrade pip"
4 - Certifique-se que seu ambiente virtual (venv) esteja ativo antes das instalações
5 - Execute em seu terminal - "pip install -r requirements.txt" # Vai baixar as bibliotecas que instalei do requirements.txt
6 - Talvez seja nescessário reiniciar o VS Code
7 - Execute tudo

1 resposta

Olá, Antonino! Como vai?

Agradeço pela sugestão a atividade Configurando o ambiente!

Vi que você explorou o gerenciamento de ambientes virtuais para isolar dependências com Python, utilizou muito bem a variável de ambiente HADOOP_HOME para garantir compatibilidade entre o PySpark e o Hadoop no Windows e ainda compreendeu a importância da compatibilidade de versões entre Python, PySpark e Pydeequ para evitar conflitos de execução.

Se quiser aprofundar ainda mais, algumas boas práticas são:

  • Fixação de versões: especifique versões exatas das bibliotecas no requirements.txt para evitar conflitos futuros
  • Arquivo de configuração: utilize um arquivo .env junto com a biblioteca python-dotenv para centralizar variáveis sensíveis
  • Validação de ambiente: crie um script de checagem que confirme se todas as dependências e variáveis estão corretas antes de executar o pipeline

Ah, uma pergunta: O que você achou mais desafiador ao configurar o Hadoop no Windows, foi lidar com o winutils.exe ou ajustar as variáveis de ambiente para funcionar corretamente com o PySpark?

Alura Conte com o apoio da comunidade Alura na sua jornada. Abraços e bons estudos!