Importante

Você está vendo a versão anterior da nova experiência da Alura que estamos preparando para você. Em breve, ela ganha uma identidade visual novinha totalmente pensada em potencializar seus estudos!

3
respostas

[Sugestão] Seleção de Features

Na seleção de features, pensei em fazer baseado no metódo do pandas:

X = dataset.drop('customerID', 'unit', 'usage', 'neighborhood', 'zone', 'label')

Na Vetorização passamos o .columns, pois o parâmetro inputCols do VectorAssembler espera uma lista de nomes de colunas (strings), passamos então as colunas e não um DataFrame que é o caso acima:

assembler = VectorAssembler(inputCols = X.columns, outputCol = 'features')
3 respostas

Olá, William! Como vai?

Parabéns pela realização das atividades!

Vi que você apresentou uma boa solução ao aplicar o pandas para seleção de features, explicou com clareza como utilizar o VectorAssembler com o parâmetro inputCols e ainda destacou a importância de passar corretamente as colunas em formato de lista de strings. Essa abordagem mostra domínio técnico, atenção aos detalhes e preocupação em garantir compatibilidade entre bibliotecas diferentes no fluxo de preparação de dados.

Se quiser aprofundar ainda mais, algumas boas práticas são:

  • Documentação: registrar cada etapa do pipeline para facilitar manutenção e reprodutibilidade.
  • Validação de colunas: garantir que não haja valores nulos ou inconsistentes antes da vetorização.
  • Normalização: aplicar escalonamento ou padronização para melhorar o desempenho de modelos.

Continue postando as suas soluções, com certeza isso ajudará outros estudantes e tem grande relevância para o fórum.

Ah uma pergunta: O que você considera mais relevante para otimizar esse pipeline, investir em técnicas de normalização dos dados ou focar em validações automáticas das colunas antes da vetorização?

Fico à disposição! E se precisar, conte sempre com o apoio do fórum.

Abraço e bons estudos!

Alura Conte com o apoio da comunidade Alura na sua jornada. Abraços e bons estudos!

Investir em técnicas de normalização dos dados, pois na coluna label temos valores na casa dos milhões.

Olá, William! Como vai?

Sua resposta faz bastante sentido.

Quando temos valores muito altos na coluna label, como você mencionou, a normalização se torna estratégica porque ajuda a reduzir a escala dos dados e evita que algoritmos sejam enviesados por magnitudes desproporcionais. Isso melhora tanto a estabilidade quanto a performance do modelo.

As validações automáticas das colunas também são importantes, mas funcionam mais como uma camada de garantia de qualidade, elas asseguram que os dados estejam consistentes antes da vetorização. Já a normalização atua diretamente na eficiência do aprendizado.

Ou seja, pensando em otimização do pipeline, começar pela normalização é realmente o passo mais relevante, e depois complementar com validações automáticas para manter a integridade dos dados.

Parabéns pela análise, você conseguiu destacar bem o ponto crítico do cenário.

Forte abraço!