Olá, William! Como vai?
Sua resposta faz bastante sentido.
Quando temos valores muito altos na coluna label, como você mencionou, a normalização se torna estratégica porque ajuda a reduzir a escala dos dados e evita que algoritmos sejam enviesados por magnitudes desproporcionais. Isso melhora tanto a estabilidade quanto a performance do modelo.
As validações automáticas das colunas também são importantes, mas funcionam mais como uma camada de garantia de qualidade, elas asseguram que os dados estejam consistentes antes da vetorização. Já a normalização atua diretamente na eficiência do aprendizado.
Ou seja, pensando em otimização do pipeline, começar pela normalização é realmente o passo mais relevante, e depois complementar com validações automáticas para manter a integridade dos dados.
Parabéns pela análise, você conseguiu destacar bem o ponto crítico do cenário.
Forte abraço!