Qual o motivo de aparecer tantos arquivos na pasta csv criada no meu caso?
Você está vendo a versão anterior da nova experiência da Alura que estamos preparando para você. Em breve, ela ganha uma identidade visual novinha totalmente pensada em potencializar seus estudos!
Qual o motivo de aparecer tantos arquivos na pasta csv criada no meu caso?
Olá, William! Como vai?
A quantidade de arquivos na pasta CSV que você está vendo é devido ao funcionamento do Spark.
Quando você escreve um DataFrame em um formato distribuído, como CSV, o Spark divide os dados em várias partições. Cada partição é salva como um arquivo separado. Isso é feito para aproveitar o processamento paralelo e distribuir a carga de trabalho entre diferentes nós do cluster.
O arquivo _SUCCESS indica que a operação de escrita foi concluída com sucesso. As várias partes (part-00000, part-00001, etc.) são as partições do seu DataFrame. Se você deseja ter um único arquivo CSV, você pode usar o método coalesce(1) antes de escrever os dados, mas isso pode impactar o desempenho, pois reduz o paralelismo.
Exemplo:
empresas.coalesce(1).write.csv(
path='/content/drive/MyDrive/curso-spark/empresas/csv',
mode='overwrite',
sep=';',
header=True
)
Espero ter ajudado!