Estou codificando com um lintter Ruff, e ele alertou sobre a linha contendo sum para juntar documentos, dei uma pesquisada e ocorre que tem tempo quadratico O(n^2) , para poucos documentos não faria diferença mas para uma grande quantidade de documentos ou de página no pdf isso faria diferença, uma forma de resolver seria trocar por um loop O(n), onde vai extendendo a lista. Pode ser um coisa irrelevante no exercício didático, mas atiçou minha curiosidade.
obs.: tem um warning sobre depreciação de bibliotecas que vou pesquisar melhor também
'''
# aqui tem que criar uma lista, copiar e criar outra lista maior
documentos = sum(
[
PyPDFLoader(str(arquivo)).load() for arquivo in arquivos
],
[]
)
'''
# aqui extende a mesma lista
documentos = []
for arquivo in arquivos:
documentos.extend(PyPDFLoader(str(arquivo)).load())