Boa noite.
realizei a divisão do texto em chunks conforme o código abaixo.
text_splitter = RecursiveCharacterTextSplitter(
chunk_size=600, # Tamanho máximo de cada chunk
chunk_overlap=150 # Sobreposição entre chunks
)
# Divide os documentos em chunks
chunks = text_splitter.split_documents(documentos)
Após comecei a analisar os chunks gerados e encontrei o seguinte chunk, aparentemente sem contexto o qual desejo tratar nesta postagem.
---chunk 5/61:------------------------------
page_content=***'contagem de glóbulos brancos do sangue) com uma destas substâncias;
- função da medula óssea prejudicada (ex.: após tratamento citostático) ou doenças do sistema
hematopoiético (responsável pela produção das células sanguíneas); - desenvolvido broncoespasmo (contração dos brônquios levando a chiado no peito) ou outras reaçõe s
anafilactóides, como urticária (erupçã o na pele que causa coceira), rinite (irritação e inflamação da
mucosa do nariz), angioedema (inchaço em região subcutânea ou em mucosas) depois do uso de' ***
metadata={'producer': 'PDFium', 'creator': 'PDFium', 'creationdate': 'D:20191206103835', 'source': 'dipirona.pdf', 'total_pages': 10, 'page': 2, 'page_label': '3', 'medicamento': 'dipirona'}
Analisando o texto apresentando, parece estar tratando a respeito da "medula óssea" e do "broncoespasmo", mas ao verificar no arquivo dipirona.pdf há a seguinte frase antes:
"A dipirona monoidratada não deve ser utilizada caso você tenha:"
Esta frase permite identificar o contexto das frases do chunk e que elas tratam das condições em que não deve ser utilizado a dipirona monoidratada, sendo:
- quando há função da medula óssea prejudicada
- ou quando foi desenvolvido broncoespasmo
Então o texto do chunk 5, se avaliado sem a frase que indica o contexto tratado, leva a uma interpretação incorreta.
Como deveria ser tratado esta situação? Deveria adicionar um metadado que ajude a contextualizar o chunk? ou outra sugestão?