Parece que o langchain_community foi descontinuado.
O langchain sugere alguns leitores de pdf no site, como estou usando um pdf que precisa de ocr, vou tentar usar o docling.
Qual document loader vcs estão usando para pdf?
Você está vendo a versão anterior da nova experiência da Alura que estamos preparando para você. Em breve, ela ganha uma identidade visual novinha totalmente pensada em potencializar seus estudos!
Parece que o langchain_community foi descontinuado.
O langchain sugere alguns leitores de pdf no site, como estou usando um pdf que precisa de ocr, vou tentar usar o docling.
Qual document loader vcs estão usando para pdf?
Oi, Diogo! Tudo bom?
Entendo que você está buscando alternativas para carregar PDFs que necessitam de OCR, já que o langchain_community foi descontinuado.
O docling pode ser uma boa opção, mas existem outras abordagens que você pode considerar. Para PDFs que precisam de OCR, você pode usar o PyMuPDF em conjunto com o pytesseract. O PyMuPDF pode ajudar a extrair imagens das páginas do PDF, e o pytesseract pode ser usado para realizar o OCR nessas imagens. Aqui está um exemplo de como você poderia implementar isso:
import fitz # PyMuPDF
import pytesseract
from PIL import Image
import io
# Carregar o PDF
pdf_document = "caminho/para/seu/documento.pdf"
document = fitz.open(pdf_document)
# Iterar sobre as páginas
for page_number in range(document.page_count):
page = document.load_page(page_number)
pix = page.get_pixmap()
# Converter para imagem PIL
img = Image.open(io.BytesIO(pix.tobytes()))
# Realizar OCR
text = pytesseract.image_to_string(img)
print(f"Texto da página {page_number + 1}:\n{text}\n")
Certifique-se de ter o Tesseract OCR instalado no seu sistema e que o pytesseract esteja configurado corretamente para encontrá-lo.
Espero ter ajudado e fico à disposição se precisar.
Abraço e bons estudos!