Importante

Você está vendo a versão anterior da nova experiência da Alura que estamos preparando para você. Em breve, ela ganha uma identidade visual novinha totalmente pensada em potencializar seus estudos!

1
resposta

Descontinuação langchain_community

Parece que o langchain_community foi descontinuado.
O langchain sugere alguns leitores de pdf no site, como estou usando um pdf que precisa de ocr, vou tentar usar o docling.
Qual document loader vcs estão usando para pdf?

1 resposta

Oi, Diogo! Tudo bom?

Entendo que você está buscando alternativas para carregar PDFs que necessitam de OCR, já que o langchain_community foi descontinuado.

O docling pode ser uma boa opção, mas existem outras abordagens que você pode considerar. Para PDFs que precisam de OCR, você pode usar o PyMuPDF em conjunto com o pytesseract. O PyMuPDF pode ajudar a extrair imagens das páginas do PDF, e o pytesseract pode ser usado para realizar o OCR nessas imagens. Aqui está um exemplo de como você poderia implementar isso:

import fitz  # PyMuPDF
import pytesseract
from PIL import Image
import io

# Carregar o PDF
pdf_document = "caminho/para/seu/documento.pdf"
document = fitz.open(pdf_document)

# Iterar sobre as páginas
for page_number in range(document.page_count):
    page = document.load_page(page_number)
    pix = page.get_pixmap()
    
    # Converter para imagem PIL
    img = Image.open(io.BytesIO(pix.tobytes()))
    
    # Realizar OCR
    text = pytesseract.image_to_string(img)
    print(f"Texto da página {page_number + 1}:\n{text}\n")

Certifique-se de ter o Tesseract OCR instalado no seu sistema e que o pytesseract esteja configurado corretamente para encontrá-lo.

Espero ter ajudado e fico à disposição se precisar.

Abraço e bons estudos!

Caso este post tenha lhe ajudado, por favor, marcar como solucionado