A parte fine tunning poderiua sugerir uma arquitetura padrão de produção hoje consiste em fazer um processo antes de fine-tunning, até porque por exemplo a OpenAI descontinuou a opção de fine tunning, mas outros modelos abertos e fechados de outros fabricantes permite:
- Usar um gerador de embeddings eficiente e genérico de partida (como o Gemini Embedding 2 na nuvem ou BGE-M3 offline).
- Combinar com busca de palavra-chave, metadados (Híbrido).
- Adicionar um Reranker (como BGE-Reranker ou Jina v3.5) no final do processo.
Uma alternativa mais barata, mas lógico vai depender do contexto, como tudo em TI, a resposta é: depende.