Olá, Fabio! Tudo bem?
A ideia do cache de prompt é otimizar o uso de tokens ao reutilizar informações já processadas em interações anteriores.
Isso geralmente resulta em economia de tokens e, consequentemente, em custos mais baixos. No entanto, é importante considerar que diferentes modelos de linguagem podem ter implementações distintas de cache e eficiência no uso de tokens. Por exemplo, como mencionado na aula, o Codex pode não ter um cache tão eficiente quanto outros modelos, como o Claude.
Isso pode explicar por que você observou um consumo maior de tokens ao manter o mesmo modelo em vez de mudá-lo. Quando você muda de modelo, pode ser que o novo modelo esteja otimizando melhor o uso de tokens devido à sua própria configuração de cache.
Outra possibilidade é que a forma como os prompts foram estruturados nos seus testes influenciou no consumo de tokens. Cada modelo pode interpretar e processar os prompts de maneira diferente, dependendo de como o contexto é mantido ou reiniciado.
Para entender melhor o que está acontecendo, você pode tentar realizar testes adicionais, mantendo variáveis controladas, como o tamanho e a estrutura dos prompts, e observar como diferentes modelos se comportam. Isso pode ajudar a identificar padrões e entender melhor as diferenças entre eles.
Espero ter ajudado e fico à disposição se precisar.
Abraço e bons estudos!
Caso este post tenha lhe ajudado, por favor, marcar como solucionado