1 / 8

Panorama

Por que o cache é casamento de prefixo

Do prefixo à fatura

A tese desta página: o cache de prompt é casamento de prefixo. Ele vale do primeiro byte até o primeiro byte diferente, e nem um caractere além. Não existe casamento de pedaço no meio, não existe reaproveitamento parcial e não existe aviso quando você quebra o casamento. É a otimização de maior retorno e menor esforço que existe em cima de um LLM e a mais fácil de perder por acidente, porque perdê-la não gera erro nenhum.

O que o cache NÃO é

  • não é cache de resposta: a mesma pergunta duas vezes gera duas gerações diferentes
  • não é busca por semelhança: prompts "parecidos" não casam, só prefixos idênticos
  • não casa por pedaço: um trecho igual no meio do prompt não vale nada
  • não avisa quando quebra: a conta sobe e o log fica idêntico

O que ele é

  • é o KV-cache da página anterior, congelado e reusado entre requisições
  • é a decisão de onde cortar: até que ponto do prompt vale guardar
  • é uma conta de escrita cara, leitura barata, com ponto de equilíbrio conhecido
  • é, sobretudo, uma decisão de arquitetura tomada antes da primeira linha

Explore cada etapa →

A matemática, num só lugar

As 4 contas que decidem se o cache vale a pena. Clique em qualquer uma para pular direto para a etapa que a explica.

Honestidade, antes de começar: tudo que envolve posição nesta página é exato o prefixo comum é calculado caractere a caractere, no seu navegador, sobre o texto que você digitar. Duas coisas são aproximadas e ficam editáveis de propósito: a contagem de tokens (o tokenizador real é BPE e depende do modelo; a regra de bolso daqui erra na casa de 10–15% em texto corrido e mais em código) e os preços e multiplicadores, que variam por provedor, por modelo e por contrato. Os valores padrão seguem a tabela pública da Anthropic escrita a 1,25× do preço de entrada com validade de 5 minutos, com validade de 1 hora, leitura a 0,1× nos dois casos. Confira os do seu provedor antes de levar qualquer número daqui para uma planilha.