Por que o cache de immediate é importante
A inferência do modelo de linguagem grande (LLM) geralmente envolve prompts repetidos – pense no mesmo sistema ou immediate de instrução aparecendo em milhares de solicitações. O reprocessamento desse prefixo idêntico para cada chamada desperdiça ciclos de computação, aumenta a latência e aumenta os custos.
O cache de immediate elimina essa redundância, fornecendo:
- Menor latência – o estágio de pré-preenchimento pode ser ignorado quando o cache é atingido.
- Maior rendimento – mais tokens são processados por unidade modelo.
O cache de immediate pode ser uma técnica poderosa para aumentar a qualidade de um modelo em domínios específicos sem comprometer o rendimento do token do modelo. As consultas podem compartilhar um grande immediate do sistema específico do domínio, com o custo de cálculo desse immediate compartilhado amortizado em todas essas consultas. Modelos de fronteira, como Claude, usar prompts do sistema que são muitos milhares de tokens escondidos. Além disso, em nossa pesquisa publicada recentemente mostramos que a otimização imediata automatizada permite que modelos de código aberto superem a qualidade do modelo de fronteira para tarefas empresariais.
Disponibilidade de recursos
O Databricks já fornece cache de immediate integrado para modelos proprietários (GPT, Gemini, Claude). Agora estendemos esse recurso para os modelos de peso aberto que alimentam nossas APIs de modelo básico (FMAPIs) para inferência em lote, pagamento por token e cargas de trabalho de taxa de transferência provisionada. Também se aplica a todo e qualquer serviço de nível superior alimentado por um modelo básico, por exemplo, Agent Bricks, Genie, AI Capabilities.
O cache de prompts agora tem suporte para os seguintes modelos OSS hospedados no Databricks:
- GPT‑OSS 20B e 120B
- Gema 3 12B
- Llama 3.1 8B ajustado (by way of serviço PEFT)
- Lhama 3.1 8B e 3.3 70B
Continuaremos a implementar esse recurso em nossos outros modelos. A segurança é uma preocupação de primeira classe na Databricks. Os caches de immediate são isolados, residem apenas na memória volátil e nunca são persistentes. É importante ressaltar que o cache é implícito: os clientes não precisam configurar nada, nosso sistema foi construído para executar automaticamente o cache de immediate e reutilizá-lo para melhorar o rendimento.
Impacto no mundo actual: inferência em lote no GPT OSS
Implementamos primeiro o cache imediato em nossos modelos GPT‑OSS e imediatamente observamos ganhos mensuráveis em um dos pipelines de inferência em lote de produção em larga escala:
- A taxa de transferência do token de entrada por réplica aumentou 2,5x
- Latência P50 reduzida em 3x
- Tudo isso com uma taxa de acerto de cache relativamente baixa de 30%

Remover
Ao reutilizar automaticamente caches KV para prompts idênticos, o Databricks permite que você execute LLMs de código aberto de maneira mais rápida, econômica e com maior segurança — tudo isso sem exigir nenhuma configuração adicional. Esteja você servindo bate-papo em tempo actual, processando grandes coleções de documentos em lote ou criando agentes de IA, o cache de immediate pode transformar um bom pipeline de inferência em um excelente. Experimente em sua próxima implantação de modelo OSS e observe as métricas de desempenho aumentarem.