Skip to content

Solicitações de cache ​

Nos modelos Claude, NordRouter armazena automaticamente em cache contextos longos. Se você enviar solicitações com início repetido (sistema de prompt, histórico de diálogos, documento grande), a parte repetida será cobrada pelo preço de uma leitura de cache, até 90% mais barata que uma entrada normal.

Como funciona ​

  1. A primeira solicitação com um contexto longo - o contexto é gravado no cache.
  2. Solicitações subsequentes com o mesmo início - a parte correspondente é lida do cache a um custo reduzido.
  3. Isso pode ser visto na resposta em usage.prompt_tokens_details.

Quanto custa ​

O cache funciona como Anthropic - a duas taxas do preço inicial do modelo:

OperaçãoMultiplicadorQuando debitado
Write (gravação em cache)×1,25primeira vez que o contexto é armazenado em cache
Leitura (leitura de cache)×0,1 (−90%)cada repetição do mesmo contexto

Cada modelo tem seu preço exato - vejacatálogo de modelos. Exemplo em Claude Fable 5 (entrada $ 1,548/1M): escreva ≈ $ 1,94/1M, leia ≈ $ 0,155/1M.

Limite de operação

Apenas contextos suficientemente longos (de vários milhares de tokens) são armazenados em cache. Solicitações curtas têm o preço normal - elas não exigem cache.

Como usar ​

1. Automaticamente - não há necessidade de fazer nada ​

A maioria das pessoas não tem nada para configurar. Se a sua ferramenta enviar o mesmo prefixo (prompt do sistema, histórico, documento grande) - NordRouter armazena-o em cache. Isso já funciona em Claude Code, OpenCode, Cline e quaisquer chatbots com histórico: a cada passo o agente envia todo o contexto - o primeiro passo escreve o cache, cada próximo lê com 90% de desconto.

2. Verifique se o cache funcionou ​

Observe o bloco usage na resposta - se parte da entrada for para o cache, haverá cached_tokens:

json
"usage": {
  "prompt_tokens": 21364,
  "prompt_tokens_details": {
    "cached_tokens": 21361     // ← прочитано из кэша по ×0.1
  },
  "completion_tokens": 40
}

cached_tokens > 0 - significa que esta parte do lançamento foi baixada pelo preço de leitura, e não pelo preço total.

3. Gerencie manualmente via cache_control ​

Se você quiser decidir por si mesmo o que exatamente armazenar em cache (endpoint /v1/messages), coloque o marcador cache_control no final do bloco que você está reutilizando - por exemplo, em um diretório grande em system:

bash
curl https://nordrouter.com/v1/messages \
  -H "x-api-key: sk-nr-ВАШ-КЛЮЧ" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "anthropic/claude-fable-5",
    "max_tokens": 512,
    "system": [
      {
        "type": "text",
        "text": "Ты ассистент по нашей документации. Вот справочник: <...много текста...>",
        "cache_control": { "type": "ephemeral" }
      }
    ],
    "messages": [{ "role": "user", "content": "Первый вопрос по справочнику?" }]
  }'
python
from anthropic import Anthropic

client = Anthropic(base_url="https://nordrouter.com", api_key="sk-nr-ВАШ-КЛЮЧ")

resp = client.messages.create(
    model="anthropic/claude-fable-5",
    max_tokens=512,
    system=[{
        "type": "text",
        "text": "Ты ассистент по нашей документации. Вот справочник: <...>",
        "cache_control": {"type": "ephemeral"},   # кэшируем справочник
    }],
    messages=[{"role": "user", "content": "Первый вопрос по справочнику?"}],
)
print(resp.usage)  # cache_creation_input_tokens на 1-м запросе, cache_read на след.

A primeira solicitação gravará o diretório no cache, todas as subsequentes com o mesmo system lerão por ×0,1. Seu cache_control é sempre uma prioridade - o cache automático não interfere nessas solicitações.

Copo na sua conta pessoal ​

LC→ Configurações → “Avisos de cache (Claude)”:

  • Ativado (padrão) - cache automático para todas as solicitações do Claude sem seus próprios tokens. Ideal para agentes e diálogos.
  • Desativar só vale a pena se cada uma de suas solicitações for completamente única - para não pagar pela gravação de um cache que não é reutilizado.
  • Se você mesmo transmitir cache_control, a posição da chave seletora não é importante, seus marcadores ainda são uma prioridade.

Exemplo de poupança ​

Um guia de 40 páginas (~30.000 tokens) com 10 perguntas para Claude Fable 5:

Sem cacheCom cache
O que está escrito10 × 30k entradas1 gravação + 9 leituras
Custo de entrada~$0,46 (≈41₽)~$0,10 (≈9₽)

Economia ≈78% – e quanto mais perguntas você tiver no mesmo contexto, mais forte será o efeito. É por isso que a codificação baseada em agente (onde o contexto é reutilizado dezenas de vezes) é muito mais barata.