Por dentro do Token Saver
Menos contexto para ler, mais espaço para trabalhar.
Logs, resultados de comandos e contexto repetido podem ocupar o espaço do que importa. O RemoteCode combina técnicas para reduzir o que seu agente pago precisa ler, mantendo um caminho de volta aos detalhes.
Testar Token Saver por 7 diasToken Saver e controle remoto fazem parte da assinatura.
Nem toda técnica roda em cada requisição. O caminho depende do conteúdo, provedor, modelos instalados e recuperação disponível. As integrações opcionais estão identificadas abaixo.
Um exemplo simples: saída repetida
Antes
INFO worker ready
INFO worker ready
INFO worker ready
INFO worker readyVisualização compacta
INFO worker ready
⟦×4⟧Ilustração, não benchmark. Contagens de repetição podem substituir linhas repetidas. A economia real depende do trabalho; reduzir a saída não aumenta os limites do provedor.
Token Saver / 01
Menos ruído, a mesma informação útil
A compressão determinística escolhe uma transformação para o conteúdo. Formatos compactos preservam a estrutura; visualizações que omitem detalhes precisam de originais recuperáveis.
JSON, TOON e tabelas compactas
Remove a formatação redundante do JSON. Arrays uniformes podem compartilhar os nomes das colunas em TOON ou numa representação tabular, evitando repetir chaves em cada linha. Pedidos de JSON continuam recebendo JSON.
Logs repetidos e progresso
Agrupa linhas repetidas com sua contagem e reduz o ruído do progresso ou da compilação. A codificação reversível reconstrói o original; visualizações resumidas mantêm uma referência para recuperação.
Testes, erros e stack traces
Condensa relatórios de testes e stack traces em torno das falhas, asserções e frames relevantes. Resumos de build destacam diagnósticos em vez de repetir etapas bem-sucedidas. Recupere a saída completa quando precisar de mais detalhes.
Diffs e estrutura do código
Janelas de diff reduzem o contexto ao redor das alterações. Esqueletos de código mostram declarações e assinaturas antes dos corpos completos. São recursos de leitura, não arquivos ou patches substitutos; o código omitido continua recuperável.
Visualizações de HTML e SVG
Reduz marcações volumosas de páginas e vetores a uma visualização de estrutura ou texto. O original continua disponível para atributos, coordenadas ou detalhes exatos que não aparecem na versão compacta.
Notebooks, lockfiles e dados embutidos
Visualizações especializadas condensam notebooks e arquivos de dependências. Assets gerados grandes e dados base64 podem virar avisos curtos com referências de recuperação, em vez de ocupar todo o contexto. Essas visualizações são intencionalmente incompletas.
Formatação, identificadores e limites de saída
Remove decoração ANSI, espaços repetidos e alinhamento excessivo de tabelas. Operações especializadas podem abreviar identificadores longos repetidos ou manter só o início e o fim de uma saída grande, com o original disponível.
Token Saver / 02
Leia o que a tarefa precisa
A próxima economia vem de selecionar evidências em vez de enviar todos os bytes.
Respostas exatas para perguntas específicas
Quando a tarefa pede apenas caminhos, um diretório, um status HTTP ou um resultado compatível de aprovação/falha, a extração determinística devolve essa informação em vez de toda a saída.
BERT e seleção por relevância
Um encoder disponível classifica trechos em relação à pergunta e seleciona linhas relevantes de saídas grandes. As linhas mantêm a ordem original. É seleção extrativa, não uma garantia sobre tudo que foi omitido.
Recupere intervalos, busque e consulte saídas armazenadas
Uma referência identifica conteúdo armazenado. Recupere o original, peça um intervalo de linhas, busque dentro dele ou use consultas estruturadas compatíveis. Estimativas e previews ajudam a decidir quanto ler. A busca só cobre o conteúdo disponível no armazenamento.
Seleção de evidências e perguntas sobre várias saídas
O especialista local pode receber um conjunto limitado de trechos relevantes, responder sobre uma referência, selecionar candidatos ou comparar várias saídas fornecidas. Trechos de origem permitem conferir a resposta sem começar pelos documentos completos.
Descubra ferramentas e skills quando precisar
O Librarian expõe indicações compactas das operações comuns e um catálogo paginado para as demais. Bots incluem um índice de suas skills; o agente pede o conteúdo quando precisa. As instruções das skills não são resumidas.
Graphify: consulte primeiro o mapa do repositório
Com Token Saver e Graphify ligados e a CLI disponível, o host mantém um grafo do repositório e orienta o agente a consultá-lo primeiro. Consultas direcionadas podem reduzir a exploração de arquivos. É uma integração real do host; a operação de nome semelhante no catálogo Librarian não executa a CLI por conta própria.
Token Saver / 03
Deixe um especialista local preparar a leitura
Depois das rotas mais simples, tarefas elegíveis podem usar um modelo para preparar uma resposta menor para o agente principal. São operações sobre conteúdo fornecido, não agentes com autoridade para publicar mudanças.
Compressão e resumos curtos
Operações assistidas por modelo condensam comandos, textos longos e atualizações. Representações compactas e resumos curtos atendem aos seus modos específicos. A inferência local usa o modelo instalado; uma API compatível configurada explicitamente usa esse endpoint.
Diagnósticos de desenvolvimento e entrega
Extrai ou agrupa falhas de testes, jobs de CI, diagnósticos, cobertura, snapshots e logs de instalação ou build. Há também operações para contêineres, infraestrutura, Kubernetes, dependências, assinatura, notarização, acessibilidade e vulnerabilidades. Elas resumem evidências; não certificam um build aprovado.
Código, APIs, dados e investigação do runtime
Consulte papéis de arquivos, imports, símbolos, estrutura JSON, campos, tabelas, endpoints ou esquemas de banco. Resuma HTTP/HAR, GraphQL, planos de consulta, benchmarks, crashes, perfis, processos, depuração, sanitizers, memória, chamadas de sistema e inspeção binária. O agente principal pode recuperar detalhes antes de agir.
Alterações, discussões e delegações
Prepara visualizações menores do histórico git, blame, conflitos, discussões de PR/MR, tickets e critérios de aceitação. Chats, e-mails e transcrições fornecidos podem virar decisões ou ações. Outras operações resumem subagentes, classificam resultados, combinam logs, comparam métricas, apontam contradições e selecionam notas de versão.
Rascunhos continuam sendo rascunhos
Operações candidatas podem sugerir planos, notas de revisão, testes, buscas, hipóteses, refactors, triagem de issues, SQL ou textos de versão. Podem redigir commits, PRs e traduções compatíveis. O agente principal precisa verificá-los. Comandos sugeridos não são executados automaticamente, e seu modelo não é trocado silenciosamente.
Seleção do modelo local e API opcional
A seleção automática usa o modelo MLX 1.7B em Macs com até 16 GiB de RAM e E4B acima de 16 GiB. As configurações também permitem escolher um modelo ou endpoint compatível com OpenAI. Rotas determinísticas dispensam geração; rotas de encoder e modelo dependem dos runtimes disponíveis. A geração externa envia conteúdo elegível ao endpoint configurado.
Token Saver / 04
Evite repetir a mesma leitura
O reaproveitamento tem efeitos distintos: algumas técnicas reduzem contexto e caches evitam trabalho local repetido.
Caches de resultados e embeddings
Pedidos idênticos podem reutilizar um resultado. Embeddings armazenados evitam repetir trabalho local de seleção. Isso melhora a eficiência local; um acerto de cache não significa, por si só, menos tokens cobrados.
Duplicatas, referências e evidências anteriores
Uma duplicata verificada pode apontar para seu original armazenado. Buscas e avisos de similaridade ajudam a localizar evidências sem tratar textos parecidos como idênticos. Comparações destacam mudanças nas falhas; exemplos de correção podem ajudar chamadas posteriores.
Mensagens locais compactas e estáveis
Respostas compactas, catálogo sob demanda e remoção de rastros de raciocínio mantêm as respostas focadas. Prompts locais estáveis e verificações de cache evitam sobrecarga; não reescrevem instruções de segurança nem garantem preços de cache do provedor.
Mensagens compactas: RCW1 e RCS1
As execuções admitidas recebem instruções para mensagens compactas e referências a trechos repetidos. RCW1 é solicitado apenas quando usa no máximo 45% dos tokens do texto conciso equivalente; caso contrário, o texto continua como texto. Literais, negação, ordem e aprovações precisam sobreviver à decodificação. Essa regra não representa economia medida de 55% em toda conversa.
Reaproveitamento de contexto entre turnos
Um resultado menor também pode reduzir o contexto repetido nos turnos seguintes. O app estima esse benefício com totais permanentes por conversa e número de execuções, usando um piso derivado das leituras de cache informadas quando maior. É uma estimativa contrafactual, diferente de acertos do cache local e do desconto efetivo do provedor.
Token Saver / 05
Aplique a economia onde o agente pode usá-la
A cobertura depende do provedor, da ferramenta, do modo e da recuperação disponível.
Wrappers, pipes e hooks compatíveis
Wrappers interceptam saídas ruidosas elegíveis, e pipes explícitos de distill comprimem texto fornecido. Hooks só se aplicam onde a substituição da saída é suportada. Ferramentas de saída exata, skills, mensagens do usuário e permissões são protegidas; a cobertura varia por provedor. Na implementação atual, Claude tem um hook PostToolUse de substituição; Codex e Grok usam wrappers de shell elegíveis e pipes explícitos, sem reescrita universal de leituras nativas de arquivos. cat, rg, sed e jq mantêm a saída integral, salvo um pedido explícito de extração com distill.
Divida saídas grandes e recupere sob demanda
Entradas grandes são divididas em pedidos limitados. A recuperação por MCP permite acessar a saída armazenada ou pedir uma visualização menor. Dividir permite comprimir volumes maiores; não multiplica a economia por si só.
Integrações opcionais de contexto e host
Há também caminhos condicionais para releituras sem alterações, deduplicação entre turnos, ocultação de resultados ou argumentos antigos, agrupamento de tarefas em fila e contexto compacto de continuidade. Exigem integração, ativação e recuperação. Não reescrevem universalmente sessões ativas. O host macOS ativa as permissões de rollout nas execuções admitidas do Token Saver; cada operação ainda verifica sua elegibilidade e recuperação. As preferências separadas de compactação do histórico e aprendizado de sessões vêm desligadas: a primeira pode compactar saídas persistidas com recuperação; a segunda pode escrever regras aprendidas nas instruções gerenciadas. Existirem no código não significa que estejam ativadas para todo usuário.
Mídia, documentos e ferramentas do workspace
Entradas de OCR/diffs de imagens, áudio, vídeo, documentos, planilhas, consultas de grafo/LSP/AST, alterações de arquivos, watches e codemods precisam de ferramentas e entradas do host. Uma entrada não comprova integração ativa: operações sem suporte retornam indisponíveis. O texto já extraído pode usar as técnicas anteriores.
Roteamento Auto e sua estimativa
Auto é um modo separado de roteamento do trabalho do agente. Quando ativo, o cálculo acrescenta uma estimativa equivalente a tokens de 25% da economia medida em saídas de ferramentas. Essa parcela não é uma redução medida em cada chamada e não garante uma fatura menor ou qualidade idêntica.
Token Saver / 06
Mantenha a economia útil e verificável
Uma resposta menor só é útil se o agente conseguir concluir a tarefa.
Armazene antes de omitir; recupere dentro do escopo
Antes de entregar uma visualização que omite detalhes, o caminho de recuperação armazena e verifica o original. As referências ficam vinculadas ao escopo de recuperação. Sem recuperação assegurada, essa entrega é recusada ou o original é usado. Recuperável não significa compressão sem perdas.
Verificações de qualidade, literais e tamanho
Conforme o caminho, verificações protegem valores literais, conferem citações, rejeitam resumos sem respaldo e usam verificações semânticas/NLI disponíveis. Limiares rejeitam reduções insuficientes. Limites de tempo permitem continuar por um caminho mais seguro. Reduzem risco, sem garantir raciocínio idêntico.
Privacidade e medição honesta
O modo local comprime no Mac; uma API externa configurada recebe o conteúdo elegível. Seu provedor de programação continua recebendo as próprias requisições. Verificações de segredos e injeção limitam operações.
Reduções medidas versus Estimated save
As substituições entregues registram a diferença entre as estimativas de tokens do original e da saída compacta. O Estimated save também inclui estimativas de respostas mais curtas, atividade do Graphify, reaproveitamento entre turnos e Auto quando aplicável. A comparação é com um agente hipotético sem esses recursos, não com a fatura do provedor. Candidatos rejeitados não somam economia medida.
O que "até 3x" significa, e quais são seus limites
É uma afirmação dependente do trabalho, não um multiplicador garantido da assinatura. Redução de tokens, cache do provedor e custo cobrado são medidas diferentes. Resumos podem omitir detalhes; recupere o original quando a precisão importar.
Confira a economia no seu próprio trabalho.
Comece com seus agentes e projetos atuais. Compare a saída compacta com o original e acompanhe a estimativa de economia no app.
Testar Token Saver por 7 diasToken Saver e controle remoto fazem parte da assinatura.