Pular para o conteúdo

Portal do Spotify reduz 90% do consumo de tokens em Claude Code

Quem trabalha com assistentes de IA para código sabe que o consumo de tokens pode sair caro rapidamente. Cada consulta envia milhares de linhas de contexto para a API, mesmo quando apenas uma pequena fração desse código importa de verdade para a tarefa em questão. A equipe de engenharia do Spotify encontrou uma solução elegante para esse problema: uma ferramenta chamada Portal que reduziu em 90% o uso de tokens no Claude Code.

O resultado foi documentado no blog de engenharia do Spotify, mostrando como a abordagem técnica específica resolve um gargalo que afeta desenvolvedores em qualquer escala de operação.

O problema do contexto excessivo

Ferramentas de IA para código como Claude Code funcionam analisando o contexto do projeto: arquivos relevantes, dependências, estrutura de diretórios. O desafio é que esses assistentes frequentemente recebem muito mais informação do que precisam. Um desenvolvedor pede ajuda para refatorar uma função específica, mas a ferramenta envia o repositório inteiro como contexto.

Isso gera dois problemas imediatos. Primeiro, o custo: APIs de modelos de linguagem cobram por token processado, tanto na entrada quanto na saída. Segundo, a performance: mais tokens significam latência maior e, em alguns casos, estouro dos limites de contexto do modelo.

Como o Portal funciona

O Portal atua como uma camada intermediária entre o desenvolvedor e o Claude Code. A ferramenta analisa a solicitação feita pelo usuário e determina quais arquivos e trechos de código são genuinamente relevantes para aquela tarefa específica.

Em vez de enviar tudo, o Portal constrói um contexto cirúrgico. Se você está trabalhando em um bug específico em um arquivo de serviço, a ferramenta identifica apenas as dependências diretas, os testes relacionados e as interfaces que aquele código utiliza. O restante do repositório fica de fora da requisição.

A redução de 90% no uso de tokens vem justamente dessa seleção inteligente. O modelo de IA continua recebendo contexto suficiente para gerar respostas precisas, mas sem o ruído de milhares de linhas irrelevantes.

Diferença para outras abordagens

Outras estratégias de otimização focam na saída: você envia o contexto completo e depois processa ou limpa a resposta do modelo. O Portal inverte a lógica ao trabalhar na entrada. Menos tokens enviados significa custo menor desde o início, além de respostas mais rápidas.

Ferramentas como GitHub Copilot e Cursor também tentam limitar o contexto enviado, mas geralmente usam heurísticas simples: arquivos abertos recentemente, importações diretas, proximidade no sistema de arquivos. O Portal vai além ao analisar o grafo de dependências real do código e a intenção expressa na solicitação do desenvolvedor.

Impacto na prática

A economia de 90% nos tokens tem consequências concretas para equipes que usam assistentes de IA em escala. Para uma empresa com dezenas ou centenas de desenvolvedores fazendo múltiplas consultas por dia, a diferença no custo mensal pode chegar a milhares de dólares.

Além do aspecto financeiro, há o ganho em velocidade. Requisições menores trafegam mais rápido pela rede e são processadas mais rapidamente pelo modelo. O desenvolvedor recebe a resposta em menos tempo, mantendo o fluxo de trabalho sem interrupções perceptíveis.

Implementação e disponibilidade

O Spotify desenvolveu o Portal internamente para uso com Claude Code, mas a lógica por trás da ferramenta pode ser aplicada a outros assistentes de IA. A chave está em construir um sistema que entenda a estrutura do código e consiga mapear dependências de forma precisa.

Linguagens com sistemas de tipos fortes e importações explícitas facilitam esse trabalho. Em projetos Python, JavaScript ou Java, é possível rastrear quais módulos dependem de quais outros. A partir daí, um algoritmo de travessia de grafo identifica o subconjunto mínimo necessário para uma tarefa.

A ferramenta exige investimento inicial de engenharia: construir o parser de dependências, integrar com o fluxo de trabalho existente, ajustar os limites de contexto para cada tipo de solicitação. O retorno, segundo os dados do Spotify, compensa esse esforço.

Próximos passos

A tendência é que mais empresas adotem estratégias similares conforme o uso de IA no desenvolvimento se torna padrão. Pagar por contexto desnecessário deixa de ser aceitável quando há alternativas técnicas viáveis.

Desenvolvedores interessados em replicar a abordagem podem começar experimentando com ferramentas de análise estática de código já existentes: Abstract Syntax Trees (AST) parsers, linters que mapeiam importações, sistemas de build que conhecem o grafo de dependências. A partir dessas bases, é possível construir um filtro de contexto customizado para o assistente de IA usado pela equipe.

O Portal do Spotify demonstra que otimização de tokens não precisa comprometer a qualidade das respostas da IA. A ferramenta mantém a precisão do Claude Code enquanto reduz drasticamente o custo por consulta, provando que contexto inteligente supera contexto volumoso.

Recomendação relacionada

Prompt Engineering for Generative AI

Um guia técnico sobre engenharia de prompt pra quem trabalha com modelos de linguagem no dia a dia.

Ver na Amazon →

Como Associado Amazon, Visão Binária pode ganhar uma comissão sobre compras qualificadas feitas através deste link, sem custo adicional pra você.