Pular para o conteúdo

Avaliar LLMs antes de ir para produção: o ciclo do GitHub que cortou 95% dos falsos positivos

Mariko Wakabayashi e Zixiao Chen, da Microsoft, descrevem como avaliam LLMs antes de produção usando o caso de um sistema de detecção de segredos. O resultado citado: redução de 95% nos falsos positivos no conjunto de dados offline, mantendo o recall dentro dos limites definidos.

O ciclo proposto

O processo é um ciclo: decisão de produto, conjunto de dados representativo, avaliação offline, análise de erros, mudança direcionada, avaliação de regressão e experimento online, com realimentação entre as etapas. Na decisão de produto, a equipe define o resultado principal (reduzir falsos positivos), a restrição de segurança (um piso de recall) e as barreiras operacionais (latência, custo, confiabilidade).

Avaliação offline como teste de integração

Prompts e configurações são versionados como código, muda-se uma variável importante por vez, e os resultados são comparados com baselines conhecidos. Upgrades de modelo entram no mesmo processo de teste. Para manter a avaliação fiel à produção, o texto pede preservar o candidato avaliado, o contexto ao redor, as informações de apoio, o formato de entrada e a lógica do sistema.

Rótulos não são verdade absoluta

Um ponto útil do texto: rótulos de produção refletem desfechos de fluxo de trabalho, não verdade absoluta. Um segredo marcado como “resolvido” pode significar que a credencial foi rotacionada ou que o risco foi aceito, e não que o alerta era falso. Para cobrir casos raros ou difíceis de coletar, a equipe complementa com exemplos sintéticos e benchmarks acadêmicos.

Análise de erros e LLM como juiz

Falhas são classificadas por origem: modelo, prompt, entrada, pipeline, conjunto de dados ou rótulo. Na triagem com LLM como juiz, casos claros vão para automação, casos de baixa confiança e alto impacto sobem para humanos, e uma amostra das previsões de alta confiança é revisada para achar erros sistemáticos.

Cuidado ao ler o número

Os 95% de redução se referem ao conjunto offline avaliado, não a resultados medidos em produção. O texto trata o experimento online como uma etapa posterior do ciclo.