For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegação principal

Seleção de modelos

Escolha o melhor modelo em termos de desempenho e custo.

Escolher o modelo certo, seja gpt-6-astra ou uma opção menor como gpt-5.6-terra, exige equilibrar precisão, latência e custo. Este guia explica os princípios fundamentais para ajudar você a tomar decisões bem fundamentadas e apresenta um exemplo prático.

Princípios fundamentais

Os princípios para a seleção de modelos são simples:

  • Otimize primeiro a precisão: Otimize a precisão até atingir sua meta.
  • Depois, otimize o custo e a latência: Busque manter a precisão com o modelo mais barato e rápido possível.

1. Concentre-se primeiro na precisão

Comece definindo uma meta clara de precisão para seu caso de uso: qual nível seria "bom o suficiente" para colocá-lo em produção? Para isso, siga estas etapas:

  • Defina uma meta clara de precisão: Determine qual será o valor desejado para sua métrica de precisão.
    • Por exemplo, 90% das chamadas de atendimento ao cliente precisam passar por uma triagem correta já na primeira interação.
  • Desenvolva um conjunto de dados de avaliação: Crie um conjunto de dados que permita medir o desempenho do modelo em relação a essas metas.
    • Continuando o exemplo acima, reúna 100 exemplos de interação que incluam o que o usuário solicitou, o encaminhamento feito pelo LLM na triagem, qual deveria ser o encaminhamento correto e se a triagem foi feita corretamente.
  • Use o modelo mais poderoso para otimizar: Comece com o modelo mais capaz disponível para atingir suas metas de precisão. Registre todas as respostas para que possamos usá-las na destilação de um modelo menor.
    • Use geração aumentada por recuperação para otimizar a precisão
    • Use ajuste fino para otimizar a consistência e o comportamento

Durante esse processo, colete pares de prompts e respostas para usar em avaliações, aprendizado few-shot ou ajuste fino. Essa prática, conhecida como consolidação de prompts, ajuda a produzir exemplos de alta qualidade para uso futuro.

Para conhecer mais métodos e ferramentas, consulte nosso Guia de otimização de precisão.

Defina uma meta realista de precisão

Calcule uma meta realista de precisão avaliando o impacto financeiro das decisões do modelo. Por exemplo, em um cenário de classificação de notícias falsas:

  • Notícia classificada corretamente: Se o modelo a classificar corretamente, você economiza o custo de uma revisão humana. Vamos supor que esse custo seja de US$ 50.
  • Notícia classificada incorretamente: Se o modelo classificar uma notícia legítima como falsa ou deixar de identificar uma notícia falsa, isso poderá desencadear um processo de revisão e uma possível reclamação, com um custo que pode chegar a US$ 300.

Nosso exemplo de classificação de notícias precisaria de 85,8% de precisão para cobrir os custos. Portanto, uma meta de 90% ou mais garante um retorno sobre o investimento no geral. Use esses cálculos para definir uma meta de precisão eficaz com base na sua estrutura de custos.

2. Otimize o custo e a latência

Custo e latência ficam em segundo plano porque, se o modelo não atingir sua meta de precisão, essas questões deixam de ser relevantes. Mas, depois de encontrar um modelo que funcione para seu caso de uso, você pode adotar uma destas duas abordagens:

  • Compare com um modelo menor usando zero-shot ou few-shot: Substitua o modelo por outro menor e mais barato e teste se ele mantém a precisão com custo e latência menores.
  • Destilação de modelos: Faça o ajuste fino de um modelo menor usando os dados coletados durante a otimização de precisão.

Custo e latência costumam estar interligados: reduzir tokens e requisições geralmente resulta em um processamento mais rápido.

As principais estratégias a considerar são:

  • Reduza as requisições: Limite o número de requisições necessárias para concluir as tarefas.
  • Minimize os tokens: Reduza o número de tokens de entrada e otimize o modelo para gerar respostas mais curtas.
  • Selecione um modelo menor: Use modelos que conciliem a redução de custos e latência com a manutenção da precisão.

Para saber mais sobre essas estratégias, consulte nosso guia de otimização de latência.

Exceções à regra

Há exceções claras a esses princípios. Se seu caso de uso for extremamente sensível ao custo ou à latência, estabeleça limites para essas métricas antes de iniciar os testes e descarte os modelos que os excederem. Depois de definir esses parâmetros, estas diretrizes ajudarão você a melhorar a precisão do modelo dentro das suas restrições.

Exemplo prático

Para demonstrar esses princípios, vamos desenvolver um classificador de notícias falsas com as metas a seguir. O experimento abaixo usa resultados históricos da família GPT-4o para mostrar o fluxo de trabalho. Nas avaliações atuais, comece com gpt-6-astra e compare com modelos menores ou que passaram por ajuste fino.

  • Precisão: Atingir 90% de classificações corretas
  • Custo: Gastar menos de US$ 5 por 1.000 notícias
  • Latência: Manter o tempo de processamento abaixo de 2 segundos por notícia

Experimentos

Realizamos três experimentos para atingir nossa meta:

  1. Zero-shot: Usamos GPT-4o com um prompt básico para 1.000 registros, mas não atingimos a meta de precisão.
  2. Aprendizado few-shot: Incluímos 5 exemplos few-shot e atingimos a meta de precisão, mas ultrapassamos o limite de custo devido ao maior número de tokens no prompt.
  3. Modelo com ajuste fino: Fizemos o ajuste fino de GPT-4o-mini com 1.000 exemplos rotulados e atingimos todas as metas, com latência e precisão semelhantes, mas custos significativamente menores.
IDMétodoPrecisãoMeta de precisãoCustoMeta de custoLatência médiaMeta de latência
1gpt-4o zero-shot84,5%US$ 1,72< 1s
2gpt-4o few-shot (n=5)91,5%US$ 11,92< 1s
3gpt-4o-mini com ajuste fino usando 1000 exemplos91,5%$0.21< 1s

Conclusão

Ao passar de gpt-4o para gpt-4o-mini com ajuste fino, alcançamos desempenho equivalente por menos de 2% do custo, usando apenas 1.000 exemplos rotulados.

Esse processo é importante: muitas vezes, não é possível partir direto para o ajuste fino porque você ainda não sabe se ele é a ferramenta certa para a otimização necessária ou não tem exemplos rotulados suficientes. Comece com gpt-6-astra para estabelecer sua meta de acurácia e, depois, teste modelos menores ou com ajuste fino quando custo e latência forem relevantes.