O relatório de setembro do AI Gateway da Vercel afirma que modelos de pesos abertos processaram 56% dos tokens encaminhados pelo gateway em agosto, mas responderam por 14% dos gastos estimados. Essa divisão mostra como o volume de uso e os orçamentos dos modelos podem contar histórias diferentes. É um retrato do tráfego de um único gateway, não uma medida de todo o mercado de IA nem das faturas efetivamente pagas pelos clientes.

Aos 20min03s do episódio 290 do podcast All-In, o painel discute o ritmo dos lançamentos de modelos de pesos abertos e premium e argumenta que modelos mais capazes e baixáveis ampliam o acesso. Essa é a interpretação dos participantes. Um dado distinto e mais limitado vem do Índice de Produção do AI Gateway de setembro, que apresenta o tráfego até agosto.

A grande mudança

  • O que mudou: No AI Gateway da Vercel, os modelos de pesos abertos passaram de uma minoria para 56% dos tokens entre dezembro e agosto, enquanto responderam por 14% dos gastos estimados a preços de tabela em agosto.
  • Por que isso importa: As equipes que escolhem modelos precisam separar a demanda por tokens dos gastos e, depois, comparar qualidade e custo operacional total nas tarefas que executam. O índice não traz resultados por tarefa nem economias para uma equipe específica.
  • O que acompanhar: A questão prática é se o modelo escolhido atende às exigências da equipe em qualidade, latência, privacidade e operação, considerando o custo total. A participação nos tokens, por si só, não responde a isso; também importam os termos da licença, o hardware e o tempo de engenharia.

O que medem os números de 56% e 14%

Segundo a Vercel, modelos de pesos abertos processaram 56% dos tokens encaminhados pelo AI Gateway em agosto, o primeiro mês em que representaram a maioria do volume do gateway. Eles responderam por 14% dos gastos estimados. O gráfico da empresa mostra que essa participação subiu de 13% em abril para 56% em agosto. O relatório tem data de 17 de setembro e usa dados até agosto.

Essa diferença não significa que executar esses modelos seja gratuito. Mesmo quando os pesos podem ser baixados, ainda são necessários computação, eletricidade e operação. Com base nas participações arredondadas, o gasto estimado por token no grupo de pesos abertos foi cerca de um oitavo do gasto dos demais modelos neste conjunto de dados. O cálculo usa os números da Vercel: 14% dos gastos divididos por 56% dos tokens, em comparação com os 86% restantes dos gastos divididos pelos 44% restantes dos tokens. É uma média entre diferentes modelos e tipos de token, não o preço ou a capacidade de um modelo específico.

O índice contabiliza tokens de entrada, saída, raciocínio, entrada em cache e criação de cache. Esses tipos de token podem ter preços diferentes, de modo que a média de cada grupo também reflete o que seus usuários enviaram e geraram. A Vercel estima os gastos com base nos preços de tabela publicados pelas empresas de IA e afirma que as faturas reais podem diferir. Essa abordagem permite comparar tráfego de equipes que usam suas próprias chaves de acesso aos provedores, mas não é uma auditoria de faturas nem uma medição do custo de computação para hospedagem própria.

O relatório também afirma que o preço médio estimado por token em todo o gateway caiu 23,2% em agosto. Entre as equipes que processaram mais de 10 milhões de tokens tanto em julho quanto em agosto, o preço mediano estimado por token caiu 7,6%. A Vercel atribui parte da queda ao crescimento do uso de pesos abertos. O relatório não separa quanto da mudança veio dessa alteração, de diferentes combinações de tokens ou de equipes que mudaram de modelos e cargas de trabalho.

Um gateway não representa todo o mercado

O índice reúne tráfego agregado e anonimizado encaminhado pelo AI Gateway da Vercel. Oferece uma visão de solicitações reais de produção que passam pelo serviço, algo mais concreto do que um ranking de modelos ou um anúncio de lançamento. Mas o relatório não demonstra que os clientes do serviço representem todos os usuários de IA, não divulga uma amostra que represente o mercado em geral e não mostra a adoção em cargas de trabalho que não usam o gateway. Portanto, as porcentagens devem ser entendidas como a composição do tráfego do gateway da Vercel.

A Vercel também observa que sua classificação de modelos de pesos abertos segue a lista atual do AI Gateway, mais ampla que a definição usada em relatórios anteriores. Os números antigos podem mudar à medida que a Vercel revise a metodologia e receba dados mais completos. A tendência mensal é informativa, mas o próprio relatório ressalta que a delimitação da categoria mudou.

“Pesos abertos” também não é sinônimo de “código aberto”. Os pesos de um modelo são parâmetros numéricos aprendidos que podem ser disponibilizados para download. A Definição de IA de Código Aberto 1.0 da Open Source Initiative estabelece um padrão mais amplo: exige a liberdade de usar, estudar, modificar e compartilhar um sistema de IA e considera informações sobre os dados de treinamento, código e parâmetros do modelo como partes da forma preferencial para modificação. Um ponto de verificação baixável ainda pode vir com restrições de licença ou sem detalhes do código e dos dados de treinamento. As equipes precisam verificar a licença e os materiais de lançamento de cada modelo.

O que essa diferença significa para quem compra IA

Os números da Vercel sustentam uma conclusão restrita: nesse gateway, modelos de pesos abertos processaram um volume maior de tokens e responderam por uma parcela menor dos gastos estimados a preços de tabela. Eles não mostram que a mesma carga de trabalho custaria menos em um servidor local nem que um modelo mais barato poderia substituir um premium sem mudanças de qualidade, velocidade ou confiabilidade.

Para uma equipe de produto, a comparação relevante é o custo de concluir a mesma tarefa com o mesmo padrão de aceitação. Isso significa incluir o volume de entradas e saídas, novas tentativas, ferramentas, roteamento, latência e qualquer revisão humana, e então comparar a cobrança do provedor com o hardware e a operação necessários para executar os pesos diretamente. O índice de setembro não fornece essas comparações por tarefa. Seu valor é indicar que modelos de pesos abertos já respondem por uma parcela substancial do uso em um gateway de produção, enquanto os gastos continuam concentrados em outros modelos.

O argumento mais amplo do painel do All-In — de que a disponibilidade de modelos está aumentando — pode ser comparado a esse tipo de evidência de uso, mas o índice da Vercel não verifica todas as afirmações sobre modelos feitas na discussão nem prevê a evolução futura da adoção. Por enquanto, é útil distinguir quantos tokens uma categoria processa, quais são as cobranças estimadas do provedor e quanto custa para uma equipe obter um resultado confiável.

Fontes e leitura complementar