O custo para rodar um modelo de inteligência artificial com o mesmo nível de desempenho caiu 47% por trimestre desde 2023 — uma desaceleração de preços 13 vezes ao ano sem precedentes na história da tecnologia. Mais rápido que chips, DNA, baterias ou eletricidade. Mas, se “pensar” com IA virou praticamente de graça, por que as grandes empresas ainda não lucram e os agentes autônomos continuam travando em tarefas simples?
A queda que quebrou todos os recordes históricos
O levantamento do instituto Epoch AI revela um padrão agressivo: assim que um novo patamar de performance vira “estado da arte” (SOTA), o preço despenca 66% por trimestre. Dois anos depois, a taxa ainda assusta: 32% a cada três meses.
A velocidade varia conforme a tarefa. Em matemática, a redução beira 52% ao trimestre; em jogos e quebra-cabeças, fica entre 39% e 43%. O estudo alerta, porém, para um viés crítico: benchmarks não equivalem a utilidade no mundo real. Muitos modelos são “treinados para a prova”, brilhando em testes padronizados, mas falhando em contextos corporativos complexos.
Por que o barato sai caro na implementação
O custo de inferência (rodar o modelo) caiu, mas a conta da implementação subiu. Para ter um agente autônomo funcionando 24/7 — com capacidade de planejar, usar ferramentas e acessar a nuvem —, a fatura mensal continua alta. OpenAI e Anthropic, líderes da fronteira tecnológica, seguem queimando caixa sob pressão de concorrentes chineses que forçam a guerra de preços.
O cenário levanta a hipótese de uma “bolha da IA”: valorizações astronômicas sustentadas por receitas que não acompanham a queda de custo marginal. O equilíbrio financeiro depende, agora, de encontrar aplicações que justifiquem o investimento em infraestrutura pesada.
Agentes de voz: o atalho que vira armadilha
A aposta da vez é a voz. OpenAI liberou o modo de voz do ChatGPT com navegação na nuvem e integração a Drive, Slack e e-mail. O Google testou no Pixel 11 um Gemini que liga para comércios e negocia sozinho, com transcrição ao vivo. Parece o assistente ideal — até a prática mostrar os vazamentos.
- O fator humano oculto: A Reuters expôs que o agente Muse, da Meta, usava operadores humanos (“concierges”) para assumir ligações quando a IA travava, expondo dados sensíveis de usuários a terceiros.
- O bloqueio por comportamento de bot: Um investidor pediu a um agente que reservasse mesa em restaurante concorrido. O sistema “pingou” a plataforma Resy centenas de vezes por hora. Resultado: a conta do usuário foi banida por atividade suspeita.
Agentes autônomos tendem a agir como “usuários apressados demais”, quebrando regras de uso, APIs e termos de serviço — e a responsabilidade legal recai sobre quem os contratou.
A nova fronteira não é o modelo, é o hardware (e o espaço)
Se o software barateou, o gargalo migrou para a física: energia, refrigeração e silício. O Google lançou o Project Suncatcher: um satélite protótipo para testar TPUs em órbita. A lógica é radical — no espaço, há luz solar constante para energia e vácuo para… bem, o resfriamento no vácuo é justamente o maior desafio, já que não há “vento” para dissipar calor.
Radiação, vibração no lançamento e comunicação a laser entre satélites completam a lista de obstáculos. Mas a sinalização é clara: a próxima onda de valor não está em comprimir parâmetros, mas em resolver a equação termodinâmica e energética do compute em escala planetária.
O que observar daqui para frente
Para o tomador de decisão, a lição imediata é separar custo de inferência de custo total de propriedade. Um modelo barato que alucina em produção, vaza dados via operador humano ou derruba sua conta em plataformas parceiras gera passivo, não ativo.
Monitore três vetores nos próximos trimestres: a margem real das empresas de fronteira (sinal de sustentabilidade), a maturidade de guardrails para agentes autônomos (evitar bans e vazamentos) e a viabilidade econômica de data centers orbitais vs. terrestres. A tecnologia ficou barata; a engenharia de produto, não.
