Tecnologia

IA ficou 13x mais barata em um ano — mas sua empresa ainda não lucra com isso

Gráfico mostra queda de 13x no custo de modelos de IA em 12 meses, com ícones de chips e moedas caindo
Custo de inferência de IA despencou 13 vezes em um ano, mas implementação empresarial segue cara e complexa.

O custo para rodar um modelo de inteligência artificial com desempenho equivalente despencou 47% por trimestre desde 2023. Em doze meses, a mesma “capacidade de pensar” sai 13 vezes mais barata. Nenhuma tecnologia na história — nem chips, nem sequenciamento de DNA, nem baterias de lítio — caiu tão rápido.

Os dados vêm do instituto Epoch AI e expõem um paradoxo: o software de IA virou commodity quase de graça, enquanto a implementação real segue cara, complexa e arriscada. Entender essa dissonância define quem captura valor e quem só queima orçamento.

Queda sem precedentes: os números que assustam até veteranos do Vale

O estudo da Epoch AI rastreou benchmarks padronizados entre 2023 e 2024. A redução média de 47% ao trimestre mascara variações importantes:

  • Matemática e raciocínio lógico: 50% a 52% mais barato por trimestre
  • Jogos e quebra-cabeças: 39% a 43% por trimestre
  • Pico pós-SOTA: quando um novo modelo vira “estado da arte”, o preço cai 66% no trimestre seguinte
  • Dois anos depois: a taxa desacelera para ~32% ao trimestre

Para colocar em perspectiva: a Lei de Moore dobrava transistors a cada dois anos. A IA está dobrando “inteligência por dólar” a cada ~40 dias.

Por que a fatura da sua empresa não reflete isso

Três forças mantêm o custo real elevado apesar da queda no modelo bruto:

1. Capacidade agêntica exige infraestrutura contínua. Agentes que operam 24/7, navegam na web, integram Slack, Google Drive e e-mail consomem tokens sem parar. O modelo barato vira caro quando multiplicado por milhares de chamadas diárias.

2. Fronteira não é lucrativa. OpenAI e Anthropic — líderes em SOTA — operam no vermelho. Subsidiam preços para ganhar mercado enquanto enfrentam concorrência chinesa (DeepSeek, Zhipu, Moonshot) que força margens para baixo. A “guerra de preços” beneficia o usuário final, mas adia a sustentabilidade dos fornecedores.

3. Benchmark ≠ produção. A Epoch AI alerta: empresas “treinam para a prova”. Um modelo que brilha no MMLU ou GSM8K pode falhar em fluxos reais com dados sujos, latência variável e requisitos de compliance.

Agentes de voz: o atalho que vira armadilha

A corrida agora é tirar a IA do chat e colocá-la no viva-voz. OpenAI liberou modo de voz com ferramentas (navegador na nuvem, e-mail, Drive) para assinantes Plus/Pro. Google testou no Pixel 11 o Gemini ligando sozinho para comércios locais — transcrição ao vivo, opção de intervenção humana.

Parece produtividade. Na prática, surgem riscos novos:

  • Meta Muse: a Reuters revelou “concierge humano” assumindo ligações quando o bot travava. Dados sensíveis do cliente expostos a operadores terceirizados.
  • Bloqueio por comportamento de bot: um investidor pediu ao agente Instinct reservar restaurante no Resy. O agente “pingou” a plataforma centenas de vezes/hora. Resultado: conta banida permanentemente.
  • Responsabilidade difusa: quando o agente erra — reserva errada, e-mail enviado ao destinatário errado, compra não autorizada —, quem responde? O fornecedor do modelo? O integrador? O usuário?

A fronteira física: energia, chips e… órbita

Se software ficou barato, o hardware virou gargalo. O Project Suncatcher do Google vai lançar satélite protótipo para testar TPUs em órbita. A lógica: luz solar 24/7 para energia, vácuo para resfriamento (embora sem convecção, só radiação), comunicação inter-satélite a laser.

Desafios listados pelo próprio Google: radiação ionizante, vibração no lançamento, gerenciamento térmico no vácuo, latência de uplink/downlink. É a versão “moonshot” literal da corrida por compute barato.

Enquanto isso, datacenters terrestres disputam gigawatts. Microsoft reativou Three Mile Island. Amazon comprou usina nuclear da Talen. A conta de energia da IA global pode superar a do Japão até 2030, segundo projeções da IEA.

O que observar daqui para frente

Curva de custo x curva de adoção. A queda de 47%/trimestre não é lei da física — depende de arquiteturas mais eficientes (MoE, quantização, distilação), dados sintéticos e hardware especializado. Se a curva achatar, a bolha de investimento (estimada em >$200 bi em 2024 só em capex de hyperscalers) cobra seu preço.

Regulamentação de agentes. UE, EUA e Brasil discutem responsabilidade civil por ações autônomas de IA. O caso Resy mostra que plataformas vão fechar APIs para agentes não certificados. Empresas que dependem de “scraping agente” terão de migrar para integrações oficiais — ou morrer.

Commoditização da camada de modelo. Llama 3.1 405B, Nemotron 3 Ultra, Qwen 2.5 72B — modelos abertos já batem GPT-4o em vários benchmarks. O valor migra para: orquestração, eval contínuo, guardrails, fine-tuning domain-specific, e dados proprietários.

Teste prático esta semana: pegue um fluxo real da sua operação (ex: cotação de fornecedores, triagem de currículos, conciliação bancária). Rode com modelo barato (Llama 3.1 70B via Groq ou Together) + eval rigoroso. Compare custo/qualidade vs. sua stack atual. A diferença no extrato bancário costuma ser o argumento final para mover o board.