O custo para rodar um modelo de inteligência artificial com desempenho equivalente despencou 47% por trimestre desde 2023. Em doze meses, a mesma “capacidade de pensar” sai 13 vezes mais barata. Nenhuma tecnologia na história — nem chips, nem sequenciamento de DNA, nem baterias de lítio — caiu tão rápido.
Os dados vêm do instituto Epoch AI e expõem um paradoxo: o software de IA virou commodity quase de graça, enquanto a implementação real segue cara, complexa e arriscada. Entender essa dissonância define quem captura valor e quem só queima orçamento.
Queda sem precedentes: os números que assustam até veteranos do Vale
O estudo da Epoch AI rastreou benchmarks padronizados entre 2023 e 2024. A redução média de 47% ao trimestre mascara variações importantes:
- Matemática e raciocínio lógico: 50% a 52% mais barato por trimestre
- Jogos e quebra-cabeças: 39% a 43% por trimestre
- Pico pós-SOTA: quando um novo modelo vira “estado da arte”, o preço cai 66% no trimestre seguinte
- Dois anos depois: a taxa desacelera para ~32% ao trimestre
Para colocar em perspectiva: a Lei de Moore dobrava transistors a cada dois anos. A IA está dobrando “inteligência por dólar” a cada ~40 dias.
Por que a fatura da sua empresa não reflete isso
Três forças mantêm o custo real elevado apesar da queda no modelo bruto:
1. Capacidade agêntica exige infraestrutura contínua. Agentes que operam 24/7, navegam na web, integram Slack, Google Drive e e-mail consomem tokens sem parar. O modelo barato vira caro quando multiplicado por milhares de chamadas diárias.
2. Fronteira não é lucrativa. OpenAI e Anthropic — líderes em SOTA — operam no vermelho. Subsidiam preços para ganhar mercado enquanto enfrentam concorrência chinesa (DeepSeek, Zhipu, Moonshot) que força margens para baixo. A “guerra de preços” beneficia o usuário final, mas adia a sustentabilidade dos fornecedores.
3. Benchmark ≠ produção. A Epoch AI alerta: empresas “treinam para a prova”. Um modelo que brilha no MMLU ou GSM8K pode falhar em fluxos reais com dados sujos, latência variável e requisitos de compliance.
Agentes de voz: o atalho que vira armadilha
A corrida agora é tirar a IA do chat e colocá-la no viva-voz. OpenAI liberou modo de voz com ferramentas (navegador na nuvem, e-mail, Drive) para assinantes Plus/Pro. Google testou no Pixel 11 o Gemini ligando sozinho para comércios locais — transcrição ao vivo, opção de intervenção humana.
Parece produtividade. Na prática, surgem riscos novos:
- Meta Muse: a Reuters revelou “concierge humano” assumindo ligações quando o bot travava. Dados sensíveis do cliente expostos a operadores terceirizados.
- Bloqueio por comportamento de bot: um investidor pediu ao agente Instinct reservar restaurante no Resy. O agente “pingou” a plataforma centenas de vezes/hora. Resultado: conta banida permanentemente.
- Responsabilidade difusa: quando o agente erra — reserva errada, e-mail enviado ao destinatário errado, compra não autorizada —, quem responde? O fornecedor do modelo? O integrador? O usuário?
A fronteira física: energia, chips e… órbita
Se software ficou barato, o hardware virou gargalo. O Project Suncatcher do Google vai lançar satélite protótipo para testar TPUs em órbita. A lógica: luz solar 24/7 para energia, vácuo para resfriamento (embora sem convecção, só radiação), comunicação inter-satélite a laser.
Desafios listados pelo próprio Google: radiação ionizante, vibração no lançamento, gerenciamento térmico no vácuo, latência de uplink/downlink. É a versão “moonshot” literal da corrida por compute barato.
Enquanto isso, datacenters terrestres disputam gigawatts. Microsoft reativou Three Mile Island. Amazon comprou usina nuclear da Talen. A conta de energia da IA global pode superar a do Japão até 2030, segundo projeções da IEA.
O que observar daqui para frente
Curva de custo x curva de adoção. A queda de 47%/trimestre não é lei da física — depende de arquiteturas mais eficientes (MoE, quantização, distilação), dados sintéticos e hardware especializado. Se a curva achatar, a bolha de investimento (estimada em >$200 bi em 2024 só em capex de hyperscalers) cobra seu preço.
Regulamentação de agentes. UE, EUA e Brasil discutem responsabilidade civil por ações autônomas de IA. O caso Resy mostra que plataformas vão fechar APIs para agentes não certificados. Empresas que dependem de “scraping agente” terão de migrar para integrações oficiais — ou morrer.
Commoditização da camada de modelo. Llama 3.1 405B, Nemotron 3 Ultra, Qwen 2.5 72B — modelos abertos já batem GPT-4o em vários benchmarks. O valor migra para: orquestração, eval contínuo, guardrails, fine-tuning domain-specific, e dados proprietários.
Teste prático esta semana: pegue um fluxo real da sua operação (ex: cotação de fornecedores, triagem de currículos, conciliação bancária). Rode com modelo barato (Llama 3.1 70B via Groq ou Together) + eval rigoroso. Compare custo/qualidade vs. sua stack atual. A diferença no extrato bancário costuma ser o argumento final para mover o board.
