O custo para rodar um modelo de inteligência artificial com desempenho equivalente despencou 47% por trimestre desde 2023, segundo a Epoch AI — uma queda de 13 vezes ao ano sem precedentes na história da tecnologia. Mas, se “pensar” com IA virou commodity quase de graça, por que implementar agentes autônomos continua caro, arriscado e longe de gerar lucro para os grandes laboratórios?
A queda que não tem paralelo histórico
O levantamento da Epoch AI compara a trajetória de preços da inferência com revoluções anteriores como sequenciamento de DNA, lei de Moore nos chips, baterias de lítio e eletrificação. A IA vence todas em velocidade. Em tarefas de matemática, a redução chega a 52% por trimestre; em jogos e quebra-cabeças, fica entre 39% e 43%.
O padrão é claro: assim que um novo patamar de performance (SOTA) é atingido, o preço cai 66% no trimestre seguinte. Dois anos depois, a taxa ainda mantém 32% de queda contínua. O aviso dos pesquisadores, porém, é direto: benchmark não é mundo real e empresas podem “treinar para a prova”.
O abismo entre inferência barata e agente viável
Se o custo marginal de uma consulta tende a zero, a conta fecha mal quando o assunto é capacidade agêntica. Manter um modelo de fronteira rodando 24/7, com acesso a ferramentas, memória de longo prazo e navegação na web, exige infraestrutura pesada e modelos caros — justamente os que OpenAI e Anthropic ainda não conseguem monetizar com lucro.
A pressão competitiva vinda da China força as líderes ocidentais a baixar preços de API enquanto queimam caixa. O mercado debate se há bolha: a tecnologia barateia no software, mas a camada de aplicação continua cara, frágil e dependente de subsídio cruzado.
Quando o “agente autônomo” tem humano no loop
A promessa de autonomia total esbarrou na realidade operacional da Meta. Reportagem da Reuters revelou que o projeto Muse utilizava um “concierge humano” para assumir ligações quando a voz da IA falhava — o velho operador de telemarketing disfarçado de inovação.
O vazamento expõe três riscos imediatos para quem compra ou vende essa tecnologia:
- Privacidade: dados sensíveis do usuário expostos a terceiros não auditados.
- Responsabilidade: quem responde pelo erro — o modelo ou o humano que monitorava?
- Custo oculto: a economia de escala some se cada sessão precisa de supervisão humana.
Voz: o atalho perigoso para o cotidiano
OpenAI e Google apostam na voz como interface principal. O modo de voz do ChatGPT já executa tarefas no navegador, redige e-mails e integra Slack e Google Drive para assinantes Plus e Pro. No Pixel 11, o Gemini liga para comércios locais, transcreve em tempo real e permite intervenção do usuário.
A conveniência é inegável: um assistente no viva-voz enquanto você dirige. O perigo está na latência entre intenção e execução. Uma ação irreversível — cancelar um contrato, transferir valor, apagar dados — disparada por alucinação de áudio ou ruído de fundo não tem botão “desfazer” fácil.
O agente que vira “bot mal-educado” e te bane
Um investidor pediu ao assistente Instinct uma mesa em restaurante concorrido. O agente bombardeou a plataforma Resy com centenas de requisições por hora. Resultado: a conta do usuário foi banida por comportamento de bot.
O Resy foi taxativo: não permite agentes de terceiros não aprovados. O caso ilustra um novo passivo: seu agente age em seu nome, mas a reputação digital que queima é a sua. Contratos de uso de plataformas vão precisar de cláusulas específicas para “ações de IA delegadas”.
A corrida saiu do data center e foi para a órbita
Se software fica barato, o gargalo físico aperta. O Project Suncatcher, do Google, vai lançar um satélite protótipo para testar TPUs no espaço. A lógica: luz solar constante para energia, vácuo para isolamento (embora resfriamento seja um desafio sem convecção) e links a laser entre satélites.
Radiação, vibração de lançamento e latência orbital são barreiras reais. Mas o sinal estratégico é claro: a próxima fronteira de custo não é algorítmica, é energética e imobiliária. Quem resolver “compute per watt per dollar” no espaço ou em reatores modulares ditam o preço da próxima década.
Como extrair valor hoje: pare de pedir “deixe bonito”
Enquanto a macroeconomia da IA se resolve, o ganho imediato está no uso tático. A maioria usa IA para decoração como gerador de imagens aleatórias. O salto de produtividade vem de tratar o modelo como diretor de projeto técnico, não como estagiário criativo.
Um fluxo que funciona na prática:
- Contexto duro primeiro: envie plantas, fotos em ângulos múltiplos, medidas, infraestrutura fixa (tomadas, HVAC, portas), orçamento real e itens imutáveis.
- Análise antes da síntese: peça para a IA mapear restrições de circulação, proporção, iluminação e armazenamento — separando fatos observáveis de hipóteses.
- Três estratégias, não três estilos: exija propostas com lógicas espaciais distintas (ex: “foco em home office”, “foco em circulação social”, “foco em armazenamento invisível”), cada uma com trade-offs explícitos.
- Crítica adversarial: ordene que a IA ataque as próprias propostas buscando falhas de manutenção, custo oculto, ergonomia e conflitos com a infraestrutura real.
- Síntese e plano de execução: gere a quarta versão incorporando o melhor e elimine o que falhou. Só então peça lista de compras com especificações técnicas (dimensão, material, função) — não links de produto.
O que observar daqui para frente
Três variáveis vão ditar se a queda de 13x ao ano chega ao seu balanço ou fica no paper da Epoch AI: a rentabilidade dos laboratórios de fronteira (se OpenAI/Anthropic quebram ou pivôam, a API sobe), a regulação de responsabilidade por agentes autônomos (EUA e UE legislam em 2025) e a disponibilidade real de energia barata para data centers — seja no Nevada, no Ceará ou na órbita baixa. Enquanto isso, trate inferência barata como insumo; o diferencial competitivo está na arquitetura de prompts, na governança de dados e na mitigação de risco de agentes que agem rápido demais no lugar errado.
